推理三瓶颈 (Three Bottlenecks of Inference)
是什么 / 为什么重要
78-推理芯片架构图 的核心框架,是 推理芯片 的读图透镜。训练是一次性教模型,推理是持续跑模型生成 token——真正烧成本的是推理(每次 query/agent 调用天天烧)。推理芯片要区别于 GPU,必须解决 GPU 在推理时撞到的三个瓶颈。
三个瓶颈
- 内存带宽(内存墙,最根本):decode 阶段每生成一个 token 都要从内存读整套权重(单用户每秒读数 TB)。此时计算单元大多空闲,FLOPS 再高也没用——决定性能的是从内存拉数据的速度。
- 灵活性的代价:GPU 通用性→transformer 推理浪费在取指/线程调度/kernel 启动,利用率远低于峰值。越把硬件固定到特定 workload 越省这浪费,但越跑不了其他模型。灵活性与效率对立。
- 部署与功耗:再快的芯片装不进机架、解不了电与热就卖不掉。大模型需多芯片互连、散热、几天内进标准数据中心——决定实战成败。
三者环环相扣:瓶颈1(选哪种内存)约束瓶颈2(能跑哪些模型/多灵活),再决定瓶颈3(几颗芯片、卖芯片还是系统)。
⭐核心规则:内存放哪决定计算自由度
- 内存拉进片内(SRAM 派 Cerebras/Groq)→ 计算固定到特定执行方式,灵活性低。
- 内存推到片外(低成本 DRAM / 分层派)→ 计算自由度高。
- 灵活性由内存布局决定,而非计算电路本身。
四内存阵营(对应 推理芯片)
SRAM 派 / 低成本 DRAM 派(绕 HBM+CoWoS)/ 分层派(多内存并存)/ HBM 派(三大内存厂需求源)。
争议点 / 待观察
- HBM 派内部灵活性向中间收敛(Etched 从纯 transformer 扩到 Mamba/MoE):全硬连线遇模型变结构即废,全通用又和 GPU 无异 → 市场聚在「固定结构+参数/部分操作可变」的中间。
- decode 当前是顺序模式利好 SRAM 派;但若 RAG/MoE/agentic(不规则访问)成主流,片上数据复用下降,SRAM 优势减弱。