78 · 推理芯片架构图:12 家按三大瓶颈排序
核心论点
推理芯片市场不是单一市场。别问「谁比 NVIDIA 快」,要问「谁能更便宜地解决 NVIDIA 昂贵解决的瓶颈」。按三瓶颈 × 四内存阵营读,12 家公司显现的不是名单而是设计理念地图。终极结论:别猜哪家赢,无论哪派赢「共同地基」(代工/内存/封装/电力/机架)都随之增长——看每种架构流向哪个组件需求,比记 12 个名字更持久。
关键数据/证据
- 推理三瓶颈(见 推理三瓶颈):①内存带宽(内存墙,decode 每 token 读全部权重)②灵活性代价(GPU 通用性浪费 vs 固定化)③部署与功耗(互连/散热/几天内进标准机架)。⭐规则:内存放哪决定计算灵活度。
- 四内存阵营:
- SRAM 派(Cerebras 晶圆级 44GB / Groq 230MB 确定性数据流)→ 量流向代工硅而非 DRAM。
- 低成本 DRAM 派(d-Matrix 256GB LPDDR5X+DIMC / Tenstorrent GDDR6+RISC-V IP 授权,Jim Keller「用 HBM 就赢不了 NVIDIA」)→ 绕开 HBM+CoWoS,打破「推理普及=HBM 一比一增长」。
- 分层派(SambaNova SRAM/HBM/DDR 三层 / Positron FPGA+HBM+DDR5)→ 一颗芯片带多种内存。
- HBM 派(Rebellions CGRA 144GB+三星/SK投资 / FuriosaAI TCP 48GB 拒 Meta $8亿 / Etched Sohu transformer-ASIC / MatX 训练+推理)→ 三大内存厂需求源;灵活性向中间收敛。
- NVIDIA 应对:竞争从芯片→机架(Vera Rubin NVL72)、HBM4 带宽 3x、CUDA 20 年生态、NVLink Fusion、许可收编(Groq $20B)。
- 超算云自研:TPU/Trainium/Maia/MTIA 年增 40%+,或把 NVIDIA 推理份额 90%+→2028 的 20-30%;但锁自家云/SDK。微软 Maia+Vera Rubin 双策略(可预测高量推理给自研,灵活训练给 NVIDIA)。