Cerebras CS-4/WSE-3 Turbo 晶圆级推理系统
Cerebras CS-4/WSE-3 Turbo是2026年8月18日Cerebras发布的新一代机架级AI推理系统,核心定位是面向前沿大模型的高吞吐、低延迟推理基础设施,官方宣称其单用户推理速度最高可达传统GPU方案的30倍。
CS-4的核心卖点不是训练,而是高吞吐、低延迟的推理,尤其是面向Agentic工作负载。Agent任务通常需要多次推理步骤、工具调用与自我验证,每次响应时间决定多步循环是否可行。Cerebras通过晶圆级SRAM与片内高带宽互联,减少HBM/DRAM带来的内存墙瓶颈,使大模型解码在单用户场景下仍能保持极高吞吐。
CS-4同时支持推理负载拆分,可作为解码单元与异构预填充硬件配套,发挥预填充(compute-bound)与解码(memory-bound)各自的架构优势。
一、架构创新亮点
1. 供电与散热革新
- 电源转换模块距离处理器仅0.5毫米,几乎完全消除板级供电损耗,为WSE-3 Turbo提供双倍电力供给。
- 采用可插拔背包式设计,将电源转换、液冷与控制电子集成一体,适配高密度机架部署。
2. 异构解耦推理架构
- 原生支持推理负载拆分,可作为解码单元与AMD Instinct GPU、AWS Trainium等异构预填充硬件配套使用,发挥不同架构的差异化优势。
- 支持超过50万亿参数的大模型运行,针对10T参数规模模型可实现全链路2微秒级低延迟跨晶圆调度。
二、实测性能
- 主流模型Token输出能力:
在GPT-OSS-120B测试中,单用户每秒生成Token数超4400,最高达4465 Token/s,是同场景GPU方案的30倍。 - 多模型性能对比:
对Llama 3.3 70B、Gemma 4-31B等模型,单用户Token输出可达3600/s,对Kimi K2.7 1T等万亿参数模型仍可保持2000 Token/s的输出能力。 - 代际提升:
相比上一代CS-3,整机Token生成速度提升93%,词元总容量提升10倍。
三、技术对比
1. 架构逻辑完全对立
- Cerebras走整片300mm晶圆一体化路线,所有核心通过晶圆内部金属走线直连,完全消除GPU集群中大量卡间NVLink互联的开销。
- 英伟达H200/B200走多芯粒拆分CoWoS封装路线,依赖大量高速铜缆、多层高算力PCB、多组HBM中介层实现集群互联。
2. 物料与工艺的增减差异
- CS-4省去了芯片切割、单颗封装、海量高速铜缆、多卡互联PCB、大量HBM配套堆叠物料,整机外部电路极简。
- H200/B200集群需要配套近5000根高速NVLink铜缆、大量高多层载板、独立显卡插槽基座,配套被动元件用量远高于CS-4。
3. 参数横向对比
| 对比维度 | Cerebras CS-4(单台3颗WSE-3 Turbo) | 英伟达H200(单卡) | 英伟达B200(单卡) |
|---|---|---|---|
| 制程工艺 | TSMC 5nm | TSMC 4N(定制4nm) | TSMC 4NP(定制4nm) |
| 核心规模 | 单颗晶圆90万AI核心,整机共270万 | 14188个CUDA核心 | 18432个CUDA核心 |
| 片上高速存储 | 单颗44GB SRAM,整机132GB | 141GB HBM3e | 192GB HBM3e |
| 内存带宽 | 单颗43.2 PB/s,整机129.6 PB/s | 4.8 TB/s | 8.3 TB/s |
| 稀疏FP16算力 | 整机750 PFLOPS | 4 PFLOPS | 8 PFLOPS |
| 整机TDP | 125-135kW | 1000W(单卡) | 1200W(单卡) |
| 单用户LLM推理Token速度 | 最高4400 Token/s | 约150-200 Token/s | 约300-400 Token/s |
- 主要适配特定模型,软件生态是Cerebras短板
四、应用场景
1. 目标场景
- 面向高交互性AI Agent、实时大模型对话、超大规模长上下文推理等对延迟和响应速度要求极高的场景,而非传统大模型训练场景。
- 晶圆级架构天然适配万亿参数大模型的低延迟推理,无需复杂的张量并行、流水线并行拆分,部署复杂度大幅降低。
2. 商用合作
OpenAI的750MW推理算力部署中,CS-4将主要承担ChatGPT实时对话的高吞吐推理节点,目标是将单用户对话的Token输出速度提升至现有GPU方案的10倍以上,解决长文本生成场景下的等待延迟问题。 AWS已将CS-4接入Amazon Bedrock服务,通过托管层屏蔽底层硬件差异,开发者无需修改原有CUDA代码,即可调用Cerebras的高吞吐推理能力,大幅降低迁移成本。 Notion将CS-4作为实时企业搜索的底层引擎,面向数百万企业用户实现毫秒级的全文档语义检索,替代原有的8卡GPU集群方案,检索响应速度提升12倍。
3. 定价
- 在按Token计费的云服务场景下,基于CS-4部署的DeepSeek V4 Pro推理服务,输入定价为0.2美元/百万Tokens,输出定价为0.5美元/百万Tokens,综合单位Token成本比英伟达B200集群方案低40%,长期大规模部署的总拥有成本优势显著。
- 以DeepSeek V4 Pro 1.6T参数模型为例,支撑1M上下文窗口约需20台CS-4系统,对应CAPEX超2000万美元,主要面向超大规模云服务商部署。
五、产业影响
CS-4的发布强化了“推理算力差异化”趋势:训练侧英伟达仍占主导,但推理侧出现晶圆级SRAM、ASIC、RISC-V CPU等多种替代路径。Cerebras能否真正扩大市场份额,取决于其软件栈成熟度、客户多元化程度以及下一代新制程芯片(而非Turbo版同die超频)的研发进度。CEO Andrew Feldman称预计到2027年底性能再提升4倍、吞吐提升20倍。
- Cerebras
- 新浪财经
- 财联社
- 凤凰网