⚡ 前沿动态

Cerebras CS-4/WSE-3 Turbo 晶圆级推理系统

🕐 2026.08.20 星期四 来源 · 媒体 🔥 3 次点击

Cerebras CS-4/WSE-3 Turbo是2026年8月18日Cerebras发布的新一代机架级AI推理系统,核心定位是面向前沿大模型的高吞吐、低延迟推理基础设施,官方宣称其单用户推理速度最高可达传统GPU方案的30倍。

CS-4的核心卖点不是训练,而是高吞吐、低延迟的推理,尤其是面向Agentic工作负载。Agent任务通常需要多次推理步骤、工具调用与自我验证,每次响应时间决定多步循环是否可行。Cerebras通过晶圆级SRAM与片内高带宽互联,减少HBM/DRAM带来的内存墙瓶颈,使大模型解码在单用户场景下仍能保持极高吞吐。

CS-4同时支持推理负载拆分,可作为解码单元与异构预填充硬件配套,发挥预填充(compute-bound)与解码(memory-bound)各自的架构优势。

一、架构创新亮点

1. ‌供电与散热革新‌

  • 电源转换模块距离处理器仅0.5毫米,几乎完全消除板级供电损耗,为WSE-3 Turbo提供双倍电力供给。
  • 采用可插拔背包式设计,将电源转换、液冷与控制电子集成一体,适配高密度机架部署。

2. ‌异构解耦推理架构‌

  • 原生支持推理负载拆分,可作为解码单元与AMD Instinct GPU、AWS Trainium等异构预填充硬件配套使用,发挥不同架构的差异化优势。
  • 支持超过50万亿参数的大模型运行,针对10T参数规模模型可实现全链路2微秒级低延迟跨晶圆调度。

二、实测性能

  • 主流模型Token输出能力‌:
    在GPT-OSS-120B测试中,单用户每秒生成Token数超4400,最高达4465 Token/s,是同场景GPU方案的30倍。
  • 多模型性能对比‌:
    对Llama 3.3 70B、Gemma 4-31B等模型,单用户Token输出可达3600/s,对Kimi K2.7 1T等万亿参数模型仍可保持2000 Token/s的输出能力。
  • 代际提升‌:
    相比上一代CS-3,整机Token生成速度提升93%,词元总容量提升10倍。

三、技术对比

1. ‌架构逻辑完全对立‌

  • Cerebras走整片300mm晶圆一体化路线,所有核心通过晶圆内部金属走线直连,完全消除GPU集群中大量卡间NVLink互联的开销。
  • 英伟达H200/B200走多芯粒拆分CoWoS封装路线,依赖大量高速铜缆、多层高算力PCB、多组HBM中介层实现集群互联。

‌2. 物料与工艺的增减差异‌

  • CS-4省去了芯片切割、单颗封装、海量高速铜缆、多卡互联PCB、大量HBM配套堆叠物料,整机外部电路极简。
  • H200/B200集群需要配套近5000根高速NVLink铜缆、大量高多层载板、独立显卡插槽基座,配套被动元件用量远高于CS-4。

3. 参数横向对比

对比维度 Cerebras CS-4(单台3颗WSE-3 Turbo) 英伟达H200(单卡) 英伟达B200(单卡)
制程工艺 TSMC 5nm TSMC 4N(定制4nm) TSMC 4NP(定制4nm)
核心规模 单颗晶圆90万AI核心,整机共270万 14188个CUDA核心 18432个CUDA核心
片上高速存储 单颗44GB SRAM,整机132GB 141GB HBM3e 192GB HBM3e
内存带宽 单颗43.2 PB/s,整机129.6 PB/s 4.8 TB/s 8.3 TB/s
稀疏FP16算力 整机750 PFLOPS 4 PFLOPS 8 PFLOPS
整机TDP 125-135kW 1000W(单卡) 1200W(单卡)
单用户LLM推理Token速度 最高4400 Token/s 约150-200 Token/s 约300-400 Token/s
  • 主要适配特定模型,软件生态是Cerebras短板

四、应用场景

1. 目标场景‌

  • 面向高交互性AI Agent、实时大模型对话、超大规模长上下文推理等对延迟和响应速度要求极高的场景,而非传统大模型训练场景。
  • 晶圆级架构天然适配万亿参数大模型的低延迟推理,无需复杂的张量并行、流水线并行拆分,部署复杂度大幅降低。

2. ‌商用合作‌

OpenAI的750MW推理算力部署中,CS-4将主要承担ChatGPT实时对话的高吞吐推理节点,目标是将单用户对话的Token输出速度提升至现有GPU方案的10倍以上,解决长文本生成场景下的等待延迟问题。 AWS已将CS-4接入Amazon Bedrock服务,通过托管层屏蔽底层硬件差异,开发者无需修改原有CUDA代码,即可调用Cerebras的高吞吐推理能力,大幅降低迁移成本。 Notion将CS-4作为实时企业搜索的底层引擎,面向数百万企业用户实现毫秒级的全文档语义检索,替代原有的8卡GPU集群方案,检索响应速度提升12倍。

3. 定价

  • 在按Token计费的云服务场景下,基于CS-4部署的DeepSeek V4 Pro推理服务,输入定价为0.2美元/百万Tokens,输出定价为0.5美元/百万Tokens,综合单位Token成本比英伟达B200集群方案低40%,长期大规模部署的总拥有成本优势显著。
  • 以DeepSeek V4 Pro 1.6T参数模型为例,支撑1M上下文窗口约需20台CS-4系统,对应CAPEX超2000万美元,主要面向超大规模云服务商部署。

五、产业影响

CS-4的发布强化了“推理算力差异化”趋势:训练侧英伟达仍占主导,但推理侧出现晶圆级SRAM、ASIC、RISC-V CPU等多种替代路径。Cerebras能否真正扩大市场份额,取决于其软件栈成熟度、客户多元化程度以及下一代新制程芯片(而非Turbo版同die超频)的研发进度。CEO Andrew Feldman称预计到2027年底性能再提升4倍、吞吐提升20倍。

声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. Cerebras
  2. 新浪财经
  3. 财联社
  4. 凤凰网
← 返回 [前沿动态]