⚡ 前沿动态

阿里玄铁C950 RISC-V芯片原生跑通千问27B

🕐 2026.08.20 星期四 来源 · 媒体 🔥 2 次点击

玄铁C950是阿里达摩院推出的64位服务器级RISC-V旗舰CPU,也是全球首款原生跑通270亿参数大模型的RISC-V架构芯片,对AI芯片自主化、边缘推理和算力多元化具有战略意义。

一、玄铁C950核心硬件规格

1. 制程与核心配置

  • 工艺制程‌:采用台积电5nm先进工艺制造,是目前全球性能最强的RISC-V服务器级CPU IP核之一。
  • 核心互联‌:单芯片最多集成64个计算核心,以8核为一个集群单元,集群间通过高速AMBA CHI总线实现低延迟互联,最高主频可达3.2GHz,避免核间通信瓶颈。
  • 合规标准‌:完全符合RVA23 Profile规范,支持Vector Crypto、Zacas、Zama16等全部RISC-V可选扩展指令集。

解码速度约30 token/s,首token延迟1.9秒,无需GPU、无需模拟层,纯CPU原生运行。传统GPU方案运行27B模型通常需要16-24GB显存。

2. 架构性能升级

相比前代玄铁C920,内存带宽提升4倍以上,内置原生矩阵与向量加速引擎,专门针对大模型推理的张量运算做了硬件级优化。

  • 流水线设计‌:采用超标量乱序微架构,搭配16级深度流水线,平衡高主频与复杂AI工作负载的执行效率。
  • 指令解码‌:8指令并行解码宽度,单周期可同时读取并处理8条指令,大幅提升指令吞吐能力。
  • 主频性能‌:最高运行主频可达3.2GHz,SPECint2006基准测试得分约70分,能效比达到22+/GHz。

3. 缓存与预取机制

  • 分级缓存‌:标配独立L1指令/数据缓存,支持高度可配置的L2缓存,还可扩展可选的共享L3缓存。
  • 智能预取‌:搭载硬件级智能数据预取算法,可在执行引擎发起请求前,将后续所需内存数据提前加载进缓存层级。
  • 带宽提升‌:相比前代玄铁C920,整体内存带宽提升4倍以上,完美适配大模型推理的高内存访问需求。

4. AI专属加速特性

  • 自研扩展指令‌:支持玄铁专属AME附加矩阵扩展ISA,可直接对接玄铁TPE张量处理引擎IP。
  • 大模型适配‌:无需GPU辅助、无需模拟层,即可原生驱动通义千问3.8-27B大模型完成全量推理,实测解码速度达30 Token/s。
  • 单Socket特性‌:不同于GPU的多线程并行推理模式,玄铁C950每个Socket仅运行单条推理线程,大幅降低大模型推理的调度开销。

5. 目标应用场景

  • 核心面向云计算、边缘计算、AI计算三大高性能场景,可直接集成进高端服务器SoC中。
  • 依托开源RISC-V指令集,完全规避X86、ARM架构的高额授权费用,支持厂商深度定制化改造。

6. 架构合规性

完全遵循RVA23 Profile规范,集成RISC-V Debug/Nexus Trace调试模块、AIA高级中断控制器、MMU内存管理单元、PMP物理内存保护单元等全套标准组件,L3缓存与SCU系统控制单元协同工作,大幅降低大模型运行时的内存访问延迟。

二、千问27B原生运行实测性能

1. 核心推理指标

  • 实测解码速度达到30 Token/s,首Token响应时间仅1.9秒,在仅32GB VRAM的硬件资源条件下即可完整运行Qwen-3.8 27B模型,无需额外外挂显存扩展设备。
  • 玄铁C950凭借8指令并行解码和专属矩阵扩展指令,在千问27B原生推理场景下,单核心推理效率比同主频的Neoverse N2高出约35%,实测解码速度可达30 Token/s。

2. 无GPU依赖特性

  • 全程未调用任何独立GPU算力,所有大模型的张量运算、上下文处理、Token生成全部由玄铁C950的CPU核心与内置加速引擎完成,彻底摆脱了大模型推理对传统GPU架构的强制依赖。
  • 玄铁C950无需额外搭配独立GPU即可运行270亿参数大模型,整机部署成本仅为Neoverse N2搭配同性能GPU方案的40%左右,大幅降低边缘AI部署门槛。

3. 边缘场景适配性

  • 相比传统GPU集群动辄数千瓦的功耗,玄铁C950整机功耗控制在数百瓦级别,可直接部署在工业边缘节点、本地私有服务器等供电条件有限的场景中,无需改造高密供电散热基础设施。
  • Neoverse N2依托ARM成熟生态,在通用服务器场景下的软件兼容性更优;玄铁C950依托阿里全栈生态,在千问大模型的软硬协同优化上具备独家优势。

三. 玄铁C950与ARM Neoverse N2的‌对比

对比维度 阿里玄铁C950 ARM Neoverse N2
指令集架构 RISC-V RVA23 Profile ARMv9.0-A
制程工艺 台积电5nm 台积电5nm
单芯片最大核心数 64核 64核
最高主频 3.2GHz 3.0GHz
流水线深度 16级 11级
指令解码宽度 8指令/周期 4指令/周期
内存带宽 比前代C920提升4倍 比前代N1提升2倍
AI专属加速引擎 内置TPE张量处理引擎+AME矩阵扩展指令 内置SVE2向量扩展指令
大模型原生支持 原生跑通千问27B,无GPU依赖 需搭配独立GPU才能运行27B级大模型
授权模式 开源RISC-V架构,无高额授权费 需支付ARM架构高额IP授权费

总结

  • 构建软硬一体护城河阿里通过自研玄铁芯片+自研千问大模型的垂直整合路线,复刻了英伟达“硬件+软件生态”的成熟模式,在竞争激烈的全球AI市场中构建了独特的差异化壁垒,实现了大模型核心算力的完全自主可控。
  • 开辟边缘AI新赛道该组合为边缘AI部署提供了全新的低成本方案,无需采购昂贵的GPU加速卡,仅通过RISC-V通用服务器芯片即可运行270亿参数大模型,大幅降低了工业、安防、中小企业等场景的大模型落地门槛。
  • 推动RISC-V生态升级此次突破直接将RISC-V架构的应用边界从微控制器、低端处理器,拓展至高端AI服务器级场景,带动整个RISC-V生态向高性能计算方向快速演进,打破了X86、ARM架构在AI算力领域的长期垄断格局。
  • 玄铁C950是全球首款面向AI大模型原生优化的RISC-V服务器级CPU,打破了ARM架构在高端服务器算力领域的长期垄断,为国内AI算力自主可控提供了全新的技术路线,而Neoverse N2作为ARMv9时代的主流服务器核心,更多面向通用云计算场景,并未
声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
  1. 阿里达摩院玄铁
← 返回 [前沿动态]