⚡ 前沿动态
阿里玄铁C950 RISC-V芯片原生跑通千问27B
玄铁C950是阿里达摩院推出的64位服务器级RISC-V旗舰CPU,也是全球首款原生跑通270亿参数大模型的RISC-V架构芯片,对AI芯片自主化、边缘推理和算力多元化具有战略意义。
一、玄铁C950核心硬件规格
1. 制程与核心配置
- 工艺制程:采用台积电5nm先进工艺制造,是目前全球性能最强的RISC-V服务器级CPU IP核之一。
- 核心互联:单芯片最多集成64个计算核心,以8核为一个集群单元,集群间通过高速AMBA CHI总线实现低延迟互联,最高主频可达3.2GHz,避免核间通信瓶颈。
- 合规标准:完全符合RVA23 Profile规范,支持Vector Crypto、Zacas、Zama16等全部RISC-V可选扩展指令集。
解码速度约30 token/s,首token延迟1.9秒,无需GPU、无需模拟层,纯CPU原生运行。传统GPU方案运行27B模型通常需要16-24GB显存。
2. 架构性能升级
相比前代玄铁C920,内存带宽提升4倍以上,内置原生矩阵与向量加速引擎,专门针对大模型推理的张量运算做了硬件级优化。
- 流水线设计:采用超标量乱序微架构,搭配16级深度流水线,平衡高主频与复杂AI工作负载的执行效率。
- 指令解码:8指令并行解码宽度,单周期可同时读取并处理8条指令,大幅提升指令吞吐能力。
- 主频性能:最高运行主频可达3.2GHz,SPECint2006基准测试得分约70分,能效比达到22+/GHz。
3. 缓存与预取机制
- 分级缓存:标配独立L1指令/数据缓存,支持高度可配置的L2缓存,还可扩展可选的共享L3缓存。
- 智能预取:搭载硬件级智能数据预取算法,可在执行引擎发起请求前,将后续所需内存数据提前加载进缓存层级。
- 带宽提升:相比前代玄铁C920,整体内存带宽提升4倍以上,完美适配大模型推理的高内存访问需求。
4. AI专属加速特性
- 自研扩展指令:支持玄铁专属AME附加矩阵扩展ISA,可直接对接玄铁TPE张量处理引擎IP。
- 大模型适配:无需GPU辅助、无需模拟层,即可原生驱动通义千问3.8-27B大模型完成全量推理,实测解码速度达30 Token/s。
- 单Socket特性:不同于GPU的多线程并行推理模式,玄铁C950每个Socket仅运行单条推理线程,大幅降低大模型推理的调度开销。
5. 目标应用场景
- 核心面向云计算、边缘计算、AI计算三大高性能场景,可直接集成进高端服务器SoC中。
- 依托开源RISC-V指令集,完全规避X86、ARM架构的高额授权费用,支持厂商深度定制化改造。
6. 架构合规性
完全遵循RVA23 Profile规范,集成RISC-V Debug/Nexus Trace调试模块、AIA高级中断控制器、MMU内存管理单元、PMP物理内存保护单元等全套标准组件,L3缓存与SCU系统控制单元协同工作,大幅降低大模型运行时的内存访问延迟。
二、千问27B原生运行实测性能
1. 核心推理指标
- 实测解码速度达到30 Token/s,首Token响应时间仅1.9秒,在仅32GB VRAM的硬件资源条件下即可完整运行Qwen-3.8 27B模型,无需额外外挂显存扩展设备。
- 玄铁C950凭借8指令并行解码和专属矩阵扩展指令,在千问27B原生推理场景下,单核心推理效率比同主频的Neoverse N2高出约35%,实测解码速度可达30 Token/s。
2. 无GPU依赖特性
- 全程未调用任何独立GPU算力,所有大模型的张量运算、上下文处理、Token生成全部由玄铁C950的CPU核心与内置加速引擎完成,彻底摆脱了大模型推理对传统GPU架构的强制依赖。
- 玄铁C950无需额外搭配独立GPU即可运行270亿参数大模型,整机部署成本仅为Neoverse N2搭配同性能GPU方案的40%左右,大幅降低边缘AI部署门槛。
3. 边缘场景适配性
- 相比传统GPU集群动辄数千瓦的功耗,玄铁C950整机功耗控制在数百瓦级别,可直接部署在工业边缘节点、本地私有服务器等供电条件有限的场景中,无需改造高密供电散热基础设施。
- Neoverse N2依托ARM成熟生态,在通用服务器场景下的软件兼容性更优;玄铁C950依托阿里全栈生态,在千问大模型的软硬协同优化上具备独家优势。
三. 玄铁C950与ARM Neoverse N2的对比
| 对比维度 | 阿里玄铁C950 | ARM Neoverse N2 |
|---|---|---|
| 指令集架构 | RISC-V RVA23 Profile | ARMv9.0-A |
| 制程工艺 | 台积电5nm | 台积电5nm |
| 单芯片最大核心数 | 64核 | 64核 |
| 最高主频 | 3.2GHz | 3.0GHz |
| 流水线深度 | 16级 | 11级 |
| 指令解码宽度 | 8指令/周期 | 4指令/周期 |
| 内存带宽 | 比前代C920提升4倍 | 比前代N1提升2倍 |
| AI专属加速引擎 | 内置TPE张量处理引擎+AME矩阵扩展指令 | 内置SVE2向量扩展指令 |
| 大模型原生支持 | 原生跑通千问27B,无GPU依赖 | 需搭配独立GPU才能运行27B级大模型 |
| 授权模式 | 开源RISC-V架构,无高额授权费 | 需支付ARM架构高额IP授权费 |
总结
- 构建软硬一体护城河阿里通过自研玄铁芯片+自研千问大模型的垂直整合路线,复刻了英伟达“硬件+软件生态”的成熟模式,在竞争激烈的全球AI市场中构建了独特的差异化壁垒,实现了大模型核心算力的完全自主可控。
- 开辟边缘AI新赛道该组合为边缘AI部署提供了全新的低成本方案,无需采购昂贵的GPU加速卡,仅通过RISC-V通用服务器芯片即可运行270亿参数大模型,大幅降低了工业、安防、中小企业等场景的大模型落地门槛。
- 推动RISC-V生态升级此次突破直接将RISC-V架构的应用边界从微控制器、低端处理器,拓展至高端AI服务器级场景,带动整个RISC-V生态向高性能计算方向快速演进,打破了X86、ARM架构在AI算力领域的长期垄断格局。
- 玄铁C950是全球首款面向AI大模型原生优化的RISC-V服务器级CPU,打破了ARM架构在高端服务器算力领域的长期垄断,为国内AI算力自主可控提供了全新的技术路线,而Neoverse N2作为ARMv9时代的主流服务器核心,更多面向通用云计算场景,并未
声明:文中数据及部分观点来源于网络,部分观点来源于个人分析和推理,仅供参考,不构成投资或商业决策建议。
资料来源
- 阿里达摩院玄铁