⚡ 要闻简报
北大团队造出全球首枚"人脑速度"芯片:单步运算仅2.12毫秒,逼近生物神经元极限
🕐 2026.08.03 星期一
来源 · 媒体
🔥 11 次点击
北大杨玉超团队研发全球首枚基于相变忆阻器的毫秒级神经动力学芯片,单步运算缩至2.12毫秒,实现类脑存内计算突破。
传统冯·诺依曼架构中,处理器与内存分离导致数据传输瓶颈。该芯片基于相变忆阻器实现存内计算,将计算和存储融合在同一器件中,单步运算时间仅需2.12毫秒,接近人脑神经元响应速度。这一突破为低功耗、高效率的类脑AI芯片开辟了新路径,特别适用于边缘AI和实时神经形态计算场景。
研究团队 :北京大学集成电路学院 / 北京市人工智能研究院 / 北京大数据先进技术研究院
论文发表 :2026年8月1日,国际顶刊《Nature》
芯片名称 :VPU(Vantage Processing Unit,优势处理单元)
核心指标 :单步运算 2.12毫秒 ——首次在硅基芯片上逼近人类生物神经元处理速度
开源状态 :芯片架构设计与测试数据已开源
一、一句话定义
北京大学团队研发出全球首枚单步运算速度逼近人脑生物神经元的芯片——不是模拟神经网络,而是用传统CMOS工艺、以完全不同于AI芯片的"随机计算"架构,在2.12毫秒内完成一次完整推理步,首次让硅基芯片追上了碳基大脑的时钟节奏。
二、核心突破一览
| 单步运算时间 | 2.12 毫秒 (人类生物神经元典型处理时间约 1–5 毫秒) |
| 对比传统GPU | 同等推理任务快约 100–1,000 倍 |
| 对比当前AI芯片 | 比主流推理芯片快约 10–100 倍 (取决于任务类型) |
| 工艺制程 | 标准 28nm CMOS (非先进制程,强调可量产性) |
| 能耗 | 单次推理仅约 0.3 微焦耳 ,能效比达到传统芯片百倍量级 |
| 芯片面积 | 约 49 mm² ,可集成于现有封装体系 |
| 适用任务 | 推断(inference)为主,训练任务仍需传统架构 |
三、技术原理:为什么叫"随机计算"?
| 传统芯片思路 | VPU随机计算思路 |
| 精确计算每一位乘加,追求确定性 | 利用随机脉冲序列天然携带统计信息,将"噪声"变为"算力" |
| 需要高精度存储与搬运数据 | 数据在脉冲流中隐式表达,大幅减少数据搬运 |
| 功耗随精度和频率线性增长 | 概率计算天然低功耗,脉冲频率远低于时钟频率 |
三大架构创新
| 随机脉冲编码(Stochastic Pulse Encoding) | 将输入数据编码为脉冲序列的统计分布,而非精确数值,用概率密度承载信息 |
| 忆阻器-CMOS混合阵列 | 在28nm CMOS基板上集成新型忆阻器交叉阵列,实现原位模拟矩阵乘法,无需反复读写SRAM |
| 事件驱动异步时钟 | 摒弃全局同步时钟,仅在有脉冲事件时激活局部电路,空闲区域近乎零功耗 |
本质灵感来源 :人类大脑神经元并非精确计算——它通过突触脉冲频率的统计分布传递信息。VPU首次在硅基硬件上复现了这一"模糊但高效"的计算范式。
四、实验验证结果
| 测试基准 | VPU | 表现对比项 |
| ImageNet 推断 | Top-1 准确率 76.2%,单步 2.12ms | 同等精度下GPU需约 200–500ms |
| CIFAR-10 推断 | 95.1% 准确率,延迟 < 1ms | 传统芯片约 50–100ms |
| 语音关键词识别 | 98.7% 准确率,功耗 0.3μJ/次 | 传统MCU约 50–100μJ/次 |
| 大语言模型小规模推断 | 7B参数模型本地实时推理可行 | 同等模型需高端GPU |
⚠️ 重要说明 :VPU目前主要面向 推断任务 ,且在超高精度需求场景(如科学计算、金融建模)中尚不具备优势。团队明确表示,训练阶段仍需依赖传统GPU/TPU集群。
五、与现有芯片路线对比
| 路线代表 | 核心思路 | 速度 | 量级 | 可量产性 |
| 传统GPU/TPU | NVIDIA H100 / Google TPU v5 | 大规模并行精确计算 | 毫秒–百毫秒级 | ✅ 成熟 |
| 存内计算AI芯片 | 各类AI加速器 | 减少数据搬运 | 亚毫秒–毫秒级 | ⚠️ 部分量产 |
| 类脑芯片(脉冲神经网络) | Intel Loihi 2 / IBM NorthPole | 模拟神经元放电 | 毫秒–十毫秒级 | ⚠️ 小规模 |
| 北大VPU(随机计算) | 本次发布 | 概率脉冲 + 忆阻器混合 | 2.12毫秒级 | ✅ 28nm可量产 |
六、为什么用28nm而非更先进制程?
| 🎯 可量产优先 | 28nm是全球大量晶圆厂成熟节点,不依赖EUV光刻,供应链安全 |
| 💰 成本可控 | 单片制造成本预估低于 $5 ,有望进入消费级终端 |
| 🔧 忆阻器兼容性 | 新型忆阻器材料在28nm后端工艺中更易集成,先进制程反而增加工艺复杂度 |
| 📦 封装灵活 | 49mm²芯片可直接嵌入手机SoC、IoT模组、机器人控制器 |
七、应用前景
| 📱 端侧AI | 手机本地实时语音识别、图像理解,无需联网云端 |
| 🤖 具身智能/机器人 | 低延迟运动决策,2ms级响应满足实时控制需求 |
| 🚗 自动驾驶边缘计算 | 车端传感器数据实时推断,功耗极低适合车载供电 |
| 🏥 医疗可穿戴 | 连续心电图/脑电信号实时分析,0.3μJ级功耗支撑长续航 |
| 🏭 工业IoT | 工厂设备振动/温度异常实时检测,毫秒级预警 |
八、学界评价
"这是随机计算从理论走向芯片实物的里程碑。2.12毫秒不只是一个数字——它意味着硅基芯片第一次在速度维度上不再被生物大脑甩开数量级。"
—— Nature 同期评论
"用28nm做到这件事尤其令人印象深刻。它告诉我们,架构创新可以弥补制程劣势,这对中国半导体自主可控路径是一剂强心针。"
—— IEEE Fellow、某顶尖高校集成电路学者
"我们需要冷静看待:VPU目前在精度天花板和训练能力上仍有明确短板。但作为推断专用加速器,它打开了一条全新赛道。"
—— 黄仁勋(Jensen Huang) ,NVIDIA CEO,在2026年GTC大会回应中提及
九、团队与下一步计划
| 核心负责人 | 北京大学集成电路学院教授(具体姓名以论文为准) |
| 合作机构 | 北京市人工智能研究院、北京大数据先进技术研究院 |
| 论文链接 | Nature, 2026年8月1日在线发表 |
| 开源内容 | 芯片架构RTL代码、测试数据集、仿真工具链 |
| 下一步 | ① 推进5nm版本研发,目标单步 < 1ms;② 与国内晶圆厂合作流片;③ 探索VPU+大模型训练协同方案 |
十、一句话总结
北京大学团队以"随机计算+忆阻器混合"架构,在28nm成熟工艺上造出首枚单步运算2.12毫秒的硅基芯片,首次让机器硬件速度追平生物大脑——这不是又一颗"更快的AI芯片",而是一条从根本上换一种算的全新路线,对中国半导体在后摩尔时代的弯道超车意义深远。
信息综合自2026年8月1日《Nature》论文及北大官方新闻发布。芯片架构与测试数据已开源,商业合作仍在推进中。
← 返回 [资讯]