智元硅光动语登顶全球全模态榜单
智元自研的具身原生全模态大模型WITA-Omni Preview以85.21分登顶DailyOmni全模态理解榜单,超越千问、Gemini、豆包及英伟达模型,八项细分指标中六项第一。独创Thinker-Talker-Actor三层端到端架构。
2026年7月28日,智元机器人正式发布重磅成果——旗下具身原生全模态大模型智元硅光动语(WITA-Omni Preview),在具身全模态理解权威第三方榜单DailyOmni中以85.21分的综合成绩登顶全球榜首,一举超越千问、谷歌Gemini、豆包及英伟达旗下同类模型,在八项细分评测指标中斩获六项第一,成为全球首个在该权威榜单中夺冠的具身智能交互模型,标志着中国具身智能的全模态交互能力正式跻身全球第一梯队。
一、硬核实力:榜单含金量与合规基础
DailyOmni榜单是当前行业公认的具身全模态能力“试金石”,评测素材大量取自真实开放环境的音视频内容,核心考验模型融合视觉画面、环境音频信息,精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力,高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力,绝非实验室环境下的封闭测试。 除了榜单成绩亮眼,智元硅光动语还是全国首款在2026年5月通过合规备案的具身智能交互大模型,依托智元独创的“三智一体”(运动智能、作业智能、交互智能+稳定硬件本体)全栈技术体系打造,从诞生之初就定位为人形机器人专属的交互智能底座,为后续规模化商用筑牢了合规根基。
二、技术突破:重构具身交互底层逻辑
不同于传统多模态模型依赖多模块串行调用的流水线模式,智元硅光动语独创“思考-表达-行动”(Thinker-Talker-Actor)三层原生端到端架构,将物理动作和表情提升为与语音并列的一级输出,让“看、听、说、动”在统一时间轴上同步推进,彻底解决了传统交互中信息割裂、延迟累积的痛点。 在训练层面,智元通过千万小时级多模态数据基座,搭配“监督微调-同策略蒸馏-强化学习”三阶段特训方法,让机器人具备在多人复杂场景中自主判断“该不该回应、何时回应、回应谁”的能力,当前预览版已实现低延迟流畅交互,后续正式版本更可支持中途插话、打断和纠正等拟人化交互方式,让机器人的沟通体验无限贴近真人。

三、迭代路径:从预览版到商用级的持续进化
智元已明确清晰的产品迭代节奏:2026年三季度将正式推出WITA Omni 1.0正式版本,把交互时延进一步压缩至500毫秒以内,完全匹配真人对话的响应节奏;后续将持续夯实“三智一体”技术架构,实现交互智能与作业智能、运动智能的深度协同联动,打通全模态感知、决策、执行的完整闭环。 同时,智元将依托真实场景部署积累的海量交互数据驱动“数据飞轮”进化,持续优化模型的全模态协同能力,让机器人的语言、语音、表情、肢体动作表达更贴合人类的自然交互习惯,不断拉近具身智能与人类的沟通距离。
四、落地前景:覆盖多场景的商用新空间
依托顶尖的全模态交互能力,智元硅光动语将率先在四大核心场景落地:
- 商业服务场景:覆盖商场展馆导览、门店导购、零售站点智能接待,可自主完成问答、路线指引、商品推荐等全流程服务,替代传统人工完成重复性接待工作;
- 公共服务场景:落地政务大厅、医院、银行等场所,提供咨询引导、业务指引等服务,有效提升公共服务的运转效率,降低人工服务压力;
- 家庭陪伴场景:搭载在人形机器人上实现情感化陪伴、生活助手功能,可完成家居控制、健康提醒、日常陪护等任务,成为具备人格感的“硅基伙伴”;
- 工业辅助场景:应用于工厂巡检、设备操作辅助环节,通过自然交互降低工业机器人的使用门槛,帮助一线操作人员快速完成设备调试、状态排查等工作。
本次智元硅光动语登顶全球榜单,不仅是单一模型的技术突破,更推动国内具身智能产业从“技术验证”全面迈向“合规商用”的部署态新阶段,后续随着国产具身智能技术集群的持续发力,人形机器人走进真实生产生活场景的速度将进一步加快。