AI大模型
超越谷歌和英伟达,智元硅光动语大模型登顶DailyOmni全球榜首
发布时间:2026年07月29日 09:00:00智元自研具身原生全模态大模型WITA-Omni Preview以85.21分登顶DailyOmni榜单,超越千问、Gemini、豆包、英伟达等国内外主流模型,在八项细分能力中斩获六项第一。
榜单发布
2026年7月28日,复旦大学研究团队发布的音视频跨模态推理评测基准"每日全模态交互能力评测"(DailyOmni)最新榜单显示:
智元硅光动语大模型预览版(WITA-Omni Preview)以85.21分的综合成绩登顶榜首,超越千问、谷歌双子座(Gemini)、豆包及英伟达旗下模型。
DailyOmni榜单
DailyOmni是行业公认的检验大模型音视频时序对齐与跨模态联合推理能力的权威第三方榜单:
- 由香港大学、卡内基梅隆大学(CMU)等机构联合推出
- 重点考察模型在真实开放环境下的"全模态感知"能力
- 评估机器人在复杂物理空间中的交互决策能力
- 核心挑战:精准判断"谁在说话"“事件发生的先后顺序”
技术架构:思考-表达-行动
硅光动语是智元自研的具身原生全模态大模型,属于智元"一体三智"(本体、运动智能、作业智能、交互智能)中的交互智能。
针对传统机器人"听、看、说、动"思维割裂、交互生硬的痛点,该模型独创了**“思考-表达-行动”(Thinker-Talker-Actor)三层端到端架构**:
- 视觉理解物理世界:依靠视觉直接理解,不再额外需要语音或文字指令
- 感知决策统一驱动:实现感知、决策与表达的一体化
- 会看眼色:不仅"听得懂",还能判断"该不该回应、何时回应、回应谁"
训练方法
通过千万小时级多模态数据基座与三阶段特训:
- 监督微调:构建高质量的多模态训练数据
- 同策略蒸馏:模拟"老师"和"学生"角色复制能力
- 强化学习:配备"奖惩机制",保持表达风格统一
八项细分能力六项第一
WITA-Omni Preview在八项细分指标中斩获六项第一,展现了在以下领域的全面优势:
- 音画联合推理能力
- 多人复杂场景交互
- 时序理解与事件排序
- 跨模态联合决策
- 自然对话交互
- 情境感知与响应
行业意义
国产模型崛起
在此次榜单前五名中,除了智元,千问、豆包等多款国产大模型亦跻身前列,彰显了中国人工智能在全模态感知领域的技术优势。
合规商用
今年5月,硅光动语大模型通过备案,成为全国首款合规备案的具身智能交互大模型,进入合规商用阶段。
生态协同
未来将与负责物理操作的"视觉-语言-动作"(VLA)模型,以及提供虚拟训练环境的世界模型GE-Sim 2.0深度协同,加速人形机器人在商业服务、公共导览等场景的规模化落地。
市场反应
此次登顶标志着中国企业在具身智能交互领域取得重要突破,为国产机器人参与全球竞争注入了强心剂。