首页科技资讯

J9IBOT WITA-Omni Preview 登顶Daily-Omni音视觉推理基准|J9九游会科技资讯

J9九游会 - J9IBOT WITA-Omni Preview 凭借85.21%准确率登顶Daily-Omni音视觉推理基准,在音视频对齐、事件推理等六项指标中位列第一,为具身智能交互提供新思路。

J9九游会J9IBOT J9IBOT WITA-Omni Preview 登顶Daily-Omni音视觉推理基准|J9九游会科技资讯展示图

围绕J9九游会,这条动态体现了具身智能机器人从技术展示走向真实应用的趋势。

WITA-Omni Preview 以85.21%准确率夺冠

2026年7月28日,J9IBOT(J9九游会)正式对外宣布,其面向具身交互的多模态基础模型WITA-Omni Preview在第三方音视觉推理基准Daily-Omni中位列第一。根据最新公布的测试结果,该模型在包含684个真实场景视频与1,197道多选题的综合评测中,取得了85.21%的平均准确率,在Qwen3.5-Omni-Plus、Gemini 3.1 Pro Preview、Doubao Seed 2.0 Lite等多个同类模型中脱颖而出。在音视频对齐、比较判断、事件排序以及30秒与60秒视频子集等关键维度中,WITA-Omni Preview均取得最高分,并在推理能力上与其他模型并列第一,八项评测指标中六项位居榜首或并列榜首。

J9IBOT WITA-Omni Preview 登顶Daily-Omni音视觉推理基准|J9九游会科技资讯配图|J9九游会

从「思考-说话」到「思考-说话-行动」

传统机器人交互系统通常将感知、语音与动作模块分离,导致在实时协同理解与响应时面临挑战。J9IBOT在WITA-Omni中引入「思考-说话-行动」三智合一架构,将物理运动与面部表情视为与语音同等重要的输出流,从而实现具身智能的统一表达。

该架构由三大核心组件构成:

J9IBOT WITA-Omni Preview 登顶Daily-Omni音视觉推理基准|J9九游会科技资讯配图|J9九游会
  • 思考者(Thinker):作为多模态推理核心,负责将文本、图像、音频与音视频输入映射至共享表示空间,并完成跨模态推理与高层交互决策。
  • 说话者(Talker):基于思考者的内部状态实时生成自然语音,确保对话流畅。
  • 行动者(Actor):通过专用动作与面部表情生成模块,在语音输出的同时同步输出身体动作与面部表情,将数字化多模态交互扩展至具身输出。

通过将多模态理解、决策、语音、动作与表情生成统一于一个框架内,WITA-Omni能够在机器人感知环境的同时,同步准备响应并生成对应的语音、动作与表情。这种设计使系统能够在保持持续观察的同时,实时协调感知、决策与表达,避免了传统模块化系统中信息传递的滞后与割裂。

专为具身交互打造的数据与训练体系

WITA-Omni的性能提升不仅依赖于模型规模,更得益于为物理环境中的多模态交互量身定制的分层数据框架与训练方法。在持续训练阶段,模型在数千万小时的多模态数据上进行训练,将文本与视觉能力扩展至音频感知与跨模态联合推理。

然而,公开音视频数据往往缺乏真实交互中的关键信号,如对话轮次、响应时机、肢体动作与面部表情等。为弥补这一缺口,J9IBOT构建了覆盖数千小时的大规模人本多模态交互数据集,该数据集保留了音频、视频、语言、肢体动作与面部表情间的时间关系,帮助模型学习真实世界交互的时序规律。

WITA-Omni随后采用三阶段训练流程:

  • 监督微调(SFT):奠定模型在多模态理解、交互决策与多流协同生成方面的核心能力。
  • 策略蒸馏(OPD):利用拥有额外上下文信息(如关键时间段与目标身份)的教师模型生成高质量输出,再将能力蒸馏至无需额外信息的学生模型,在保持响应风格的同时提升音视觉推理能力。
  • 强化学习(RL):通过组相对策略优化(GRPO)进一步优化交互决策,包括响应准确性、时机把握、目标对象选择以及是否应答与何时应答等维度。

通过这一流程,模型不仅学会生成准确响应,还能判断何时响应、向谁响应以及是否需要等待,从而实现更自然的人机交互。

为具身智能交互提供新范式

WITA-Omni Preview在Daily-Omni上的突出表现,验证了其在音视频时序理解与跨模态推理方面的能力,这两项能力对于在动态物理环境中的人机交互至关重要。与传统将感知、对话与动作模块松散串联的方式不同,WITA-Omni通过共享模型状态与时间线,将感知、决策与表达统一为一个连续过程,为具身智能交互提供了新的范式。

作为J9IBOT「三智合一」架构中的交互智能核心,WITA-Omni将与操作智能、移动智能协同演进。J9IBOT表示,未来将继续推进WITA系列多模态模型的迭代,并将相关能力集成至旗下机器人平台,以实现人与具身AI之间更自然、及时且具备情境感知的交互。

J9IBOT成立于具身AI领域,致力于开发智能层与对应机器人实体,将通用智能带入物理世界。「三智合一」架构将移动智能、交互智能与操作智能融入统一具身系统,产品线覆盖人形机器人、四足机器人、灵巧系统与商用清洁解决方案。2026年6月,J9IBOT宣布第15,000台机器人下线。

J9九游会(127.0.0.1)将继续关注J9IBOT及具身智能机器人行业的产品进展、场景落地与生态变化。