当前位置:首页 >

WAIC 2026 特别对话|央视专访朱军:AI从生成视频,到理解世界

发布日期:2026-07-21  浏览次数:0

近日,世界人工智能大会(WAIC)期间,央视频《科技零距离》推出“对话100个面向未来的科技人物”特别节目,邀请生数科技创始人、清华大学人工智能研究院副院长朱军,与总台央视记者张姵玲展开深度对话。

0.png

从实时视频生成到机器人通用大脑,从海量视频的数据价值到世界模型的技术路径,朱军系统分享了生数科技对通用世界模型的长期判断与实践。视频生成、实时交互与机器人行动,并非彼此割裂的技术方向,而是通用世界模型从理解、预测到行动的连续演进。


视频模型不只生成内容,也在学习世界如何变化

访谈中,朱军首先介绍了生数科技最新发布的实时交互模型Vidu S1。


不同于传统视频模型一次性生成固定片段,Vidu S1将用户输入持续纳入生成过程。用户可以直接通过语音与数字角色互动,模型实时理解语音中的情绪与指令,并生成相应的表情、动作和视频内容。


Vidu S1支持无限时长连续生成,用户还可以自定义角色形象、音色和人设,打造个性化实时交互角色,应用于直播、游戏、数字陪伴等场景。


在朱军看来,实时交互并不是独立于视频生成之外的新方向,而是视频模型走向世界模型的重要一步。


视频并非简单的像素序列,而是对现实世界动态变化的记录。人物、物体、环境、动作和事件,都以时空变化的方式包含在视频之中。通过大规模视频训练,模型不仅能够生成画面,也在逐步学习物体如何运动、环境如何变化,以及不同动作可能带来怎样的结果。


“从视频生成,到实时交互,再到动作生成,这三件事底层是一体的。”朱军表示,模型既可以在数字世界生成内容,也可以根据外部输入持续更新状态,并进一步在物理世界生成机器人可执行的指令。


从Vidu到Motubrain,视频生成如何走向物理世界

在外界看来,生数科技从视频大模型进入机器人领域,似乎是一次跨界。但朱军表示,公司对世界模型的探索开始得很早。


2024年,团队在Vidu模型上观察到超出预期的视频动态性与一致性,由此意识到,视频模型形成的时空建模和动态预测能力,并不只适用于内容生成,也有可能进一步延伸至物理世界。


2025年7月,生数科技发布Vidar。模型首先通过视频预测生成未来状态,再借助逆动力学模块,将未来状态映射为机器人动作,初步验证了视频生成模型支持物理行动的可行性。


2025年12月,生数科技进一步推出并开源Motus,在统一模型框架中整合环境理解、未来状态预测和动作生成,探索“理解—想象—行动”的完整闭环。


2026年4月,生数科技推出世界动作模型Motubrain,进一步面向复杂长程任务和跨本体泛化。面对制作咖啡、调制鸡尾酒、插花、浇水等任务,模型可以理解任务目标,将其拆解为多个步骤,并在执行过程中持续观察环境、预测变化和调整后续行动。


朱军表示,生数科技进入世界模型领域并非追逐行业热点,而是视频大模型技术路线的自然延伸。正是基于长期积累的视频模型能力,团队得以更早验证从视频预测走向动作生成的路径。


从Vidar到Motus,再到Motubrain,生数科技逐步推动视频模型从生成数字内容,走向理解并作用于物理世界。


突破具身智能“数据墙”,构建世界模型数据金字塔

当前,具身智能面临的一个核心挑战,是高质量机器人数据采集成本较高,并且容易受到本体、任务和环境的限制。


传统VLA模型通常依赖遥操作采集机器人轨迹,再通过模仿学习拟合特定动作。这种方式可以在相对受限的场景中取得较高精度,但难以覆盖真实环境中的各种变化。当物体、背景或机器人本体发生变化时,模型的泛化能力往往会明显下降。


生数科技选择了一条不同的路线:先通过海量、多样、真实的视频数据学习通用世界知识,再利用机器人数据完成专业技能和具体本体的对齐。


朱军将这一数据体系概括为“数据金字塔”,覆盖互联网通用视频、第一视角人类动作视频、仿真合成数据和机器人实采轨迹等不同类型的数据。


其中,通用视频帮助模型广泛认识人物、物体、环境和动作规律;第一视角视频提供更接近人类操作过程的信息;仿真和机器人轨迹数据,则进一步补充本体状态、控制指令和精确的动作反馈。


这种训练方式与人的学习过程相似。人在掌握一项专业技能之前,已经通过长期观察建立了对周围世界的基本认识。真正学习骑车或使用工具时,只需要少量专业指导,就可以快速完成迁移。


因此,生数科技希望先进行通用知识和通用技能的学习,再进行专业技能训练。基于强大的通用基座,模型在适配新本体和新任务时,可以降低对大规模真机数据的依赖。


但拥有海量数据只是第一步,更重要的是,模型能否真正利用这些数据。


过去,互联网视频由于缺少机器人动作标注和控制信号,很难被传统VLA模型直接使用。生数科技选择生成式技术路线,以视频预测和重建为学习目标,让模型从像素变化中自主学习人物、物体、空间、动作和状态演化。


在朱军看来,大模型时代应当采用更加通用、朴素的学习目标。语言模型通过预测下一个Token学习语言规律;对于视频和世界模型,最基础的目标就是预测和还原像素。


虽然像素级预测难度更高,但也正因如此,模型必须同时处理物体、空间、时间、动作和状态变化。越完整、越接近数据本身规律的学习目标,越有可能推动模型形成更深层的世界理解。


早在2022年,团队便提出并开源U-ViT架构,将Transformer的注意力机制引入扩散模型,提升扩散模型的可扩展性,并验证其Scaling Law。这也为生数科技此后开展大规模视频模型和世界模型训练奠定了技术基础。


原创MoT架构,统一理解、预测和行动

数据决定模型能够学习多少世界知识,架构则决定这些知识能否被统一组织和调用。


目前,不少具身智能方案仍采用相对分离的结构:视觉模型负责理解环境,世界模型负责预测未来,策略模型再负责输出动作。


这种模块化方式在特定任务中较容易实现,但不同模块独立训练,容易带来信息损失与误差累积,也很难形成能够持续扩展、跨任务复用的通用基座。

为此,生数科技自主提出并持续演进Mixture-of-Transformer,即MoT统一架构。


在这一架构中,理解专家负责感知和理解环境,生成专家负责预测未来状态,行动专家负责生成机器人动作。不同专家通过联合注意力机制协同,在同一个模型中实现理解、预测和行动的一体化。


基于同一个底层基座,模型既可以在像素空间生成和预测视频,也可以在动作空间输出机器人可执行的动作,还可以同时预测未来状态和动作。


生数科技并不是在视频模型之外简单外挂一个动作模块,而是希望从底层架构上连接数字世界和物理世界,通过统一架构、像素级学习目标和端到端全局优化,建立可规模化扩展的通用基座。


Motubrain正是基于MoT统一架构打造。在同一个模型中,它可以统一完成环境理解、未来状态预测和动作轨迹生成。