凯时AG

从天生到行动,,生数科技用通用天下模子毗连「两个天下」

作者:胡财东
宣布时间:2026-07-23 02:31:20
阅读量:89

从天生到行动,,生数科技用通用天下模子毗连「两个天下」

在天下人工智能大会(WAIC)的展馆里,,机械人通常是最抢镜的一类展品。。

机械臂抓取物体、人形机械人听从指令完立室务,,“天下模子”也经常陪同这些演示泛起,,用来诠释机械人怎样明确情形、展望转变并完成行动。。久而久之,,天下模子似乎逐渐成为机械人和自动驾驶领域的专属看法。。

但在生数科技首创人、清华大学人工智能研究院副院长朱军看来,,通用天下模子并不但服务于某个简单场景,,其焦点是通过统一的基座与架构,,实现对天下的明确、展望与行动。。

7 月 20 日,,在生数科技与万兴科技联合承办的“天下模子驱动下的 AI 影视生产力新范式”专题论坛上,,朱军提出天下模子不是视频模子的升级,,也不是语言模子的延伸,,而是 AI 从“天生内容”迈向“明确天下、推演天下、实时交互天下”的新范式。。

基于统一底层基座,,模子既可以在像素空间天生视频内容,,也可以在行动空间输出机械人可执行的行动。。AI 视频与具身智能因此并非两条割裂的手艺蹊径,,而是天下建模能力在数字天下和物理天下中的差别延伸。。

这也是明确生数科技通用天下模子战略的要害。。

公众最早通过视频大模子 Vidu 熟悉这家公司。。现在,,其产品系统已经从数字内容天生拓展至实时交互和物理行动:天下天生模子 Vidu 明确并天生动态数字内容 ;;;;;;实时交互模子 Vidu S1 将用户指令纳入天生历程 ;;;;;;天下行动模子 Motubrain 则将对情形的明确和展望转化为机械人行动。。

看似分属 AI 视频与具身智能两条赛道,,现实上,,三款产品沿着统一条路径睁开:天生天下、在天下中交互,,并最终行动于天下。。

01天下模子的焦点,,不但是“展望下一帧”

天下模子事实需要具备什么能力??????

朱军将其概括为三个部分:明确、想象和行动。。

首先,,模子要感知并明确目今情形 ;;;;;;其次,,要展望差别输入或行动可能带来的转变 ;;;;;;最后,,还要把明确和展望转化为可执行的决议。。

这与人类学习骑车、开车等手艺的历程相似。。人在接纳行动前,,会预判差别操作的效果,,再选择更清静、稳固的方案。。

因此,,天下模子不但是天生一个看起来真实的未来,,也不但是展望下一帧画面,,而是要形成从明确目今状态、推演未来转变到指导行动的闭环。 ;;;;;;等耸钦馓啄芰ψ钪惫邸⒁笠沧罡叩挠τ弥,,但不是唯一应用。。

数字内容同样需要天下建模。。

图片纪录的是一个瞬间,,视频则包括时间、空间和状态的一连转变。。人物运动时,,身体、衣服和配景要坚持合理转变 ;;;;;;镜头切换后,,角色外貌、服装和空间位置不可无故改变 ;;;;;;随着内容延伸,,模子还要处理物体关系、事务顺序和情形状态。。

视频模子不但要知道物体“长什么样”,,还要学习它怎样运动、怎样与情形爆发关系,,以及一个状态怎样演变为下一个状态。。

虽然,,天生连贯视频并不等同于拥有完整的通用天下模子能力,,但视频天生所要求的时空建模、动态展望和状态一致性,,为进一步走向实时交互和物理行动提供了基础。。

02视频数据,,是构建通用天下模子的主要底座

从第一性原理出发,,构建通用天下模子需要解决两个问题:数据和架构。。

已往,,大模子通过通用架构、规 ;;;;;;莺退懔π纬 Scaling Law。。要让天下模子从特定场景的小模子走向通用基座,,同样需要大规模、多样化的数据。。

生数科技将相关数据归纳为一个从互联网视频到机械人实采轨迹的“数据金字塔”,,其中包括通用视频、第一视角人类行动视频、合成数据和机械人轨迹数据。。

这些数据的差别,,主要体现在规模和精度上。。

互联网视频规模重大,,纪录了人物、物体、情形、行动及其时空关系。。影视剧、纪录片、监控视频和第一视角影像,,都生涯了真实天下运行的一部分信息。。

机械人轨迹数据则能够提供枢纽角度、控制信号、力反馈和行动效果,,但收罗本钱高,,规模远小于互联网视频。。

已往,,由于缺少行动标注和机械人控制信号,,通用视频很难直接用于从状态到行动的学习。。但随着视频天生模子生长,,模子可以通过展望和重修视频,,学习空间、时间、行动和效果之间的关系,,视频数据也由此成为天下模子大规模预训练的主要基础。。

不过,,视频数据不可替换机械人数据。。

视频可以告诉模子行动在视觉上怎样爆发、情形怎样转变,,却无法完整提供机械人执行所需的枢纽角度、力反馈、本体状态和控制信号。。

更合理的路径,,是先通过海量视频学习通用的天下纪律,,再通过机械人数据增补准确的行动知识和物理反。。呵罢咄卣固煜履W拥娜现愣,,后者提升行动精度。。

03从 Vidu 到 Motubrain,,是统一套能力的逐步延伸

若是只看产品形态,,生数科技从视频天生走向具身智能,,像是一次横跨两条赛道的营业扩张。。但从其模子生长路径来看,,这更像是视频建模能力向实时交互和物理行动的自然延伸。。

生数科技从建设之初便定位于基础模子,,并将视频建模作为手艺起点。。在模子训练历程中,,团队逐渐发明,,视频模子的能力上限并不但体现在画质、时长和天生效果上。。随着数据和模子规模扩大,,模子对人物、物体、空间关系与动态转变的明确也在一连增强。。

这意味着,,视频模子学习的不但是怎样天生画面,,还包括天下怎样随时间转变。。模子对时空结构、运动纪律和状态演化明确得越深入,,就越有可能从内容天生进一步走向实时交互,,以致物理行动。。

已往两年,,视频基模也履历了从展示手艺可能性,,到进入真实生产环节的快速演进。。

早期的视频天生更多用于展示模子能够“天生什么”,,现在,,模子最先被用于广告、短剧、影视等现实生产场景,,并逐步肩负提高内容可用率、缩短制作周期和降低生产本钱的使命。。

以 Vidu Q1 为例,,其推出的参考生视频能力,,允许用户通过主体参考图天生角色和视觉元素相对一致的视频。。以后,,参考生视频逐渐成为行业中的主要产品范式,,也让视频模子从随机天生工具,,进一步走向可控制、可复用的生产工具。。

关于生数科技而言,,这一历程也强化了一个判断:高质量视频基模不但能够服务内容生产,,其在大规模训练中形成的时空明确、动态展望和状态一致性能力,,也可以继续迁徙至更普遍的智能使命。。

解决数据之后,,还需要一套能够统一组织这些能力的模子架构。。现在,,一些具身智能方案仍然接纳疏散式结构:感知模子认真识别情形,,天下模子认真展望未来,,战略模子认真输出行动。。差别模浚????榛钟呕,,容易带来信息割裂和误差累积。。

生数科技的思绪,,是通过 Mixture-of-Transformer(MoT)架构,,将情形明确、天下状态展望和行动轨迹天生整合至统一框架。。模子既可以在像素空间天生视频,,也可以在行动空间输出机械人行动,,还可以凭证使命需要举行联合展望。。

基于这一架构,,生数科技的三项产品划分肩负差别层级的使命。。

天下天生模子 Vidu 支持文生视频、图生视频、参考生视频等创作方式,,一连提升主体与场景一致性、运动体现、物理合理性、镜头控制及内容交互性,,资助创作者越发高效地完成高保真内容创作。。

实时交互模子 Vidu S1 进一步将外部输入纳入天生循环。。用户可以在互动历程中一连发出语音指令,,让角色实时改变心情、行动和行为。。每一次输入都可能影响下一时刻的画面,,模子不但要天生内容,,还要凭证反馈一连更新状态。。

Vidu S1 支持无限时长一连天生,,可实现 540P、25FPS 输出,,最高支持 42FPS,,并允许用户基于真人、动漫或萌宠形象及个性化音色建设交互角色。。

到了天下行动模子 Motubrain,,模子的输出则从数字内容变为机械人可以执行的行动。。Motubrain 定位于具身智能机械人的通用大脑,,将情形明确、天下状态展望与行动轨迹天生统一建模。。面临插花、浇水等使命,,模子需要明确目今情形和使命目的,,展望差别行动可能带来的效果,,并天生气械人可以执行的行动轨迹。。

三款产品划分回覆了三个递进的问题:能否天生一个一连转变的数字天下??????能否让这个天下凭证外部输入实时更新??????能否将对天下的明确和展望转化为物理行动??????

它们不是三款产品的简朴并列,,也不是生数科技从视频天生突然转向机械人,,而是统一套天下建模能力从天生、交互到行动的逐步延伸。。

从 Vidu Q1 建设参考生视频的生产范式,,到 Vidu Q3 提升重大音视频内容天生能力,,再到 Vidu S1 和 Motubrain 划分走向实时交互与物理行动,,生数科技试图建设的是一套能够同时服务高质量内容生产和具身智能落地的通用基础模子。。

04机械人之外,,天下模子尚有更大界线

行业习惯将天下模子与机械人绑定,,一个主要原因是机械人能够把展望转化为可见的物理效果。。

杯子是被乐成拿起,,照旧被机械臂碰倒,,效果一目了然。。真真相形也会严酷磨练模子是否明确空间关系、接触关系和行动效果。。

但类似问题同样保存于数字内容中。。

角色上一镜拿起的杯子,,下一镜是否还在 ;;;;;;人物转死后,,服装和配景是否合理转变 ;;;;;;导演修转业动后,,角色身份、空间关系和镜头节奏能否坚持稳固。。这里虽然没有机械臂,,模子仍然需要维护一个一连转变的情形。。

两类使命的差别主要在于输出形式和风险品级。。数字内容蜕化可以重新天生,,机械人行动失误则可能造成现实损失。。因此,,物理天下对实时感知、控制精度、稳固性和清静性提出了更高要求。。

但天下模子所学习的内容,,不应只由最终毗连的是屏幕照旧电机来界说。。只要模子需要体现目今状态、展望未来转变,,并凭证外部输入更新情形或作出行动,,天下建模能力就已经加入其中。。

机械人不是天下模子的唯一归宿,,而是其中对感知、展望、决媾和执行闭环要求更高的一种应用。。

05数字天下与物理天下怎样形成互补

生数科技同时结构数字天下和物理天下,,不但是由于二者可以共享底层手艺,,还由于两条蹊径有可能在数据、反馈和能力验证上形成互补。。

数字天下的优势在于数据规模大、使用频率高、试错本钱低。。

海量视频可以资助模子学习物体运动、人物行为和情形转变 ;;;;;;广告、短剧、影视和互动内容的生产,,又能一连爆发真实反馈,,例如哪些效果被接纳、哪些镜头频仍返工、角色一致性和行动体现在哪些场景下容易蜕化。。

物理天下则提供更准确的行动数据和更严酷的因果磨练。。

机械人必需遵守真实空间中的尺寸、接触、受力和运动约束。。使命是否完成、物体是否被碰倒、行动是否清静稳固,,无法依赖视觉效果掩饰。。这些反馈可以磨练模子学到的纪律能否转化为可靠行动。。

反过来,,机械人在真实使命中学习到的行动知识、物体交互纪律和空间约束,,也可能资助视频模子提升运动体现和物理合理性。。

概括来说,,数字天下资助模子扩大对天下的认知规模,,并提供更快的产品反。 ;;;;;;物理天下则磨练这些认知能否转化为准确、稳固的行动。。

生数科技这条蹊径真正值得视察的,,是二者能否形成正向循环:视频预训练为机械人提供通用天下知识,,机械人行动为视频模子增补物理约束,,数字内容的规 ;;;;;;褂煤蜕桃祷乇,,则为恒久的基座模子训练提供支持。。

这也是通用天下模子战略最具想象力、同时最需要验证的部分。。

06最终仍要接受生产力的磨练

已往一轮大模子生长,,AI 主要从语言和静态知识中学习纪律。。天下模子则进一步将学习工具扩展至空间、时间、状态转变和行动效果。。

这让视频天生、实时数字角色和机械人控制进入统一个手艺命题。。

天生视频,,需要维持人物、场景和行动的一连性 ;;;;;;驱动实时数字角色,,需要凭证用户输入一连更新状态 ;;;;;;控制机械人,,则要进一步展望行动效果,,并天生可执行的行动轨迹。。

对生数科技而言,,Vidu 不是通用天下模子战略之前的旧营业,,Motubrain 也不是与视频割裂的新偏向。。前者天生数字天下,,Vidu S1 让数字天下接受实时反馈,,后者则实验将明确和展望转化为物理行动。。

在数字天下,,要看模子能否提高内容可用率、镌汰返工并降低生产本钱 ;;;;;;在物理天下,,则要看机械人能否走出仿真和演示,,在差别本体、使命和动态情形中恒久稳固运行。。

当内容天生、实时交互与物理行动逐步建设在统一套天下建模能力之上,,AI 也将从明确和天生信息,,进一步走向明确天下、展望天下,,并行动于天下。。对生数科技而言,,这既是从 Vidu 走向 Motubrain 的手艺路径,,也是其押注通用天下模子的恒久逻辑。。

 

文章点评

未盘问到任何数据!

揭晓谈论

◎接待加入讨论,,请在这里揭晓您的看法、交流您的看法。。

最新文章

热门文章

随机推荐

【网站地图】