作者 | 邱晓芬
编辑 | 袁斯来
硬氪获悉,,,「眸深智能」(Motion Brain)完成近亿元Pre-A轮追加融资,,,本轮投资方包括中国头部物业服务公司、香港财团、多家上市公司联合打造的工业投资平台瑾悦投资、创合汇资源,,,以及老股东徐汇资源。。。。。。
这也是继2026年5月3亿元Pre-A轮之后,,,「眸深智能」两个月内再次获得投资,,,别的,,,该公司Pre-A+轮的近5亿融资也在交割当中。。。。。。该公司透露,,,今年上半年以来,,,「眸深智能」的估值增添超10倍,,,是业内生长速率最快的具身大脑企业之一。。。。。。
「眸深智能」建设于2025年1月,,,定位为全球最懂行动的自进化具身大脑公司,,,致力于"给10亿台机械人装原生通用大脑"。。。。。。
该公司由复旦大学深度学习实验室主任陈涛教授、原英特尔中国首席科学家张益民博士,,,与一连创业者穆泽林配合开办。。。。。。焦点团队拥有海思、英特尔、英伟达三大芯片巨头的配景人士,,,是海内少数具备算子级适配能力的具身大模子团队。。。。。。
只管2025年才注册建设,,,「眸深智能」的手艺积累从2022年已经最先。。。。。。在手艺蹊径上,,,「眸深智能」选择了一条与主流VLA(视觉-语言-行动)差别的路径——以行动为焦点的"天下行动模子"(World Motion Model)。。。。。。
(图源/企业)
从2022年起,,,「眸深智能」团队已经宣布了MLD(隐空间行动扩散模子)。。。。。。在其时,,,行业主流是将行动视为离散的信号,,,导致天生的行动僵硬且缺乏多样性,,,而「眸深智能」团队在全球dede规模内首次提出将行动映射到隐空间(Latent Space),,,并引入扩散模子(Diffusion Model)。。。。。。
MLD相当于让AI学会了“无师自通”地天生行动:不再需要逐帧教机械人怎样走路,,,而是让模子像画家去噪一样,,,从一团随机噪声中还原出自然、连贯的人体姿态。。。。。。
若是说MLD解决了“怎么天生行动”,,,「眸深智能」又进一步着眼于怎样“指挥行动”。。。。。。2023年9月,,,团队创立性宣布了MotionGPT。。。。。。类比汉字的基本笔画,,,团队将人体姿态拆解为约3000个“行动基元”。。。。。。就像大语言模子(LLM)通过展望下一个token来天生句子一样,,,MotionGPT通过展望下一个“行动token”来天生重大行为。。。。。。
这种将一连行动离散化的处理方式,,,不但极大地提升了模子对长序列使命的明确能力,,,更主要的是,,,它让机械人具备了Zero-Shot(零样本)泛化能力——没见过的行动指令,,,也能通过重组行动词汇来明确并执行。。。。。。这也是全球首个把行动做成token的具身大模子,,,揭晓于NeurIPS 2023。。。。。。
到了2026年,,,团队已经累计宣布了7代模子,,,基于前述积累,,,「眸深智能」团队又进一步推出了STI- WM(时空一体天下行动模子)具身大模子。。。。。。
STI-WM时空一体天下行动模子是完周全向机械人长时序妄想、在线闭环控制、真实物理交互打造的原生具身智能框架,,,实现空间结构、时间演化、物理一致性、执行鲁棒性四维一体化统一。。。。。。
据先容,,,STI-WM的焦点突破在于,,,彻底挣脱了古板VLA(视觉-语言-行动)模子对海量真机数据的重度依赖,,,接纳了“80%互联网视频+10%动捕数据+10%真机数据”的训练配方,,,并MotionGPT建设的行动辞书,,,从海量无标注的视频中学习物理纪律,,,再用少量动捕数据校准生物力学特征,,,最后仅用10%的真机数据完成闭环对齐。。。。。。
也就是说,,,这种全新的数据训练范式,,,将真机数据需求降低了90%,,,又将行动准确度提升至99%。。。。。。
同时,,,「眸深智能」团队又在今年3月提出的T?MB(Task*Task Motion Brain)也让机械人具备了离线自进化能力,,,当模子安排到端侧后,,,无需联网回传数据,,,仅凭外地交互就能一连优化性能,,,使命执行准确度最高提升25%,,,解决了机械人落地后发明bug必需返厂升级的痛点。。。。。。
值得注重的是,,,英伟达DAIR实验室在最新ARDY模子中,,,便援引了「眸深智能」的MLD与MotionGPT两项原创手艺——这是近两年英伟达第三代行动模子对该公司手艺蹊径的第四次引用。。。。。。
不过,,,真正决议这套大脑能否规;;;;,,,除了手艺蹊径之外,,,尚有端侧算力本钱,,,这也是「眸深智能」的一大竞争壁垒。。。。。。据先容,,,「眸深智能」从第一代模子起就同步推进两个偏向——模子压缩与国产芯片适配。。。。。。
一方面,,,通过模子蒸馏、冗余参数压缩等工程化方案,,,「眸深智能」将千亿参数级模子压缩至百亿级别,,,在详细场景中参数目降低约75%,,,端侧推理延迟从约200毫秒降至10毫秒左右;;;;另一方面,,,同步适配海思(昇腾310/910)、地平线、燧原(燧原S60)等国产芯片平台,,,实现低功耗、高实时、超低本钱的端侧推理。。。。。。
这套软硬协同的打法,,,带来的直接效果是,,,模子端侧推理本钱从20万元降至1万元,,,大脑续航时间提升10倍,,,而精度和性能却不掉点。。。。。。这一压缩事情也资助该团队获得了IJCAI 2025全球最佳论文奖,,,也是近五年唯一获此奖项的中国大陆团队。。。。。。
依托这一能力,,,「眸深智能」可在两周内完成一套具身大模子从一个本体到另一个本体的适配,,,包括复旦自研的“光华1号”、宇树G1、上海人形机械人立异中心的“青龙”和“灵龙”等本体。。。。。。
(图源/企业)
「眸深智能」首创人、CEO穆泽林体现,,,海内具身智能行业普遍接纳在外洋芯片上训练、再移植适配国产芯片的方案,,,性能消耗与兼容性问题突出,,,而「眸深智能」未来在模子训练、推理全流程中将基于国产算力芯片原生开发,,,实现手艺栈完全自主可控。。。。。。
在商业化层面,,,「眸深智能」一ㄇ现在海内少数有营收的具身智能大脑公司。。。。。。穆泽林告诉硬氪,,,其2025年审计回款收入万万元,,,2026年上半年3000万元,,,预计今年营收规模5000万元以上。。。。。。
现在,,,公司客户笼罩工业检测、物业、环卫等场景。。。。。。2026年第一季度,,,「眸深智能」已与某港股上市物业公司、A股上市环卫龙头的机械人产品交付;;;;正在推进与头部连锁零售集团、头部白色家电工厂的人形机械人落地场景研发。。。。。。
以下是硬氪与穆泽林的交流实录(略经摘编)
硬氪:行动怎么酿成Token?????这是行业难点吗?????
穆泽林:确实是行业卡点。。。。。。我们可以把行动明确为「数字化的姿态」:就像小人书的一页是一个静态姿势,,,一连翻页就成了动画。。。。。。我们早期通过几十人团队手工标注了几万个姿态,,,界说了3000多个基础行动Token,,,类似汉字的3000个常用字,,,组合后能笼罩人类所有行为。。。。。。
更焦点的是让模子学习行动间的关联:就像大语言模子通过学习海量文本掌握字词排列纪律,,,我们让模子寓目百万小时的互联网视频(影视剧、监控、Vlog等),,,学习「喝水时手会抬到嘴边」「抱胸后或许率会睁开手臂」这类行动因果逻辑。。。。。。同时连系10%的动捕数据和10%的真机数据做校准,,,最终实现行动Token的端到端天生——支持从文本、图片、3D点云到行动的转化,,,也就是原生多模态能力。。。。。。
硬氪:行动Token的组合会不会导致算力需求爆炸?????怎样优化?????
穆泽林:我们不需要穷举所有行动,,,而是学习行动的排列纪律。。。。。。优化主要有两个偏向:一是数据层面,,,80%用互联网视频(已做物理先验过滤,,,确保切合现实纪律),,,降低对高本钱动捕/真机数据的依赖;;;;二是模子压缩层面,,,我们在端侧安排上有深挚积累,,,曾获得全球顶会最佳论文——通过Token剪枝、量化、动态优化等手艺,,,能把端侧盘算量降低62倍,,,推理延时从200毫秒压缩到10毫秒,,,模子参数目镌汰80%的同时精度不降反升(部分使命提升3%-6%)。。。。。。
硬氪:现在具身智能领域手艺蹊径分化,,,有的着重影象,,,你们是着重行动,,,您怎么看这种分化?????
穆泽林:回归第一性原理:大语言模子的乐成实质是Transformer架构实现了Token的排列天生。。。。。。具身智能也应该遵照这个逻辑,,,焦点是解决「执行层」问题——让机械人能稳固完成使命。。。。。。
像影象优化这类更底层的问题,,,我以为短期很难通过首创公司突破,,,需要DeepSeek、OpenAI这类巨头在芯片存储、存算一体架构上的恒久探索。。。。。。我们更务实:通过行动Token的泛化能力(Zero-Shot)解决新使命执行问题,,,好比机械人学过拿矿泉水瓶,,,没学过专长机,,,也能通过行动序列迁徙完成80%的准确度,,,剩余20%通过少量后训练或强化学习校准即可。。。。。。
硬氪:为什么选择适配国产算力,,,而不是用更成熟的英伟达卡?????
穆泽林:恒久来看,,,国产GPU是必定选择——N卡会越来越贵、供应受限。。。。。。凯时AG焦点优势是「懂芯片」:团队有海思、英特尔、英伟达三大芯片巨头的配景,,,是海内唯一具备算子级适配能力的具身大模子团队。。。。。。现在已经买通了燧原S60、昇腾310/910等国产芯片的安排,,,下半年目的是攻克千卡级国产集群训练,,,实现纯国产化的大模子训练方案。。。。。。
这不但能解决供应链清静问题,,,更能提升资源效率:好比别人训练一次需要1万张卡、破费5亿,,,我们通过算子优化,,,1000张卡、5000万就能完成,,,类似DeepSeek的低本钱训练逻辑。。。。。。
硬氪:具身智能芯片的时机在那里?????你们会自己做吗?????
穆泽林:端侧具身芯片确实是大时机,,,现在海内已有20多家公司在结构(好比辉曦、光与星辰等),,,但大多瞄准200TOPS算力(类似英伟达Orin)。。。。。。我们以为未来模子需要处理触觉、传感器、3D点云等多模态信号,,,算力需求会快速提升到1000-2000TOPS——若是芯片公司现在量产200TOPS的产品,,,等流片出来时可能已经跟不上模子迭代速率。。。。。。
我们不会自己做芯片,,,除非未来公司规模抵达数千亿级。。。。。。现阶段更聚焦「软硬协同」:通过算子优化让模子适配现有芯片,,,和芯片公司相助而非重复造轮子。。。。。。
硬氪:未来工业分工会是怎样的?????大脑和本体是否会各自形成通用供应商?????
穆泽林:本体可能会像汽车行业一样,,,有差别的特色(好比负载更大、更轻量化),,,但大脑领域或许率会形成「一超多强」名堂——通用大脑的研发门槛极高,,,海内真正具备研发能力的团队屈指可数。。。。。。我们目的是成为谁人「超等通用大脑」,,,同时允许其他团队聚焦细分场景(好比快递分拣、电力巡检)。。。。。。
5-10年内,,,不会泛起每家机械人公司都自研大脑的情形——大脑的研发投入(人才、算力)远超本体,,,创业公司更有时机突破,,,就像OpenAI不是大厂孵化的。。。。。。大厂的优势在纯软件场景,,,而具身智能需要软硬件深度连系,,,创业公司的无邪性和专注度更有优势。。。。。。
首页图源|企业供图
排版|范馨雅
非洲青年带家乡水稻丰收照片思念袁隆平