封面新闻记者 李继龙
在智能驾驶竞争一直升级的配景下,,,,车企之间的较量正从应用层逐渐向底层AI能力延伸。。。。。
克日,,,,小鹏汽车宣布视觉基础模子TuringViT。。。。。这是继天下模子、展望模子等手艺之后,,,,小鹏今年推出的又一项AI底层手艺效果。。。。。与已往更多聚焦详细功效差别,,,,此次宣布瞄准的是视觉感知这一智能驾驶和具身智能的主要基础能力,,,,也意味着车企关于AI竞争正进一步深入究竟层手艺领域。。。。。
视觉感知被以为是智能驾驶系统获取情形信息的主要入口。。。。。随着大模子、VLA(视觉-语言-行动)等手艺加速落地,,,,行业对视觉模子提出了更高要求,,,,包括处理更高分辨率图像、多摄像头输入以及一连视频数据,,,,同时还要兼顾算力和运行效率。。。。。
零样天性能、训练数据规模以及VisionTransformer编码器的1K分辨率吞吐量。。。。。TuringViT仅使用10%的训练数据,,,,就实现了比领先的开源基线模子更强的准确性与效率权衡。。。。。
据小鹏先容,,,,TuringViT围绕模子架构、数据治理和训练方式举行了优化。。。。。官方数据显示,,,,该模子仅使用约10%的训练数据,,,,便抵达甚至凌驾部分主流开源视觉模子的性能,,,,同时在高分辨率场景下具备更高运行效率。。。。。
关于智能汽车而言,,,,这意味着车辆能够以更低算力本钱完成更重大的情形感知,,,,从而进一步提升辅助驾驶系统在重亨衢况、狭窄蹊径、特殊交通加入者识别等场景下的体现。。。。。与此同时,,,,也有望降低智能驾驶系统开发和安排本钱。。。。。
TuringViT的块架构和模子设置。。。。。 (左)主干建设在重复的图灵块,,,,图灵线性注重力(TLA)聚合全局上下文;;;;;其序列长度感知归一化和输入依赖的输出门可稳固可变标记训练并坚持高频局部细节。。。。。 (右)TuringViT-18L和TuringViT-24L的模子设置,,,,在共享相同补丁大。。。。。16×16)的同时,,,,接纳2D RoPE,,,,以块和总层数为标准,,,,嵌入/头部维度,,,,以及多层感知器(MLP)比例。。。。。
值得关注的是,,,,这项手艺并不但局限于汽车。。。。。凭证官方妄想,,,,TuringViT未来将同时应用于智能驾驶、智能座舱以及IRON人形机械人,,,,成为小鹏物理AI系统的主要视觉基础平台。。。。。
今年以来,,,,随着AI大模子快速生长,,,,海内多家车企纷纷加速结构AI底层能力。。。。。从天下模子到端到端智能驾驶,,,,再到现在的视觉基础模子,,,,行业竞争重点正从简单功效比拼,,,,逐渐转向算法、数据和算力等焦点能力建设。。。。。
业内普遍以为,,,,未来智能汽车竞争不但取决于硬件设置,,,,更取决于底层AI模子的一连迭代能力。。。。。谁能够构建更高效、更低本钱、更易训练的基础模子,,,,谁就有望在智能驾驶、智能座舱以致具身智能等多个领域形成更大的手艺优势。。。。。
随着AI手艺一直向汽车工业渗透,,,,车企之间的竞争也正在从产品竞争升级为底层手艺系统竞争,,,,而视觉大模子正成为这一轮竞争的主要偏向之一。。。。。
26日至27日,,,,澳门闽侨联谊会赴吉林长春参访,,,,20余位会员走进中国一汽集团、长光卫星等企业,,,,相识行业前沿科技和立异效果。。。。。此次参访活动由中华天下台湾同胞联谊会主理,,,,吉林省台湾同胞联谊会承办。。。。。