8 月 5 日,,,,,Sand.ai 宣布并开源 MAGI-2 Preview。。。。。。这是一款统一音视频天生模子:文本、视频和音频进入统一个 Transformer,,,,,画面和声音由统一套主干配合天生。。。。。。模子总参数约 114B,,,,,每次天生激活约 6B,,,,,这是全球首个开源千亿级 MoE 视频天生模子。。。。。。
2025 年 4 月,,,,,Sand.ai 曾开源 24B 参数的自回归视频模子 MAGI-1。。。。。。时隔一年多,,,,,这家公司再次把主力视频天生模子带入开源系统,,,,,参数规模从 240 亿扩大至 1,140 亿。。。。。。
已往两年,,,,,开源视频天生模子的参数规模大多停在十几 B 以内,,,,,最大的也不过二三十 B。。。。。。语言模子那里,,,,,开源模子早就进入了几千亿甚至万亿参数,,,,,靠的都是 MoE。。。。。。
虽然说两类模子面临的使命差别,,,,,参数规模不可直接代表能力崎岖,,,,,但这组差别仍然说明,,,,,视频模子扩展规模要支付更高的盘算和通讯价钱。。。。。。视频模子的参数规模恒久停留在这一水平,,,,,也主要受制于这两项本钱。。。。。。MAGI-2 Preview 将总参数推至 114B,,,,,实验解决的正是这个问题。。。。。。
视频模子为什么一直做不大?????
视频的序列远比文本长,,,,,模子天生视频,,,,,需要把画面切分成大宗空间 patch。。。。。。一帧画面临应一批 token,,,,,一连数秒的视频再叠加文本与音频,,,,,最终形成的序列远长于通俗语言使命。。。。。。分辨率、帧率和天生时长中的任何一项增添,,,,,都会进一步推高 token 数目。。。。。。
浓密模子中,,,,,每个 token 都要经由所有参数。。。。。。模子参数增添,,,,,单个 token 的盘算量也会同步上升;;再乘上视频的超长序列,,,,,训练和推理本钱很快变得难以遭受。。。。。。在语言模子中可行的参数扩张方式,,,,,移到视频使命上,,,,,往往先撞上本钱与效率的限制。。。。。。2026 年 3 月 OpenAI 阻止运营 Sora,,,,,其背后很大一部分原因就在于:以其时的架构和推理本钱,,,,,大规模商用险些不具备经济上的可行性。。。。。。
语言模子缓解这一问题,,,,,依赖的是混淆专家模子(Mixture of Experts,,,,,MoE)。。。。。。模子保存一个重大的专家池,,,,,每个 token 只激活其中一小部分,,,,,由此把总体容量和单次盘算拆开。。。。。。模子可以继续增添参数,,,,,拓展能力上限,,,,,但每次推理不必挪用所有权重。。。。。。
把这套要领移到视频模子上,,,,,难题主要泛起在通讯环节。。。。。。
古板专家并行(Expert Parallel)会先为每个 token 选出需要挪用的专家,,,,,再把 token 发送到专家所在的 GPU。。。。。。激活的专家越多、序列越长,,,,,装备之间需要搬运的数据也越多;;专家负载还会随着输入内容转变,,,,,导致差别装备肩负的盘算量一直波动。。。。。。
在文本序列中,,,,,这套机制尚可运转。。。。。。但换成视频的 token 规模,,,,,跨卡通讯就很容易抵消希罕盘算节约下来的算力。。。。。。视频模子因此需要的不但是 MoE 架构,,,,,还包括一套专门为长序列和高频路由设计的漫衍式系统。。。。。。
114B 的容量,,,,,6B 的激活参数
MAGI-2 Preview 的解法分两步,,,,,第一步是把专家切得更细。。。。。。
古板 MoE 通常为一个 token 的完整隐藏体现选择专家。。。。。。MAGI-2 Preview 则先把 3,072 维隐藏体现拆成 12 个 256 维子空间,,,,,每个子空间称为一个 head。。。。。。每个 head 拥有 256 个专家,,,,,并从中选出 6 个。。。。。。
(泉源:Sand.ai)
由此盘算,,,,,一层网络包括 3,072 个相互自力的小专家,,,,,每个 token 在每层合计激活 72 个。。。。。。放到整个模子中,,,,,MAGI-2 Preview 拥有约 114B 总参数,,,,,每次天生现实激活约 6B。。。。。。
作为参照,,,,,DeepSeek-V4-Pro-Preview 每层设置 384 个路由专家,,,,,每个 token 选择 6 个;;Kimi K3 设置 896 个专家,,,,,每个 token 选择 16 个。。。。。。
大语言模子对“专家”的界说,,,,,以及面向的维度和使命与视频模子并不相同,,,,,数目不可直接换算成能力。。。。。。两者比照更能说明的是路由粒度:MAGI-2 Preview 将一个 token 拆进多个低维子空间,,,,,让行动、外观、声音和语义划分寻找适合的专家,,,,,再把差别专家的输出组合起来。。。。。。
Sand.ai 将这种结构称为 Ultra-fine-grained MoE。。。。。。更细的专家分工扩大了能力组合空间,,,,,也为统一音视频天生提供了基础。。。。。。
MAGI-2 Preview 将文本、视频和音频放在统一个上下文中处理。。。。。。模子内部既有三种模态共享的专家,,,,,也有各自的专属专家。。。。。。声音、口型、心情、行动和镜头节奏从天生最先便相互影响,,,,,镌汰了先天生画面、再串联声音模子所爆发的接口和对齐问题。。。。。。
图丨文本、视频和音频进入统一个 Transformer(泉源:Sand.ai)
专家增添到数千个后,,,,,古板调理方式很快触及效率上限。。。。。。对此,,,,,Sand.ai 引入了 Head Parallel,,,,,改变通讯与路由的顺序。。。。。。
古板 Expert Parallel 先路由、再通讯;;Head Parallel 先凭证 head 分发 token 体现,,,,,再由装备在外地完成专家选择和盘算。。。。。。由于分发的数据形状牢靠,,,,,主要通讯量只取决于输入体现,,,,,不再随激活专家数目线性增添,,,,,装备之间的负载也更稳固。。。。。。
这套机制让 MAGI-2 Preview 能够把专家划分得更细,,,,,同时阻止通讯本钱吞掉希罕盘算带来的收益。。。。。。3,072 个专家能够真正协同事情,,,,,条件正在于此。。。。。。
图丨分层 Head Parallel 架构(泉源:Sand.ai)
架构之外,,,,,还需要一整套工程系统支持。。。。。。
数千个小专家意味着高频路由、重复的数据重排和大宗小矩阵盘算。。。。。。通用 MoE 很难在这种负载下坚持足够高的硬件使用率。。。。。。Sand.ai 为此开发了盘算内核库 MagiMoE,,,,,将路由、排序和专家盘算合并执行,,,,,镌汰中心效果与显存搬运。。。。。。
训练部分由漫衍式优化器 MagiMuon 支持。。。。。。它使用 Muon 处理主体矩阵参数,,,,,用 AdamW 更新其余参数,,,,,并针对大宗细粒度专家重新设计参数组织和跨装备盘算方式,,,,,使训练能够稳固扩展到千亿参数规模。。。。。。
专家划分越细,,,,,数据也越需要支持这种分工。。。。。。Sand.ai 没有把“高质量数据”简朴明确为重复过滤,,,,,团队希望尽可能保存重大行动、少见主体、特殊镜头、非典范声音和长尾组合,,,,,再通过更准确的标注组织这些数据。。。。。。这样能让模子更好地模子明确主体、行动、场景、镜头、时序,,,,,以及声音、画面和文本之间的关系。。。。。。
模子、系统和数据由此连在一起。。。。。。关于视频天生,,,,,扩大参数已经不再是纯粹的算法问题,,,,,模子架构、盘算内核、漫衍式训练和数据管线需要同时转变。。。。。。
这套刷新最终要落到天生本钱上。。。。。。凭证 Sand.ai 团队提供的内部测算,,,,,在 8 卡 H100、凭证目今月租价钱折算的条件下,,,,,差别推理设置天生一段 10 秒视频的本钱约 0.5 元(蒸馏后的模子)。。。。。。按团队口径,,,,,折算到每秒,,,,,价钱约为行业主流模子的十分之一。。。。。。
视频天生通常准时长计价。。。。。。单位本钱若是下降一个数目级,,,,,批量天生素材、多版本迭代等已往不敷经济的用法,,,,,才可能进入通例生产流程。。。。。。
天生效果则有第三方榜单可以比照。。。。。。在 Artificial Analysis 的图生视频(image-to-video)榜单上,,,,,MAGI-2 Preview 排在第 6 位。。。。。。一个激活参数仅 6B 的开源模子,,,,,天生效果已经进入目今视频天生的第一梯队。。。。。。
(泉源:Artificial Analysis)
作为预览版,,,,,MAGI-2 Preview 与最顶尖模子仍有差别,,,,,Sand.ai 对此并不讳言;;对一家资源远少于大厂的创业公司而言,,,,,这个效果证实的是另一件事:把功夫花在架构和系统上,,,,,同样的卡可以换出更多的天生能力。。。。。。按团队的说法,,,,,正式版会沿着这套已经跑通的架构继续扩大参数和数据规模,,,,,探索更长时长的视频天生,,,,,进一步提升天生质量、音画同步和长时一致性,,,,,并一连降低单位天生本钱。。。。。。
开源改变的是加入界线
这次宣布的另一个重点,,,,,是开源自己。。。。。。已往,,,,,千亿级视频模子怎样设计架构、坚持稳固训练,,,,,要害细节大多留在闭源公司的内部系统中。。。。。。
而 MAGI-2 Preview 提供了一个可供拆解和验证的工具。。。。。。研究机构可以视察细粒度专家怎样分工,,,,,路由是否会随着人物、行动和声音转变。。。。。。推理框架与芯片厂商也获得了一种新的果真事情负载:数千个细粒度专家带来的高频路由、数据重排和大宗小矩阵盘算,,,,,需要新的内核、通讯战略和硬件适配。。。。。。
更下游的转变爆发在企业侧。。。。。。影视、广告、游戏和电商企业掌握大宗专有素材,,,,,其中一部分受到保密、版权和合规要求限制,,,,,不适合直接发送给外部 API。。。。。?????湃ㄖ厝媚W咏肫笠底约旱呐趟闱樾纬晌赡,,,,,企业也可以围绕特定人物、商品和镜头语言继续训练。。。。。。
应用公司同样多了一个选择。。。。。。挪用闭源 API 时,,,,,本钱、并发、接口能力和产品节奏主要由模子厂商决议;;有了开源模子,,,,,应用公司可以在外部 API、外地安排和定制模子之间重新盘算本钱。。。。。。
114B 模子虽然不是下载后便能轻松运行的工具。。。。。。安排依然需要一定的硬件、通讯、工程和运维门槛。。。。。。它改变的是加入界线:已往主要由头部模子公司掌握的千亿级视频模子,,,,,现在最先进入研究机构、基础设施团队和行业企业的视野。。。。。。
语言模子已经提供了一条可供参照的路径。。。。。?????茨W硬恍枰诿恳幌钅芰ι隙剂杓葑钋康谋赵茨W;;只要进入可用区间,,,,,企业就会最先较量安排本钱、数据控制、定制空间和供应商风险,,,,,闭源厂商也碰面临降低价钱、开放更多能力的压力。。。。。。
视频天生可能形成相近的名堂。。。。。。闭源模子继续在产品体验、服务稳固性和商业支持上坚持优势,,,,,开源模子则提供安排和刷新的空间。。。。。。双方的竞争会从天生质量延伸到价钱、数据和开发工具,,,,,性能天花板很难再单独决议输赢。。。。。。
已往两年,,,,,视频模子较量的是画面是否逼真、行动是否自然。。。。。。接下来,,,,,决议行业走向的问题会更多地泛起在画面之外:一段视频以什么本钱天生,,,,,模子由谁控制,,,,,规模能否继续扩大。。。。。。
MAGI-2 Preview 不会连忙改写视频模子的排名。。。。。。它带来的转变,,,,,是让这些问题第一次有了一个千亿参数级的果真样本,,,,,可以由更多人拆解、验证。。。。。。
参考资料:
1.https://sand.ai/blog/magi-2-preview
运营/排版:何晨龙
注:封面/首图由 AI 辅助天生