ARTICLE · 人工智能
114B 参数、6B 激活,Sand.ai 开源全球首个千亿 MoE 视频生成模型
一语总结清华系团队 Sand.ai 开源全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview,通过自研架构与底层优化大幅降低推理成本。
本文报道了清华系团队 Sand.ai 开源的全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview。该模型总参数达 114B,单次前向仅激活约 6B,生成成本仅为行业主流模型的十分之一。技术上,模型延续了音画协同建模的单流架构,并创新性地采用 Multi-Head LatentMoE 设计,配合自研 MagiMoE 算子库与 Head Parallel 并行策略,有效解决了视频 MoE 的通信与 Scaling 瓶颈。该模型的开源为学术界研究超大视频模型提供了宝贵资产,也为企业私有化部署提供了全新选择。
- MAGI-2-preview 实现了千亿参数视频 MoE 模型的开源,大幅降低了视频生成成本。
模型总参数 114B,单次前向仅激活 6B,生成 10 秒 1080P 视频的成本仅需 5 毛钱,约为行业主流模型的十分之一,且在 AA 视频生成榜单中排名第六。
- 采用单流架构与 Multi-Head LatentMoE 设计,重构了视频模型的 Scaling 路径。
文本、视频和音频在单流架构中共同建模,音画同步更自然;Multi-Head LatentMoE 将隐藏表示拆分并独立路由,每层拥有超 3000 个独立专家单元,提升了能力组合的多样性。
- 自研 MagiMoE 算子库与 Head Parallel 并行策略,攻克了视频 MoE 的通信瓶颈。
通过在路由前按 head 分配计算,使设备间传输形状固定的表示,通信量不再随激活专家数波动,从而解决了视频长序列带来的通信开销问题。
114B 参数、6B 激活,Sand.ai 开源全球首个千亿 MoE 视频生成模型
本文报道了清华系团队 Sand.ai 开源的全球首个千亿参数 MoE 视频生成模型 MAGI-2-preview。该模型总参数达 114B,单次前向仅激活约 6B,生成成本仅为行业主流模型的十分之一。技术上,模型延续了音画协同建模的单流架构,并创新性地采用 Multi-Head LatentMoE 设计,配合自研 MagiMoE 算子库与 Head Parallel 并行策略,有效解决了视频 MoE 的通信与 Scaling 瓶颈。该模型的开源为学术界研究超大视频模型提供了宝贵资产,也为企业私有化部署提供了全新选择。
文章金句
"单纯迁移 MoE 不管用,还要扛得住超长序列和跨卡通信,同时保证音频、视频、文本在同一套系统里顺畅协作。
"千亿级 MoE,不只属于语言模型。