MAGI-2 Preview - Sand.ai 开源的统一音视频生成模型
MAGI-2 Preview是什么
MAGI-2 Preview 是 Sand.ai 开源的统一音视频生成模型,总参数约 114B、单 トークン 仅激活约 6B,是全球首个千亿级开源 MoE 视频模型 。采用单流架构将文本、视频、音频 token 置于同一 変圧器 处理,核心为超细粒度 MoE,12 头 × 256 维路由、每头 256 个专家选 Top-6,配套分层 Head Parallel、MagiMoE 执行系统与 MagiMuon 优化器实现高效训练 。模型支持文生视频与图生视频,生成 10 秒音画同步、1080P 视频,蒸馏后推理成本约为行业主流的十分之一;权重(约 307GB)与推理代码以 Apache 2.0 协议完整开源 。

MAGI-2 Preview的功能特色
- 文生视频(T2V):根据文本提示词直接生成视频。
- 图生视频(I2V):以一张静态图作为首帧,结合提示词生成视频。
- 音画同步统一生成:画面与声音(台词、环境音、音乐)在同一序列中一次生成,音频直接混流进输出文件,无需后期配音。
- 输出规格:固定 10 秒时长(当前唯一支持的时长);两阶段生成——preview 阶段先生成 512×896 低清,refiner 阶段提升至 1080P。
- 涌现能力:多镜头间人物身份保持一致;角色台词、歌声可与字幕效果同步出现(未设专门模块,源于数据中保留的跨模态关系)。
- 千亿参数、极低激活:总参数约 114B,单 token 仅激活约 6B,推理成本约为行业主流模型的 1/10(蒸馏后 10 秒 1080P 视频约 0.5 元)。
- 单流统一架构:文本、视频、音频 token 拼接为同一序列,由同一个 Transformer 骨干处理,无多模态塔和交叉注意力。
- 超细粒度 MoE(MagiMoE):40 层 Transformer,中间 36 层为 Multi-Head MoE;路由表示分 12 头 × 256 维,每头独立路由、从 256 个专家中选 Top-6,每个稀疏层含 3,072 个头内专家单元。
- Head Parallel 通信设计:跨设备通信量不随 Top-k 增长,收发形状可静态预分配,避免负载不均和内存峰值问题。
- 分层 Head Parallel:跨节点 InfiniBand 只传固。定形状的头切片,节点内 NVLink 全分片托管专家参数,通信确定性高。
- MagiMoE 执行系统:路由、Top-K、专家 FFN、SwiGLU 全链路算子融合,支持长序列省显存的前向/反向路径。
MAGI-2 Preview的核心优势
- 极致的推理效率与成本优势 114B 总参数、单 token 仅激活约 6B,通过 MoE 将模型容量与单次计算量解耦;蒸馏后生成 10 秒 1080P 视频成本约 0.5 元,仅为行业主流模型的 1/10,大幅降低了高质量视频生成的使用门槛 。
- 超细粒度 MoE 架构(MagiMoE) 全球首个将 Multi-Head LatentMoE 扩展到 100B 级的视频模型:12 头 × 256 维独立路由、每头 256 专家选 Top-6,同一 token 的不同表示子空间可组合不同专家,实现比传统 MoE 更细的条件化容量分配 。
- 架构—系统—优化器全栈协同设计 分层 Head Parallel 让跨节点通信形状固定可预分配;MagiMoE 执行系统全链路算子融合;MagiMuon 优化器按"头 × 专家"结构独立正交化——三者共同解决了 114B 规模下通信、算子、优化三大扩展瓶颈。
- 原生音画同步的单流统一生成 文本、视频、音频 token 进入同一序列、由同一 Transformer 处理,台词、口型、环境音、音乐与画面一次生成、天然同步,而非多模型拼接。
- 突破"数据过滤陷阱"的数据方法论 从过滤式精选转向高吞吐生产 + 精确多模态标注,保留复杂运动、多镜头、字幕等真实世界复杂性,涌现出跨镜头身份一致、台词与字幕同步等未设专门模块的能力 。
MAGI-2 Preview官网是什么
- プロジェクトのウェブサイト:https://sand.ai/blog/magi-2-preview
- GitHubリポジトリ:https://github.com/SandAI-org/MAGI-2-preview
- HuggingFaceモデルライブラリ:https://huggingface.co/sand-ai/MAGI-2-preview
MAGI-2 Preview的操作步骤
- 确认环境:准备 8 张 NVIDIA Hopper 架构 GPU(80GB 级),并安装 Python 3.12、CUDA 工具链和 ffmpeg.
- 安装代码:推荐直接用
docker pull sandai/magi-2-preview:latest拉取官方镜像,或克隆仓库后用 pip 源码安装. - ダウンロード・ウェイトの使用
hf download sand-ai/MAGI-2-preview --local-dir ckpt从 Hugging Face 下载约 307GB 的全部模型权重. - 入場の準備:编写 JSON 批量文件指定提示词(填入
image字段即为图生视频),可选开启 Prompt 增强让 LLM 自动扩写提示词. - 走り推理実施
bash scripts/run_demo.sh批量生成,或用torchrun --nproc_per_node=8 inference/pipeline/entry.py --prompt "..."生成单条视频. - 結果を出す:在输出目录中得到带同步音轨的 10 秒 1080P MP4 视频文件.
- 进阶调优(可选):通过 offload 环境变量控制显存调度、开启确定性模式或导出 latent,满足复现与二次开发需求.
MAGI-2 Preview的适用人群
- AI 学术研究者:适合研究 100B 级视频 MoE 的路由行为、Scaling 规律与架构设计的科研人员,权重和技术报告完整开放可直接实验.
- 大模型基础设施工程师:适合关注 MoE 通信优化、算子融合、分布式训练系统的工程师,其分层 Head Parallel 与 MagiMuon 方案具有直接参考价值.
- 视频生成应用开发者:适合拥有 8 卡 Hopper 算力、希望在 Apache 2.0 许可下自托管并二次开发音视频生成能力的创业团队与企业.
- 内容创作与影视制作团队:适合需要文生/图生视频、音画同步输出且对生成成本敏感的专业内容团队(蒸馏后成本约为行业 1/10).
- オープンソースコミュニティの貢献者:适合参与 MagiAttention、MagiCompiler 等配套开源生态、为视频生成基础设施做贡献的开发者.
MAGI-2 Preview的常见问题
Q:生成的视频可以多长?
A:目前固定为 10 秒,这是模型当前唯一支持的时长。
Q:免费吗?可以商用吗?
A:可以,模型权重和推理代码均以 Apache 2.0 协议开源,允许自由商用和二次开发。
Q:本地部署需要什么硬件?
A:需要 8 张 NVIDIA Hopper 架构 GPU(如 H100/H200),并下载约 307GB 的模型权重,硬件门槛较高。
Q:个人电脑能跑吗?
A:不能,官方明确要求 8 卡 Hopper 集群,目前也没有 ComfyUI 等轻量化节点;个人用户建议通过 sand.ai 线上产品体验或等待蒸馏版。
© 著作権表示
記事の著作権 AIシェアリングサークル 無断転載はご遠慮ください。
関連記事
コメントはありません




