MAGI-2 Preview - Sand.ai 开源的统一音视频生成模型

堆友AI

MAGI-2 Preview是什么

MAGI-2 Preview 是 Sand.ai 开源的统一音视频生成模型,总参数约 114B、单 token 仅激活约 6B,是全球首个千亿级开源 MoE 视频模型 。采用单流架构将文本、视频、音频 token 置于同一 Transformer 处理,核心为超细粒度 MoE,12 头 × 256 维路由、每头 256 个专家选 Top-6,配套分层 Head Parallel、MagiMoE 执行系统与 MagiMuon 优化器实现高效训练 。模型支持文生视频与图生视频,生成 10 秒音画同步、1080P 视频,蒸馏后推理成本约为行业主流的十分之一;权重(约 307GB)与推理代码以 Apache 2.0 协议完整开源 。

MAGI-2 Preview - Sand.ai 开源的统一音视频生成模型

MAGI-2 Preview的功能特色

  • 文生视频(T2V):根据文本提示词直接生成视频。
  • 图生视频(I2V):以一张静态图作为首帧,结合提示词生成视频。
  • 音画同步统一生成:画面与声音(台词、环境音、音乐)在同一序列中一次生成,音频直接混流进输出文件,无需后期配音。
  • 输出规格:固定 10 秒时长(当前唯一支持的时长);两阶段生成——preview 阶段先生成 512×896 低清,refiner 阶段提升至 1080P。
  • 涌现能力:多镜头间人物身份保持一致;角色台词、歌声可与字幕效果同步出现(未设专门模块,源于数据中保留的跨模态关系)。
  • 千亿参数、极低激活:总参数约 114B,单 token 仅激活约 6B,推理成本约为行业主流模型的 1/10(蒸馏后 10 秒 1080P 视频约 0.5 元)。
  • 单流统一架构:文本、视频、音频 token 拼接为同一序列,由同一个 Transformer 骨干处理,无多模态塔和交叉注意力。
  • 超细粒度 MoE(MagiMoE):40 层 Transformer,中间 36 层为 Multi-Head MoE;路由表示分 12 头 × 256 维,每头独立路由、从 256 个专家中选 Top-6,每个稀疏层含 3,072 个头内专家单元。
  • Head Parallel 通信设计:跨设备通信量不随 Top-k 增长,收发形状可静态预分配,避免负载不均和内存峰值问题。
  • 分层 Head Parallel:跨节点 InfiniBand 只传固。定形状的头切片,节点内 NVLink 全分片托管专家参数,通信确定性高。
  • MagiMoE 执行系统:路由、Top-K、专家 FFN、SwiGLU 全链路算子融合,支持长序列省显存的前向/反向路径。

MAGI-2 Preview的核心优势

  • 极致的推理效率与成本优势 114B 总参数、单 token 仅激活约 6B,通过 MoE 将模型容量与单次计算量解耦;蒸馏后生成 10 秒 1080P 视频成本约 0.5 元,仅为行业主流模型的 1/10,大幅降低了高质量视频生成的使用门槛 。
  • 超细粒度 MoE 架构(MagiMoE) 全球首个将 Multi-Head LatentMoE 扩展到 100B 级的视频模型:12 头 × 256 维独立路由、每头 256 专家选 Top-6,同一 token 的不同表示子空间可组合不同专家,实现比传统 MoE 更细的条件化容量分配 。
  • 架构—系统—优化器全栈协同设计 分层 Head Parallel 让跨节点通信形状固定可预分配;MagiMoE 执行系统全链路算子融合;MagiMuon 优化器按"头 × 专家"结构独立正交化——三者共同解决了 114B 规模下通信、算子、优化三大扩展瓶颈。
  • 原生音画同步的单流统一生成 文本、视频、音频 token 进入同一序列、由同一 Transformer 处理,台词、口型、环境音、音乐与画面一次生成、天然同步,而非多模型拼接。
  • 突破"数据过滤陷阱"的数据方法论 从过滤式精选转向高吞吐生产 + 精确多模态标注,保留复杂运动、多镜头、字幕等真实世界复杂性,涌现出跨镜头身份一致、台词与字幕同步等未设专门模块的能力 。

MAGI-2 Preview官网是什么

  • Project website:https://sand.ai/blog/magi-2-preview
  • GitHub repository:https://github.com/SandAI-org/MAGI-2-preview
  • HuggingFace Model Library:https://huggingface.co/sand-ai/MAGI-2-preview

MAGI-2 Preview的操作步骤

  • 确认环境:准备 8 张 NVIDIA Hopper 架构 GPU(80GB 级),并安装 Python 3.12、CUDA 工具链和 ffmpegThe
  • 安装代码:推荐直接用 docker pull sandai/magi-2-preview:latest 拉取官方镜像,或克隆仓库后用 pip 源码安装The
  • download weighting: Use of hf download sand-ai/MAGI-2-preview --local-dir ckpt 从 Hugging Face 下载约 307GB 的全部模型权重The
  • Prepare to enter:编写 JSON 批量文件指定提示词(填入 image 字段即为图生视频),可选开启 Prompt 增强让 LLM 自动扩写提示词The
  • running inference: Implementation bash scripts/run_demo.sh 批量生成,或用 torchrun --nproc_per_node=8 inference/pipeline/entry.py --prompt "..." 生成单条视频The
  • Getting results:在输出目录中得到带同步音轨的 10 秒 1080P MP4 视频文件The
  • 进阶调优(可选):通过 offload 环境变量控制显存调度、开启确定性模式或导出 latent,满足复现与二次开发需求The

MAGI-2 Preview的适用人群

  • AI 学术研究者:适合研究 100B 级视频 MoE 的路由行为、Scaling 规律与架构设计的科研人员,权重和技术报告完整开放可直接实验The
  • 大模型基础设施工程师:适合关注 MoE 通信优化、算子融合、分布式训练系统的工程师,其分层 Head Parallel 与 MagiMuon 方案具有直接参考价值The
  • 视频生成应用开发者:适合拥有 8 卡 Hopper 算力、希望在 Apache 2.0 许可下自托管并二次开发音视频生成能力的创业团队与企业The
  • 内容创作与影视制作团队:适合需要文生/图生视频、音画同步输出且对生成成本敏感的专业内容团队(蒸馏后成本约为行业 1/10)The
  • Open Source Community Contributors:适合参与 MagiAttention、MagiCompiler 等配套开源生态、为视频生成基础设施做贡献的开发者The

MAGI-2 Preview的常见问题

Q:生成的视频可以多长?

A:目前固定为 10 秒,这是模型当前唯一支持的时长。


Q:免费吗?可以商用吗?

A:可以,模型权重和推理代码均以 Apache 2.0 协议开源,允许自由商用和二次开发。


Q:本地部署需要什么硬件?

A:需要 8 张 NVIDIA Hopper 架构 GPU(如 H100/H200),并下载约 307GB 的模型权重,硬件门槛较高。


Q:个人电脑能跑吗?
A:不能,官方明确要求 8 卡 Hopper 集群,目前也没有 ComfyUI 等轻量化节点;个人用户建议通过 sand.ai 线上产品体验或等待蒸馏版。
© Copyright notes

Related posts

No comments

You must be logged in to leave a comment!
Login immediately
none
No comments...