MAGI-2 是什么? 为什么 MAGI-2 值得关注? MAGI-2 能做什么? 部署门槛高吗? 值不值得用? MAGI-2 Preview 是 Sand.ai 在 2026 年 8 月 5 日发布并开源的千亿级(114B 总参数)MoE 音视频生成模型,也是目前全球首个开源的千亿参数视频生成模型。它最核心的特点只有一句话:把文本、视频、音频放进同一个 Transformer 里联合建模,一次就能生成 10 秒 1080p、且画面与声音天然同步的视频。 对创作者来说,这意味着过去“先出画面、再单独配口型/音效”的多段链路被压缩成一步——人物说话时,口型、表情、身体动作和环境声由同一套主干共同生成,镜头完整度更高。 语言模型早就被 MoE 推到千亿、万亿级,开源视频模型却长期停在十几 B。MAGI-2 用一套叫 MagiMoE 的超细粒度专家架构把总参数推到 114B,却把每个 token 实际激活的参数压到约 6B:它将 3072 维隐藏表示拆成 12 个 256 维 head,每个 head 有 256 个专家、每次只选 6 个,单层共 3072 个 head-local 专家单元、每 token 激活 72 个。 结果就是“存储容量很大、单步计算很省”——在 Artificial Analysis 视频生成榜单上排第 6,用的却只是 6B 激活参数。 多数开源视频模型只生成无声画面,音频要靠后续对口型或配乐补上。MAGI-2 延续 Sand.ai 在 MagiHuman 论文里的单流架构:文本、视频、音频作为统一 token 序列,在同一主干的每一层 self-attention 里持续交换信息。口型、表情、动作、对白、环境声从生成一开始就互相影响,而不是最后拼接。
优点
- + 全球首个千亿级开源 MoE 视频模型(114B 总参数)
- + 文本/视频/音频统一单流建模,原生音画同步
- + 10 秒 1080p 视频推理成本约 0.5 元,约主流模型 1/10
- + 权重与代码全开源,可私有化部署与领域微调
- + Artificial Analysis 视频生成榜排名第 6(仅 6B 激活参数)
缺点
- - 硬件门槛极高:需 8×H100/Hopper GPU,权重约 307GB
- - 目前仅支持 10 秒固定时长输出
- - Preview 阶段,非轻量托管替代品,需工程部署能力
- - 消费级 GPU 暂难直接运行(等待社区量化版本)
- - 中文提示词表现中等
MAGI-2 是什么?
MAGI-2 Preview 是 Sand.ai 于 2026 年 8 月 5 日发布并开源的千亿级(114B 总参数)MoE 音视频生成模型。它把文本、视频、音频放进同一个 Transformer 统一建模,输入提示词或“提示词+静图”即可一次生成 10 秒 1080p、且画面与声音同步的视频。
MAGI-2 免费吗?怎么部署?
模型权重与推理代码在 HuggingFace(sand-ai/MAGI-2-preview)与 GitHub(SandAI-org/MAGI-2-preview)全开源、可免费自部署,但本地推理需要 8 张 NVIDIA Hopper(如 H100)GPU、约 307GB 权重,并提供 Docker 镜像与 torchrun 脚本。无 SaaS 订阅门槛,但实际成本来自算力。
MAGI-2 和主流视频模型有什么不同?
最大差异是“统一音视频”:多数开源视频模型(如 Wan、LTX)只生成无声画面,音频需后处理;MAGI-2 用单流架构让口型、表情、动作、对白、环境声从生成之初就相互影响,音画同步更自然。代价是模型规模大(114B)、对硬件要求高。
普通创作者能直接用 MAGI-2 吗?
对多数个人创作者而言,本地点跑门槛偏高。更现实的做法是等社区量化/轻量版本,或使用托管视频生成服务。MAGI-2 当前更面向研究机构、基础设施团队与具备多卡算力、需要私有化部署的企业。
MAGI-2 和 MAGI-1 有什么区别
MAGI-1(2025-04)是 24B 自回归视频模型,研究“视频该怎么生成”;MAGI-2 转向“视频模型该怎么规模化”,从自回归分块改为统一单流 + MoE,参数从 24B 扩到 114B。 **有官方托管服务吗?** Sand.ai 另有托管的 Magi 产品(积分订阅制,可对静图做文本驱动动效),与开源 MAGI-2 权重是不同入口;开源模型本身免费,成本来自算力。 --- *以上参数(114B 总参 / 6B 激活、10 秒 1080p、0.5 元/条、AA 榜第 6)均来自 Sand.ai 官方博客、HuggingFace/GitHub 仓库及光明网等公开报道,整理于 2026-08-30,具体能力以官网为准。*