近日,国内AI创企Sand.ai正式对外开源全球首个千亿级MoE架构视频生成模型MAGI-2 Preview,一举刷新开源视频模型的参数规模与技术架构上限,在AI生成领域引发行业广泛关注。此次开源打破了传统视频大模型“参数越大、算力越贵、推理越慢”的固有难题,以混合专家架构实现超大参数与极低推理成本的双向兼顾,为通用AI视频生成技术的普惠落地、生态迭代提供全新国产底座,推动行业技术范式全面升级。
长期以来,AI视频生成模型的规模化落地始终受限于算力成本与架构短板。传统稠密型视频大模型为提升生成画质、时空连贯性,只能通过单纯堆叠参数实现能力升级,但参数扩容会带来算力消耗、推理时长、部署成本的指数级增长,多数千亿级视频模型仅能闭源商用,普通开发者与中小企业难以调用。同时,多数模型存在音视频割裂、动态画面失真、长时序场景不稳定等问题,难以兼顾生成质量与落地效率,成为行业规模化普及的核心痛点。
本次开源的MAGI-2 Preview模型凭借创新MoE混合专家架构,实现技术层面的突破性平衡。该模型整体总参数达1140亿,属于业界顶尖千亿级视频生成模型梯队,但其独创的稀疏激活机制,让单次前向推理仅激活60亿参数参与运算,大幅降低实际算力消耗。这种“大参数储备、小算力激活”的运行模式,彻底改写视频生成模型的成本曲线,实测生成每秒视频的算力成本仅为行业主流模型的十分之一,完美解决了大模型高性能与低成本无法兼顾的行业难题。
除极致的算力性价比优势外,该模型打破音视频分离生成的行业惯例,采用统一Transformer架构,实现文本、视频、音频一体化生成。过往多数AI视频模型仅负责画面生成,需搭配独立音频模型二次合成,极易出现音画不同步、风格不统一、细节割裂等问题。而MAGI-2 Preview通过单模型统一处理音视频时序逻辑,让画面动态与音效节奏高度匹配,大幅提升生成视频的完整性、流畅度与观感质感,尤其适配剧情视频、动态广告、科普短片等精细化创作场景。
依托先进架构与海量训练数据,该模型在核心能力上实现全面突破。相较于传统模型,其生成画面的时空连续性更强,能够精准处理复杂动态场景、物体位移、光影变化,有效减少画面闪烁、变形、卡顿、穿模等常见问题。同时模型精准适配文生视频、图生视频等主流创作模式,兼容多种分辨率与时长需求,兼顾普通轻量化创作与高精度商业级产出,适配自媒体创作、影视剪辑、广告制作、数字人动态渲染、虚拟场景搭建等多元商用场景。
作为全球首个开源的千亿MoE视频生成模型,MAGI-2 Preview的全开源落地具备重要行业意义。不同于头部企业闭源研发的千亿级模型,Sand.ai开放完整代码与模型权重,全球开发者、中小企业、科研团队可免费调用、二次微调与商用部署,大幅降低高端AI视频技术的研发与落地门槛。这一举措打破了海外模型在高端视频生成领域的技术垄断,为国产AI视频生态自主化、创新化发展提供核心技术支撑。
业内分析表示,MoE稀疏架构是下一代大模型的核心演进方向,而Sand.ai本次开源动作,率先将该技术路线落地视频生成赛道,为行业提供了高效可复制的技术范本。未来,依托千亿级参数底座与低成本推理优势,叠加开源生态的持续迭代,该模型将持续赋能内容创作、数字文娱、虚拟仿真、商业营销等众多领域,加速AI视频生成技术从高端试点走向全民普惠,持续引领生成式视频AI产业高质量发展。