Wan3.0 正式上线

阿里云于 8 月 24 日发布视频生成模型 Wan3.0。这是万相系列的第三代产品,上一代 Wan2.7 已经在多个视频生成榜单上拿到过第一名。Wan3.0 在时长、输入格式、画面质量和编辑能力上都有明显升级。

核心变化

原生 30 秒视频。之前的模型单次生成通常在 5-10 秒,Wan3.0 支持一次性输出 30 秒连续视频,且带自动场景分割。创作者不需要再手动拼接片段。

文档格式输入。这是 Wan3.0 最有辨识度的更新:首次支持 doc、xls、ppt、pdf、md 等文件格式作为输入。你丢一份 PPT 进去,模型会解析内容并生成对应视频。对企业宣传片、教学视频这类场景有实际意义。

最多 20 个参考素材。图生视频、角色驱动、场景重建等模式下,可以同时传入最多 20 个参考图或视频片段。模型会从中提取人物外貌、场景风格等信息,合成到新视频里。

画面质量。官方用了"电影级真实感"来形容,实际效果取决于提示词和素材质量。从 GitHub 仓库的示例来看,动态模糊、光影反射、布料褶皱这些物理细节比上一代有所改善。

文字渲染。Wan3.0 支持 12 种语言的文字渲染,包括中文、英文、日文、韩文、阿拉伯文等。可以生成带文字的视频片段,比如片头标题卡、字幕叠加。之前的视频生成模型在这方面普遍做得不好。

生成模式

模式说明
文生视频文字描述 → 30秒视频
图生视频静态图片 → 动态视频
参考生视频多个参考素材 → 新场景视频
视频编辑基于提示词修改已有视频
文生图 / 图编辑高保真图片生成和对话式编辑

定价

分辨率API 价格(元/秒)
480P¥0.3
720P¥0.6
1080P¥1.2

8 月 24 日至 9 月 23 日期间,阿里云百炼和千问 AI 平台提供 API 限时 7 折优惠。换算下来,生成一段 10 秒 1080P 视频约 ¥8.4(原价 ¥12)。

第三方平台方面,跳跃视界、Deevid、剧火、京东灵境、美图、井萌等已经接入 Wan3.0。

使用渠道

开源代码和模型权重在 GitHub 上发布:AlibabaCloud-Official/Wan3.0。

竞品对比

视频生成赛道目前的主要玩家:

Wan3.0 的差异化在于文档输入能力和多参考素材支持。对于需要批量制作企业视频、教学内容的团队,这两个功能解决了实际痛点。

写在后面

视频生成模型的竞争在 2026 年下半年明显加剧。Wan3.0 把单次生成时长推到 30 秒,且支持文档输入,算是往实用方向迈了一步。不过模型的实际效果还是得看具体使用场景——同样的提示词在不同素材质量下差异很大。感兴趣的话可以直接去 wan.video 试用。