Seedance 2.5 发布:字节跳动视频模型单次生成 30 秒,多模态参考全面升级

7 月 31 日,字节跳动 Seed 团队发布新一代视频创作模型 Seedance 2.5。官方给这次更新的定位是"一镜成片,随心参考",重点落在长叙事、多模态参考和编辑能力三块。

单次生成 30 秒,支持多轮延长

Seedance 2.5 把单次生成时长从 2.0 的 15 秒翻倍到 30 秒。30 秒内模型可以组织多个有逻辑关联的镜头,让故事有铺垫、推进、转折和收尾,而不是简单延续一个画面。官方示例里,一段歌手登台演出的片段,模型完整演绎了化妆间互动、穿过后台走廊、与伴舞相遇、一起登台的整个过程。

多轮延长是另一个关键能力。用户可以在已有视频上继续衔接后续镜头,模型保持主体特征、场景环境和叙事节奏一致,最终拼出数分钟的统一视听内容。官方称镜头衔接和场景过渡做了优化,主体在多次切镜中保持稳定,音画对齐。

针对 AI 视频常见的"油腻感",模型在物体材质、人物肤质与眼神、光影、饱和度上做了系统调整,也减少了字幕和背景音乐不受控的情况。

多模态参考:30 张图、10 段视频、10 段音频

Seedance 2.5 支持单次输入最多 30 张图片、10 段视频、10 段音频作为参考素材。模型综合理解素材中的构图、场景、风格、人物和道具,按指令用于生成。多人同框、群像叙事时,能同时还原多个人物的形象和声音。

白模参考(clay render)是这次升级的重点。用户可以用无纹理 3D 模型搭出空间结构、主体姿态、运动轨迹和镜头机位,模型参考这套结构生成视频,复杂镜头的构图和调度更接近预期。光照控制也借助白模的空间信息做了增强,光源方向、色温、强度、阴影投射都按物理规律来。

时间戳级编辑

生成阶段,用户可以用 prompt 控制特定时间段的故事、视角、运镜和节奏。生成之后,还能针对指定片段里的角色、动作、声音做定向修改,前后保持连贯。绿幕编辑、视角编辑、参考编辑等能力也做了强化,官方举例说绿幕场景下,模型能根据新环境的物理规则渲染衣服飘动、头发状态、步态和光影。

落地平台与产业场景

Seedance 2.5 正在陆续上线即梦 AI、豆包专业版,API 服务近期上线火山方舟。教育领域已经进入真实场景,豆包爱学 App 的"豆包课堂"用模型把课文背后的历史背景转成视频。工业制造、具身智能、自动驾驶方向,模型用于生成合成视频数据,帮助训练机器人的感知和操作能力,模拟极端天气、复杂路况等长尾场景。

HN 上 Seedance 2.5 的帖子目前有 140 多分。评论区对生成质量评价普遍不错,有人觉得"接近爬出恐怖谷的另一侧",也有人照例抱怨不开源、没有权重。这倒是 AI 视频赛道的老话题:质量和可控性在涨,但"只给 API 不给权重"的模式,社区买不买账是另一回事。