Hacker News 中文摘要

RSS订阅

Seedance 2.5 -- Seedance 2.5

文章摘要

字节跳动Seed团队发布新一代视频生成模型Seedance 2.5,支持单次生成30秒高质量音视频片段,可多轮扩展,并升级多模态参考与编辑功能,显著提升长视频的连贯性、画质和创意控制力。

文章总结

今天,我们正式发布新一代视频生成模型Seedance 2.5。自Seedance 2.0推出以来,用户对视频生成模型的期待已从生成片段转向完成创意作品。基于Seedance 2.0统一的多模态音视频联合生成架构,Seedance 2.5聚焦基础生成和参考生成,在长叙事、多模态参考和编辑方面取得重大突破。它立足实际应用场景,释放更大的创作想象力和控制力,进一步提升生产力。

主要亮点包括:

  • 单次生成最长30秒,支持多轮扩展:Seedance 2.5可一次性生成高质量30秒音视频片段,并支持多轮扩展。它还改进了镜头切换和场景变化,增强长视频的连贯性,在图像、音频和动作质量上显著提升,呈现出比常见AI生成视频更自然、精致的视觉效果。用户因此能制作出数分钟的高质量内容,保持一致的视听语言,一气呵成地呈现完整故事。

  • 全面升级的多模态参考:用户现在可一次性输入最多30张图片、10个视频片段和10个音频片段作为参考素材。模型还强化了粘土渲染、动作和创意参考等多种参考能力,更好地把握创作者意图,实现涉及多个主体、场景和镜头变化的复杂创意。

  • 更精准稳定的编辑能力:Seedance 2.5提供时间戳级别的控制,可对音视频内容进行精准编辑,显著提升效率和可控性。模型还增强了绿幕、摄像机视角和基于参考的编辑等高级功能,满足电影、广告等专业复杂领域的严苛要求。

凭借长叙事、多模态参考和编辑方面的进步,Seedance 2.5超越了更长的单次视频生成。模型能更好地理解创意意图,并以更强的控制力实现从创意到成片的旅程。现在,我们邀请您观看一部由Seedance 2.5端到端制作的创意短片。

今天,Seedance 2.5已在即梦AI、豆包Pro等平台上线,API访问即将通过BytePlus ModelArk提供。我们邀请您试用并分享反馈。

30秒长叙事与多轮扩展:一次性呈现完整故事

Seedance 2.5将单次视频生成从15秒延长至30秒,并进一步强化长视频中的叙事能力。在30秒内,模型能组织多个逻辑连贯的镜头,使故事通过铺垫、发展、转折和结局展开,而非简单延长单一时刻。例如,在一段歌手舞台表演的一镜到底片段中,模型描绘了歌手在化妆间与工作人员互动、穿过后台走廊、与舞者会合、一同登台表演的完整故事,而非仅登台那一刻。

得益于模型的多轮扩展能力,用户可以平滑地在现有视频输出后追加后续镜头。在整个扩展过程中,它保持主要角色、环境和叙事节奏的一致性。这使得用户能一次性输出长达数分钟的视频,减少了拆分片段、反复拼接素材和修复转场的工作量。

在视觉呈现方面,模型实现了更流畅的镜头运动切换。主要主体在多个剪辑中保持稳定,音画同步,形成高度连贯的长视频。例如,在一段京剧场景中,镜头跟随主角的水袖优雅地做圆形环绕,主体和背景完全一致。水袖的摆动在空中形成自然弧线,紧密遵循真实物理规律。

此外,为解决AI生成视频中常见的人为感过强问题,Seedance 2.5系统优化了物体纹理、皮肤和眼睛特征、光照和色彩饱和度等细节。模型还减少了字幕和背景音乐中的不可控现象,交付的最终产品接近实拍镜头的电影质感。

多模态参考全面升级,为复杂创意任务带来更强控制力

Seedance 2.5进一步强化了多模态参考生成能力。用户可一次性输入最多30张图片、10个视频片段和10个音频片段作为参考素材。更大数量和更多样化的参考能更好地捕捉用户意图,生成包含更多主体、更丰富场景和更灵活镜头运动的复杂视频。

模型全面理解所有素材中的视觉构图、场景、风格、角色和道具等元素,并按指令应用于视频生成过程。即使在多角色镜头或群像叙事等复杂场景中,也能保持多个角色的外貌和声音,同时保持每个主体的特征稳定。

Seedance 2.5还增强了粘土渲染、动作和创意参考等特定参考能力,让用户对画面中的主体、动作和镜头运动进行更精细的控制。例如,通过粘土渲染参考,用户可以使用无纹理的3D模型构建场景的空间结构、角色姿势、运动路径和摄像机角度。模型随后利用此结构生成视频,确保复杂镜头的构图和调度紧密符合创作者预期。此外,Seedance 2.5改进了光照控制。通过利用粘土渲染的空间信息,它生成遵循物理定律的真实光照效果,如光源方向、色温、强度和阴影投射,使最终输出中的光影更加自然。

更精准可靠的编辑,提升创作效率

在视频创作中,用户通常需要在生成过程中控制节奏,并在之后完善细节。动作发生的精确秒数、镜头切换的准确时机、特定片段中角色动作是否需要调整,都深刻影响最终结果。更精准可靠的编辑能力让创作者能准确实现创意,提高效率,降低重复生成的成本。

Seedance 2.5支持通过时间戳进行精准内容编辑。在生成阶段,用户可以使用提示词控制特定时间段的叙事、摄像机视角、运动和整体节奏,使输出更贴合创作意图。生成后,用户可以对特定片段中的角色、动作或情节元素进行针对性修改,同时保持编辑前后的连续性和真实感。

Seedance 2.5还提升了多种编辑功能,如绿幕编辑、摄像机视角编辑和基于参考的编辑,以满足电影、广告等专业领域的严苛要求。例如,在绿幕编辑中,模型可以替换背景,在保持主体不变的同时讲述完全不同的故事。此外,它擅长渲染主体如何响应新环境的物理规则,包括衣物飘动方向、头发状态、步伐节奏和光照互动,确保主体与场景和谐融合。

深入更广泛的行业场景,持续探索实际价值

随着模型能力的提升,Seedance 2.5正深入教育、制造等更广泛的行业场景。在教育领域,模型已开始进入真实学习环境。例如,Seedance 2.5可以将课程背后的历史背景、人物和故事情节转化为更生动、沉浸的视觉内容。它还能帮助教师更高效地制作教学视频,将科学原理、历史事件、实验步骤等抽象内容转化为动态演示。这不仅降低了教育素材制作的门槛,还允许高度灵活的内容定制。

在工业制造、具身智能和自动驾驶等领域,Seedance 2.5正融入高度特定的生产流程。模型可以生成高质量的合成视频数据,帮助训练机器人的感知和操作技能。它还被用于工业模拟、流程培训和设备演示。对于自动驾驶,模型可以模拟长尾场景,如极端天气和复杂交通状况,为系统测试和训练提供更多样化的样本。

总结与展望

Seedance 2.5在理解和渲染真实世界方面迈出了重要一步,将视频生成从片段级输出提升为全面的创意工作流。同时,我们认识到仍有改进空间,特别是在复杂运动的物理合理性和涉及多主体交互的场景稳定性方面。

展望未来,Seed团队将继续探索更连贯的叙事,提供更直观的生成和编辑体验,并进一步加深模型对真实世界物理规律的理解。我们希望Seedance模型能变得更生动、更可控、更善于理解用户意图,帮助更多用户表达创意想法,同时继续探索和服务更广泛的行业需求。

评论总结

根据评论内容,主要观点和论据总结如下:

正面评价(认可度高)
- 视频质量惊人,连贯性和细节表现优异。
- “This seems extraordinarily good to me, compared to what I've seen before.”(mcintyre1994)
- “The quality is quite high... a big step up in quality and capability.”(heresalexandria)
- 对电影制作和广告行业有实际应用价值。
- “Have already seen countless major ad spots using ai generated videos; big name companies.”(Gecko4072)
- “This feels like the serious inflection point for high quality full length feature film productions.”(heresalexandria)

负面评价(认可度中等)
- 主要用途可能被滥用,如虚假信息和垃圾内容。
- “Is it just me or are these video models only actual use case is misinformation and spam?”(ares623)
- “I don't think audio, image or video generation should exist... haven't seen enough positive applications.”(damsta)
- 技术虽好,但缺乏开放权重和实际可访问性。
- “No weights, no care.”(CamperBob2)
- “Where can you actually get access to these models that isn't an outright scam?”(iamleppert)

中立/反思性观点
- 技术令人惊叹,但创作者可能因资源过剩而失去动力。
- “Now that we have these tools, I am absolutely disinterested in it... like when you pirate a bunch of games and you play none.”(Keyframe)
- 模型发展方向受市场需求影响,中国侧重动作/特效,西方更需对话/表演迁移。
- “The direction they're taking these models correlates heavily to the usage demand of China vs the West.”(jjcm)

其他关注点
- 成本较低(约7美元),适合长叙事广告创作。
- “This will make longer (~30s) narrative add creation a lot better... roughly $7.”(scamdrill)
- 开源替代品(如MiniMax H3)可能提供更好控制。
- “I'd honestly take the slight quality hit for more control and lower costs.”(ronsor)