苹果的WWDC26刚结束不久,发布会转场衔接效果让我意犹未尽。
老板看完念叨了好几天,想让我给AI星踪岛的机器人之家模块,也做个这样风格的发布会!
我说,人家那是实拍的。一套灯光设备够买一间会议室,随便一组镜头够请一支摄影团队忙一周。
老板说:那你想想办法。
那肯定得用AI,我第一时间想到视频效果最好的模型,字节的Seedance 2.0。
既然是做发布会视频,肯定要上大屏。清晰度不能妥协,素材底子必须能承受后期多次修改。
刚好字节昨天在火山引擎 Force 大会上宣布 Seedance 2.0 支持原生4K和10-bit色深,真是及时雨。
而且这次 Force 大会,还发了一个新的豆包语音生成模型 1.0。我实测过了,这个音频模型的升级比 Seedance 2.0 更让我坐不住!
我给大家演示效果,你就知道有多厉害了。
Seedance 2.0 的镜头调度我一直很满意,放到专业剪辑软件里完全不违和。
最近发现了两个小技巧,能让镜头调度更灵活。
第一个是关于参考图的。
虽然 Seedance 2.0 支持9个参考已经是行业领先了,但做发布会视频分镜一多,9张偶尔还是不够用。
其实可以把所有分镜拼成一张大图,一整张传进去。
Seedance 2.0 也能理解。
每一格的构图、角色位置、文字说明,AI照单全收,会按顺序把对应的视频片段跑出来。
不过大家以后就不用纠结9个参考不够了。
下个月火山引擎要发 Seedance 2.5,最高支持50个参考!图片、视频、音频都能往里投。
单段时长也从8秒提到了30秒,我现在已经在盘算下一支视频怎么拍了。
下一个技巧更神奇。
如果你发现图片和文字提示词控制镜头运镜不太好表述,其实你可以直接在图上画条线,告诉AI:
第一人称无人机飞行视角,严格遵循图像中的红色飞行路径,画面中不出现红色线条和箭头,没有跳接。
就能生成沿着路径的鸟瞰飞行镜头,以前得租无人机才拍得出来。
现在你只需要用 Seedance 在参考图上画根线就行了。
来看看最终生成的发布会开场的4K成片。
原生4K直出的视频,每一帧截下来都是高清图。
我另外还生成了一个720P的效果放在一起对比,差距一目了然。
原生4K和10-bit色深,对专业影视工作室来说太有用了。
4K可以直接上大屏,电影院、发布会LED墙,不用后期拉伸。
而10-bit色深能让从暗部到聚光灯下的亮部的过渡没有色带,更自然。后期调色空间也大得多。
说不定很快,就能在电影院里看到用 Seedance 2.0 做的电影。
画面这块完全够用了,但一支发布会视频,光有画面只算做了一半,另一半在声音。
旁白的质感,直接决定整场发布会的质量。
我把演讲稿投给这次新出的豆包语音生成模型 1.0,加上一句提示词:
生成出来不仅仅是两个人在对谈,还能听到背景的BGM和一些环境的声音。
而且在对谈时,BGM会自然地降低,这效果就像是有专业剪辑师做的多轨混音一样。
方言生成的效果也不错,你听听我生成的这个东北口音版,一开口「哎妈呀」,自带喜感。
再试试科幻风格的机器人独白,声音的质感和人格都跟着风格变了。
试到这里我已经有点上头了,它居然不只是说,还能唱出来。
别看我演示的就两分钟,其实豆包语音生成模型1.0能拉到几十分钟不换音色,做播客、有声书、长篇配音绰绰有余。
除了文字提示词,上传录音也支持,生成出来的音频不仅音色一样,连语气和节奏都惟妙惟肖。
多角色对话更不用说,不只双人,复杂场景里多个声音一次全出来,每个人的说话风格都分得开。
以前说到字节的AI,大家第一个反应是视频模型Seedance 2.0强。
但这次豆包语音生成模型 1.0从「能做语音」直接跳到了「重新定义语音模型能做什么」的程度。
以后大家提起字节的AI,视频和语音,两块都是行业第一梯队。
一条流水线全跑通
这次一起发的,不止视频和音频。图片模型 Seedream 5.0-Large 也更新了。
比如做发布会PPT,把复杂的图文信息扔过去,能生成一张可视化很好的图表。哪里不满意,圈一下直接改。
还能像PS一样把图片分层,精细化处理每一层。
同一个画面里,中文、英文、阿拉伯文,多种语言排在一起,各自按自己的阅读习惯对齐。
以后就可以把字节的这3个模型连成一条完整的创作线。
先用 Seedream 画分镜概念图:
再投给 Seedance 生成视频画面,最后交给豆包语音生成模型配上声音。
从创意到成片,一个人就能从头跑到尾。回头想想挺感慨的,去年这时候,AI出的画面拿去发篇文章、做条短视频,完全够用了。
现在再看,AI做的内容已经能从手机屏里走到影院级的商业项目中去了,这也就短短一年。
所以我想问问大家,这一年多AI创作工具的进步,最让你意外的是什么呢?