今天给大家介绍一下 ViMax,一个做多镜头 AI 视频的开源项目。

我看这个项目时,先看的是它怎么处理比较长的故事。现在生成几秒钟画面的工具不少,但故事一拉长,角色外观和场景衔接就容易出问题。ViMax 的主要思路,是把剧本、角色、分镜、镜头生成和最终合成放在一个流程里处理。
我们给它一句话想法可以,给它完整剧本也可以,如果手里有一段小说,也能让它先拆成适合视频表达的内容。
ViMax 是什么
ViMax 是一个开源视频生成项目,官方叫法是 Agentic Video Generation。按我的理解,它不是单独负责生成画面的模型,而是一套视频生产流程。
我们输入创意以后,它会先整理故事,安排角色和场景,再设计分镜和镜头。后面才开始生成图片、视频片段,并把这些素材合成成片。

事先说清楚,ViMax 开源,不代表生成视频没有成本。它需要接入聊天模型、图片生成模型和视频生成模型,这些都是需要你自己提供的。刚开始试的时候,先跑几个场景的小案例,别直接做长视频。
功能详情:它能做到哪一步
Idea2Video:一句话生成短片
如果我们只有一个大概想法,还没有完整剧本,可以用 Idea2Video。
一般需要准备这些内容:
官方有个小动物日常示例:
这个例子的输入并不复杂,ViMax 会先把故事补完整,再安排角色、剧本和分镜,之后才进入镜头生成。对不太会写分镜的人来说,这一步能帮上忙。
Script2Video:已有剧本可以生成视频
如果我们手里已经有剧本,就不用让 ViMax 替我们编故事了。
Script2Video 支持更明确的输入,我们可以写清楚场景、人物、动作和对白,再补上镜头数量、节奏和风格要求。比如一个篮球场练习的场景,谁在做动作,谁在说话,镜头数量不要超过多少,都可以写进去。
手里已经有明确题材,我会先用 Script2Video。故事由我们自己定,ViMax 主要帮我们拆分成分镜并生成画面,剧本写得越具体,后面需要修改的地方会少一些。
Novel2Video:小说内容可以拆成多场景视频
如果是小说这类比较长的内容,可以用 Novel2Video。
我们把一段小说内容交给它,它会先整理故事线,保留主要情节和角色,再把内容拆成适合视频表达的场景。小说里的大段描写,会变成人物、环境、动作和镜头安排。

拿它做小说片段可视化、短剧样片、漫画脚本预演都可以。不要一上来就丢一本完整小说,先拿一章,或者拿一个冲突比较明确的片段试,内容越短,我们越容易检查它有没有乱改剧情。
AutoCameo:把自己或宠物放进故事里
AutoCameo 可以用参考照片生成角色,让人物或者宠物出现在故事里,角色会在多个镜头里尽量保持相近的外观。做宠物短片,或者让个人形象出现在虚构故事里,都可以用这个功能试一下。


我们打开文件夹,看看给生成的效果:

这点非常重要,我刚开始没有做人物的形象提示约束,导致主角人物形象会变化,文章后面我放个视频案例,你们看了就明白了。
重点提醒:涉及真人照片时,只能用自己的照片,或者先拿到对方授权。不要拿别人的正脸图来生成,发到平台上很容易出问题。
Web UI:浏览器里管理项目、分镜和生成进度
ViMax 现在有 Web UI。想看分镜和中间结果时,用浏览器比一直切命令行方便。
页面里可以建项目,和 ViMax Agent 对话,上传文件,看分镜,看生成过程中的文件,也能看渲染进度。项目设置里可以配置模型服务,界面有浅色和深色模式。

用 Web UI 时,剧本、分镜和镜头素材都能在页面里检查,视频生成不是点一次按钮就结束,中间每一步都可能要改。发现剧情不对或者角色有偏差,可以早点停下来处理,比生成完再返工省时间。
多镜头一致性:角色和场景尽量保持一致
多镜头视频里经常会出现角色和场景对不上的情况。比如第一个镜头里角色穿红衣服,下一个镜头变成蓝衣服;前一秒人在左边,后一秒背景换了,这些问题不复杂,但很影响观看。
ViMax 会把角色参考、场景参考、首帧画面和镜头安排放在一起处理。它还会检查生成的图片,让后面的镜头尽量接得上前面的内容。

它也不能保证所有镜头都对。 它会把角色和场景接不接得上这一步放进流程里,我们不用完全靠自己拿截图反复补参考图,生成后还是要人工检查。
跑一个小案例
可以先用下面这个短案例试一下。
故事想法:
昔日被退婚的少年云烬,曾被全城嘲笑为废物。三年后,他独自回到云岚山门,在万人注视下登上擂台,挑战当年羞辱他的天才少女。战斗中,他以黑尺、身法与青蓝异火逆转局势,最终没有羞辱对方,只把旧婚书焚成灰烬,平静离去。
创作要求:
小说剧情画面 + 旁白解说 + 1分钟左右视频
把这段内容放进 Web UI,让 ViMax 先生成故事和分镜。这里不要直接做长片,先看角色有没有变化,剧情有没有跑偏。



如果分镜没有问题,再继续生成关键画面和视频片段,中间有角色不对、场景不接、动作不合理的地方,就停下来改。不要硬让它继续跑,后面会多花调用费。
PS:因为我只是简单测试一下效果,对关键画面和视频片段就不做审查了,剧本设计也一字不改了,直接跑,看最终效果。
第一次跑的时候,建议把目标放低一点,先用这个小案例检查故事是否完整、角色有没有明显变化、中间过程能不能修改。如果这几项和你的期望目标有差距,就先别急着做长视频。
运行不到十分钟,成品来了:
上面这个视频就是简单描述两句,然后一次没调,直接跑出来的效果。感觉特效还行、旁边基本对得上画面,但是人物前部分是短发,形象没有固定,这个就需要越详细越好的剧本描述和分镜审查找问题了,大家感兴趣的可以自己去玩玩。
比较适合的使用场景
短视频创意样片
有一个选题,但还没想清楚怎么拍,可以先用 ViMax 出一个粗样片。我们不用一开始就找人画分镜,也不用先写很完整的拍摄方案。
生成结果不一定能直接发布,但可以帮我们判断这个故事有没有画面感。如果看完样片还是觉得画面撑不起来,这个选题可以先放一放。
小说、漫画和短剧的前期预演
小说改视频时,要考虑哪些情节留下,哪些描写变成画面,哪些角色需要一直出现,只拿原文去讨论,很多问题看不出来。
ViMax 可以先把文字拆成场景和镜头。我们再拿这个结果去改剧本、画分镜,或者拿给负责剪辑和美术的人看,比直接看一段小说原文清楚一些。
产品和课程讲解视频
如果我们已经有讲解稿,可以把它整理成剧本,再让 ViMax 生成画面。课程片头、概念解释、产品故事,都可以先用它做样片。
我不建议把生成结果直接当正式商业成片,画面细节、字幕、品牌元素和配音,还是人工再过一遍比较好。
人物或宠物出镜的内容
AutoCameo 适合做宠物短片、家庭纪念视频、个人形象小故事这类内容。
真人照片要先取得授权,不要因为工具支持参考图,就随便使用别人的肖像。
团队内部沟通创意
团队内部讨论创意时,光靠文字有时不够直观。先做一条几十秒的样片,把人物、场景和大致节奏摆出来,沟通会容易一些。
ViMax 可以放在前期沟通里用,样片能让讨论更具体,至于内容最终好不好,还是要靠人判断。
我的看法
不要把 ViMax 看成单个视频模型的替代品,它主要做的是把写故事、做分镜、生成镜头和合成视频这些步骤连起来。
如果只是要一个几秒钟的画面,用 ViMax 会有点重,直接找顺手的视频生成工具更快。做有角色、场景和连续剧情的内容时,ViMax 的流程就比较合适。
我现在比较看好它的 Web UI 和 Script2Video。Web UI 能看到中间过程,Script2Video 能把剧本控制权留在我们自己手里。如果完全让 AI 自己安排,前期确实省事,但后面发现问题时,修改起来会比较麻烦。
开源地址
https://github.com/HKUDS/ViMax