字数 2016,阅读大约需 11 分钟
周末在GitHub trending上刷到Pixelle-Video,我点进去的时候以为又是哪个套壳项目,毕竟AI自动化制作视频的套壳产品太多了。仔细看了看还真不是,这个是阿里国际AI团队(AIDC-AI)做的,Apache 2.0开源。
说回这东西本身,输入一个主题,它自动写完文案、生成配图或视频片段、合成语音,加上BGM,吐出一个成品视频。这个东西我看了一下,牛X之处在于不用会剪辑、不用写脚本、没显卡的话直接用云端API,如果有显卡全套跑本地的话,一分钱不用花。
说真的这类工具今年冒出来不少,有的只做文案,有的只做配音,有的只能生图不能生视频。Pixelle-Video是我见到的第一个把整条产线串起来的。
生成流程我直接放图:

就四步:文案生成 → 配图规划 → 逐帧处理 → 视频合成。
它不生成任何东西——就是个把各种模型串起来的装配工
别搞混了,Pixelle-Video不是Runway之类的,它自己不生成任何东西。
它干的事情说白了就是把别人家模型串起来。LLM写文案,丢给ComfyUI或者Seedream出图,再丢给Edge-TTS念稿,最后ffmpeg合在一起,套个HTML模板。每个环节接什么模型全由你自己定,这个产品不会做任何限制。(生成的质量取决于你使用的模型质量)
画质不行换图模型,文案太烂换LLM,声音不喜欢换TTS工作流,不用赌一个模型能把所有事都做好。
WebUI长这样,Streamlit搭的,灰底白框,没什么设计感,就那种「能用就行」的开发者界面:

三栏布局,左边输入,中间调参数,右边预览。我个人还挺喜欢这种风格的,不花里胡哨。
文案:LLM随便换,不想让AI写就贴现成稿子
在左侧栏敲一句「为什么我们还没有找到外星文明」,点生成,LLM给你吐一段解说词出来。这个例子是项目文档里给的,我试了几次,确实能跑通。
接的模型随便换。GPT-4o、通义千问、DeepSeek、Ollama本地模型,下拉菜单直接选,选了自动填好base_url和model。自己搭了私有API的也能接,不挑食。
我拿几个主题跑了一遍,GPT-4o出来的文案更自然,通义千问偏书面,但也够用了。看个人口味,没有哪个一定更好。
不想让AI写也行。切到「固定文案内容」模式,把现成稿子贴进去。项目文档里有个例子是拿这个模式做《斗破苍穹》小说解说,我猜是哪个老哥把自己写的文案直接丢进去出片了。
做科普,为什么我们还没有找到外星文明?,来看看效果:
配图方案:ComfyUI本地、RunningHub云端、直连API,三条路都行
文案有了得配画面。Pixelle-Video在这块的选择空间是我觉得整个项目最对胃口的地方。
三条路:
- • ComfyUI工作流,本地跑,有能打的显卡就行。默认带了个
image_flux.json,自己写的也能丢进workflows文件夹,适合本来就在玩ComfyUI的人。
- • RunningHub云端,工作流挂云上,本地不用显卡,按量付钱。支持并行处理和并发数配置。
- • 直连模型API,2026年6月刚上的功能。在WebUI里把DashScope、OpenAI、Seedream、Seedance、Kling这些的API Key一填,画图生视频直接调,ComfyUI都不用装。我自己现在就走这条线,图个省事。
这三条路不是互斥的,比如文案走Ollama本地,配图走Seedream API,语音走Edge-TTS免费方案。这种拼积木的感觉是Pixelle-Video跟其他那种一键出片工具拉开差距的地方。
还有一个小细节:配图风格靠prompt prefix来统一,在视觉设置里填一句英文,比如「Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style」,所有分镜都沿用这个风格。不会第一帧油画风第二帧日漫风,这个可以在长视频或者分集短剧中使用,风格不会突变。
语音合成、视频模板,还有几个塞进来的扩展模块
语音这块Edge-TTS免费用,微软的,多语言支持,效果不差。Index-TTS能做声音克隆,上传一段参考音频(MP3/WAV/FLAC都行),它复刻那个声音来念解说词。想做个人IP号的话能省掉每次录音的麻烦。
2026年1月加了多语言TTS,韩语法语日语都能搞。TTS工作流跟配图那套逻辑一样,会写的自己丢进workflows文件夹。
模板系统分三种:static_开头的是纯文字排版,image_开头的是AI生成的图当背景叠文字,video_开头的是AI视频片段当背景。竖屏横屏方形都有,下拉菜单选。
会写HTML的人可以在templates文件夹里自己搞,字号颜色位置动画全都能调。
说实话默认模板的美术就那样,不是我挑剔,是真的偏工具感。要做出小红书那种精致程度得自己磨prompt prefix或者干脆重写模板。但开源项目嘛,架子搭好了,好不好用还得看自己怎么用。
今年初开始这个项目还塞了几个奇怪的模块进来:
- • 数字人口播,上传一张人像图和文案,数字人对着镜头念,韩语日语都行,使用场景应该是跨境电商,毕竟这玩意开发团队背景是阿里国际AI团队嘛。
- • 图生视频,一张静态图让它动起来。动作迁移,传一段参考视频(比如跳舞)和一张图片(比如猫),视频里的动作迁移到图片上,效果就是那只猫在跳那段舞,这个我还没自己试过,看demo挺玄乎的。
- • 自定义素材,上传自己的照片和视频,AI分析完自动生成脚本再合成。
来,展示看看数字人口播效果,(韩语带货口红)
安装
Windows整合包一键启动,完全免费也能跑
Windows用户去Releases页面下整合包,解压,双击start.bat,浏览器自动打开localhost:8501。Python、ffmpeg全在包里,什么都不用装。我第一次用的时候还有点不习惯这种「什么都不用装」的感觉,很少开源项目是这样的,太省心了反而觉得是不是少了什么步骤。
macOS和Linux从源码跑,先装uv和ffmpeg:
git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
uv run streamlit run web/app.py
用完在「系统配置」面板填LLM的API Key、选图像方案,保存,回到左边输入主题点生成,等几分钟完事。
Pixelle-Video可以一分钱不花。Ollama本地跑LLM,ComfyUI本地跑图像,Edge-TTS免费语音,BGM用内置的。零成本。当然得有张能跑ComfyUI的卡,8G显存起步吧。
懒得折腾本地的用通义千问API,做个三段视频大概0.01到0.05元。我自己测过一个三分钟短视频,通义千问加Edge-TTS,API费不到一毛,但是有时候烧的也挺厉害,自己把握好。
全套云端走OpenAI加RunningHub也行,不挑设备,笔记本都能跑,费用猛长,这个适合对视频质量要求很高的玩家。
简单做个总结
这项目当然不是完美的,GPU永远是硬伤,生图生视频吃显存,Pixelle-Video只是个装配工它解决不了这种事。默认模板和默认工作流的审美也就及格水平,出品好不好看全看你自己肯不肯花时间调。
对于不需要特别精美的,做个视频教程啊、内部分享课程啊什么的,这玩意就非常合适。
GitHub地址:
https://github.com/AIDC-AI/Pixelle-Video