社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

GitHub 2.2万 Star!阿里这个开源项目,输入一句话就能全自动出视频

极客之家 • 2 月前 • 188 次点击  

 

字数 2016,阅读大约需 11 分钟

周末在GitHub trending上刷到Pixelle-Video,我点进去的时候以为又是哪个套壳项目,毕竟AI自动化制作视频的套壳产品太多了。仔细看了看还真不是,这个是阿里国际AI团队(AIDC-AI)做的,Apache 2.0开源。

说回这东西本身,输入一个主题,它自动写完文案、生成配图或视频片段、合成语音,加上BGM,吐出一个成品视频。这个东西我看了一下,牛X之处在于不用会剪辑、不用写脚本、没显卡的话直接用云端API,如果有显卡全套跑本地的话,一分钱不用花。

说真的这类工具今年冒出来不少,有的只做文案,有的只做配音,有的只能生图不能生视频。Pixelle-Video是我见到的第一个把整条产线串起来的。

生成流程我直接放图:

就四步:文案生成 → 配图规划 → 逐帧处理 → 视频合成。

它不生成任何东西——就是个把各种模型串起来的装配工

别搞混了,Pixelle-Video不是Runway之类的,它自己不生成任何东西。

它干的事情说白了就是把别人家模型串起来。LLM写文案,丢给ComfyUI或者Seedream出图,再丢给Edge-TTS念稿,最后ffmpeg合在一起,套个HTML模板。每个环节接什么模型全由你自己定,这个产品不会做任何限制。(生成的质量取决于你使用的模型质量)

画质不行换图模型,文案太烂换LLM,声音不喜欢换TTS工作流,不用赌一个模型能把所有事都做好。

WebUI长这样,Streamlit搭的,灰底白框,没什么设计感,就那种「能用就行」的开发者界面:

三栏布局,左边输入,中间调参数,右边预览。我个人还挺喜欢这种风格的,不花里胡哨。

文案:LLM随便换,不想让AI写就贴现成稿子

在左侧栏敲一句「为什么我们还没有找到外星文明」,点生成,LLM给你吐一段解说词出来。这个例子是项目文档里给的,我试了几次,确实能跑通。

接的模型随便换。GPT-4o、通义千问、DeepSeek、Ollama本地模型,下拉菜单直接选,选了自动填好base_urlmodel。自己搭了私有API的也能接,不挑食。

我拿几个主题跑了一遍,GPT-4o出来的文案更自然,通义千问偏书面,但也够用了。看个人口味,没有哪个一定更好。

不想让AI写也行。切到「固定文案内容」模式,把现成稿子贴进去。项目文档里有个例子是拿这个模式做《斗破苍穹》小说解说,我猜是哪个老哥把自己写的文案直接丢进去出片了。

做科普,为什么我们还没有找到外星文明?,来看看效果:

配图方案:ComfyUI本地、RunningHub云端、直连API,三条路都行

文案有了得配画面。Pixelle-Video在这块的选择空间是我觉得整个项目最对胃口的地方。

三条路:

  • • ComfyUI工作流,本地跑,有能打的显卡就行。默认带了个image_flux.json,自己写的也能丢进workflows文件夹,适合本来就在玩ComfyUI的人。
  • • RunningHub云端,工作流挂云上,本地不用显卡,按量付钱。支持并行处理和并发数配置。
  • • 直连模型API,2026年6月刚上的功能。在WebUI里把DashScope、OpenAI、Seedream、Seedance、Kling这些的API Key一填,画图生视频直接调,ComfyUI都不用装。我自己现在就走这条线,图个省事。

这三条路不是互斥的,比如文案走Ollama本地,配图走Seedream API,语音走Edge-TTS免费方案。这种拼积木的感觉是Pixelle-Video跟其他那种一键出片工具拉开差距的地方。

还有一个小细节:配图风格靠prompt prefix来统一,在视觉设置里填一句英文,比如「Minimalist black-and-white matchstick figure style illustration, clean lines, simple sketch style」,所有分镜都沿用这个风格。不会第一帧油画风第二帧日漫风,这个可以在长视频或者分集短剧中使用,风格不会突变。

语音合成、视频模板,还有几个塞进来的扩展模块

语音这块Edge-TTS免费用,微软的,多语言支持,效果不差。Index-TTS能做声音克隆,上传一段参考音频(MP3/WAV/FLAC都行),它复刻那个声音来念解说词。想做个人IP号的话能省掉每次录音的麻烦。

2026年1月加了多语言TTS,韩语法语日语都能搞。TTS工作流跟配图那套逻辑一样,会写的自己丢进workflows文件夹。

模板系统分三种:static_开头的是纯文字排版,image_开头的是AI生成的图当背景叠文字,video_开头的是AI视频片段当背景。竖屏横屏方形都有,下拉菜单选。

会写HTML的人可以在templates文件夹里自己搞,字号颜色位置动画全都能调。

说实话默认模板的美术就那样,不是我挑剔,是真的偏工具感。要做出小红书那种精致程度得自己磨prompt prefix或者干脆重写模板。但开源项目嘛,架子搭好了,好不好用还得看自己怎么用。

今年初开始这个项目还塞了几个奇怪的模块进来:

  • • 数字人口播,上传一张人像图和文案,数字人对着镜头念,韩语日语都行,使用场景应该是跨境电商,毕竟这玩意开发团队背景是阿里国际AI团队嘛。
  • • 图生视频,一张静态图让它动起来。动作迁移,传一段参考视频(比如跳舞)和一张图片(比如猫),视频里的动作迁移到图片上,效果就是那只猫在跳那段舞,这个我还没自己试过,看demo挺玄乎的。
  • • 自定义素材,上传自己的照片和视频,AI分析完自动生成脚本再合成。

来,展示看看数字人口播效果,(韩语带货口红)

安装

Windows整合包一键启动,完全免费也能跑

Windows用户去Releases页面下整合包,解压,双击start.bat,浏览器自动打开localhost:8501。Python、ffmpeg全在包里,什么都不用装。我第一次用的时候还有点不习惯这种「什么都不用装」的感觉,很少开源项目是这样的,太省心了反而觉得是不是少了什么步骤。

macOS和Linux从源码跑,先装uv和ffmpeg:

git clone https://github.com/AIDC-AI/Pixelle-Video.git
cd Pixelle-Video
uv run streamlit run web/app.py

用完在「系统配置」面板填LLM的API Key、选图像方案,保存,回到左边输入主题点生成,等几分钟完事。

Pixelle-Video可以一分钱不花。Ollama本地跑LLM,ComfyUI本地跑图像,Edge-TTS免费语音,BGM用内置的。零成本。当然得有张能跑ComfyUI的卡,8G显存起步吧。

懒得折腾本地的用通义千问API,做个三段视频大概0.01到0.05元。我自己测过一个三分钟短视频,通义千问加Edge-TTS,API费不到一毛,但是有时候烧的也挺厉害,自己把握好。

全套云端走OpenAI加RunningHub也行,不挑设备,笔记本都能跑,费用猛长,这个适合对视频质量要求很高的玩家。

简单做个总结

这项目当然不是完美的,GPU永远是硬伤,生图生视频吃显存,Pixelle-Video只是个装配工它解决不了这种事。默认模板和默认工作流的审美也就及格水平,出品好不好看全看你自己肯不肯花时间调。

对于不需要特别精美的,做个视频教程啊、内部分享课程啊什么的,这玩意就非常合适。

GitHub地址:

https://github.com/AIDC-AI/Pixelle-Video

 

这个公众号曾分享过许多有趣的开源项目。如果你不想逐篇翻阅历史文章,也可以直接关注微信公众号“极客之家”,通过后台留言与我们互动交流

图片

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/197711