社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

语音 AI 爆发了,这 3 个 GitHub 开源项目建议了解一下。

逛逛GitHub • 昨天 • 21 次点击  

01

一个网页,把字幕、翻译、配音全包了

做一条多语言视频,很多麻烦都来自工具太散,每个步骤本身反而没有那么难。

先下载视频,再分离人声、生成字幕、翻译文本、合成配音,最后还要把素材重新对齐。

Voice-Pro 把这些事情装进了同一个 Gradio WebUI。目前项目在 GitHub 上拿到了约 1.2 万 Star。

Dubbing Studio

它的 Dubbing Studio 可以下载 YouTube 视频、提取音频,用 Demucs 分离人声,再调用 Whisper、Faster-Whisper 或 Whisper-Timestamped 做识别和字幕。

翻译部分支持 100 多种语言,字幕、音频和视频素材都能接着往下处理。

配音能力也很全。

Edge-TTS 和 kokoro 适合常规语音合成,F5-TTS、E2-TTS、CosyVoice 则可以做零样本声音克隆。

你想给播客换语言,给教程补一条英文音轨,或者快速生成一版带字幕的外语视频,都能在一个界面里完成。

这个项目很适合内容创作者。

只想调用一个语音 API 的开发者,可能用不到这么完整的工作台。它已经把常见流程做成了可视化页面。

WebUI for Real-Time Speech Recognition and Translation

Podcast Production WebUI Using Voice-Cloning Technology

Windows 加 NVIDIA 显卡的体验更稳,Mac 和 Linux 虽然提供了启动脚本,但目前没有经过充分验证。

AI 模型下载量大约 10GB,官方建议预留 20GB 以上空间,显存 4GB 起步,8GB 以上会更从容。

开源地址:https://github.com/abus-aikorea/voice-pro

02

把语音助手拆成四块,想换哪个模型都行

Hugging Face 开源的 speech-to-speech 目前已经有约 1 万多 Star。

项目把一套语音助手拆成四个环节:VAD 判断你什么时候开始和停止说话,STT 把语音转成文字,LLM 生成回答,TTS 再把回答读出来。

这四个环节的实现你可以灵活更换。

比如目前默认配置使用 Parakeet TDT 做语音识别,语言模型走 OpenAI 兼容接口,语音输出使用 Qwen3-TTS。

你也可以换成 Whisper、Faster-Whisper、Paraformer、Kokoro、Pocket TTS 等方案。

Switching an OpenAI Realtime client endpoint from hosted OpenAI to a self-hosted speech-to-speech server

如果你要做桌面语音助手、智能硬件、机器人,或者想研究一套能完全本地运行的语音链路,这个项目很适合拿来打底。

它提供了一套可以不断换零件的工程框架,角色和应用形态都由你决定。

开源地址:https://github.com/huggingface/speech-to-speech

03

让 Agent 边聊天边干活

感觉基于语音优先的 Agent 产品要爆发了。

我之前也研究过,有一个很尴尬的点,是你发语音让 AI 去查资料或改文件,接下来只剩下漫长的安静。

任务没结束,话也没法继续聊,体验很差。

开源地址:https://github.com/QwenAudio/qwen-audio-agent

Qwen Audio Agent 想解决的就是这个问题。

定位是一套实时语音运行时,把前台对话和后台 Agent 分成两条可以并行工作的链路。

你可以一边和它说话,一边让后台 Agent 查资料、调用工具或处理项目。

执行过程中还能追问进度、取消任务,也能创建多个互相独立的任务。任务完成后,结果会自动回到当前对话里,不需要你反复切窗口查看。

qwen-audio-agent 原理图

后台 Agent 支持 OpenCode、OpenClaw、Qoder、Kimi Code 等,Codex 和 Claude Code 也可以通过外部适配器连接。

你原来配置的工具、MCP、Skill 可以继续复用。

交互端提供浏览器 WebUI、终端 TUI 和 macOS 桌面悬浮球。

macOS 默认支持带回声消除的全双工对话,AI 说话时你可以自然插话;Linux 和 Windows 的 TUI 默认使用半双工模式。

项目还会把个人档案、明确要求长期记住的信息和任务状态保存在本机。

qwen-audio-agent 接入参考架构

04

点击下方卡片,关注逛逛 GitHub

这个公众号历史发布过很多有趣的开源项目,如果你懒得翻文章一个个找,你直接关注微信公众号:逛逛 GitHub ,后台对话聊天就行了:

图片

Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/199601