01
一个网页,把字幕、翻译、配音全包了
做一条多语言视频,很多麻烦都来自工具太散,每个步骤本身反而没有那么难。
先下载视频,再分离人声、生成字幕、翻译文本、合成配音,最后还要把素材重新对齐。
Voice-Pro 把这些事情装进了同一个 Gradio WebUI。目前项目在 GitHub 上拿到了约 1.2 万 Star。

![]()
它的 Dubbing Studio 可以下载 YouTube 视频、提取音频,用 Demucs 分离人声,再调用 Whisper、Faster-Whisper 或 Whisper-Timestamped 做识别和字幕。
翻译部分支持 100 多种语言,字幕、音频和视频素材都能接着往下处理。
配音能力也很全。
Edge-TTS 和 kokoro 适合常规语音合成,F5-TTS、E2-TTS、CosyVoice 则可以做零样本声音克隆。
你想给播客换语言,给教程补一条英文音轨,或者快速生成一版带字幕的外语视频,都能在一个界面里完成。
这个项目很适合内容创作者。
只想调用一个语音 API 的开发者,可能用不到这么完整的工作台。它已经把常见流程做成了可视化页面。

![]()

![]()
Windows 加 NVIDIA 显卡的体验更稳,Mac 和 Linux 虽然提供了启动脚本,但目前没有经过充分验证。
AI 模型下载量大约 10GB,官方建议预留 20GB 以上空间,显存 4GB 起步,8GB 以上会更从容。
02
把语音助手拆成四块,想换哪个模型都行
Hugging Face 开源的 speech-to-speech 目前已经有约 1 万多 Star。
项目把一套语音助手拆成四个环节:VAD 判断你什么时候开始和停止说话,STT 把语音转成文字,LLM 生成回答,TTS 再把回答读出来。
这四个环节的实现你可以灵活更换。
比如目前默认配置使用 Parakeet TDT 做语音识别,语言模型走 OpenAI 兼容接口,语音输出使用 Qwen3-TTS。
你也可以换成 Whisper、Faster-Whisper、Paraformer、Kokoro、Pocket TTS 等方案。

![]()
如果你要做桌面语音助手、智能硬件、机器人,或者想研究一套能完全本地运行的语音链路,这个项目很适合拿来打底。
它提供了一套可以不断换零件的工程框架,角色和应用形态都由你决定。
03
让 Agent 边聊天边干活
感觉基于语音优先的 Agent 产品要爆发了。
我之前也研究过,有一个很尴尬的点,是你发语音让 AI 去查资料或改文件,接下来只剩下漫长的安静。
任务没结束,话也没法继续聊,体验很差。
开源地址:https://github.com/QwenAudio/qwen-audio-agent
Qwen Audio Agent 想解决的就是这个问题。
定位是一套实时语音运行时,把前台对话和后台 Agent 分成两条可以并行工作的链路。
你可以一边和它说话,一边让后台 Agent 查资料、调用工具或处理项目。
执行过程中还能追问进度、取消任务,也能创建多个互相独立的任务。任务完成后,结果会自动回到当前对话里,不需要你反复切窗口查看。

![]()
后台 Agent 支持 OpenCode、OpenClaw、Qoder、Kimi Code 等,Codex 和 Claude Code 也可以通过外部适配器连接。
你原来配置的工具、MCP、Skill 可以继续复用。
交互端提供浏览器 WebUI、终端 TUI 和 macOS 桌面悬浮球。
macOS 默认支持带回声消除的全双工对话,AI 说话时你可以自然插话;Linux 和 Windows 的 TUI 默认使用半双工模式。
项目还会把个人档案、明确要求长期记住的信息和任务状态保存在本机。

![]()
04
点击下方卡片,关注逛逛 GitHub
这个公众号历史发布过很多有趣的开源项目,如果你懒得翻文章一个个找,你直接关注微信公众号:逛逛 GitHub ,后台对话聊天就行了: