GitHub 雷达
首次出现 88 天前

jamiepine/voicebox

1. Voicebox 是一个本地优先的开源 AI 语音工作室,集语音克隆、语音合成、语音输入和智能体语音输出于一体,可替代 ElevenLabs 和 WisprFlow 等闭源云服务。 2. 基于 Tauri(Rust)构建,支持 macOS、Windows、Linux 和 Docker,集成 7 种 TTS 引擎(如 Qwen3-TTS、LuxTTS、Kokoro 等)、Whisper 语音识别、本地 LLM 及 MCP 协议,所有模型和数据均在本地运行。 3. 亮点在于零样本语音克隆、多语种与表现力控制、无限制长度的故事编辑、全局热键听写、MCP 工具调用赋予 AI 智能体声音,并支持自定义语音人格,适用于隐私敏感的全栈语音应用和智能体交互场景。

近 7 日
+2,187
累计 Star
55.1k
Fork
6,858
近 30 日
+4,326
Star 趋势 · 69 个采集点
+69%
6 月 23 日9 月 19 日
语言TypeScript
分类AI/机器学习
最近提交8 月 9 日
创建时间1 月 25 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. Voicebox 是一个本地优先的开源 AI 语音工作室,集语音克隆、语音合成、语音输入和智能体语音输出于一体,可替代 ElevenLabs 和 WisprFlow 等闭源云服务。 2. 基于 Tauri(Rust)构建,支持 macOS、Windows、Linux 和 Docker,集成 7 种 TTS 引擎(如 Qwen3-TTS、LuxTTS、Kokoro 等)、Whisper 语音识别、本地 LLM 及 MCP 协议,所有模型和数据均在本地运行。 3. 亮点在于零样本语音克隆、多语种与表现力控制、无限制长度的故事编辑、全局热键听写、MCP 工具调用赋予 AI 智能体声音,并支持自定义语音人格,适用于隐私敏感的全栈语音应用和智能体交互场景。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开