详细介绍
产品定位
VoiceStudio(仓库 debpalash/VoiceStudio,原名 OmniVoice-Studio)是一款开源、本地优先的语音工作台,目标是给需要语音克隆、声音设计、视频配音、听写转录和有声书制作的用户提供一个可替代 ElevenLabs 的桌面方案。它采用 AGPL-3.0 许可,GitHub 星标约 2.9 万,强调无需注册账号或 API key,音频默认不出本机,适合重视隐私、可控性和离线可用性的个人与团队。项目自述处于 active beta 阶段,默认引擎权重为 CC-BY-NC 非商用许可,商用需逐个引擎核实。
核心功能
它把多种语音能力整合在一个应用里。声音克隆为零样本模式,官方称最短 3 秒音频即可,5 至 15 秒干净单人录音效果更稳,克隆出的音色以 .ovsvoice 文件保存在本地;声音设计可按年龄、口音、音高、风格等描述生成全新声音;视频配音提供转录、翻译、说话人分离、重新配音到导出 MP4 的一站式流程;有声书支持导入 EPUB 或 PDF、多角色配音、按章节渲染并导出带章节的 m4b;听写与转录支持实时听写、字幕生成与说话人分离。内置 16 个 TTS 引擎,默认 OmniVoice,另有 CosyVoice 3、GPT-SoVITS、MOSS-TTS-Nano、MLX-Audio、Sherpa-ONNX、IndexTTS 2.5 等,并集成 11 个 ASR 引擎,语言目录号称 646 种。
技术特点
架构采用 Tauri v2 桌面壳、React 前端与 FastAPI 后端,支持 CUDA、Apple Silicon MPS、MLX、ROCm 与纯 CPU 推理。本地 HTTP 服务运行在 3900 端口并镜像 OpenAI 音频 API,提供语音合成、转录与音色列表接口,改一下 base_url 就能用 OpenAI SDK 接入;同时挂载 MCP 服务器,可供 Claude Desktop、Cursor 等调用 generate_speech、clone_voice、transcribe 等工具。平台支持 macOS Apple Silicon、Windows 10/11 与 Linux x86_64,Intel Mac 无法运行本地后端;内存最低 8GB 推荐 16GB,磁盘最低 10GB,GPU 可选,显存最低 4GB 推荐 8GB 以上。
适用场景
它适合播客和视频创作者做本地配音、翻译与字幕,适合作者和出版社把 EPUB 或 PDF 制作成多角色有声书,也适合记者、研究者和学生进行实时听写、采访转录与说话人分离。对开发者和 AI 应用团队而言,VoiceStudio 可作为本地语音基础设施:通过 3900 端口的 OpenAI 兼容接口或 MCP 工具把语音合成、克隆和转录接入现有工作流,同时避免把敏感音频上传到云端。需要商用时应先确认 AGPL-3.0 义务和各引擎权重许可,尤其是默认引擎的 CC-BY-NC 限制。







