把语音助手跑在本地:HuggingFace 开源了!一点都不用上传你的声音

前阵子我想给自己搭一个语音助手。
不是那种”你好,今天天气怎么样”的简单对话,是能聊几句、能听懂上下文、不用联网的那种。我在 GitHub 上搜了一圈,试了三个项目,没有一个能跑通。不是缺这个依赖,就是装到一半模型下载卡住。最离谱的一个,配置完环境启动,它给我发了条短信——“欢迎使用,您的订阅已生效,首月免费”。
那感觉就像你打算自己做饭,结果外卖送到了。

为什么本地语音 AI 一直不好做
不是技术不行,是生态太碎。一个能听会说的本地语音助手,需要四个组件串起来:
- 语音活动检测(VAD):告诉系统什么时候有人在说话;
- 语音转文字(STT):把你说的话变成文本;
- 大语言模型(LLM):理解你的话并生成回复;
- 文字转语音(TTS):把回复念出来。
四个组件,四个不同的项目,四种安装方式。你当然可以全部用云服务,Whisper 做转录,GPT 做理解,ElevenLabs 做朗读——效果好,每天用半小时的话,一个月下来大概 30 到 40 美元。你的每一句话都存在别人的服务器上。
HuggingFace 的解法
HuggingFace 最近开源了一个项目叫 speech-to-speech,把上面四个组件镶进一个统一的 pipeline。GitHub 上已经有 10.1k 星标,周增长 3823,遵循 Apache 2.0 开源许可。

核心思路:VAD、STT、LLM、TTS 四个组件打包在一起,每个都可以独立替换,启动只需要一条命令:
speech-to-speech --tts pocket --pocket_tts_voice jean
不管是用 Parakeet TDT 做语音识别,还是用 Qwen3-TTS 做语音合成,接口统一,配置统一。LLM 模块接的是 OpenAI 兼容协议,所以你可以用任何兼容 OpenAI 的模型——本地跑的、云端的、自建的,都行。
本地部署的三个核心优势
- 隐私:你的语音数据——说了什么、怎么说的、跟谁说的——全在本地。没有录音上传,没有”系统悄悄录音”的担忧。对医疗、金融、法务这些行业来说,这是唯一合规的方案。
- 延迟:没有网络往返,响应时间就是你的硬件上限。官方数据是端到端 300 毫秒以内。人类对话的自然停顿是 200 到 500 毫秒,几乎感觉不到它在”思考”。
- 可靠性:云端语音 API 会限流、宕机、涨价。你的本地语音助手不会。TTS 模型挂了换一个,LLM 不适合换一个——不把命运交给任何一家公司。

一些实话
当前版本对中文的支持还在路上。默认的语音预设都是英文发音,要跑中文需要自己接 Qwen3-TTS 等中文模型。配置不算复杂,但也非开箱即用。
硬件门槛也不低。项目说的是”消费级硬件可行”,但如果你只有 8GB 内存的 MacBook Air,跑 Qwen3-TTS 加上一个 7B 的 LLM 会有点吃力。试下来 16GB 以上的机器才算流畅。
总结与项目信息
它的目标用户是”愿意折腾的开发者”,不是”只想用”的普通用户。
如果一个项目既能让你学会语音 Agent 的完整技术栈,又能让你跑出一个真实的语音对话系统,那它值得你花一个晚上。

- 项目地址:
https://github.com/huggingface/speech-to-speech - 许可协议:Apache 2.0
关注「善忘技术夹」全媒体矩阵
扫描上方宣传海报二维码,第一时间获取最新技术文章、开源项目与免安装小程序体验。