善忘技术夹 Logo
善忘技术夹
善用佳软 开源/免费

妙幕 SmartSub:视频转字幕、翻译、AI 配音全免费本地跑通的开源工具

做视频的人,迟早会被字幕和配音拖住。

一段 20 分钟的素材,要加中文字幕,要翻译成英文,要配两版配音。传统做法分几步走:先用剪映或 PR 听写,再丢进 DeepL 翻译,最后用云 TTS 生成配音。每个环节都得手动搬数据,商用服务按分钟收费,长视频成本蹿得快。涉及客户内训、产品演示这类敏感内容,还不敢传到云端 ASR。

一个人扛这些累,团队协作数据和版本更乱。

最近发现了 SmartSub(中文名”妙幕”),一个开源桌面工具,把视频下载、字幕转写、翻译、校对、AI 配音、声音克隆、字幕烧录整条流水线装进一个应用。GitHub 上 5.1k Stars,MIT 协议,地址在 github.com/buxuku/SmartSub。

SmartSub 主界面

这是什么

SmartSub 的定位是”一站式字幕翻译与 AI 配音桌面工具”。说人话:从粘贴视频链接到烧录出带字幕和配音的成片,全程在一个应用里完成,整条流水线能完全免费本地跑通,不需要任何 API Key。

技术上用 Electron + Next.js 构建,转写靠 whisper.cpp、sherpa-onnx 这些本地模型,TTS 部分集成了 Kokoro、VITS 和零样本声音克隆。Windows、macOS(含 Apple Silicon)、Linux 三平台都能跑。数据全在本机,不上传任何东西到服务器。

它解决的不是”AI 能不能听懂语音”,是”视频字幕配音整条流水线”的工程问题:免费、本地、一站式。

SmartSub Logo

流水线拆成五个环节

SmartSub 把这条流水线拆成五个环节,每个环节都给足选项。

视频下载:粘贴链接就能取材

支持 B 站、YouTube 等主流平台,底层是 yt-dlp 加 lux 双引擎,自动匹配。还能直接抓取官方字幕做对照,对搬运海外内容的人特别实用。要下载会员内容,支持导入 cookie。

字幕转写:8 种本地 ASR 引擎

转写是整个工具的核心。内置 8 种引擎类型,whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet 都是本地的,再加上 9 家云端 ASR 可选。每个任务能单独选引擎,不用全局绑定一个。

硬件加速做得比较细。NVIDIA 走 CUDA,AMD/Intel 走 Vulkan,Apple Silicon 走 Core ML/Metal,没 GPU 也能 CPU 跑。CUDA 版本能在应用内一键切换,不用自己装 Toolkit,这点对 Windows 用户友好。

字幕翻译:20 种服务,含本地 LLM

翻译部分接了 20 种服务。免费的 Bing、Google 内置可用,DeepLX、百度、DeepSeek、Gemini、OpenAI 兼容 API 都能接。比较有意思的是支持 Ollama,能挂本地 LLM 做翻译,敏感内容不出本机。

翻译参数能在 UI 里直接改,支持导入导出配置。批量处理长视频字幕时省事。

TTS 配音与声音克隆:本地和云都能用

配音部分分本地和云两块。本地引擎有 Kokoro(103 种音色)、VITS(174 种中文音色)、ZipVoice(零样本声音克隆)。云端接了 Edge TTS、OpenAI 兼容、Azure、ElevenLabs、火山引擎、小米 MiMo。

零样本克隆是亮点。一段几秒到十几秒的参考音频,就能克隆声音给字幕配音。商用声音克隆服务不便宜,本地跑免费。当然,伦理边界要自己把握,别拿别人声音做违规内容。

字幕烧录:硬烧和软字幕都支持

最后一步是合成。支持硬烧录(字幕压进视频画面)和软字幕(外挂字幕轨),实时预览效果。FFmpeg 在后台跑,不用单独装。

字幕校对界面

实测体验

装起来不复杂。GitHub Releases 下载对应平台安装包,macOS 还能用 Homebrew:brew tap buxuku/tap 然后 brew install --cask smartsub

第一次启动要下载模型。whisper.cpp 的基础模型几百 MB,大模型几个 G,取决于你要多高的准确度。建议在 WiFi 下进行。

视频烧录合成界面

跑通一个完整流水线的感受。下载一段 10 分钟的 YouTube 视频,本地 whisper.cpp 转写用了 3 分钟(NVIDIA 4060 加 CUDA),翻译用内置免费源几分钟,TTS 用 Kokoro 配音 2 分钟,烧录 1 分钟。整条流水线大概 7 分钟跑完,没花一分钱。

几个真实感受。

转写准确度比剪映自带的好一截。whisper.cpp 的 medium 模型对中英文混说、专业术语的识别都还行,但标点偶尔不准,需要校对环节兜底。字幕校对界面做得不错,支持撤销重做,还能用 AI 做润色。

声音克隆的可用性看场景。Kokoro 自带音色已经够用,做零样本克隆需要一段清晰的参考音频,效果和 ElevenLabs 比还有差距,但免费、本地、不依赖网络,对中小创作者够用。

适用门槛要说清。CPU 转写慢,长视频得有 GPU 才实用。Mac 上 Apple Silicon 体验最好,CoreML 加逘认开。Windows 用户建议有 NVIDIA 卡,AMD/Intel 走 Vulkan 也行但速度差一截。云端服务接入要自己配 API Key,对纯小白有点门槛。

不适合的场景也要说。要交付级品质的配音,本地 TTS 还差一点火候,得接 ElevenLabs 这类专业服务。要做实时字幕直播流,SmartSub 是离线工具,做不了。

和别家怎么比

和商用方案比(剪映加 PR 加云端 TTS)。商用方案功能成熟、效果好,但按分钟收费,长视频成本高。SmartSub 整条流水线免费,但模型质量要看本地算力。

和拼接方案比(yt-dlp 加 whisper 加 DeepL 加 TTS API 加 ffmpeg)。自己拼一条流水线能跑,但门槛高,配置文件一堆,数据和版本管理乱。SmartSub 一个应用搞定,UI 操作,对非程序员友好。

和开源同类比(WhisperDesktop、Subtitle Edit)。这些工具专注单一环节,转写或编辑。SmartSub 覆盖整条流水线,从下载到烧录,不用切换工具。

收尾

适合用 SmartSub 的人:视频创作者、字幕组、跨语言内容运营、关注开源 AI 工具的开发者。特别是那些做长视频、对成本敏感、又不想把内容传到云端的创作者,这个工具对口。

不适合:追求交付级配音品质的专业团队、纯小白不愿配环境的、要做实时直播字幕的。

几个使用提醒。硬件门槛要清楚,没有 GPU 长视频跑不动,Apple Silicon 体验最好。声音克隆要用于授权内容,别踩伦理和法律边界。云端服务接入要自己配 API Key,本地部分完全免费无限制。

获取方式:GitHub 搜 buxuku/SmartSub,macOS 用 Homebrew,其他平台从 Releases 下载安装包。

妙幕这个名字起得挺准。字幕和配音这件事,过去像是隔着一层幕布,要用多个工具拼接、要花不少钱。SmartSub 把这层幕布揭开了一角,开源、免费、本地、一站式,让中小创作者也能跑通完整的字幕配音流水线。

喜欢这款工具?关注「善忘技术夹」全媒体

扫描二维码关注微信公众号与小程序,获取更多高品质开源软件推荐与效率工具测试。

善忘技术夹 微信公众号宣传图
微信公众号 (扫码关注)
善忘技术夹 微信小程序宣传图
微信小程序 (扫码即用)