给视频配字幕,能不能不花钱也不上传?

你电脑里大概也囤着几段视频:一场讲座、一段播客、一条产品演示,想加字幕发出去,却一直拖着没动。
可一拖就是半年。不是懒,是每次打开字幕工具都犯难——要么按分钟计费,一小时几十块;要么要把视频传到别人服务器上,而内容可能还涉密。那种「明明是我自己的东西,却要交给别人、还得花钱」的别扭,你大概也熟。
你犹豫一下,关掉了网页。字幕,又没做。
这事其实可以不这么拧巴。
一个反常识的事实
多数在线字幕工具,默认要把你的音视频传到云端才能识别。
而这套流水线——抽音轨、识别、校对、出字幕——全在你自己电脑上跑。模型权重下到本地之后,拔了网线也能用。没有按量扣费,没有内容出库,没有 token 账单。
说白了,它给的是「不想把内容交出去、又不想为字幕持续付费」的人。它不太适合「随手丢一段、要立刻出完美字幕」的预期;更适合愿意在自己电脑上搭一次、之后批量慢慢跑的人。
冷知识:它用的识别引擎是 Whisper,权重首次运行会自动下载(base 约 140MB)。国内直连官方源常超时,程序会自己切到镜像站;下好后就能彻底离线。后面会说几个真实的坑。
它到底在做什么

整条链路是一条本地脚本流水线:
抽音轨(ffmpeg)→ Whisper 本地识别 → 词表校对(专名纠偏)→ 断句优化 → 输出 srt / vtt。
默认用 base 模型、默认中文。档位(tiny 到 large-v3)、语言、样式都能调,整目录也能批量丢进去。
它正好接住几类人反复踩的坑。
三类人会用得上
① 知识博主 / 课程制作者。 一批录播课要配字幕,云端按分钟太贵,自己电脑跑一夜不花钱。
② 想做双语 / 出海的人。 中英双语字幕,同一段音频跑两遍模型,自动按时间戳并成「中文行 + 英文行」。
③ 注重隐私的人。 会议记录、内部培训、还没公开的内容,不想上传任何服务器。
一个特别实用的点:内容里一旦有专名——角色名、品牌、术语(比如命理、小说人名),Whisper 极容易把同音字翻车。把专属词列进一张词表,识别完会自动纠一遍。后面有例子。
怎么用,三步就够
第 1 步,先自检环境(不处理文件,只告诉你缺什么):
python scripts/cli.py --check
第 2 步,常用的一句——中文视频出中文 srt,顺手过词表:
python scripts/cli.py 讲座.mp4 --wordlist assets/wordlist.example.json
第 3 步,决定字幕长什么样。 三种形态对照一下:
| 形态 | 命令 | 字幕能否关 | 适合 |
|---|---|---|---|
| 外挂 srt / vtt(默认) | 不加 flag | 播放器加载才显 | 校对、二次编辑 |
| 封装软字幕 | --mux | ✅ 可开关 | 分发交付 |
| 硬烧进画面 | --burn | ❌ 不可关 | 社交平台、不支持软字幕处 |
想双语就加 --mode bilingual --vad;整目录批量直接把文件夹当参数传;要更准就上 --model large-v3(吃显卡或耐心)。
收藏这张高频命令速查,省得每次翻文档:
| 想做的事 | 命令 |
|---|---|
| 中文视频 → 中文 srt | cli.py 讲座.mp4 --wordlist wl.json |
| 中英双语(开 VAD) | cli.py 讲座.mp4 --mode bilingual --vad |
| 只出英文 | cli.py 讲座.mp4 --mode translate |
| 封装软字幕交付 | cli.py 讲座.mp4 --mux |
| 整目录批量 | cli.py ./lectures/ --wordlist wl.json |
词表小技巧:格式很简单,字典式就行——{"陆晨":"陆辰","奇门盾甲":"奇门遁甲"}。识别完脚本按词整词替换,长词优先匹配。专名密集的内容,这张表能救回一大半误识。
把丑话说在前

它不是魔法,有几处要心里有数:
识别做不到完全准确。 尤其专名密集的内容,必须过词表 + 人工过一遍。别指望一键完美。
base 模型默认吐繁体。 因为它的训练语料里港台繁体占比高。实测一段简体朗读,base 仍输出繁体。词表校对是精确字形匹配——模型吐出繁体「鹿塵」,你词表里写简体「陆晨」就对不上,会静默跳过。所以词表的 wrong 键要用模型实际吐出的字形(仓库示例已按真实繁体填好,可直接参考)。要统一简体,要么把繁体 wrong 键补进词表,要么自己装个 OpenCC 跑一道。
双语 = 同一段音频跑两遍模型。 CPU 上能跑,但慢。追求速度就上 GPU 或更大模型。
硬烧不可逆。 烧进画面的字幕改不了,务必先校好 srt 再 --burn。
首次要下模型权重。 base 约 140MB,好在已自动切国内镜像、下完可离线。Windows 硬烧中文容易出方块,记得用 --font-file 指定中文字体。
认知增量:很多人不知道——「双语字幕」本质是模型跑两遍(一遍识别、一遍翻译),所以慢;而「词表校对」靠的是字形精确匹配,这也就解释了为什么繁体内容要特意用繁体 wrong 键。这两点,是它和「一键云端魔法」本质不同的地方。
适合谁先试
如果你也属于「录了一堆视频,字幕一直拖着没做」的人——你需要的不是又一个按分钟收费的网页,而是一条能在自己电脑上跑完的本地流水线。
先跑一句 --check 看看环境齐不齐,比直接冲进任何工具都稳。
你手头有没有哪段视频,一直想加字幕却卡在「要上传 / 要花钱」上?评论区聊聊,说不定正是它擅长的那种。
请根据 https://skillhub.cn/install/skillhub.md,安装 video-subtitle-v1。
211

被折叠的 条评论
为什么被折叠?



