给视频配字幕,能不能不花钱也不上传?(附skill安装地址)

给视频配字幕,能不能不花钱也不上传?

你电脑里大概也囤着几段视频:一场讲座、一段播客、一条产品演示,想加字幕发出去,却一直拖着没动。

可一拖就是半年。不是懒,是每次打开字幕工具都犯难——要么按分钟计费,一小时几十块;要么要把视频传到别人服务器上,而内容可能还涉密。那种「明明是我自己的东西,却要交给别人、还得花钱」的别扭,你大概也熟。

你犹豫一下,关掉了网页。字幕,又没做。

这事其实可以不这么拧巴。


一个反常识的事实

多数在线字幕工具,默认要把你的音视频传到云端才能识别。

而这套流水线——抽音轨、识别、校对、出字幕——全在你自己电脑上跑。模型权重下到本地之后,拔了网线也能用。没有按量扣费,没有内容出库,没有 token 账单。

说白了,它给的是「不想把内容交出去、又不想为字幕持续付费」的人。它不太适合「随手丢一段、要立刻出完美字幕」的预期;更适合愿意在自己电脑上搭一次、之后批量慢慢跑的人。

冷知识:它用的识别引擎是 Whisper,权重首次运行会自动下载(base 约 140MB)。国内直连官方源常超时,程序会自己切到镜像站;下好后就能彻底离线。后面会说几个真实的坑。

它到底在做什么

整条链路是一条本地脚本流水线:

抽音轨(ffmpeg)→ Whisper 本地识别词表校对(专名纠偏)→ 断句优化 → 输出 srt / vtt。

默认用 base 模型、默认中文。档位(tinylarge-v3)、语言、样式都能调,整目录也能批量丢进去。

它正好接住几类人反复踩的坑。


三类人会用得上

① 知识博主 / 课程制作者。 一批录播课要配字幕,云端按分钟太贵,自己电脑跑一夜不花钱。

② 想做双语 / 出海的人。 中英双语字幕,同一段音频跑两遍模型,自动按时间戳并成「中文行 + 英文行」。

③ 注重隐私的人。 会议记录、内部培训、还没公开的内容,不想上传任何服务器。

一个特别实用的点:内容里一旦有专名——角色名、品牌、术语(比如命理、小说人名),Whisper 极容易把同音字翻车。把专属词列进一张词表,识别完会自动纠一遍。后面有例子。

怎么用,三步就够

第 1 步,先自检环境(不处理文件,只告诉你缺什么):

python scripts/cli.py --check

第 2 步,常用的一句——中文视频出中文 srt,顺手过词表:

python scripts/cli.py 讲座.mp4 --wordlist assets/wordlist.example.json

第 3 步,决定字幕长什么样。 三种形态对照一下:

形态命令字幕能否关适合
外挂 srt / vtt(默认)不加 flag播放器加载才显校对、二次编辑
封装软字幕--mux✅ 可开关分发交付
硬烧进画面--burn❌ 不可关社交平台、不支持软字幕处

想双语就加 --mode bilingual --vad;整目录批量直接把文件夹当参数传;要更准就上 --model large-v3(吃显卡或耐心)。

收藏这张高频命令速查,省得每次翻文档:

想做的事命令
中文视频 → 中文 srtcli.py 讲座.mp4 --wordlist wl.json
中英双语(开 VAD)cli.py 讲座.mp4 --mode bilingual --vad
只出英文cli.py 讲座.mp4 --mode translate
封装软字幕交付cli.py 讲座.mp4 --mux
整目录批量cli.py ./lectures/ --wordlist wl.json

词表小技巧:格式很简单,字典式就行——{"陆晨":"陆辰","奇门盾甲":"奇门遁甲"}。识别完脚本按词整词替换,长词优先匹配。专名密集的内容,这张表能救回一大半误识。


把丑话说在前

它不是魔法,有几处要心里有数:

识别做不到完全准确。 尤其专名密集的内容,必须过词表 + 人工过一遍。别指望一键完美。

base 模型默认吐繁体。 因为它的训练语料里港台繁体占比高。实测一段简体朗读,base 仍输出繁体。词表校对是精确字形匹配——模型吐出繁体「鹿塵」,你词表里写简体「陆晨」就对不上,会静默跳过。所以词表的 wrong 键要用模型实际吐出的字形(仓库示例已按真实繁体填好,可直接参考)。要统一简体,要么把繁体 wrong 键补进词表,要么自己装个 OpenCC 跑一道。

双语 = 同一段音频跑两遍模型。 CPU 上能跑,但慢。追求速度就上 GPU 或更大模型。

硬烧不可逆。 烧进画面的字幕改不了,务必先校好 srt 再 --burn

首次要下模型权重。 base 约 140MB,好在已自动切国内镜像、下完可离线。Windows 硬烧中文容易出方块,记得用 --font-file 指定中文字体。

认知增量:很多人不知道——「双语字幕」本质是模型跑两遍(一遍识别、一遍翻译),所以慢;而「词表校对」靠的是字形精确匹配,这也就解释了为什么繁体内容要特意用繁体 wrong 键。这两点,是它和「一键云端魔法」本质不同的地方。


适合谁先试

如果你也属于「录了一堆视频,字幕一直拖着没做」的人——你需要的不是又一个按分钟收费的网页,而是一条能在自己电脑上跑完的本地流水线。

先跑一句 --check 看看环境齐不齐,比直接冲进任何工具都稳。

你手头有没有哪段视频,一直想加字幕却卡在「要上传 / 要花钱」上?评论区聊聊,说不定正是它擅长的那种。

请根据 https://skillhub.cn/install/skillhub.md,安装 video-subtitle-v1。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值