📑 本文导航
专业软件
Adobe Premiere Pro 2026
DaVinci Resolve

剪映
其他免费开源的方案
Buzz,带图形界面,Whisper 内核,原生支持同音频中英混合识别,直接导出SRT)
核心优势:本地离线,不上传视频,识别中英夹杂句子(比如 “这个 project 我们下周 review”)效果很强,导出 srt 直接丢进 PR。 适合:只用一两次、不想注册账号、不想把素材上传云端
1. Buzz(开源 GUI,Windows/Mac)
Github 开源,底层是 OpenAI Whisper,有可视化窗口,不用敲代码
- 特点:
- 拖入 MP4/MP3,自动识别,自动检测语言,中英混读可以一次性识别(这点比 PR 原生强)
- 直接导出
.srt、vtt、txt - 离线本地运算,文件不会上传到外网,隐私友好
- 模型按需下载:small(快,一般电脑)、medium(平衡)、large-v3(精度最高,中英混合首选,体积大)
- 缺点:大模型 CPU 跑会慢一点;有独显会快很多
- 使用流程:
- GitHub 下载安装包(chidiwilliams/buzz)
- 打开,把视频拖进去
- Model 推荐
large-v3(中英混合最好),语言不用固定,Auto - 开始转录,校对字幕
- 菜单导出 SRT,直接导入 PR
2. OpenAI Whisper(开源,命令行)
Buzz 的底层本体,纯命令行,适合不怕简单终端命令的人
- 支持自动识别混合中英,跑完自动生成 srt
- 一行命令示例(装好 python+ffmpeg 后)
whisper video.mp4 --model large-v3
执行完自动输出 video.srt
- 缺点:需要安装 Python、ffmpeg,没有图形界面,一次性使用稍微麻烦一点
3. FunASR 阿里开源(命令行,本地离线)
阿里语音开源项目,SenseVoice 模型,多语种混合识别很强,支持一键输出 srt,对中文优化很好,支持中英混讲
funasr audio.wav -f srt
适合会简单命令行;图形界面弱,更适合技术向
4. Aegisub(开源字幕编辑器,免费)
⚠️ 它本身不带语音识别! 作用:校对 SRT 字幕神器,Whisper/Buzz 生成字幕之后,用 Aegisub 打开,微调时间轴、改错别字,最后保存 srt,导入 PR 不会乱码。 如果你需要精细调整字幕时间码,搭配上面工具一起用。
👉 轻量在线免费方案(⚠️隐私注意)
适合很短视频;重要素材不要上传
- HuggingFace Spaces 上的 Whisper web demo(网页版 Whisper) 浏览器直接跑模型,本地网页运算(部分 demo 文件不上传服务器),识别后下载 SRT。 搜索:
whisper web demo huggingface
缺点:长视频会卡,网页偶尔失效
方案对比,帮你快速选
| 工具 | 图形界面 | 中英混合识别 | 导出 SRT | 难度 |
|---|---|---|---|---|
| Buzz | ✅有 | ✅优秀 | ✅一键导出 | 最低(推荐一次性用) |
| Whisper 原版 | ❌命令行 | ✅优秀 | ✅自动输出 | 中等 |
| FunASR | ❌命令行 | ✅优秀 | ✅命令输出 | 中等 |
| 在线 Whisper Demo | ✅网页 | ✅可以 | ✅下载 | 低,但是长视频不稳 |