语音转录字幕生成srt(Premiere/DaVinci/Buzz)

媒体处理 wes 22 hours ago (2026-09-04) 31 views
📑 本文导航

专业软件

 

Adobe Premiere Pro 2026

 

DaVinci Resolve

 

剪映

 

 

其他免费开源的方案

Buzz,带图形界面,Whisper 内核,原生支持同音频中英混合识别,直接导出SRT

核心优势:本地离线,不上传视频,识别中英夹杂句子(比如 “这个 project 我们下周 review”)效果很强,导出 srt 直接丢进 PR。 适合:只用一两次、不想注册账号、不想把素材上传云端

1. Buzz(开源 GUI,Windows/Mac)

Github 开源,底层是 OpenAI Whisper,有可视化窗口,不用敲代码

  • 特点:
    • 拖入 MP4/MP3,自动识别,自动检测语言,中英混读可以一次性识别(这点比 PR 原生强)
    • 直接导出 .srt、vtt、txt
    • 离线本地运算,文件不会上传到外网,隐私友好
    • 模型按需下载:small(快,一般电脑)、medium(平衡)、large-v3(精度最高,中英混合首选,体积大)
  • 缺点:大模型 CPU 跑会慢一点;有独显会快很多
  • 使用流程:
    1. GitHub 下载安装包(chidiwilliams/buzz)
    2. 打开,把视频拖进去
    3. Model 推荐 large-v3(中英混合最好),语言不用固定,Auto
    4. 开始转录,校对字幕
    5. 菜单导出 SRT,直接导入 PR

2. OpenAI Whisper(开源,命令行)

Buzz 的底层本体,纯命令行,适合不怕简单终端命令的人

  • 支持自动识别混合中英,跑完自动生成 srt
  • 一行命令示例(装好 python+ffmpeg 后)
whisper video.mp4 --model large-v3

执行完自动输出 video.srt

  • 缺点:需要安装 Python、ffmpeg,没有图形界面,一次性使用稍微麻烦一点

3. FunASR 阿里开源(命令行,本地离线)

阿里语音开源项目,SenseVoice 模型,多语种混合识别很强,支持一键输出 srt,对中文优化很好,支持中英混讲

funasr audio.wav -f srt

适合会简单命令行;图形界面弱,更适合技术向

4. Aegisub(开源字幕编辑器,免费)

⚠️ 它本身不带语音识别! 作用:校对 SRT 字幕神器,Whisper/Buzz 生成字幕之后,用 Aegisub 打开,微调时间轴、改错别字,最后保存 srt,导入 PR 不会乱码。 如果你需要精细调整字幕时间码,搭配上面工具一起用。

👉 轻量在线免费方案(⚠️隐私注意)

适合很短视频;重要素材不要上传

  1. HuggingFace Spaces 上的 Whisper web demo(网页版 Whisper) 浏览器直接跑模型,本地网页运算(部分 demo 文件不上传服务器),识别后下载 SRT。 搜索:whisper web demo huggingface

缺点:长视频会卡,网页偶尔失效

方案对比,帮你快速选

工具 图形界面 中英混合识别 导出 SRT 难度
Buzz ✅有 ✅优秀 ✅一键导出 最低(推荐一次性用)
Whisper 原版 ❌命令行 ✅优秀 ✅自动输出 中等
FunASR ❌命令行 ✅优秀 ✅命令输出 中等
在线 Whisper Demo ✅网页 ✅可以 ✅下载 低,但是长视频不稳