← 返回AI工具

WhisperX 词级时间戳转写工具

给 OpenAI Whisper 补上两处短板:官方仓库称用 VAD 切分与批处理,在 large-v2 上可跑到约 70 倍实时速度;再用外部的音素对齐模型,把句子级时间戳细化到每一个词;说话人分离走 pyannote,做会议记录与字幕时能直接知道谁在什么时间说了哪句话

工具界面

交互式工具即将上线

功能特点

  • ✓ 速度快:官方仓库给出的大写数字是约 70 倍实时(70x realtime)转写,靠的是批处理推理与更快的后端
  • ✓ 词级时间戳:官方说明改用外部音素对齐模型来获取精度更高的单词级时间轴,解决 Whisper 原生时间戳偏差可达数秒的问题
  • ✓ 说话人分离:通过 pyannote 做 diarization,多人对话时能把每句话分派到具体说话人
  • ✓ VAD 预处理:先做语音活动检测切分再识别,长音频切段更干净,也更容易并行
  • ✓ 开源且可自托管:官方仓库按 BSD-2-Clause 许可发布,可在自己机器上跑,不必把音频交给第三方 API

使用步骤

  1. 打开官方仓库 https://github.com/m-bain/whisperX 阅读 README 与安装说明
  2. 按官方要求准备好运行环境(通常需要 Python 与 PyTorch,转写前建议先装好 ffmpeg 以便处理音频)
  3. 用官方提供的命令行或示例脚本对音频转写,需要区分说话人时加上 diarization 相关参数(pyannote 需要 Hugging Face 访问令牌)
  4. 拿到词级时间戳与说话人标记的转写结果后,再接进你自己的字幕、会议纪要或剪辑流程

常见问题

WhisperX 是什么?

WhisperX 是围绕 OpenAI Whisper 做增强的开源转写工具,官方仓库为 https://github.com/m-bain/whisperX 。它提供的核心是带单词级时间戳与说话人分离的快速自动语音识别,官方仓库给出的速度数字是 large-v2 上约 70 倍实时。

它和直接用 Whisper 有什么区别?

按官方说明,Whisper 的转写本身准确,但时间戳是句子级的(utterance-level)而且可能偏差好几秒,另外原生不支持批处理。WhisperX 用批处理提速,并用外部的音素/CTC 对齐模型把时间戳细化到词,同时补上说话人分离。

词级时间戳有什么用?

它让每个词都带上时间轴,做字幕、卡拉OK式文本高亮、按句剪辑、把会议记录定位到音频某一秒、以及按发言人对齐内容时都要靠它。相比句子级时间戳,词级时间轴能显著减少字幕与画面不同步的问题。

说话人分离需要额外准备什么?

官方文档说明说话人分离通过 pyannote 实现,通常需要提供 Hugging Face 的访问令牌才能拉取相应的 diarization 模型。也就是说功能可用,但要额外做一步令牌与模型授权配置。

可以商用吗?

WhisperX 代码本身按 BSD-2-Clause 许可发布,相对宽松;但要留意它依赖的模型与服务各有自己的许可与条款(例如 Whisper 模型、pyannote 模型、Hugging Face 的使用条款)。商用前请逐项核对相关许可,以各项目官方页面为准。

跑它要什么硬件?

官方仓库的功能描述中提到在 large-v2、beam_size 为 5 的情况下显存需求低于 8GB,说明主流 NVIDIA 显卡即可运行;用更小的模型或以 CPU 运行也可以,但速度会明显下降。实际耗时与显存占用随音频长度、模型规格与硬件配置变化,请以官方文档与自测结果为准。