openai/whisper

Whisper

OpenAI 开源语音识别模型

★ 65k 7.6k forks Python MIT
speech-recognitionasrtransformermultilingual
4.5综合评分
功能
4.5
文档
4.0
活跃度
2.5
易用
4.0

亮点

  • 多语言 ASR 强基线
  • 支持语种识别与翻译
  • 生态衍生项目丰富

适用场景

  • 视频字幕自动生成
  • 会议播客转写
  • 多语言 ASR 服务

评测正文

Whisper 是 OpenAI 在 2022 年开源的多语言语音识别模型,凭借在 68 万小时多语言数据上的训练,至今仍是开源 ASR 的强基线。它的鲁棒性优于多数同期模型,对口音、噪声和混响有较好容忍度。

核心能力包括多语言语音转文字、语种识别、口语翻译(X→英文)、时间戳对齐,以及 tiny/base/small/medium/large 多档模型规模。社区衍生出 faster-whisper(CTranslate2 加速)、whisper.cpp(C++ 推理)、whisperX(词级时间戳与说话人分离)等生态。

亮点是模型质量与多语言覆盖在开源圈仍然能打,生态衍生项目丰富;不足是官方仓库更新缓慢(已两年未发版),长音频需自行分段避免幻觉,标点与时间戳在快速模型上不够稳定。

适用场景:视频字幕生成、会议与播客转写、低成本多语言 ASR 服务。需要词级精度或说话人分离时建议直接用 whisperX。