描述
OpenAI Whisper 是一个复杂的预训练模型,旨在用于自动语音识别 (ASR) 和语音翻译。由 OpenAI 开发,Whisper 基于 Transformer 编码器-解码器架构,也称为序列到序列模型。它在一个包含 680,000 小时标记语音数据的广泛数据集上进行了训练,采用大规模弱监督。这种训练使 Whisper 能够在不同数据集和领域中有效泛化,而无需微调。
Whisper 模型有五种配置可供选择,每种配置在大小和能力上有所不同。较小的模型在仅英语和多语言数据上进行训练,而最大的模型则专门针对多语言。这些模型可以在 Hugging Face Hub 上访问,为不同的 ASR 和翻译任务提供灵活性。Whisper 可以转录音频样本并将语音从一种语言翻译成另一种语言,使其成为开发人员和研究人员的多功能工具。
该模型使用上下文令牌来确定转录或翻译的任务和语言。这些令牌指导模型预测输出语言和任务,从而实现受控或自动预测。Whisper 的能力扩展到通过分块算法进行长格式转录,使其能够处理任意长度的音频样本。
虽然 Whisper 在 ASR 和翻译方面表现出色,但它也存在一些局限性。模型的准确性可能因语言而异,尤其是那些训练数据较少的语言。此外,它可能会产生幻觉,即输出包含音频输入中不存在的文本。尽管面临这些挑战,Whisper 对口音、背景噪音和技术语言的鲁棒性使其成为改善可及性和开发 ASR 解决方案的宝贵工具。
OpenAI Whisper 模型亮点
在 680,000 小时的数据上进行预训练
支持自动语音识别
实现语音翻译
基于 Transformer 的编码器-解码器模型
提供五种模型大小
处理多语言和仅英语任务
用于任务和语言控制的上下文令牌
使用分块进行长格式转录
OpenAI Whisper 模型入门
访问页面:访问 Hugging Face 模型页面
加载模型:从 Hub 下载 Whisper 模型
配置环境:设置 WhisperProcessor
集成:使用上下文令牌进行任务
微调:使用标记数据提高性能
OpenAI Whisper 模型的使用案例
- 语音识别
- 语音翻译
- 多语言 ASR
- 无障碍工具
- 研究与开发












