Hugging Face 开放 ASR 排行榜首次纳入全球南方语言:印度英语与印地语评测补上“谁在说”
Hugging Face 在开放 ASR 排行榜中加入面向印度英语与印地语的 Monsoon 数据集,首次纳入来自全球南方的语言并记录说话人地区、年龄、性别和设备等元数据,以揭示总体 WER 掩盖的群体与地域差异。印地语片段采用多种合理拼写的“文字格”评分方法(OI-WER),公开与私有分片并存,旨在推动更具代表性的语音识别评测与改进方向。
Hugging Face 在开放 ASR 排行榜中加入面向印度英语与印地语的 Monsoon 数据集,首次纳入来自全球南方的语言并记录说话人地区、年龄、性别和设备等元数据,以揭示总体 WER 掩盖的群体与地域差异。印地语片段采用多种合理拼写的“文字格”评分方法(OI-WER),公开与私有分片并存,旨在推动更具代表性的语音识别评测与改进方向。
Hugging Face 与 Voice Arena 8 月 28 日宣布,开放自动语音识别(ASR)排行榜新增两套面向印度语言环境的评测数据集:Monsoon en-IN 和 Monsoon hi-IN。前者覆盖印度英语,后者覆盖印地语。Hugging Face 称,这是该排行榜多语种评测中首次纳入来自全球南方的语言,也是首个进入现有多语种标签页的印度语系语言。
这次更新的重点不只是增加一种语言,而是试图改变语音识别排行榜只报告一个总体字错误率(WER)的做法。新数据记录了说话人的地区、年龄、性别、设备和其他背景信息,使开发者能够进一步观察:模型的平均分是否掩盖了某些地区、群体或设备上的系统性差异。
一个分数无法说明谁被识别得更差
开放 ASR 排行榜此前主要围绕英语及欧洲语言建立,通常以 WER 衡量模型把语音转换成文字时出现的错误数量。这个指标对模型之间的总体比较有用,但它并不会告诉读者测试音频来自谁,也不会显示模型是否在某些口音、年龄群体或设备上表现明显更差。
Hugging Face 在公告中援引既有研究指出,自动语音识别的错误率并不是在不同使用者之间均匀分布的。相关研究曾发现,商业系统对黑人说话者的识别错误率约为白人说话者的两倍;另有研究显示,性别、年龄和口音也可能造成差异。换言之,一个看似接近的总体 WER,并不意味着所有使用者获得了相同的识别质量。
这也是 Monsoon 数据集的设计出发点。它没有只收集更长的录音,而是尝试扩大说话人和使用条件的范围,覆盖地理位置、年龄、性别、词汇、设备、声学环境、说话类型、语速,以及同一段语音存在多个合理文字写法的情况。
两种语言、四个分片和近五千名说话者
Monsoon 包含公开和私有两类分片,四个分片之间的说话者互不重叠,总计覆盖 4,888 名说话者。公开分片可供开发者自行评分,私有分片则由 Hugging Face 保留,用于降低针对测试集优化的可能性。
数据集的构成如下:
| 分片 | 语言 | 音频时长 | 说话者 | 地区覆盖 | 设备数 | 转写方式 |
|---|---|---|---|---|---|---|
| Monsoon en-IN public | 印度英语 | 5.62 小时 | 1,444 | 428 个地区 | 556 | 标准化文本,保留口语不流畅现象 |
| Monsoon en-IN private | 印度英语 | 5.58 小时 | 1,405 | 420 个地区 | 560 | 标准化文本,保留口语不流畅现象 |
| Monsoon hi-IN public | 印地语 | 1.33 小时 | 468 | 202 个地区 | 315 | 接受正字法变体的文字格 |
| Monsoon hi-IN private | 印地语 | 4.47 小时 | 1,571 | 295 个地区 | 582 | 接受正字法变体的文字格 |
数据来自未经脚本准备的双声道对话。录音者使用自己的手机和网络,在室内或室外进行日常话题交流;随后,数据被按单个说话者分割成片段。数据集还记录职业、教育、婚姻状况、收入区间、手机品牌、所在城市,以及在当前地区居住的年数等字段。
这种收集方式有意保留了真实部署中常见的差异。来自不同地区的说话者可能使用不同设备,在不同噪声环境中说话,也可能出现停顿、重启、夹杂英语词汇和非标准表达。对于排行榜而言,这意味着模型分数不再只对应一组“干净”且相对同质的语音。
印度英语的地区差异可能被总体分数掩盖
Hugging Face 公布的一项示例分析显示,开放排行榜上的八个模型在印度英语公开分片上的 WER 集中在 4.81 至 4.99 之间,最佳与最差之间只有 0.18 个百分点。从总体分数看,这些系统几乎难以区分。
但按地区分组后,结果出现了更大的差异。公告称,OpenAI 的 whisper-large-v3-turbo 在不同地区之间的 WER 波动为 0.46 个百分点;落后其 0.14 个百分点的 mistralai/Voxtral-Mini-3B-2507,地区间波动则达到 1.68 个百分点,在中部地区的 WER 为 4.38,在东部地区为 6.06。
不同模型遇到的困难地区也不完全相同。公告举例说,IBM Granite Speech 3.3 2B 在北部地区表现最差,Microsoft VibeVoice-ASR-HF 在南部地区表现最差,而 Voxtral-Mini-3B-2507 在东部地区表现最差。如果只是某个地区的音频普遍更难,那么不同模型应当大致以相同顺序排列这些地区;实际情况并非如此。
需要注意的是,这是一项用于说明数据集分析能力的示例,并不是对所有模型或所有印度地区的最终结论。数据集作者也提醒,Monsoon 的价值在于让这类拆分分析成为可能,而不是用一次排行榜结果概括印度英语的全部地区差异。
印地语为何需要另一种评分方法
印地语评测还面对一个与地区覆盖不同的问题:同一段话可能存在多种合理的书写方式。日常印地语经常夹杂英语词汇,英语来源词在天城文中的写法并不总是固定;复合词也可能连写或分写。若只为每段音频指定一个参考文本,模型即使准确识别了声音,也可能因为选择了另一种合理拼写而被计为错误。
因此,Monsoon hi-IN 不使用单一字符串作为唯一答案,而是为每个文本片段提供一个“文字格”,列出该语境下可接受的拼写变体。数据集作者使用正字法感知词错误率(OI-WER)进行评分:模型输出只要与该片段允许的文字形式之一相符,就不会因为正字法选择不同而受到惩罚。
这项方法建立在 AI4Bharat 提出的印地语语音识别评测工作之上。Hugging Face 同时开放了 voi-oiwer 实现,以便开发者复现相关结果。作者还表示,使用单一参考文本与使用文字格进行评分时,不同模型的错误率上升幅度并不相同,排行榜顺序也可能因此改变。
公开数据与私有数据如何进入排行榜
印度英语 Monsoon 数据已经作为 Voice Arena Monsoon 加入开放 ASR 排行榜的默认数据列,因此会参与模型的总体 Average WER;私有对话分片则进入包含其他私有数据的 “Private (conversational)” 栏目。
印地语的公开和私有分片放在多语种标签页中。只有在选定的所有语言上都具备结果的模型,才会参与相应的横向排名。开发者可以在排行榜上提交模型,先通过公开数据报告结果,再由 Hugging Face 团队在私有分片上运行评测。提交流程通过 Open ASR Leaderboard 的 GitHub 仓库进行。
目前,排行榜的主界面仍同时报告 WER 与实时因子(RTFx):WER 越低通常越好,RTFx 越高意味着处理速度更快。该项目此前的研究论文显示,Conformer 编码器与 Transformer 解码器组合在平均 WER 上表现突出,而 CTC 和 TDT 解码器通常更适合长音频或批量处理场景。新增 Monsoon 数据后,模型比较又多了一层现实问题:它不仅要在总体上准确,也要在不同说话者和书写习惯下保持稳定。
这类评测方向并非孤立出现。此前,Hugging Face 与 Treble 发布的 FFASR 远场 ASR 排行榜把重点放在距离、噪声和房间声学条件上;而 Hume 的 Real World VoiceEQ 评测则尝试从自然性、可靠性和理解力等维度扩展语音 AI 的评价方式。
从“模型排名”转向“模型在哪里失效”
Monsoon 的意义在于,它把语言覆盖、说话者背景和评测方法放进同一条公开工作流中。开发者不仅可以看到哪个模型的平均分更低,还可以继续追问:它在哪些地区表现最弱?是否依赖某类手机?对不同年龄或职业群体是否稳定?面对多种合理拼写时,所谓的错误究竟是识别错误,还是书写选择差异?
这些问题尤其重要,因为语音识别正被用于客服、教育、医疗、数字服务和个人助理等场景。在这些应用中,平均分很难单独代表用户体验;如果排行榜没有记录说话者和环境,开发者也难以判断某项改进究竟帮助了谁。
Monsoon 并没有声称解决语言和地区偏差问题。它提供的是一套更容易复现和拆解的测量方式:公开分片让社区可以自行检查,私有分片减少对测试集的适配,而与说话者相关的元数据则让总体 WER 背后的差异有机会被看见。
对于开放模型生态而言,这也意味着排行榜的作用正在发生变化。它不再只是把模型按一个数字排成队列,而开始成为决定研究资源投向的基础设施:没有被测量的语言、群体和使用条件,往往也更难获得持续优化。此次印度英语和印地语进入开放 ASR 评测,首先改变的或许不是某个模型的名次,而是行业今后会问哪些问题。
来源:
- Hugging Face:The Open ASR Leaderboard Adds Its First Global South Language
- Monsoon en-IN 数据集
- Monsoon hi-IN 数据集
- Open ASR Leaderboard
- Voice Arena STT 方法说明
- Open ASR Leaderboard 研究论文
- Quantifying Bias in Automatic Speech Recognition
- Towards Orthographically-Informed Evaluation of Speech Recognition Systems for Indian Languages
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

