IBM发布 Granite Speech 5.0 TurboCTC:470M 参数模型冲击超高速语音转录
IBM 在 Hugging Face 发布 Granite Speech 5.0 TurboCTC 与其 NC 版本,两款仅约 4.7 亿参数的英语 ASR 模型主打超高吞吐量和边缘部署能力,官方称在 NVIDIA H200 上可达 12,600 RTFx。模型采用纯编码器+CTC 路线,适合大批量转录流水线场景,但在准确率、远场鲁棒性和多语言支持方面仍需更多评测验证。
IBM 在 Hugging Face 发布 Granite Speech 5.0 TurboCTC 与其 NC 版本,两款仅约 4.7 亿参数的英语 ASR 模型主打超高吞吐量和边缘部署能力,官方称在 NVIDIA H200 上可达 12,600 RTFx。模型采用纯编码器+CTC 路线,适合大批量转录流水线场景,但在准确率、远场鲁棒性和多语言支持方面仍需更多评测验证。
IBM Granite 团队在 Hugging Face 发布两款新的英语自动语音识别(ASR)模型 Granite Speech 5.0 TurboCTC 和 Granite Speech 5.0 TurboCTC NC。两款模型都只有约 4.7 亿参数,却将重点放在批量转录吞吐量和边缘部署上:团队公布的测试结果显示,它们在 NVIDIA H200 上的处理速度超过 12,600 RTFx,理论上可以在约一秒内处理超过三个半小时的语音。
这次发布的核心并不是让语音模型承担更多“理解”任务,而是把转录本身做得更快、更轻、更容易规模化。Hugging Face 的原始发布文章称,两款模型均于 2026 年 8 月 25 日公开,适合会议、客服录音、视频字幕和其他大量语音转文字场景。
两款模型的差别首先体现在许可证
标准版 ibm-granite/granite-speech-5.0-470m-turboctc 使用相对较小的训练数据集,采用 Apache 2.0 许可证。按照模型卡说明,它面向企业级、低延迟和高吞吐量的英语语音转录,可用于研究、产品开发及商业部署。
NC 版,即 granite-speech-5.0-470m-turboctc-nc,在标准版基础上加入了 GigaSpeech 和 SPGI Speech 等额外数据,训练数据规模更大,但采用 CC-BY-NC-SA-4.0 许可证,只适合非商业用途。IBM 和 Hugging Face 都提醒使用者,NC 版本的额外数据和许可证限制意味着它不能简单地视为标准版的商业替代品。
两款模型都只支持英语。标准版模型卡称其使用约 60,000 小时英语音频训练;NC 版本则使用约 75,000 小时英语音频。两者都加入了合成数据,包括多说话人片段,以及包含数字、货币、网站、电话号码、地址和小数点等内容的语音样本。这些数据设计直接对应客服、财报、企业会议和信息录入中容易出错的表达。
速度来自 CTC 和编码器路线
Granite Speech 5.0 TurboCTC 采用由 16 个 Conformer 模块组成的纯编码器架构,以 Connectionist Temporal Classification(CTC,连接主义时间分类)为主要训练目标。它没有上一代 Granite Speech 中的语言模型主干、语音投影器和 LoRA 适配器,也不需要自回归地逐个生成文本 token。
这是一项有意的功能取舍。模型通过较低的输出 token 速率和贪心解码,直接把连续语音映射为文字;相较之下,带有语言模型的系统通常能更好地处理语音翻译、关键词偏置和更复杂的语音任务,但推理链路也更长、资源开销更高。
根据两款模型的 Hugging Face 模型卡,模型输入经过三阶段的 2 倍时间下采样,将声学特征从每秒 100 帧降至每秒 12.5 个 token。编码器使用分块注意力,避免长音频序列采用标准点积注意力时产生的平方级计算增长;第八个 Conformer 模块的中间结果还会用于自条件训练。
这种架构解释了速度和内存占用之间的关系。模型卡把模型规模列为约 0.5B 参数,而 Hugging Face 的发布文章称,其吞吐量比此前 Granite Speech 模型快 20 倍以上。不过,这种比较主要针对不同架构和任务配置下的推理性能,并不意味着所有设备、所有批大小或所有音频条件都能达到同样的倍数。
12,600 RTFx 是什么概念
RTFx 是语音识别基准中常用的吞吐量指标,数值越高,表示系统每秒能够处理的音频时长越多。12,600 RTFx 意味着,在特定硬件、批量推理和评测配置下,系统处理音频的速度约为实时速度的 12,600 倍。
IBM 和 Hugging Face 给出的数字是在 NVIDIA H200 上测得的批处理结果,因此它更能说明模型适合高并发离线转录,而不是直接等同于单条语音在普通笔记本上的端到端延迟。实际应用还会受到音频读取、特征提取、批大小、显存、I/O 以及后处理等因素影响。
在公开短音频测试集上,发布文章给出的非商业版平均词错误率(WER)为 4.85%,Apache 2.0 标准版为 5.00%。两者的结果来自 Open ASR Leaderboard 公共测试集;文章特别说明,这组数字是团队公布的非正式结果,但使用了 Hugging Face Jobs 和排行榜的评测工具,预计与正式评测结果一致。
截至 8 月 25 日,两款模型也被放入 FFASR(远场自动语音识别)排行榜。根据发布方的说法,标准版在远场准确率上排名第九,NC 版排名第五,同时两款模型都是该榜单中速度最快的模型。这个结果值得关注,因为在真实会议室、客厅、车内或机器人场景中,麦克风距离、混响和背景噪声往往比短音频基准更能决定系统是否可用。AIFlux 此前介绍过的FFASR 远场 ASR 排行榜正是试图把这种部署差异纳入公开比较。
它更适合转录流水线,而不是通用语音助手
Granite Speech 5.0 的定位边界相当清楚:它是一个英语语音转文字编码器,而不是能够直接完成多轮对话、翻译或复杂语音推理的通用语音语言模型。没有语言模型主干,意味着它牺牲了部分上下文修正和生成能力;换来的则是更小的内存占用、更简单的部署方式,以及适合大批量音频的吞吐量。
对于企业来说,这种分工可能比“一个模型包办所有事情”更容易落地。一个典型架构可以先用 TurboCTC 负责稳定、快速地把音频转成文字,再把文本交给其他语言模型完成摘要、分类、质检或信息抽取。这样做也让转录和后续理解模块可以独立替换,便于控制成本和权限。
这类模块化思路已经出现在实时语音系统中。AIFlux 对Gemma 4 实时语音 AI 架构的报道显示,语音采集、ASR、语言模型推理和语音合成可以由不同模型和硬件模块组成。Granite Speech 5.0 则把其中的 ASR 环节进一步推向低资源和高吞吐量方向。
对于开发者,模型目前可通过 Transformers 使用。模型卡说明,在下一版 Transformers 发布前,需要从源代码安装相关版本;推理接口使用 AutoModelForCTC 和 AutoProcessor,并支持批量音频输入。IBM 还表示,两个模型均使用其 Blue Vela 超级计算集群训练,单个模型的训练过程使用 8 张 H100 GPU、耗时约 10 天。
高速度仍需放在可比评测中理解
Granite Speech 5.0 的发布也反映出语音识别模型评测中的长期张力:准确率、速度、语言覆盖和真实环境鲁棒性很难同时达到最优。Hugging Face 的Open ASR Leaderboard同时报告 WER 和 RTFx,并逐步加入多语言、长音频和私有数据集,以避免单一短音频英语基准过度影响结论。
Hugging Face 的榜单说明,带有语言模型解码器的 Conformer 系统通常在英语准确率上更有优势,而 CTC 和 TDT 等解码路线则更擅长提供高吞吐量。Granite Speech 5.0 选择的是后者:它不是要在所有语音任务中取代更大的模型,而是针对“把大量英语音频尽快变成可处理文本”这一环节进行优化。
评测透明度本身也成为模型发布的一部分。AIFlux 此前报道过 Hugging Face 将结构化评测记录与模型页面和榜单连接起来的尝试,即在模型页展示统一评测结果。对 TurboCTC 这样的速度导向模型而言,硬件、批大小、音频类型和评分数据集是否一致,往往与一个醒目的峰值数字同样重要。
目前仍有几项问题需要进一步观察。第一,两款模型只支持英语,能否扩展到多语言场景尚未有公开时间表。第二,12,600 RTFx 是 H200 批处理测试结果,普通边缘设备上的真实吞吐量和功耗仍需独立验证。第三,NC 版本在远场榜单上的优势是否能在更多未见过的会议、电话和多说话人数据中保持,也不能仅凭公开短音频结果判断。
从现阶段的定位看,Granite Speech 5.0 TurboCTC 更像是语音基础设施中的一个高效组件,而不是又一个试图覆盖全部能力的“大模型”。如果后续测试能够证明它在真实远场和长音频条件下仍能维持接近的速度—准确率平衡,那么这类 470M 参数的专用编码器,可能会在客服分析、会议归档、视频字幕和端侧语音应用中获得比更大模型更直接的部署价值。
来源:
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

