谷歌将多语言 AI 从单纯翻译推进到理解真实表达与文化语境,提出面向1000种语言的路线并加强与本地社区合作,推进离线模型、手语支持与功能手机应用以缩小数字鸿沟。文章指出技术覆盖并不等于文化准确性,真正挑战在于数据代表性、隐私治理与社区参与。
谷歌正在把“多语言 AI”的目标,从支持更多翻译语言推进到理解人们在真实生活中的表达方式。9月15日,谷歌研究与技术及社会事务高级副总裁 James Manyika 在官方博客发表文章称,谷歌的技术和产品目前已覆盖300多种语言,服务超过70亿人,按谷歌的估算相当于全球人口的86%。但公司也承认,数千种语言和方言仍然在数字世界中缺乏代表性。
这篇文章并不是一次单独的模型发布,而是谷歌对其语言技术路线的一次集中说明:重点不再只是把一种语言转换成另一种语言,而是让 AI 理解语气、节奏、情绪、文化背景,以及不同社区实际使用语言的方式。
本文主要依据谷歌2026年9月15日发布的官方文章及相关研究、产品页面。文中关于覆盖范围、模型表现和用户规模的数据,除特别说明外均为谷歌公布或引用的数据。
从“把语音变成文字”转向直接理解声音
谷歌称,传统语音识别通常经过“语音转文字—处理文字—文字转语音”的多步流程。这种方式便于工程实现,却可能丢失说话中的语调、停顿、情绪和上下文。现实对话也并不总是由完整、规范的句子组成:人们会笑、犹豫、打断彼此,也会在一句话中混用多种语言,例如 Spanglish 或 Hinglish。
谷歌希望通过“原生音频智能”减少这种损失。按照公司的说法,Gemini 3.5 Live Translate 已支持70种语言和超过2000种语言对,能够处理对话中的语言切换,并尽量保留情绪线索。Gemini 3.5 Transcribe 则面向语音转写,目标是识别自我纠正、填充词、专业术语和多人对话,并输出格式化文本。
这一方向也延续了谷歌近期对语音产品的推进。AI Flux此前报道过Google Translate在iOS与Android推出实时翻译升级,以及Gemini 3.5 Transcribe从“听见”走向“理解”。这些产品更新显示,谷歌正试图把语音能力从一个独立的识别环节,变成翻译、输入、对话和任务执行的共同基础。
“1000种语言计划”仍依赖低资源语言数据
谷歌此次再次提到“1000种语言计划”。这一计划的核心难点并不只是模型规模,而是许多语言缺少足够的数字文本、标注语音和高质量测试集。
谷歌2023年发布的Universal Speech Model研究文章显示,USM使用了1200万小时语音和280亿句文本进行训练,预训练覆盖300多种语言。谷歌当时将其描述为迈向1000种语言目标的重要一步,并强调通过跨语言迁移,让数据丰富语言中学到的模式帮助数据稀缺语言。
谷歌此次文章称,相关计划的目标是支持全球最常用的1000种语言。但这并不等于所有语言都已经获得同等质量的支持。谷歌自己的语言包容性项目页面也指出,全球约有7000种语言,而只有少数语言在互联网上得到充分表达;不同产品的语言覆盖范围也并不相同。
因此,“支持一种语言”需要谨慎理解。它可能意味着能够识别部分语音、提供基础翻译、在特定产品中输入文字,或仅仅完成研究评测,并不自动意味着用户能在所有产品中获得自然、准确且完整的体验。
数据收集开始更多依赖本地社区
谷歌表示,面向低资源语言的工作不能只依赖通用网络数据。由于网络内容高度集中于少数主流语言,公司正在与当地大学、研究机构和社区合作收集语音及多模态数据。
谷歌介绍的三个项目体现了这一思路。WAXAL面向撒哈拉以南非洲,覆盖27种语言,涉及超过26个国家和超过1亿名使用者;印度的 Project Vaani 已收集来自109种语言、超过15.5万名说话者的3万多小时语音;Amplify Initiative 则与四大洲20所大学和1600多名本地专家合作,收集1.5万条体现地方语境的多模态数据。
其中,Project Vaani由印度科学研究院及相关机构推动,项目官方网站强调,语言数据收集需要覆盖城乡、年龄、性别、教育背景和不同地区,而不是只记录标准化的城市口音。这样的设计直接关系到模型能否理解同一种语言内部的差异。
谷歌还推出了 Language Explorer,用于可视化 LinguaMeta 开放语言数据仓库。公司称,该项目持续绘制超过7000种口语、书面语和手语的分布图。不过,数据“被收集”并不等于社区已经获得相应的控制权或收益;数据使用授权、代表性、隐私保护和成果回馈,仍然是多语言 AI 必须面对的问题。
离线模型和功能手机瞄准数字鸿沟
谷歌将语言包容性与网络和设备条件联系起来。公司估计,全球仍有超过30亿人无法稳定接入互联网。为此,谷歌介绍了 TranslateGemma,一组基于 Gemma 3 构建的开放翻译模型,支持55种语言,并提供4B、12B和27B三种规模。
按照谷歌公布的信息,4B版本面向移动和边缘设备,12B版本可在消费级笔记本上运行,27B版本则面向云端部署。公司强调,模型经过蒸馏和专门训练后,在部分评测中以更少参数达到更大模型的表现。但这类结果依赖特定数据集和测试条件,不能直接等同于所有语言、设备和现实场景中的体验。
对仍在使用功能手机的人群,谷歌提到与 Viamo 合作的 AVA 语音助手。该服务在卢旺达进行试点,谷歌称已经通过 Gemini 回答超过200万个问题。它的意义不在于把最新硬件带给所有人,而是尝试在不依赖智能手机的情况下,通过交互式语音应答系统提供信息服务。
手语支持显示“多语言”不只是口语问题
谷歌此次还把语言范围扩展到手语。Google DeepMind介绍的Sign-Language-to-Text模型在超过50种手语、逾10万小时数据上训练,首先支持美国手语到英语的转换,并通过 Gboard 和 Live Transcribe 在 Pixel 11 上提供功能。
手语并不是把英语单词用手势表达出来,而是拥有自身语法和词汇的自然语言。模型需要同时理解手、臂、躯干、头部和面部动作。谷歌称,SL2T会先使用设备端模型提取人体姿态坐标,再把几何信息发送到服务器进行翻译,而不是直接上传原始视频;这是一种试图降低隐私风险的设计。
不过,首批产品仍然只支持美国手语到英语,更多设备和语言尚待推出。谷歌也没有宣称已经解决全球200多种手语的数字化问题。对聋人社区而言,模型是否准确、是否能适应不同熟练程度和地区变体,以及社区是否真正参与产品治理,可能比“支持50多种手语”的训练规模更重要。
技术覆盖率之外,真正的考验是文化准确性
谷歌举出的另一个例子来自新西兰:公司与毛利语专家合作,改进 Google Maps 对当地地名的发音。这个案例说明,语言技术的错误不一定表现为翻译句子出错,也可能是把一个地名读错,进而忽略其历史和文化含义。
谷歌在文章中说,目前语言技术已经嵌入 Search、Android、Chrome、YouTube 和 Google Play 等九个平台,覆盖超过50亿人。但覆盖规模并不能代表每一种语言都被同样深入地理解。对于低资源语言,模型可用性仍会受到训练数据、设备性能、网络连接、地区开放范围和评测方法的限制。
AI 正在帮助更多语言进入数字产品,但“让每个人都能使用 AI”与“让每个社区都能按照自己的方式被理解”并不是同一个目标。谷歌这次公布的计划,显示行业竞争正在从增加语言数量,转向争夺更真实的数据、更细致的评测,以及与本地社区建立长期合作关系。最终能否实现语言包容性,仍取决于这些承诺能否转化为稳定、可访问、尊重文化并且由使用者真正受益的产品。
来源: