应用与产品

Wispr Flow完成2.8亿美元B轮融资,推出Canto语音模型

美国语音输入公司Wispr Flow完成2.8亿美元B轮融资,估值达20亿美元,并发布面向真实噪声环境的自研语音模型Canto。公司将把资金用于提升识别准确率、产品研发与部署,目标从单纯听写扩展到更广泛的语音驱动交互和自动化工作流。

Wispr Flow完成2.8亿美元B轮融资,推出Canto语音模型

美国语音输入公司Wispr Flow完成2.8亿美元B轮融资,估值达20亿美元,并发布面向真实噪声环境的自研语音模型Canto。公司将把资金用于提升识别准确率、产品研发与部署,目标从单纯听写扩展到更广泛的语音驱动交互和自动化工作流。

美国语音输入初创公司Wispr Flow于2026年8月17日宣布完成2.8亿美元B轮融资,投后估值达到20亿美元。本轮融资由Menlo Ventures领投,既有投资者和新投资者共同参与,使公司累计融资额达到3.61亿美元。

在融资消息之外,Wispr还预览了首个自研语音识别模型Canto。公司称,该模型面向汽车、街道、开放式办公室等真实使用环境,重点处理背景噪声、风声、口音和音乐等因素。按照Wispr的披露,在其所称的“最困难条件”下,Canto可以把错误率从超过30%降至5%至10%。这一数字目前属于公司自述的测试结果,尚未有独立基准对其普遍适用性进行复测。

从语音输入切入更大的交互市场

Wispr表示,新资金将主要用于提高语音识别准确率、推进产品研发和扩大部署规模。公司内部关注的一项指标是“零编辑率”,即用户说出的内容有多大比例可以在首次转写后直接使用,而无需修改。

这反映出语音输入产品面临的一个核心难题:用户对语音错误的容忍度,往往低于对普通语音助手的容忍度。天气查询或设置闹钟出错时,用户可以重新说一遍;但如果语音工具用于写工作邮件、代码或重要文件,一个错误的词可能打断原本的思路,迫使用户重新回到键盘。

Wispr首席执行官Tanay Kothari在公司的融资公告中说,用户改用语音输入的目的,是保持思路的连续性;如果产品每隔几句话就要求用户停下来修正,语音节省时间的价值就会被削弱。

公司称,用户目前已经通过Flow生成超过600亿个单词,产品覆盖几乎所有《财富》500强企业,并被超过1万家企业使用。路透社在相关报道中也引用了这些数据。不过,这些使用量和企业覆盖数据主要来自Wispr自身披露,并不是经过公开审计的经营指标。

Canto押注真实环境,而非安静录音室

传统语音识别系统通常在相对干净的录音条件下训练和评估,但现实中的语音输入往往伴随着复杂干扰。用户可能在汽车里说话,也可能在街上、公共交通工具上或开放式办公室中使用语音工具;说话者的口音、语速、混合语言和周围人的声音,也会影响转写结果。

Wispr称,Canto针对这些环境进行了优化,并能够处理一定程度的多语言混用。公司还表示,模型将结合用户个人词典、联系人姓名和历史纠正信息,以提高对专有名词、个人表达方式和代码词汇的识别能力。

这类能力的价值并不只在于降低字词错误率。Wispr在其关于Flow技术挑战的文章中,把低延迟、个性化、上下文理解、用户纠正学习和不确定性提示列为长期工程问题。公司希望语音模型不仅能把声音转成文字,还能根据用户正在使用的应用、此前的表达习惯和当前任务,生成更接近可直接使用的文本。

语音AI的评估也正逐渐从单一的识别分数,扩展到噪声、口音、对话稳定性和真实场景泛化能力。AIFlux此前在语音AI评测从“会说”转向“会听”的报道中提到,语音系统在自然性、可靠性和理解力等维度上可能表现出明显差异,自动化榜单并不能完全替代真实用户和人工评审。

因此,Canto披露的5%至10%错误率需要结合测试集、噪声类型、语言范围、统计口径和对照模型来理解。Wispr目前没有在公告中公开完整的评测方法、数据集或第三方测试结果,外界仍难以据此判断模型在不同地区和不同用户群体中的表现。

Wispr不再把自己定位为单纯的听写工具

融资公告显示,Wispr正在把产品方向从“语音转文字”扩展到更广泛的人机交互。公司近期推出了会议记录工具Notetaker,用于生成会议摘要和行动事项;TechCrunch在报道中称,Wispr还希望进一步把这些结果连接到其他工具中,例如更新文件或生成邮件草稿。

Wispr的长期规划可以概括为三个阶段:可靠的语音输入、从语音到行动,以及通过可穿戴设备扩大使用范围。公司在“语音界面发展规划”中表示,语音输入是建立用户信任的第一步,只有当用户相信系统能准确理解自己,才会愿意让它处理更复杂的任务。

这一路线也解释了为什么准确率会成为本轮融资的主要投入方向。对Wispr来说,语音输入是进入用户日常工作流程的入口;会议记录、上下文理解和后续行动则是提高产品使用频率和商业价值的下一步。公司还在推进高级接口实验室,由曾参与亚马逊Alexa早期工作的Ariya Rastrow负责,探索语音之外的新型人机交互方式。

高估值背后的竞争与验证压力

Wispr进入下一阶段时,面对的并不是一个没有竞争者的市场。除了苹果、谷歌、微软、OpenAI和Anthropic等大型科技公司在持续推进语音功能,市场上也出现了Willow、Monologue、Aqua和Superwhisper等面向个人用户的产品。会议记录领域则已有Granola、Fireflies和Read AI等竞争者。

更大的挑战在于,语音输入产品需要同时解决模型质量、延迟、隐私和分发问题。Wispr官网目前将Flow定位为可在桌面和移动设备上使用的语音转文字工具,并强调支持100多种语言、个人词典和跨应用工作流。面向企业的产品页面则列出SOC 2 Type II、HIPAA和ISO 27001等合规能力,但不同合规功能适用的套餐和部署条件并不完全相同。

对于估值达到20亿美元的Wispr而言,投资者押注的不只是一个更快的听写应用,而是一层能够连接用户意图、文本编辑、会议记录和后续操作的交互基础设施。公司需要证明,语音输入带来的高频使用能够转化为稳定的订阅收入,也需要证明Canto在公司自测环境之外仍然具备足够的可靠性。

接下来值得观察的,是Canto何时全面投入使用、第三方测试是否能够验证其在噪声和口音环境中的表现,以及Notetaker能否从摘要工具进一步发展为能够执行后续工作的交互层。对于语音AI行业来说,真正的竞争标准可能不再是模型在安静环境里能否准确听写,而是它能否在用户不愿停下来检查的时刻,持续理解并完成任务。

来源:

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读