我们的B轮融资与语音的未来

语音技术已从被怀疑的玩具变为被依赖的生产力工具,Flow以2.8亿美元B轮融资和自研模型Canto,将准确性作为核心赌注,推动语音输入走向无缝人机交互。

TANAY KOTHARI(@TANKOTS)随笔 · 已翻译 · 约 5 分钟
阅览室 · 投融资#语音#模型#零编辑率原文

去年五月我们宣布A轮融资时,我关于语音的对话大多以对方解释为何怀疑开场。那种怀疑很自然。人们尝试语音工具已有15年,每次结果都如出一辙,因此合理的假设是这次也会让他们失望。

如今我不再听到这样的对话了。人们转而告诉我,用说的代替打字省下了多少时间,以及他们希望Flow接下来做什么。一年多的时间里,语音从人们观望的对象变成了他们依赖的工具,变化之快出乎我们所有人的意料。

正是这种转变促使我们完成了新一轮融资,更重要的是,它将塑造接下来的一切。今天,我们宣布获得2.8亿美元B轮融资,估值达20亿美元,由我们的长期投资伙伴Menlo Ventures领投。

更高的赌注,更高的标准

过去十年的大部分时间里,对着电脑说话意味着问天气或设定时器。我们的首席科学家Ariya Rastrow——Alexa背后团队的创始成员之一——曾撰文谈到这份清单在十年间变化甚微。门槛很低,但赌注也低,因为没有人用语音做对自己重要的事。如果它听错了,你再说一遍就继续了。

人们现在做的事情不同了。当语音成为你撰写重要信息和关键工作文档的方式时,一个错词就会让你付出实实在在的代价。你停下来,伸手去够键盘,修正它,等你抬起头时,刚才正在思考的东西已经消失了。这打断了你的心流,也损害了你对产品的信任。用说的而不是用打的全部意义在于保持在自己的思路里,而一个每隔几句话就把你拉出来的工具,并没有为你节省任何东西。

“之所以选择说话而非打字,是为了保持思维的连贯性。”

因此,准确性对我们而言并非众多功能之一。它决定了这一切能否成为人们生活与工作的方式,也是本轮工作中首要且最大的一部分投入所在。

新模型 Canto,为真实环境而生

伴随此次融资,我们推出了首款专有语音模型 Canto的预览版。大多数语音模型都是在安静房间、优质麦克风、且模型已多次听过类似口音的条件下进行训练和评估的。但几乎没有人生活在这样的环境中。你可能在车里、街上,或在开放式办公室里,离别人的谈话仅一英尺之遥。

我们打造这款模型,正是为了适应人们实际使用Flow的场景。在最艰难的条件下——背景噪音、风声、浓重口音或音乐声中,词错误率从超过30%降至5%到10%之间。在日常使用中,我们预计它能将需要编辑的听写次数减少30%至35%。

在最嘈杂的环境中,Flow的新模型将词错误率降低了4倍以上——从30%以上降至5-10%。📷

它也更擅长处理人们真实的说话方式。全球约有一半人口在日常中会切换语言,有时甚至在一句话内混用,而一次只训练一种语言的模型对此处理不佳。印地英语(Hinglish)就是一个体现细节的好例子。印地语使用者通常用天城文书写,但当他们说印地英语时,期望得到的是罗马字母的转写,因此即使每个词都听对了,也不足以提供可直接发送的内容。同样,针对个人生活中特有的词汇也是如此,这正是模型会参考你的词典及周围人姓名的原因。

多曼塔斯·萨博尼斯,三次入选NBA全明星的球员,这样说道:“我每天都在使用Flow。我从小就在英语、西班牙语和立陶宛语之间切换,无论我说哪种语言,它都能跟上我。因此,投资并支持一个我每天都在用且深信不疑的产品,对我来说是个毫不犹豫的决定。”

我们真正追求的数字

在内部,我们以所谓的“零编辑率”来衡量自己,即你所说的每一句话中,第一次就能正确返回且完全不需要你干预的比例。不是接近可发送,也不是快速修正,而是真正原封不动。这是一种刻意严苛的评分方式,也是我们未来几年工作所对标的标准。

本轮融资的大部分将投入于此,用于缩小这一差距的研究,以及让这项技术普及到人们日常交流和输入的地方。这个模型正是这一努力的起点。这也是我们成立Wispr高级交互实验室的原因,由Ariya加入并领导:同样的信念,延伸得更远,朝着能理解你意图、把握你正在做的事情的上下文,并将其转化为成果而非文本块的系统迈进。Flow是你对电脑说的话。Notetaker,我们上周推出的会议记录工具,是你对其他人说的话。随着底层模型的进步,两者都会变得更好。我们正在构建一个智能层,朝着无缝人机交互的愿景迈进,从语音开始,最终扩展到其他模态。

“能理解你意图、把握你正在做的事情的上下文,并将其转化为成果而非文本块的系统。”

六十亿字之程

人们如今已用Flow书写了超过六百亿字。每一个字,都是某人在某个瞬间决定,说话比打字更便捷。Flow现在也被几乎所有财富500强企业及超过一万家企业所采用。

这正是我们肩负的全部责任——确保你所说的下一个字,能如你所愿地传达回来。这笔资金旨在缩短这两者之间的距离,而未来数年,我们将以缩小这一距离的程度来评判自己。

感谢你一路陪伴至此。你是我们不断抬高标杆的动力,而我们不打算停止提升它。

已读完 · 本文由熊猫易读翻译重排
知识卡片
一句话总结1 张
一句话总结

语音技术已从被怀疑的玩具变为被依赖的生产力工具,Flow以2.8亿美元B轮融资和自研模型Canto,将准确性作为核心赌注,推动语音输入走向无缝人机交互。

核心观点3 张
核心观点
01

语音的赌注已变高

  • 过去语音只做简单任务,门槛低、赌注低,听错再说一遍即可。
  • 现在语音用于重要工作,一个错词就打断心流、损害信任。
  • 准确性因此不是功能之一,而是决定成败的核心。
核心观点
02

模型须为真实环境而生

  • 多数模型在安静房间训练,但人实际在车里、街头、开放式办公室
  • Canto针对真实场景优化,最嘈杂环境下词错误率从30%+降至5-10%
  • 日常使用中,需编辑的听写减少30-35%
核心观点
03

零编辑率是终极标尺

  • 内部以零编辑率衡量:每句话第一次就正确、无需任何干预。
  • 融资大部分投入缩小零编辑率差距的研究
  • 成立Wispr高级接口实验室,由Ariya领导,迈向理解意图的智能层。
关键概念2 张
关键概念
零编辑率Zero-edit rate
详情
语音转写中,首次输出即完全正确、无需用户任何修改的比例。就像像打字时每个键都一次敲对,从不需要按退格键。
收起
关键概念
印地英语(Hinglish)Hinglish
详情
印地语与英语的混合语,日常中常在一句话内切换,需罗马字母转写。就像像中文里夹英文单词,但还要把拼音转成英文拼写。
收起
对比1 张
语音的过去与现在
过去十年
· 问天气、设定时器· 门槛低、赌注低· 听错再说一遍即可
现在
· 撰写重要信息与关键文档· 一个错词代价高· 打断心流、损害信任
任务重要性
错误代价
过去十年现在
关键数据3 张
最嘈杂环境下的词错误率
30%+ → 5–10%

在最嘈杂环境(背景噪音、风声、浓重口音、音乐)下,Flow新模型Canto的词错误率从超过30%降至5%–10%之间。

错误率降低4倍以上,相当于每100个词中听错的词从30个减至5–10个

来源:Wispr Flow官方公告

Flow累计书写字数
600亿字

人们已用Flow书写超过600亿字,且Flow被几乎所有财富500强企业及超过1万家企业采用。

相当于约7500万本《论语》的字量

来源:Wispr Flow官方公告

B轮融资金额
$2.8亿

Wispr Flow宣布获得2.8亿美元B轮融资,估值达20亿美元,由长期投资伙伴Menlo Ventures领投。

估值20亿美元,约为A轮后估值的数倍

来源:Wispr Flow官方公告

金句摘录2 张
金句
之所以选择说话而非打字,是为了保持思维的连贯性。

—— Wispr Flow团队

点明语音输入的核心价值在于不打断心流

金句
我从小就在英语、西班牙语和立陶宛语之间切换,无论我说哪种语言,它都能跟上我。

—— 多曼塔斯·萨博尼斯

以NBA球星实例证明多语言混合场景下的可靠性

各方实体2 张
Wispr Flow
Wispr Flow
语音输入产品,让用户用说话代替打字
产品 Flow语音输入、Notetaker会议记录融资 B轮2.8亿美元,估值20亿美元规模 超1万家企业、几乎所有财富500强
Canto
Canto
Wispr Flow首款专有语音模型,为真实嘈杂环境优化
性能 嘈杂环境词错误率30%+→5-10%能力 多语言混合、个人词典、联系人姓名识别
全文脉络1 张
全文脉络
Flow以准确性为核心,推动语音从低门槛工具进化为高赌注生产力平台
已生成 15 张 · 每篇精选,少而精