我们的B轮融资与语音的未来
语音技术已从被怀疑的玩具变为被依赖的生产力工具,Flow以2.8亿美元B轮融资和自研模型Canto,将准确性作为核心赌注,推动语音输入走向无缝人机交互。

去年五月我们宣布A轮融资时,我关于语音的对话大多以对方解释为何怀疑开场。那种怀疑很自然。人们尝试语音工具已有15年,每次结果都如出一辙,因此合理的假设是这次也会让他们失望。
如今我不再听到这样的对话了。人们转而告诉我,用说的代替打字省下了多少时间,以及他们希望Flow接下来做什么。一年多的时间里,语音从人们观望的对象变成了他们依赖的工具,变化之快出乎我们所有人的意料。
正是这种转变促使我们完成了新一轮融资,更重要的是,它将塑造接下来的一切。今天,我们宣布获得2.8亿美元B轮融资,估值达20亿美元,由我们的长期投资伙伴Menlo Ventures领投。
更高的赌注,更高的标准
过去十年的大部分时间里,对着电脑说话意味着问天气或设定时器。我们的首席科学家Ariya Rastrow——Alexa背后团队的创始成员之一——曾撰文谈到这份清单在十年间变化甚微。门槛很低,但赌注也低,因为没有人用语音做对自己重要的事。如果它听错了,你再说一遍就继续了。
人们现在做的事情不同了。当语音成为你撰写重要信息和关键工作文档的方式时,一个错词就会让你付出实实在在的代价。你停下来,伸手去够键盘,修正它,等你抬起头时,刚才正在思考的东西已经消失了。这打断了你的心流,也损害了你对产品的信任。用说的而不是用打的全部意义在于保持在自己的思路里,而一个每隔几句话就把你拉出来的工具,并没有为你节省任何东西。
“之所以选择说话而非打字,是为了保持思维的连贯性。”
因此,准确性对我们而言并非众多功能之一。它决定了这一切能否成为人们生活与工作的方式,也是本轮工作中首要且最大的一部分投入所在。
新模型 Canto,为真实环境而生
伴随此次融资,我们推出了首款专有语音模型 Canto的预览版。大多数语音模型都是在安静房间、优质麦克风、且模型已多次听过类似口音的条件下进行训练和评估的。但几乎没有人生活在这样的环境中。你可能在车里、街上,或在开放式办公室里,离别人的谈话仅一英尺之遥。
我们打造这款模型,正是为了适应人们实际使用Flow的场景。在最艰难的条件下——背景噪音、风声、浓重口音或音乐声中,词错误率从超过30%降至5%到10%之间。在日常使用中,我们预计它能将需要编辑的听写次数减少30%至35%。
在最嘈杂的环境中,Flow的新模型将词错误率降低了4倍以上——从30%以上降至5-10%。📷
它也更擅长处理人们真实的说话方式。全球约有一半人口在日常中会切换语言,有时甚至在一句话内混用,而一次只训练一种语言的模型对此处理不佳。印地英语(Hinglish)就是一个体现细节的好例子。印地语使用者通常用天城文书写,但当他们说印地英语时,期望得到的是罗马字母的转写,因此即使每个词都听对了,也不足以提供可直接发送的内容。同样,针对个人生活中特有的词汇也是如此,这正是模型会参考你的词典及周围人姓名的原因。
多曼塔斯·萨博尼斯,三次入选NBA全明星的球员,这样说道:“我每天都在使用Flow。我从小就在英语、西班牙语和立陶宛语之间切换,无论我说哪种语言,它都能跟上我。因此,投资并支持一个我每天都在用且深信不疑的产品,对我来说是个毫不犹豫的决定。”
我们真正追求的数字
在内部,我们以所谓的“零编辑率”来衡量自己,即你所说的每一句话中,第一次就能正确返回且完全不需要你干预的比例。不是接近可发送,也不是快速修正,而是真正原封不动。这是一种刻意严苛的评分方式,也是我们未来几年工作所对标的标准。
本轮融资的大部分将投入于此,用于缩小这一差距的研究,以及让这项技术普及到人们日常交流和输入的地方。这个模型正是这一努力的起点。这也是我们成立Wispr高级交互实验室的原因,由Ariya加入并领导:同样的信念,延伸得更远,朝着能理解你意图、把握你正在做的事情的上下文,并将其转化为成果而非文本块的系统迈进。Flow是你对电脑说的话。Notetaker,我们上周推出的会议记录工具,是你对其他人说的话。随着底层模型的进步,两者都会变得更好。我们正在构建一个智能层,朝着无缝人机交互的愿景迈进,从语音开始,最终扩展到其他模态。
“能理解你意图、把握你正在做的事情的上下文,并将其转化为成果而非文本块的系统。”
六十亿字之程
人们如今已用Flow书写了超过六百亿字。每一个字,都是某人在某个瞬间决定,说话比打字更便捷。Flow现在也被几乎所有财富500强企业及超过一万家企业所采用。
这正是我们肩负的全部责任——确保你所说的下一个字,能如你所愿地传达回来。这笔资金旨在缩短这两者之间的距离,而未来数年,我们将以缩小这一距离的程度来评判自己。
感谢你一路陪伴至此。你是我们不断抬高标杆的动力,而我们不打算停止提升它。