微软正在测试一种你说话时也会说话的 AI,却什么都没宣布
8月2日,有人发现了微软内部测试场地里一个隐藏的入口,这是一个只供测试使用的界面。里面有一个名为 MAI-Realtime 的模型。据说它会向一小群合作伙伴提供提前访问权限。没有公告,没有技术资料,没有价格页面,甚至连一篇博客文章都没有。只有一个藏在角落里的模型。
而且这不会只是又一个语音模型。这将是微软第一个能够同时听你说话和开口说话的模型。
我们知道什么,以及为什么要谨慎看待
先说最重要的一点:这是泄露,不是发布。这条消息来自TestingCatalog,他们获得了试用版本。微软什么都没有确认,也没有给出日期。这家公司完全可能下周就把这个项目埋掉。
这个版本提供两个声音,Victoria 和 Grant。据说它们比 Copilot 当前的语音模式自然得多。该模型支持十七种语言,其中包括法语。一个调试面板还可以跟踪处理步骤和延迟,也就是响应所需的时间。很快就能看出,这个工具的目标是开发者,不是普通大众。它还有一个相当好笑的限制:它不会唱歌,也不会产生任何语音以外的声音。没有音效,没有哼唱。
对讲机和电话
要理解这会带来什么变化,首先得看看当前语音助手的工作方式。今天的复杂词汇是 full duplex。只要两个东西就能解释清楚它。
用对讲机时,每个人轮流说话。你按下按钮,说话,松开,然后说「到你了」。只要你在说话,就什么也听不见。用电话时,两个人可以同时说话和听对方说话。他们可以打断对方,或者在对方继续说话时发出「嗯」的声音。full duplex 就是电话。half duplex 就是对讲机。
你使用的语音助手就像对讲机。它们的处理方式像一场有三个跑者的接力赛。第一个把你的声音转换成文字。第二个准备回答。第三个把这段文字转换成声音。每个人都要等前一个人完成。
三名跑者传递接力棒。一个人直接奔跑。差别体现在等待时间上。
full duplex 模型取消了这些接力环节。音频一次性输入和输出。最重要的是,模型在说话时会继续听你说话。所以如果你打断它,它就可以停下来,而不是像你现在的助手那样把一句话说完,却只说给空气听。
红线就是我们。语言学家测得,人类说话轮次之间大约有200毫秒的沉默。
数字说明了差别。一条优化良好的普通链路会在800毫秒到2秒之间响应。没有特别优化时,它需要2到4秒。由Kyutai发布的 Moshi 这样的 full duplex 模型,大约是200毫秒。这也正好是我们在人类对话中两次说话轮次之间留下的沉默时间。
这就是为什么和语音助手对话总会显得有点奇怪。问题未必来自声音。问题在于回答之前的空白。在真正的对话中,一秒钟的沉默就已经足以让人感到尴尬。
最难的不是说话,而是知道什么时候闭嘴
取消接力环节会带来另一个问题。机器必须猜出一件我们不用思考就能做到的事:你是说完了一句话,还是只是在找合适的词?
实时对话的全部难点就在这个问题上。人类不用思考就能解决它。机器却会在这里碰得头破血流。
微软的模型似乎提供了两种决定方式。第一种方式是通过分析你话语的含义自行决定。微软设计的一个组件会负责识别句子的结尾。第二种方式把一段静默时间和语义分析结合起来。它更可预测,面向那些希望模型以稳定的方式作出反应,而不是任由它即兴发挥的人。
这个设置说明了产品面向谁。对于一个只想问天气的人,不会有人提供两种轮流说话的管理模式。提供这两种模式的对象,是一家打算把这套系统装进客服部门,并精确调整机器何时该闭嘴的企业。
只不过,OpenAI 一个月前就已经领先了
谈 MAI-Realtime,不可能不看看大家现在已经能用的东西。7月8日,OpenAI 发布了GPT-Live。原理是一样的:一个同时听和说的语音模型。不需要提前访问,也不是什么封闭实验室。它已经在 ChatGPT 里了,到处都是,立刻就能用。
只差一个月,但更重要的是,这是两个完全不同的地方。左边已经派上用场。右边只能偷偷参观。
让微软难受的细节,是可用性。GPT-Live-1 提供给付费订阅者,GPT-Live-1 mini 提供给免费账户。换句话说,即使一分钱都不付,今晚你也能在手机上测试全双工。全双工,简单说就是同时听和说的能力。只要按下 ChatGPT 的语音按钮就行。
那段传遍全网的视频,以及它真正讲了什么
OpenAI 发布了一段值得一看的演示,“This is the new ChatGPT Voice”。视频里,三个上了年纪的女人和助手聊天。她们互相打断,犹豫一下,然后继续说。而且真的能用。这玩意儿会在她们说话时发出“mmh”和“ouais”。她们思考时它会安静下来,她们说完后又重新接上。结果自然得让人不安。
选择这三位女士,显然不是没有深意的。演示表明,不用键盘打字的人也能使用语音。很难为这项技术找到更好的论据了。The Register 不过以它一贯的那种体贴方式,指出了另一个细节。这个年龄段也正是这类工具助长的电话诈骗所瞄准的人群。两种观察可以同时成立。问题就在这里。
那么,微软做得更好吗?
简短回答:不。在唯一对你重要的标准上,微软甚至远远落后。GPT-Live 在数亿人的口袋里运行。MAI-Realtime 仍然藏在一个内部工具里,没有日期,没有价格,也没有确认。
就能力而言,这两个模型非常相似。不过微软还是有两三个论点可以拿出来说。
- OpenAI 多出来的东西:显然是可用性,但还有一个设计得很聪明的小窍门。当你的问题需要真正的搜索时,GPT-Live 会在后台把它交给更强大的模型 GPT-5.5。与此同时,它会继续和你闲聊。这就避免了你一问复杂问题,它马上沉默十秒。
- 微软多出来的东西:已经宣布支持十七种语言,两种管理轮流说话的方法,也就是决定谁在什么时候说话,还有一个实时显示响应时间的面板。这些东西对一个只想和手机聊天的人来说,都没什么吸引力。相反,一家想把模型接入电话总机的企业,马上就能看出它的价值。
- 真正的突破口:GPT-Live 还没有为开发者提供接口,也就是说,还没有官方方式把它集成进他们自己的应用。这套接口已经承诺会提供,但现在还不存在。因此,微软仍然可以从专业用户这扇门进入,而不是从大众用户那扇门。凭借它的各种设置和调试面板,也就是用来找出技术问题的面板,它的模型简直像是专门为这个目的设计的产品。
我的感觉,我就按它值多少说多少:OpenAI 赢得了橱窗,微软在经营后间。这不是最光彩的位置。它往往是最赚钱的位置。
和机器说话的另一种方式,就是让它写下来
微软把自己的模型藏起来,OpenAI 让一群老奶奶聊个不停的时候,另一种语音用途已经在你的机器上运行得非常好了。奇怪的是,几乎没人谈到它。这就是听写。
这不是同一种难题。一个能够同时听和说的全双工模型,必须处理轮流说话的问题。它必须理解你什么时候说完了,并知道什么时候该闭嘴。听写只朝一个方向进行:你说话,然后一段干净的文字出现在光标闪烁的地方。不需要进行对话,也就不需要协商谁该说话。问题更简单。这就是它已经被解决的原因。
Wispr Flow 做什么,以及它为什么让人意外
这类产品里最出名的叫作 Wispr Flow。原理一句话就能说清:你按住一个按键,说话,松开按键,然后文字就出现在你正在使用的应用里。任何应用都行。搜索框、邮件、VS Code,或者你最喜欢的 AI 的聊天窗口。
它的卖点是速度。语音输入每分钟 220 个词,键盘输入每分钟 45 个词。这个数字很好看,但真正改变使用方式的并不是它。
真正的区别在于清理。你像平时说话一样进行听写,带上你的“呃”、你的“那个”、你的“不,等等,我重来”。这些东西不会出现在屏幕上。AI 模型会发现你改口了,丢掉第一个版本,保留正确的版本。它还会加上标点,并根据你写作的应用调整语气。旧式听写会忠实地抄下每一次犹豫。之后你得一行一行地全部改正。那还不如直接打字。
整个产品都在这个漏斗里。进去的是口头草稿,出来的是书面文字。
所以,它和旧式听写的区别并不在于识别词语。这个部分已经运行很多年了,我在OpenAI 的新转录模型中已经详细讲过这一点。区别在于,软件识别出这些词之后会拿它们做什么。
Wispr Flow 可以在 Mac、Windows、iPhone 和 Android 上运行,支持一百多种语言。那家公司为此筹集了 81 million dollars。就我个人而言,我已经用它写提示词,也就是给 AI 的指令,写邮件,还有写相当一部分笔记,好几个星期了。现在再为了长篇文字回到键盘前,感觉就像一件苦差事。这正是那种傻瓜都能用的工具,直到有一天你把它卸载了,才会明白它的价值。
不过还是有两件事让人卡住
第一件事,是云端。Wispr Flow 没有离线模式:你说出的每句话都会发往服务器,然后以文字的形式回来。有一个隐私模式,可以保证音频和转录内容不会被保留。很好。但这丝毫不会改变传输过程:你的声音还是会离开你家。在听写密码或医疗记录之前,先花三秒钟想一想。
第二件事,是价格。这下我可要抱怨了。订阅费是每月 15 dollars,如果按年付费,则是每月 12 dollars。也就是每年 144 dollars,把声音变成文字。单独来看,考虑到它提供的服务,这并不贵。问题是,现在已经没有什么东西是单独存在的了。
每一张卡单独看都很合理。真正有问题的是这堆东西。
这是在上一个多余的订阅之后,又多出来的一个订阅。一个用来聊天的 AI,另一个用来写代码的 AI,在线存储,办公套件,音乐,现在又多了一个用来说话的订阅。每一个单独拿出来,都完全有理由存在。加在一起,它们最后就能抵得上一笔房租。软件已经从“我买一个工具”变成了“我租用使用它的权利”。我不记得有人问过我的意见。
出路,因为出路还是有的
好消息是,你不一定要花钱才能进行听写。
- 最简单的解决方案其实已经装在你那里了。在 Windows 11 上,按下
Win + H就能打开语音输入。在 Mac 上,听写功能位于键盘设置中。它免费,能正常工作,甚至还会自动加上标点。不过,系统不会清理你的犹豫。于是你的“呃”就会出现在屏幕上。 - 想要享受清理功能又不想订阅,VoiceInk 是开源软件,也就是说它的代码是公开的。它完全在你的机器上运行,使用本地安装的 Whisper 模型,一次性收费 29 美元。任何东西都不会离开你的电脑。它的缺点在于兼容性:只能在搭载 Apple 芯片的 Mac 上运行。
- 介于两者之间,SuperWhisper 可以让你选择本地处理或云端处理。它提供了更多设置,但在真正变得有用之前,也需要多做一点配置。
既然我已经用上了,就给你一个建议:先付一个月的订阅费,弄明白为什么人们会对此上瘾。然后看看本地方案能不能用一次性付款完成 90% 的工作。无论哪种情况,你以后都不会再用键盘敲一长串提示词了。
那这和 MAI-Realtime 到底有什么关系?听写是 Microsoft 和 OpenAI 正在尝试解决的问题的简化版。让机器根据听写内容写下来,这已经解决了。让它进行真正的对话,有停顿,有打断,还有临时改变主意,这就复杂得多了。简单版本已经能用了,你今晚就可以开始使用。
具体来说,这对你有什么改变
三件事。第三件不是个好消息。
1. 你可以打断你的机器说话
如今,当你的助手开始进行一段三十秒的回答,而这段回答又和你的问题不搭时,你有两个选择。你礼貌地等着,或者停下一切,从头再来。有了一个在说话时也会听你说话的模型,你只要简单地说“不了,等一下”,它就会停下来。就像人一样。乍看之下,这似乎微不足道。用起来,却会改变一切。
2. 当你的双手被占用时,语音变得可以使用了
这才是真正的承诺。开车时,做饭时,做手工时,或者怀里抱着孩子时,键盘都不是一个选项。可如今使用语音仍然是一件苦差事。我们像电台主持人一样咬字清楚,等着,然后再重复一遍。把延迟降到十分之二秒,就是和机器说话不再像做练习的那个时刻。我们说话,就这么简单。
3. 呼叫中心才是真正的目标,这一点得说清楚
我们来看看谁会为这种模型买单。不是你。是那些整天接电话的企业。一个可以自然地被打断,又不会留下尴尬空白的助手,听起来更像电话那头的真人。这正是目标。
我对此有自己的看法,而且我不回避。技术进步是真实的。至于别人是否会提前告诉你,你正在和一台机器说话,这同样是个真实的问题。这已经不再是实验室里的问题了。这是一个可能直接打电话到你家里的问题。
我的看法
最让我感到震撼的,是它的低调。根据这次泄露的信息,Microsoft 正在测试一种能够用十七种语言进行自然对话的模型。可它没有技术资料,就出现在一个内部工具的角落里。两年前,我们本来会看到一场发布会,一段制作精良的视频,还有三个小时的演示。
有两种可能的解读。要么 Microsoft 还没有确信这个模型足够可靠,所以宁愿低调地让人测试。要么这种发布已经变得如此普通,甚至不值得再发一份公告。第二种假设在我看来更有可能。这也最让人眩晕。
我不会这么快就高兴起来。在内部测试场里被发现的模型,还不是已经宣布的产品。两者之间还隔着定价,安全护栏,在欧洲的可用性,以及那种不打招呼就埋掉项目的老习惯。六个月后再见,看看 Victoria 和 Grant 还存不存在。






Join the conversation
You need an account to comment on this article. Creating one is free and takes under a minute.
No comments yet.