抱抱脸的 Trending 排行榜,这两天被一个中国团队屠了。
语音和翻译两条黄金赛道,同时冒出一匹黑马。
OpenAI 被挤到后头,谷歌和英伟达也没能顶住。
它叫网易有道。
就是考四六级那年,你天天开着查单词的那个有道。

语音识别榜,R2T2 登顶

翻译榜,T3PO 登顶
发布才五天。
有道开源的真流式语音识别模型 R2T2,和流式翻译模型 T3PO,双双坐上抱抱脸的两张王座。
这张榜是全世界极客用脚投票投出来的,含金量不用多解释。
两张榜摆在一起,排面直接拉满。
语音识别那张,R2T2 排第一。
OpenAI 家的大杀器 Whisper-large-v3 屈居第六,英伟达的模型掉到了第八。
翻译那张,T3PO 同样是榜首。
谷歌和 Meta 这些名震江湖的翻译老前辈,全被挤到了后头。
这两个模型背后,藏着一盘大棋。
从说,到听,再到译,Voice Agent 要用到的语音本事,有道想一口气全部配齐。
刚一亮相,就锋芒毕露。
一、全球极客排队给它修路
登顶之后的这一周,海外开发者圈子炸了。
R2T2 开源没几天,全世界的极客像发现了新大陆一样扑上来,争先恐后地给它修路。
第一个动手的硬核大佬叫 davidxifeng。
他给近 3000 star 的音频框架 audio.cpp 提交了代码。
把 R2T2 的核心机制用 C++ 从头重写了一遍。
9 月 19 日,代码正式合入主分支。
这一下,R2T2 彻底甩掉了 Python。
连贵的显卡都用不着,在苹果 M3 芯片上就能跑出 8 倍实时速度。
门槛一下没了。
紧接着,一批离线的 AI小工具像下饺子一样冒出来。
苹果的端侧框架适配版出了。
能把 30 种语言实时翻成英文的全离线字幕工具也做出来了。
苹果电脑上的语音输入工具,专门给它写了离线插件。
这波热潮把抱抱脸官方都惊动了。
他们亲自下场,给 R2T2 搭了个 ZeroGPU 在线演示,还倒贴免费算力。

抱抱脸上的 ZeroGPU 在线演示
海外量化圈也加班加点,赶出了从 Q2 到 Q8 的全套 GGUF 量化版本。
llama.cpp 和 Ollama 拿来就能跑。
这待遇,过去只有顶流开源大模型才享受得到。
一位开发布道师连夜码了长帖,开头一行大写加粗。
语音智能体有个要命的转写毛病,老爱把已经吐出来的字偷偷改掉。
现在中国团队开源了一个模型,直接把这个问题秒了。

推文原话:只追加不改写的流式转写,词一旦提交就不再重写
另一位博主也感慨,只有 2B 参数,200 毫秒延迟。
每个词一吐出来就当场定稿,绝不反悔,而且百分之百开源。

推文原话:2B 参数做到 200 毫秒延迟的实时转写
一个语音识别模型,凭什么让全世界的极客像疯了一样抢着搬。
答案在它身上一个多数同行还没练成的本事。
二、说完的话不再改口,R2T2 靠的是什么
「给张伟转三百块,不对,是三千块,备注写九月房租。」
这种说到一半突然改口的破事儿,谁都干过。
我们把这句话同时喂给 Whisper 和 R2T2。
Whisper 用的是常见的伪流式做法,每零点几秒把整句话从头再认一遍。
好戏开始了。
一边字幕疯狂闪烁,边听边改。
金额一度被改成九千元,过了半秒多才改回三千。
要是助手手快,这笔钱就按九千转出去了。
R2T2 这边,字只要一上屏就纹丝不动。
收款人对了,金额对了,备注也对了,一次到位。

同一句话的两次转写对比:一边中途改字,一边一次交付
换个场景,定闹钟。
「明天早上六点半叫我起床,算了,七点吧,每隔五分钟再响一次。」
起床时间在六点半和七点半之间来回横跳。
最后把「七点吧」听成了「七点八」,「再响一次」成了「再想一次」。
R2T2 依然一次到位。
点外卖也好不到哪去。
菜名在「公保鸡丁」和「宫宝鸡丁」之间改了好几次,就是没写对。
场景换了一个又一个,对手每一回都在边听边改。
R2T2 一个字都没回头改过。
平时看剧开字幕,前面几个字突然闪一下变了,忍忍也就过去了。
可要是字幕后面接的是一个会转账的语音智能体,情况完全不同。
它会买票,它会导航,前面偷偷改一个字都是灾难。
所以到了语音智能体时代,不反悔成了最要命的刚需。
人类同传圈有条老规矩。
说出口的话绝不能收回,译错了只能硬着头皮往下补。
这条规矩,机器过去死活学不会。
R2T2 偏偏把它拿捏了。
它的解法堪称暴力美学,逼模型学会两个动作,落子和闭嘴。
每溜进来 80 毫秒的音频碎片,模型就得做一次灵魂拷问。
这几个字,我听死了没有。
听准了就当场提交,提交出去的字像刻在石头上,再也不准动。
没听清就按住不发,再多听 80 毫秒。

音频流分段进入模型,逐段提交之后不再回改
实测数据摆在这里。
同一个基础模型,不做这套训练,直接硬逼它每 160 毫秒边听边出字。
中文字错率高达 39.72%,基本属于胡言乱语。
这数字没法看。
用最长稳定前缀这套方法训过之后,错误率暴降到 3.48%。
差了整整十倍。
拉上其他模型一比,更是降维打击。
同样是每 160 毫秒出一次字。
英伟达那套错误率 20.64%,一家欧洲公司的模型是 29.59%。
R2T2 只有 6.42%。

中文测试集在 160 毫秒配置下的字错误率与延迟
不仅如此,团队还把两家头部商业 API 拉进来打擂台。
它们可以随时回头改字,英文错误率 6.20%,延迟 0.95 秒起步。
R2T2 死守落子无悔,错误率压到 6.13%,延迟只有 0.55 秒。
又准,又快,还绝不反悔。
对手悔棋都下不过它。
真没得比。

英文测试集上真流式与伪流式的两组对比

准确率与延迟的帕累托前沿,R2T2 落在左下角
光看论文不过瘾,我们直接上了有道的在线演示。
各种刁钻的说法挨个喂给它。
不管怎么测,屏幕上的字只往后长,一次都没回头改过。
落子无悔这四个字,果然不是白叫的。
中英夹杂的购物指令也没问题。
「在京东买一根 Type-C 的充电线,一米五的,别买成 Lightning 的」。
一个英文词都没落下。
遇到人名和产品名这类生僻词,在技术词汇里填一下就行。
像周枫这样的名字,还有生僻的平台名,填进去之后全部认对。

在线演示里的实时转写界面
三、你负责听,我负责译:T3PO 补上另一半
R2T2 摆平的是听,T3PO 搞定的就是译。
T3PO 的全称很长,和 R2T2 摆在一起,明显是在致敬星战里那对无敌机器人搭档。
一个是 R2-D2,一个是 C-3PO。
这是程序员才懂的浪漫。
同传里最要命的矛盾,译得快就容易错,想译准就得等。
T3PO 的绝招是让模型自己拿主意。
上下文够了就开译,不够就再等一等。
再把读还是写这个决策练到最优。

T3PO 在五个测试集上的质量与延迟,红线是 T3PO
这两个模型一串起来,奇迹就发生了。
R2T2 负责把定了稿的增量文字一块块扔过来,T3PO 拿到当场开译。
整条链路从说完再识别再翻译的串行模式,变成了边说边听边理解边翻译的极速管道。
我们拿 T3PO 实测了一圈。
中文英文来回切,原话说完一秒多,译文就跟上来。
顺滑得像旁边真坐着一位人类同传。
再试一个同传最怕的场景,说话人自己改口。
「明天上午十点,哦不对,是下午两点,在三楼会议室开会,大家记得带电脑。」
T3PO 已经把上午十点译了出去,收不回来。
它就像真人同传一样顺口接了一句抱歉,再把下午两点补上。
报财报也难不倒它。
「今年第三季度,公司营收三十七亿五千万元,同比增长百分之二十三点六,净利润一亿两千万元」。
它等数字说完才开口。
3.75 billion 对,23.6% 对,120 million 也对。
就连满嘴口头禅的英文,它也不硬译。
直接提炼成一句干净的「我们或许应该把发布日期推迟到下周」。
四、下一场恶战,打在语音智能体的入口
过去两年,大家夸中国模型厉害,夸的基本都是通用大模型的主榜。
抱抱脸今年夏天的报告里有个数字。
2026 年的大部分月份,中国实验室发布的最大开源模型,参数规模都超过了美国同行。
如今这种领先正从主榜蔓延到语音赛道,翻译和多模态赛道,还有视频这些细分方向。
网易有道这次双登顶,就是从主榜领先走向全谱系领先最锋利的一块拼图。
这块拼图,有道早就开始摆了。
2023 年,有道推出国内首个教育大模型「子曰」。
今年 5 月开源多模态推理引擎。
6 月开源支持 14 种语言零样本语音克隆的 TTS 引擎。
9 月又用 R2T2 和 T3PO 补齐了识别和翻译两端。
从说到听,再到译,语音交互的完整闭环,有道用一年半时间硬生生打通了。
这套能力早已在真实场景里上岗。
有道的同传产品累计服务了 2500 万用户,使用次数一年翻了一倍。
9 月 16 日的有道开放日上,周枫说了一句话。
模型体现的是聪明。
智能体体现的是能干。
工作流体现的是靠谱。

有道开放日上的周枫
说到底,普通人要的未必是模型本身,而是一件顺手的 AI工具。
未来的机器要替人开会,要替人做同传,还要替人接电话。
在这场争夺语音入口的战争里,谁有一双听得准又落子无悔的耳朵,谁就卡住了时代的咽喉。
这双耳朵,中国团队已经造出来了,还彻底开源给了全世界。
中国模型的故事,也从主榜上的一枝独秀,走到了全谱系的多点开花。
目前两个模型已经在 GitHub 和抱抱脸全面开源。
在线演示也开着,可以去感受一下什么叫真正的赛博同传。
