一只没露脸的兔子,先冲上了榜首
翻开发者调用榜的时候,一个从没听过的名字排在了第一。
它叫玉兔。厂商没认领,官方也没发过一条消息。
几天时间里,它的热度一路飙升。在开发者常用的两个模型调用榜上,它都拿到了当天的调用量第一。

社交平台上很快也热闹起来。
有人晒出自己的用法,说把一张餐巾纸上的草图丢进去,一个下午就变成了能跑的飞行追踪面板。

有人只是随手测了一次,结果好得有点出乎意料。

还有人拿同一段提示词做了对照。结论是它把此前霸榜过一阵的另一款模型赢了。

看到这些,我的第一反应是不信。
猜它是谁先放一边,先测
我从调用平台拿了接口,接到一个开源的智能体运行环境里。为了公平,我特意挑了此前没用过的那个。
和它打交道的方式还是 AI对话 那一套。把需求说清楚,剩下的交给它。
顺手给它取了个中文小名。
一个晚上加一个上午,我随机抽了四个任务放进去。
下面的记录带着我自己的主观色彩,主要还是呈现。
第一个任务是盖一座天坛。
我让它用一套网页三维框架做一个立方体风格的天坛,还要求带可交互的细节。
任务跑起来,我就去看剧了。大概一两个小时之后想起来看一眼,居然已经跑完。比我预想中快很多。
它还自己加了些我没提过的东西。
底部控制条里有三个时刻可以切换,从夜到黎明再到正午,另外还有下雨和下雪两个开关。
昼夜会自行循环,一天大约三分半钟。时辰文字也跟着从子时走到亥时。
麻烦的是,我用的那个运行环境根本没长眼睛。它看不到画面,所有判断都来自程序化分析,靠色相分类和像素直方图对账。
做完了我才想起来这件事。

所以评分上,我再给它加一颗星,算是道歉。
第二个任务,是一个更懂调休的闹钟
我的需求是苹果系统上的一个闹钟,要能对付调休和节假日。
它一共花了 22 分 46 秒。
响铃时的界面会霸占整块屏幕。很霸道,也很简洁。

第一轮跑出来的界面是这样的。

按理说一轮就够用。但我又让它加了个“这个月到底响不响”的判断,起床时间也调到 7 点 23 分。
这活实用性更强,看它自己写的说明文档更有意思。

苹果系统的硬限制它也考虑到了。一个应用最多只能挂 64 条待定通知,超了就直接丢。每周重复的触发器又没法单独排除某一天。

它的做法是两条腿走路。
不过我在说明里看到了点别的东西。

我盯着那段判定逻辑看了两遍,选择沉默。
第三个任务是给思考过程加一层字幕。
第三个任务是做一个电脑上的小工具,把运行环境的思考过程像字幕一样打在屏幕上。
好消息是快。可能不到五分钟。我正开着文档写稿,屏幕上就冒出来一个东西。

坏消息是,它这次脑补的细节没那么丰富。
第一版确实一直在显示思考的回路,但窗口不能拖动,也没有关闭和最小化。
这个位置一度挡住了我的对话框。我有点恼火。

不到 15 分钟,而且是在我同时开着好几个任务的前提下,它改好了。
现在想怎么挪就怎么挪。不显示思考的时候,它会缩得很小一只。
它自己说的一段话挺诚实。合成鼠标事件在这个环境里会被系统丢掉一部分,所以拖动是否和指针一一同步,它没法在无头环境里断言。
还有个小毛病,拖动的时候窗口会一闪一闪。
问题不大。实时显示思考过程本来就让窗口忽大忽小,我又在旁边拖,两套操作打架了。
说到底,首轮做出来的东西总会有点小瑕疵。提一句,一般一轮就能解决。要加新功能,就再聊一轮。
十几个任务测下来,我把手伸向了视频。
前前后后测了十几个任务,跨度从纯 AI编程 到做一个能跑的小应用。
海外论坛上有人的体感和我一样。

我测试的过程里,几乎没有遇到一轮解决不了的问题。
只有一次。任务是给某个代码仓库的文章列表加分页和标签组合筛选,还要补全测试、保持旧接口能用。
它先说全部检查通过,随后又说明代码检查还剩 33 个错误。
这个问题一说就改了。我又让另一个工具帮忙复审了一遍,也说没问题。

十几个任务测下来我有点累了,就把手伸向了多模态。
我丢给它一段视频,画面里一个机器人站在吧台后面调酒。

我什么背景都没交代,只问了一句:这个机器人在干嘛。
中间过程太长,直接看结果。

回答相当细。视频 34.6 秒,竖屏,每秒 30 帧。它把动作拆成了几段,先倒酒摇壶,再放下工具做手势,接着镜头推近给手部特写,最后又举起一罐继续操作。
有一个数字有点奇怪。这个任务的缓存命中率偏低,而其余任务都在 95% 以上。

它到底是谁家的
测完之后我才回头去认真看开发者的第一手反馈。好的坏的都有,整体偏好评。
有人说它是个工具狂人,能连着跑十条以上的命令。

有人说它快。写了几个脚本丢给别的新模型审,两次都没挑出错误。

也有人不满意。有人说它想得太多。这倒和天坛那个任务对得上,它给的结果比我的提示词丰富得多。

那么想得多到底算好还是算坏,我也说不好。
猜厂商这个环节,网友的答案五花八门。
有人听它的声音像另一家公司的模型,直接喊话让对方别藏了。

也有人和我一样,从名字里那个英文单词出发,猜它是某家大厂的新版本。看到这条我笑了。

国内几家头部厂商的模型,几乎都被猜了一遍。

还有人猜它是一家美国大厂即将发布的新模型。

比起猜它是谁,更值得看的其实是它为什么能这么快登顶。
现在大家挑模型的标准越来越实际。快不快,准不准,贵不贵。
正因如此,几乎所有的高速档模型都成了处理高频任务的常备工具。
与其纠结它背后是哪家,不如先看它把哪类活干明白了。
宁可多花两分钟把需求写清楚,也别指望它一次就猜中你要的东西。
照这个路子,这只兔子大概率也打算走通这条线。至于定价,只能等厂商出来认领了。
把它当成一件顺手的 AI工具,比当成全能选手更合适。
