一只没露面的兔子登顶双榜:我拿四个任务测了它

一只没露脸的兔子,先冲上了榜首

翻开发者调用榜的时候,一个从没听过的名字排在了第一。

它叫玉兔。厂商没认领,官方也没发过一条消息。

几天时间里,它的热度一路飙升。在开发者常用的两个模型调用榜上,它都拿到了当天的调用量第一。

模型调用榜排名截图

社交平台上很快也热闹起来。

有人晒出自己的用法,说把一张餐巾纸上的草图丢进去,一个下午就变成了能跑的飞行追踪面板。

开发者晒出的使用体验

有人只是随手测了一次,结果好得有点出乎意料。

开发者随手测试后的反馈

还有人拿同一段提示词做了对照。结论是它把此前霸榜过一阵的另一款模型赢了。

同题对照的测试结果

看到这些,我的第一反应是不信。

猜它是谁先放一边,先测

我从调用平台拿了接口,接到一个开源的智能体运行环境里。为了公平,我特意挑了此前没用过的那个。

和它打交道的方式还是 AI对话 那一套。把需求说清楚,剩下的交给它。

顺手给它取了个中文小名。

一个晚上加一个上午,我随机抽了四个任务放进去。

下面的记录带着我自己的主观色彩,主要还是呈现。

第一个任务是盖一座天坛。

我让它用一套网页三维框架做一个立方体风格的天坛,还要求带可交互的细节。

任务跑起来,我就去看剧了。大概一两个小时之后想起来看一眼,居然已经跑完。比我预想中快很多。

它还自己加了些我没提过的东西。

底部控制条里有三个时刻可以切换,从夜到黎明再到正午,另外还有下雨和下雪两个开关。

昼夜会自行循环,一天大约三分半钟。时辰文字也跟着从子时走到亥时。

麻烦的是,我用的那个运行环境根本没长眼睛。它看不到画面,所有判断都来自程序化分析,靠色相分类和像素直方图对账。

做完了我才想起来这件事。

运行环境写下的说明

所以评分上,我再给它加一颗星,算是道歉。

第二个任务,是一个更懂调休的闹钟

我的需求是苹果系统上的一个闹钟,要能对付调休和节假日。

它一共花了 22 分 46 秒。

响铃时的界面会霸占整块屏幕。很霸道,也很简洁。

闹钟响铃时的界面

第一轮跑出来的界面是这样的。

第一轮跑出的闹钟界面

按理说一轮就够用。但我又让它加了个“这个月到底响不响”的判断,起床时间也调到 7 点 23 分。

这活实用性更强,看它自己写的说明文档更有意思。

说明文档里的工程结构

苹果系统的硬限制它也考虑到了。一个应用最多只能挂 64 条待定通知,超了就直接丢。每周重复的触发器又没法单独排除某一天。

苹果系统的硬限制与应对

它的做法是两条腿走路。

不过我在说明里看到了点别的东西。

响铃判定逻辑片段

我盯着那段判定逻辑看了两遍,选择沉默。

第三个任务是给思考过程加一层字幕。

第三个任务是做一个电脑上的小工具,把运行环境的思考过程像字幕一样打在屏幕上。

好消息是快。可能不到五分钟。我正开着文档写稿,屏幕上就冒出来一个东西。

屏幕上冒出的浮动窗口

坏消息是,它这次脑补的细节没那么丰富。

第一版确实一直在显示思考的回路,但窗口不能拖动,也没有关闭和最小化。

这个位置一度挡住了我的对话框。我有点恼火。

作者提交修改意见

不到 15 分钟,而且是在我同时开着好几个任务的前提下,它改好了。

现在想怎么挪就怎么挪。不显示思考的时候,它会缩得很小一只。

它自己说的一段话挺诚实。合成鼠标事件在这个环境里会被系统丢掉一部分,所以拖动是否和指针一一同步,它没法在无头环境里断言。

还有个小毛病,拖动的时候窗口会一闪一闪。

问题不大。实时显示思考过程本来就让窗口忽大忽小,我又在旁边拖,两套操作打架了。

说到底,首轮做出来的东西总会有点小瑕疵。提一句,一般一轮就能解决。要加新功能,就再聊一轮。

十几个任务测下来,我把手伸向了视频。

前前后后测了十几个任务,跨度从纯 AI编程 到做一个能跑的小应用。

海外论坛上有人的体感和我一样。

论坛用户的故障反馈

我测试的过程里,几乎没有遇到一轮解决不了的问题。

只有一次。任务是给某个代码仓库的文章列表加分页和标签组合筛选,还要补全测试、保持旧接口能用。

它先说全部检查通过,随后又说明代码检查还剩 33 个错误。

这个问题一说就改了。我又让另一个工具帮忙复审了一遍,也说没问题。

作者贴出的表情包

十几个任务测下来我有点累了,就把手伸向了多模态。

我丢给它一段视频,画面里一个机器人站在吧台后面调酒。

机器人调酒视频截图

我什么背景都没交代,只问了一句:这个机器人在干嘛。

中间过程太长,直接看结果。

逐帧拆解的回答

回答相当细。视频 34.6 秒,竖屏,每秒 30 帧。它把动作拆成了几段,先倒酒摇壶,再放下工具做手势,接着镜头推近给手部特写,最后又举起一罐继续操作。

有一个数字有点奇怪。这个任务的缓存命中率偏低,而其余任务都在 95% 以上。

缓存命中率对比

它到底是谁家的

测完之后我才回头去认真看开发者的第一手反馈。好的坏的都有,整体偏好评。

有人说它是个工具狂人,能连着跑十条以上的命令。

论坛上关于工具调用的评价

有人说它快。写了几个脚本丢给别的新模型审,两次都没挑出错误。

关于速度的评价

也有人不满意。有人说它想得太多。这倒和天坛那个任务对得上,它给的结果比我的提示词丰富得多。

关于信息量的评价

那么想得多到底算好还是算坏,我也说不好。

猜厂商这个环节,网友的答案五花八门。

有人听它的声音像另一家公司的模型,直接喊话让对方别藏了。

网友从声音猜测厂商

也有人和我一样,从名字里那个英文单词出发,猜它是某家大厂的新版本。看到这条我笑了。

围绕名字里英文单词的猜测

国内几家头部厂商的模型,几乎都被猜了一遍。

国内厂商被集体猜测

还有人猜它是一家美国大厂即将发布的新模型。

关于新模型的猜测

比起猜它是谁,更值得看的其实是它为什么能这么快登顶。

现在大家挑模型的标准越来越实际。快不快,准不准,贵不贵。

正因如此,几乎所有的高速档模型都成了处理高频任务的常备工具。

与其纠结它背后是哪家,不如先看它把哪类活干明白了。

宁可多花两分钟把需求写清楚,也别指望它一次就猜中你要的东西。

照这个路子,这只兔子大概率也打算走通这条线。至于定价,只能等厂商出来认领了。

把它当成一件顺手的 AI工具,比当成全能选手更合适。