最近打开 WorkBuddy,模型面板里多了个新名字。
它叫 Space-Bunny,旁边标着限时折扣。
倍率那一栏,写着 0.03。
自我介绍栏里只有两个字,匿名。
没有发布会。
没有技术报告。
也没有跑分海报。
它 9 月 23 日上线,三天就登顶。
9 月 27 日那一天,它在两家聚合平台同时排到第一,一家单日约 4 万亿 token,另一家约 8 万亿。
到 10 月 2 日,周榜第一也归了它。
一整排当红模型,全被压在身后。
奇怪的是,到今天为止,没有一家厂商出来认领。

这篇就当成一份实操笔记。
它怎么开,怎么用,能派什么活,我分四块讲清楚。
用它之前,先确认三件事
先把客户端更到最新版。
模型选择目前只在云上模式里开放。
再新建一个任务。
在空着的输入框里,随便发一句话。
官方文档写得很清楚。
第一句话发出去,模型选择才会显现。
在空框里翻下拉列表,是翻不到的。
然后点输入框里那个模型名,比如默认的 Auto。
面板弹出来,找到 Space-Bunny。
看到限时折扣,选中它。
顺手把思考强度拉到最高档。
怎么算调对了。
卡片描述行会写着一行字。
大意是推理快,编码强,还支持原生多模态输入。
下面还有一行,写着折扣的起止日期。
看到这两行,就对了。
规格上,它的上下文能塞进 1M。
一整个代码仓库再加一堆文档,一次进去。
能读文字。
能读图片。
还能读视频。
但它只往外吐文字,自己不生成图。
思考强度分五档,默认就是开着的。
0.03 倍率,到底便宜在哪
九月底,我给一群老师上线下课,讲怎么选模型。
我把倍率表摊在屏幕上,一个一个念。
有一档是 0,免费,碰上复杂题就跟不上。
我管它叫初中生。
这个 0.03 的档位,算个大学生。
另一家的 0.06 也是大学生,快还省。
最高那档是 1.62,我说这个是教授,出场费贵得吓人。
干 AI编程 这行的人,感受会更直接。
那堂课我反复强调一句话。
别用自动档。
自动档烧积分最狠。
结果 10 月 2 日,我的面板里,0.03 这一档旁边,又冒出一个 0.03。
不是最便宜那档独享便宜。
是最便宜那档,开始有并排的了。

0.03 和 1.62,中间差了 54 倍。
这个数字直接决定,你跟 AI 说一天话要花多少钱。
所以这不是哪个模型更强的问题。
是你打算让 AI 干多重的活的问题。
那它到底是谁家的。
公开的说法一共四种。
它到底是谁家的,四种说法
这个我不敢下结论。
四种猜测全摆出来,你自己判断。
线索最多的是分词器。
有人拿 50 组字符串比对切分结果。
结论是它跟一家国产厂商的家族完全吻合,别家一个都对不上。
有人直接问它是谁家的,它当场自报家门。
还有人在那家厂商的开源仓库里,提前五天翻到一版新配置。
1M 上下文,三档推理,全对得上。
第二种猜测更浪漫。
名字里有太空,又有兔子,还赶上中秋。
于是有人说,这是另一家的模型。
第三种猜的是大厂的新一代。
有人反驳,说这家以前都是直接上,没这个躲躲藏藏的习惯。
第四种纯粹是玩笑。
太空加兔子,有人猜是火箭公司。
这四种我一个都不排除。
也一个都不认定。

因为到今天,没有任何一方站出来认领。
上一个这么干的,是八月的另一个匿名模型。
它免费了六天,最后揭晓是某智谱家的。
揭晓当天,立刻转成收费。
剧本有先例。
先匿名免费,跑够真实数据。
量攒够了,再公布身份。
然后收钱。
好话和差话,这段时间都听得到。
有测评博主出九道题,把它和同档快模型摆一起比。
评价是速度挺快,交付可以,长程调度也还行。
还有人一次性丢四个活给它。
第一轮全跑通了。
差话同样真实。
有博主在编程工具上测了六道题。
指令遵循,动画绘制,浏览器里的操作系统,三维赛车,看板应用。
道道差评。
最扎心的一条是,用中文提的需求,交出来是英文界面。
也有人说,这几天升级之后,它没以前好用了。
同一道游戏题,它跑完只用了 1 分 51 秒,同档另一个模型却跑了整整 4 分钟。
快是真快。
但快出来的是基础版,页面完整性不如人家。
它的工具调用错误率,是 3.45%。
所以我的判断是,它是个合格的底座。
还不是一个合格的交付器。
对一个上线才十天的模型,这评价已经不低了。
那怎么跟它说话。
我教了十三年 AI,见过太多人打开对话框就说你好,然后回头怪它答得不好。
它不知道你到底要干什么,只能凭字面瞎答一气。
我手上常备四组提示词,可以直接抄。
派活那组,写清楚给谁干,做成什么样,什么算完成。
修改那组,不满意的时候特别好用。
“别给我加我没提的功能”,这句对便宜快的模型尤其重要。
它输出是克制的。
但任务描述一模糊,它就开始自由发挥。
喂长文档那组,先把边界划好再让它动手。
1M 上下文的意思不是你说话它都记得。
是你一次能塞很多。
空塞三百页不给指令,它就还你三百页摘要。
界面纠错那组,页面出来是英文时补一句就行。
“删掉没经过我确认的内容”,这句我现在每次都加。
哪些活能派,哪些不能
这是全篇最重要的一块。
该派的活有三类。
重复性、要跑很多遍的活。
批量改名,整理,改格式。
跑十遍的成本,可能比跑一遍旗舰模型还低。
图和视频变成能跑的东西。
有人丢给它一张手绘草图,不到五分钟就拿到能点能转的网页,整页都是它现写的。
有人喂一段游戏录屏,它复刻出飞船和音效。
画面都是它自己写的代码跑出来的。
长文档结构化整理。
一整本书转成知识图谱。
它还能分清哪些是原文写明的,哪些是它推断的。
不该派的活也有三类。
需要交付完整成品的活。
人工补漏的功夫,往往比省下的钱还多。
涉密的东西,合同,客户资料,没公开的代码,员工信息。
一样都别丢给它。
无人值守的自动化。
3.45% 的错误率,聊天时感觉不到。
跑长流程,就是每二十多次错一次。


9 月 28 日,一位温州做制造的老板给我打电话。
他开口第一句不是 AI 有什么用。
是你现在用的是哪些产品,什么模型。
我这才意识到,老板们对 AI 的兴趣,正在换轨道。
以前问的是这东西能不能用。
现在问的是这东西我该用哪个。
对我们这些离不开 AI工具 的人,这才是真正的变化。
过去两年我们学 AI,学的都是怎么让 AI 干活。
接下来要学的,是怎么给一群 AI 派活。
你手上有五六个模型,性能不一样,价格差几十倍,擅长的活也不一样。
这跟你带团队是一回事。
你不会让同一个实习生既写代码,又写文案,还跟客户吵架。
一个来路不明、正在打折的模型,值不值得把活派过去。
我的答案是敢。
但只派公开的活。
打活动的模型就是临时工。
它不是你的基础设施。
趁现在,把你手上一直拖着的那件活挑出来。
挑一件不敏感的,扔给它跑一遍。
别光看别人晒的演示。
你自己跑一遍更实在。
倍率差 54 倍,活的性质又不同,最优解自然不同。
模型选型的本质,不是找到最强的那个。
是找到这件活最划算的那个。
想,全是问题。
干,就对了。
