一位顶着新染红发的创始人,这两天在海外一档播客里露面。
他是 TypeSafe 的联合创始人兼 CEO,迪奥戈。
整场访谈他几乎什么都往外说。
很敢讲。

开场第一句就是冷水。
他先点了公开榜单的名。
那类榜单极容易被操纵。
这话不假。
开发者就算不主动作弊,也会被榜单牵着走。
榜单之外,他更信长期攒下来的产品体验和信任。
把模型放进自己的工作流,针对这条工作流去测,才知道它在要紧环节里到底什么水平。
宁可信长期跑出来的体验,也别只盯着榜单上那个分数。

说到早年在 OpenAI 的那几年,他也没留面子。
他说自己当年身在 OpenAI,深深感受过什么叫无力。
这话一出来,评论区直接热闹了。
弹幕炸了。

这几天,Jev 这款“不会聊天、只会做决定”的模型火遍了全网。
有人拿它筛海量论文。
有人拿它预判客户的需求。
还有人连夜开源了一个聊天助手,专门预判老板的心思。
6 天时间,官方视频的浏览量冲到 3870 万。
在一份第三方综合榜上,它拿到 75.3 分,排在第一。
这类 AI工具 好不好用,上手几句就能看出来。

我把整场访谈的重点都整理了出来。
下面直接看。

一、能解世纪难题,为什么干不了活
访谈一开始,主持人问他爆火之后什么感觉。
他说自己已经被榨干了。
听着都累。
每天只剩一副筋疲力尽的躯壳,四处飘荡。

事情铺天盖地砸过来。
他是技术出身的一把手,每天要到处救火。
这几年他常讲一个比喻。
整个行业像游乐园里的镜子屋。
画面感很强。
人人都有点脱离现实,说着逻辑对不上的话。
而就在这一周,行业终于被拉回了地面。

他常在演讲里抛出一个问题。
模型已经聪明到能挑战千禧年大奖难题。
可它连大批最基础的工作都接不住。
那些活门槛不高,也说不上有什么成就感。
人本来可以去做更有意思的事,现在却还困在里面。
根子在于,我们还没法把它们自动化。
手里有一台动力强悍的引擎,却找不到合适的接口。
问题就在接口。

主持人接着问,能不能给点可披露的数据。
他给的数字很实在。
日处理量已经突破一万亿词元。
而且不是昙花一现的峰值,夜间流量还在持续走高。
这说明大量调用来自机器,不只是用户尝鲜。
他反倒不太看重注册量。
这点挺反常识。
之前他们踩过一个小坑。
社交平台上有人调侃他们是营销天才。
可公司几乎没有市场团队。
所谓“营销”,只是带着一股直愣愣的劲,持续给候补名单里的人开放注册。
麻烦在于,很多注册者根本不是开发者。
进来随便跑几条查询,疑惑一句“这又不是聊天机器人”,然后就走。
真正棘手的是调用速率限制。
一个系统就是这样搭起来的。
前期投入把链路搭好,等产出超过成本,这套逻辑就能沉到后台,变成别的系统的依赖。

他还说,自己厌倦了 AI 永远站在舞台中央。
世界本身应该更有趣,模型退到幕后就好。
这话挺清醒。

主持人追问他,最难的部分过去了吗。
他说没有,后面还会有更硬的挑战。
如果各种工作都顺利自动化,经济数据一片欢腾,那才算过关。
他并不这么乐观。
现在整个行业都在卷速度、拼成本,反倒把可靠性给弄丢了。
可可靠性才是一款产品真正的灵魂。
这是他的原话。

他给过一个很具体的目标。
五年内把全要素生产率拉高 3 个百分点。
他说没有哪家实验室把这个当目标。
可这才是衡量这场变革的真尺子。
他甚至反问,模型都能解世纪难题了,为什么在真正有价值的工作上贡献几乎为零。
他的判断是,眼下几乎所有模型创造的商业价值都还接近于零。
等真变革来了,宏观数据一定会显出来。
尺度很大。

关于 SaaS 会不会被冲垮,他觉得这说法离谱。
他更相信 SaaS 会被 AI 全面改造。
最懂业务痛点的厂商,才是这场自动化的主角。
判断很直接。

有人问,技术人员该盯哪些方向。
他一次列了好几类。
企业囤着却不敢算的暗数据是一类。
编程助手是一类。
需要模型参与闭环的实时场景是一类。
游戏也算一类。
高度可组合的智能软件同样在列。
剩下还有做校验和观测的一类。
他还分享了一个省钱的工程手法。
处理一份庞大的状态数据,可以先给每条消息打上编号,再逐条独立提问。
那份状态只需付费加载一次。
账很好算。

聊到编程助手,他的判断挺冷静。
眼下跑在最前面的,是 Codex 这类编程助手。
可它们那一套单一模型体系,只适配自家业务。
目前的 AI编程,本质上还是围绕单一模型在竞争。
各家开源出来的东西,能力差距并不大。
循环能实现的能力边界是有限的。
一旦有谁做出独有的杀手级场景,所有人都会一拥而上。
开源项目又能很快把这套能力复刻一遍。
他说自己希望和所有产品对接,哪怕对方是竞品。
作为基础设施,他不该带着偏向性立场。
姿态放得很低。

二、嵌进软件里的决策内核
他想要的东西,跟聊天机器人不是一路。
聊天模型在做文本补全,人类反馈的模型在陪人说话。
他要做的是给代码用的内核,输出直接交给程序读取。
名字来自一个经济学悖论,主打极致的性价比。
在可靠性、成本和速度这几项里,他死磕性价比。
取舍很清楚。

有人问他,为什么反对传统的安全对齐,不做输出拒绝。
他说自己不反对安全本身。
只是那套对齐方式,跟开发者的需求并不匹配。
只聊天的话,模型回一句“我无法回答”,顶多让人烦躁一会儿。
可要把它当后台依赖,随机拒绝就是一个严重的缺陷。
业务软件不能因为一条奇怪输入就崩掉。
这套思路来自不懂软件开发的人。
他们沉迷于“AI 同事”的浪漫想象,却没挖出工具真正的潜力。
他要的是能力对齐,让模型按工程师的意图把活干完,输出可预测。
宁可把它当成一件工具,也别给它安一个同事的浪漫人设。

聊到接口设计,他讲了三个基础动作。
一个是选择,对应枚举上的分支。
一个是空值,对应条件判断。
一个是打分,对应排序和阈值比较。
名字内部争了很久,最后才定下来。
有人提议叫泳池派对,还有人坚持要叫猫叫。
他们希望这些概念语义清楚,别跟原生类型混淆。
名字只是壳。

至于视觉能力这块缺口,他说不预设边界。
行业里有个经典矛盾。
到底该按用户嘴上提的要求做产品,还是给他们真正需要的东西。
他们低调做了两年,选了后者。
一味迎合,产品会滑向保姆式思路,反而伤体验。
对开发者友好,是把他当成能独立决策的成年人。
边界感很强。

他还说,基础设施才是关键。
光速本身就是物理瓶颈。
欧洲服务器不足,延迟优化不到位,这点他很遗憾。
终极目标不只是做成一家卖模型的公司,而是交付多种形态的智能内核。
决策内核好比智能时代的传输协议。
他想建的是智能领域的亚马逊。
野心不小。

三、越听话的模型,为什么反而不好用
校准这个话题,过去行业里很少讨论。
他说人类反馈会带来一个副作用,叫模式丢弃。
模型为了看起来不出错,主动放弃了那些真实但罕见的情况。
转而去给一个平庸、安全的万金油答案。
副作用是,决策场景里可能灾难性失效。
模型越听话,越容易这样。
这是副作用。

他提到另一位老前辈的判断。
那个人有一张著名的幻灯片。
饼图显示,序列越长,出错概率越高。
数学推导看着无懈可击,现实经验却不支持。
这就是理论和现实之间的断裂。
如果分布覆盖得完整,遇到离群样本就不会被过度惩罚。
而模式丢弃像早期的图像生成,只保留最高频的输出。
为了让长文本表面不出错,模型必须变得极度保守。
明显的错很容易被发现,细微的偏差却很难识别。
硬把字符串聊天模型套到决策场景,本身就是一场灾难。
路子不对。

谈到“放缓前沿模型研发”的联名呼吁,他觉得视角太窄。
那套逻辑链条看着自洽,底层前提却可以替换。
资源曾经大量投给一类用单元测试做强化学习的尝试,那条路走不通。
对他来说,最合适的投入就是不投入。
部分实验室有一种责任错觉,以为想变强就得不断给模型中间自由发挥的权限。
真正该担责的是研究者,不是普通大众。
他的目标不是说服头部实验室。
而是唤醒工程师们。
让大家重新燃起希望。
动手去自动化那些一直想自动化的流程。

四、不卷跑分,也不堆算力
他写过一篇还没对外发的文章,描绘理想中的未来。
核心愿景是“做我所想”。
不要机械地照字面执行,而是理解使用者的真实意图。
至于智能无处不在的宏大蓝图,他不愿过度承诺。
多模态也要辩证看,有些模态增益能力,有些反而有害。
语音领域甚至出现了行业性撤退。
缩放定律也不等于无脑砸钱。
它只是描述投入和性能提升之间的关系。
即便无限投入,部分能力依旧可能够不着。
钱不是万能的。

有人问,缩放定律的价值到底在哪。
他自认想法疯狂,同时又极度务实。
资源投入确实带来收益,可投入常是指数增长,性能提升却低于线性。
除非这份边际收益价值极高,否则商业上并不划算。
他更在意的是,在现有底座上还能挖出多少价值。

说到跑分,他对公开榜单整体持负面态度。
那类榜单非常容易被操纵。
即便厂商无心作弊,也会被动地拟合数据集。
早年各家实验室专门收集类似的数据去刷榜。
建立信任不该靠公开榜单。
应该把模型放进自己的工作流,针对那条工作流去评估和测量。
他引用过一句名言,长期看算法终将战胜算力。
找对北极星任务,是最难也最重要的事。
方向比算力重要。

他给自己所在的团队换了个定位。
与其说是模型实验室,不如说是数据实验室。
合成数据只是表象。
任务形态决定数据形态。
不同技术路线的数据体系完全不一样。
即便用户数据能拿来训练,他们也刻意不用。
真实世界里用户提问服从幂律分布,很容易过拟合。
他们瞄准的是多年之后的未来。
数据团队更像艺术家,要定位模型的毛刺,用外科手术式的方式修。
重点是先处理通用场景,而不是修补个别特例。
顺序不能反。

提示词越写越大怎么办。
他真心建议把大问题拆小,并行发起多次调用。
写一段巨型系统提示词,拿到一坨输出,再调另一轮模型校验,这套模式很扭曲。
安全校验也不该只写一条笼统的禁止拒绝。
拆成多条独立查询,分别校验每一类风险。
一旦出现漏洞,就新增一条校验问题,调整阈值,沉淀成测试用例。
软件会永久记住这套逻辑,不必依赖提示词的上下文。
有些任务依旧超出当前能力。
有人拿它去炒股,他觉得这很酷,但现阶段要谨慎。
每一个子校验都可以单独评估。
能力不足就先不上线。
非要上,就要加人工兜底。
眼下有些编程助手过度拟合现有框架,很难接上外部工具。
开发者只能在提示词里反复乞求模型调用工具,这不是正确的工程解法。
工程不该这么写。

有人问他,钱和热度都到位了,产品也落地了,感觉如何。
他说过去在演讲里总吊大家胃口,不肯讲自动化到底怎么落地。
这下原型直接摆到所有人面前。
拖了好几年。

当年离开的时候,他其实是带着情绪走的。
他心里一直有个念头。
万一寒冬真来了,而自己没有拼尽全力去挡,那会是他的责任。
一边是人类反馈把“吹出去的牛”和“落地的活”拉得越来越远。
一边是行业没注意到,可编程的模型才是真正能释放经济价值的那条路。
现在看,最坏的那种寒冬应该是躲过去了。
产品上线还不到一周,数据已经证明它在干实打实的活。
有句话他以前私下说过,现在愿意公开再说一遍。
给我十亿美元,我也不会从零开始重训大模型,因为太烧钱了。
态度很坚决。

现成能力完全可以拿来裁剪、拼接。
做点“弗兰肯斯坦式”的组合,不必什么都从零训起,照样能解决现实问题。
思路挺省。

当年他推动过一个项目,用自研算法换掉了慢吞吞的数据清洗。
上线之后,那个项目几乎拿下了当时大模型的半壁江山。
可结果呢,产品大量被用来生成网页垃圾文案。
模型很强,却没创造真正的社会价值,问题到底出在哪。
于是他开始倒推。
如果真要引发一场经济革命,到底是谁在调用接口,是人还是程序。
他的结论是,绝大多数调用会来自代码。
可惜整个行业都在拼命卷“跟人聊天”的体验。
他还把这套想法跟奥特曼聊过。
对方直接来了一句,这太好了,你应该去干。
而他的感觉是,可我还在上班呢。
场面有点好笑。

有人问他,如果有个研究员看到了新方向却拿不到资源,他会给什么建议。
他说自己并不看好市面上一大批新实验室。
很多实验室没有清晰目标,拿了钱漫无目的地做实验,把别人做过的再做一遍。
这样能创造价值的概率很低。
他也从不迷信头衔。
真正重要的是人本身,以及你到底在不在乎手上要解决的问题。
只想安静做研究,大厂实验室往往是更好的归宿。
但如果被真实问题驱动,有明确的原则和任务,那就放手去干。
别把自己困在“聊天模型”的思维牢笼里。
他最后说,这条路他们证明了走得通。
但这只是开始,还有大片前沿等着社区一起开拓。
话没说满。
Codex安装汉化 中转站 微信:douhanq
