Codex 三十万字系统提示词被扒开,内部规矩全露了

一个做编程助手的模型,被人翻了个底朝天。

泄露的不是代码。

是它背后那份内部说明书。

长度将近三十万个字符。

前一阵子,另一家的旗舰模型刚出过同样的事。

这回轮到了 OpenAI。

爆料的人常年盯着各家模型的提示词。

他把文件传进了公开仓库。

语气还特别轻松。

慢慢看。

拆开之前先记住一件事。

这不是漏洞。

这是一份写给人看的文档。

爆料者晒出泄露消息的帖子截图

被扒出来的是 Codex 的桌面版。

文件名直接用了它自己的名字。

正文一千九百多行。

里面装着指令模板,临时指令文件,还有内部协作的规矩。

这类东西过去锁在服务端。

现在整份摆在所有人面前。

有人形容,这相当于把饮料配方公开了。

一份系统提示词,决定了模型怎么说话,怎么做事,什么时候停手。

对一款 AI工具 来说,这份文件等于它的行动准则。

它更像一份写给新员工的员工手册。

那位爆料者也没想到会这么热闹。

他在帖子里写,一共提取出二十九万多个字符。

顺手把仓库地址也贴了出来。

底下很快分成两拨人。

拆台的说,这东西本来就藏在客户端里,算不上多高深的技术活。

惊叹的那拨只关心一件事。

里面究竟写了什么。

因为这份文件恰好是一份现成的教材。

一、先说那股腔调

平时用聊天机器人,最烦的是什么。

大概是那股浓得化不开的腔调。

动不动就总结一下,动不动就深入探讨。

有意思的是,写这份文件的人也受不了这套。

写作那一节被单独拎了出来,写得很重。

因为官方很清楚,用户最先感觉到的就是腔调。

原话点了一批要避开的词。

“底线是”,“重要性”,“视角”,“深入”,“培养”,“利用”,“值得注意的是”。

文件管它们叫废话词。

不管中文还是英文,一律不许用。

这批词在中英文里都太常见。

一不留神就会用上。

所以文件干脆把它们列成一张黑名单。

泄露文件里写作风格一节的截图

接着还有三条具体要求。

要求它不要强行热情。

兴趣和个性可以自然流露,但不要恭维,也不要强颜欢笑。

要求它不要拿废话凑字数。

说清楚想干什么就行,不用交代自己不会做什么。

要求它像同事那样说话。

用熟悉的词,把步骤讲完整,别指望用户自己脑补。

这三条要求看着普通。

落到写代码上就是省时间。

少寒暄,多干活。

它不用猜用户喜欢什么写法。

仓库里那份文件开头的截图

光看这几条,就知道这份文件有多实在。

它不是喊口号。

它是把一份能落地的工作要求,拆成了一条一条。

接下来更让人意外的,是权力那部分。

二、它被允许自己往下做

文件用了很长的篇幅讲自主。

原话说得很直白。

用户很讨厌你停下来问要不要确认。

一旦手上的证据够支撑下一步,就该继续做,而不是回头找人对齐。

还说,不要为了省时间,省精力,就交一份勉强能用的东西。

任务需要接着干,就把该做的做完。

这句话的分量很重。

因为绝大多数助手到了关键一步都会停下来。

它被要求自己建隔离的工作区。

自己解决版本冲突。

自己开一份草稿,等人签字。

只有遇到不可逆的操作才会停手。

比如改密码,比如转账。

除此之外,它得一路推到底。

反过来说,它也被明确禁止做一些事。

比如在没有授权的时候改别人的东西。

比如把没验证过的结果说成已经完成。

文件还留了一个细节,防止它闷头干活把人晾着。

只要调用了工具,每六十秒得回一句状态。

哪怕只有一句话。

这就像一个靠谱的资深工程师。

接到活,转身去写。

遇到小问题自己处理。

中间偶尔冒一句正在看日志。

最后把结果端过来。

权限给到这个程度,工具自然也不能差。

文件里最硬的部分就是工具链。

第一条关于搜索。

用的还是那几家通用的命令。

但文件直接写死了一个偏好。

优先用最快的那个搜索命令,它比老牌的方案快得多。

只有实在没办法,才退回到下一档。

第二条关于并行。

如果几个子任务互不相干,就不许一个一个来。

要一次性丢出去,同时跑。

第三条最让人眼馋。

文件里出现了一个叫技能清单的东西。

遇到没做过的活儿,模型可以去指定目录翻这份清单。

翻到什么就学什么。

这相当于给模型挂了一排能随时更换的书。

第四条,它还能动电脑。

文件里专门有一节,讲它怎么操作浏览器和界面。

它可以自己开网页,点按钮,填表单,甚至截图。

为了防止它闯祸,文件把确认权限分成了四种。

一种是从头到尾都由人来接管。

一种是每次动作都要先问一句。

一种是事先划好范围,范围之内不用再问。

最松的一种,是让它自己判断。

从紧到松,刚好覆盖了大部分场景。

松到什么程度,取决于任务有多危险。

这套设计比一句请谨慎操作有用得多。

四种确认权限的对照表截图

三、记忆和审查都写好了

确认权限只是一层。

文件还替它想好了记性不够的问题。

写代码的人都知道,上下文一满,脑子就断片。

这份文件给了一套换班的办法。

词元预算快用完的时候,它得先写一份笔记。

笔记里要有目标,有决定,有进度,还有学到的东西,以及下一步。

然后它才去开一个新的上下文。

这像不像人交班之前写的那份交接稿。

写完之后,新来的那位直接接着干。

笔记这件事听着普通。

可它是长任务能不能跑完的关键。

没有它,任务一长就得从头再来一遍。

写这份文件的人显然吃过记性不好的亏。

所以它把交接当成了硬规定。

不是建议,是必须。

还有一个更微妙的设计。

它可以在后台常驻。

系统会定期推来一个隐藏的心跳信号。

被叫醒之后,它去检查那些后台任务。

心跳那一段规定了模型什么时候可以开口。

安静是默认状态。

开口需要有理由。

没事就不打扰人。

出了岔子才弹出来通知。

这样既不会烦人,也不会漏事。

这已经不像一个问答工具了。

它更像一个随时待命的同事。

做 AI编程 的人看到这一段,大概会羡慕。

再往后翻,是最实用的一节。

文件把代码审查的方法也写进去了。

先给问题分级。

最要紧的那档,要立刻放下手里的事去修。

其次是下个周期内必须解决。

再次是正常,有空再处理。

代码审查分级制度表截图

分级之外,还有几条铁律。

不重要的风格问题可以放过。

每一条建议都得说清为什么是问题。

建议不要写太长。

一次别贴超过三行代码。

替换要给得精确,连缩进都不能差。

语气要客观,不许拍马屁。

这几条看着像规矩,其实是经验。

每一条背后都对应一类返工。

风格上的争论,往往一整天都吵不完。

一句含糊的建议,改完还是不对。

把话说具体,比说好听重要。

这一节甚至可以单独拿出来用。

放进公司内部的审查流程里也不违和。

再往后,是外网评论区的众生相。

有人被震撼到语无伦次。

有人觉得这事被包装过头了。

一位网友说,这文件本来就在客户端里,谈不上泄露。

另一位更不客气。

他说,这活儿跑个抓包工具就能干。

任何人都能从几家大模型那里把提示词抠出来。

没必要搞得像挖出了古代卷轴。

这些话刺耳,但有道理。

技术含量确实不高。

可是对普通开发者来说,这份材料仍然值钱。

因为它把顶尖团队的做法摊开了。

一份系统提示词背后,是无数次失败换来的经验。

哪些话该说,哪些话不该说。

什么该自己决定,什么必须问人。

这些判断没法从论文里抄。

只能靠一次次翻车攒出来。

也有人担心,这类文件越写越长,模型会不会被规矩压住。

从这份文件看,答案是不会。

规矩越多,它反而越像人。

四、吵得比写的人还热闹

看到这里,会发现一个变化。

过去大家以为提示词是一门玄学。

加一句深呼吸,加一句做不好就扣钱,模型就聪明了。

这份文件把这种想法推翻了。

真正好用的助手,靠的不是几句巧话。

靠的是一整套系统工程。

它是模块化的,能按需加载。

它有记忆管理的办法。

它有执行的策略,也有兜底的规则。

它还有一层层的权限设计。

模型正在从一台聪明的问答机器,变成一套能自己运转的系统。

而这份文件,刚好是那套系统的一张剖面图。

至于泄密这件事本身。

对厂商来说,大概不太好受。

对手册的用户来说,倒是一份白捡的教材。

有意思的还有一点。

这类文件以后只会越写越长。

因为让模型听话这件事,本来就没有捷径。

得一条一条写清楚。

哪些地方可以让它自己走,哪些地方必须拉住它。

哪些话它永远不能说,哪些动作它必须问。

这些问题没有标准答案。

只能一边用一边补。

还有人盯着厂商的下一步。

文件既然漏了,规则大概率会重写。

下一次再被扒出来,可能就不是这一版了。

但这套思路会留下来。

因为它解决的问题,每个做助手的人都躲不开。

让模型少说废话,多做实事。

让它知道什么时候停,什么时候往前冲。

让它记得住,也说得清。

三十万字里没有一句玄学。

全是具体的交代。

这可能才是这份文件最让人服气的地方。

Codex安装汉化 中转站 微信:douhanq