AI 写代码越来越快,这件事早就没有争议。
跟不上的是它下游的那条流水线。
大家更关心哪个 AI工具写得快,很少有人问一句,写完之后的账谁来结。
9 月 19 日,Anthropic 在自己的博客里公开了一组内部数据。
全公司八成的代码由 Claude 编写。
工程师平均每季度交付的代码量,是 2021 至 2025 年平均水平的 8 倍。

代码审查也一并被接手了。
Claude 在代码改动的审查和合并批准环节,承担了大量主力工作。
写代码不再是瓶颈,审代码也不再卡脖子。
堵点往下游走。

持续集成这条流水线,负责把每一份代码改动自动跑一遍测试。
过去半年,它的运行任务量涨了 25 倍。
被同时压上来的还有测试规模。单元测试和集成测试的用例总量,涨了 10 倍。
半年时间,两样东西一起翻了一个数量级以上。
最后被砸瘫的,就是这条流水线。

智能体写码的节奏,和人有本质区别
代码写得快,流水线为什么会直接暴毙。
根本原因在于,智能体提交代码的行为模式跟人类工程师完全不同。
传统流程里,一个人要构思,要敲键盘,还要在本地反复调试。
一天能提交的改动数量有限。人还习惯把一堆相关修改打包成一个中大型的提交。
人需要休息。
集群因此有充足的低谷期来消化积压任务。
换成 Claude 当主力之后,节奏彻底变了。
第一个变化是提交的颗粒度。改动更小,更碎,也更密。
一个小修正就是一次提交。全系统在单位时间内要触发的流水线次数,呈几何级增长。
第二个变化是全天候。
智能体不需要睡觉。白天它们配合人类的高并发提交,深夜和周末也不停地跑任务。
跑任务之外,它们还不停提代码,顺手做重构。
低谷期被彻底抹平了。

第三个变化是测试。
Claude 写完逻辑之后,会顺手补上密密麻麻的单元测试和集成测试。
整个代码库的测试规模因此涨了 10 倍。
按照老做法,每一次提交都跑全量测试,流水线早就超时卡死了。
三次补丁,一次比一次短命
Anthropic 为这套流程搭过一个服务,叫测试影响分析。
它靠两个组件运转。
监听器负责记录每次流水线的测试结果,选择器负责决定每一次提交该跑哪些测试。
这套架构在人类时代运转良好,却埋了一个致命隐患:单点写入。
为了保证测试历史严格按时序记录,系统最初被设计成单进程写入。
面对每秒倾泻而来的上千个并发任务,监听器开始严重滞后。
在智能体原生的开发节奏里,20 分钟的滞后就是灾难。
监听器只要落后 20 分钟,数万次测试状态就同步不过去。
后果是连锁的。
错误代码被合并了,其他工程师开始排查跟自己无关的报错。
偶发失败的测试阻塞了合流,新增或修复的测试又无法及时生效,回归风险一路飙升。
接下来是止血。
补丁一是换更大的机器,把核数翻倍。谁都知道这是临时的,只是没人想到它只撑了 70 天。

补丁二是分片。不再要全局的单一写入者,改成每个代码包一个独立的分片工作进程。
它撑了 29 天。

补丁三是每日重启。
到了 2026 年 3 月,这台不断打补丁的单体服务彻底崩溃。
每个工作日刚过午后,进程就会撞上内存上限。
与其继续加机器,不如承认这套架构已经到顶。
团队排查了半天,只找到 4 个微小缺陷。他们试着替换两种运行时的内存分配器来优化垃圾回收,全部无效。
由于单点服务承受着超高负载,团队不敢冒着全线停摆的风险给它做生产环境内存分析。

无奈之下,工程师启用了绝招:每日定时自动重启。
在每秒几十倍的并发倾泻下,这套古老的重启大法连一天都没撑过去。
每日重启还带来了严重的任务数据丢包。
监听器经常连续落后 1 小时以上。选择器只能拿着陈旧数据瞎猜,全公司的流水线大面积亮红灯。

推倒重来:剥离内存状态
被逼到绝境的工程师,最终听了 Claude 几个月前的建议。
把整个服务炸掉,彻底重写。
宁可停机重来一次,也别再靠补丁续命。
新架构的刀法很干脆,直接剥离单体内存状态,转向分布式无状态设计。
落地的动作分三步。
先引入内存数据存储,再让写入变成异步的轻量汇聚,最后把选择器拆成秒级只读。
效果立竿见影。
上线切换并完成调优之后,结果很直接。
此前每周都在攀升的未处理事件队列,动辄堆积数十万。现在它被拉成了一条贴地的水平直线。
这件事的意义,不只是一次扩容
Anthropic 这次复盘的真正价值,在于它验证了一个更根本的判断。
AI编程带来的冲击,已经从程序员会不会失业,走到了整套软件工程体系会不会过载。
一个过去不起眼的单实例服务,完全可能成为整个团队排队等待的地方。
所以 AI编程的竞争正在往下延伸。代码生成能力只是上半场,工程体系的承载能力才是下半场。
谁能让测试及时反馈,谁能让结果可靠流转。做到这两点的人,才更有可能把新增代码变成可交付的软件。
代码可以一夜暴增。
交付能力得跟上。
