GPT-6 发布,OpenAI 首次承认模型达到 AGI 水平:一文看懂它有多强

OpenAI 正式发布了 GPT-6,消息出来以后我把前后能翻的资料都过了一遍,挑最要紧的几条讲:这次不是挤牙膏式的小版本,官方头一回公开承认模型到了 AGI 的水平,推理测试从 7.8 分直接跳到 99.9 分,它还能自己盯着屏幕操控电脑干活,速度是人类的 4 倍。

官方这次把话说得很直白

GPT-6 是全新一代预训练模型,跟 GPT-5.5、GPT-5.6 那种小步迭代不是一回事,发布会上的措辞也不含糊,直接承认它达到了通用人工智能也就是 AGI 的水平,编程电脑操控数学科研这些老牌榜单,它全部超过了此前的模型。

AGI 通用人工智能推理

最能说明问题的是 ARC-AGI 通用推理测试。这个测试满分 100 分,公认的难考,上一代 GPT-5.6 只拿到 7.8 分,GPT-6 一口气考到 99.9 分,我特意核了一下,这个分数基本等于满分,直接把顶给封了。

演示里的几个画面

榜单数字是纸面实力,真要看它行不行,我还是更信演示画面,挑几个有冲击力的讲。

Astra 长时间自主任务

操控电脑这块,速度是真的不讲道理。一场金融建模挑战里,GPT-6 全程只用眼睛看屏幕,自己动鼠标敲键盘,把参赛的人类冠军远远甩开,用时只有对方的四分之一,全程没让任何人搭手。

长工期它也不怵。演示里 Astra 一口气干了 7 天,用虚幻引擎把整个曼哈顿搭了出来,放大到每条街道每家店铺都有细节,还能先在 Blender 里建模,再把模型搬进虚幻引擎让人直接走进去看,搞设计的人应该懂这有多省事。

做 3D 游戏基本是手拿把攥的事。演示中途博主想跳一下,空格连按,角色嗖地窜上了天,这个小插曲反倒给演示添了乐子,评论区不少人拿这个玩梗。

办公桌上的活它照样接得住。丢一张表格照片进去,能还回一份能编辑的 Excel,做个 PPT 出手就是专业水准,财务税务这类表单、预约查询这种操作,交代一句就有人跑腿,后台忙活的是一队 agent。

价格翻了一截,短板也明摆着

价格是绕不开的坎,我看完发布的第一反应就是先翻价目表,GPT-6 的官方定价是 GPT-5.6 的 2.5 倍,单看标价涨得挺猛,不过 token 效率也跟着上来了,同一个任务实际跑下来,账单经常比用 5.6 还低,我算了下这笔账,省不省还真要看任务类型。

短板我也留意过。提前用上的开发者说,前端审美和 3D 建模这类偏创作的活,它还是压不过 Claude 5.1,写文章风格也学得慢,成品偶尔带一股 AI 味,这些只能等后续版本慢慢补。

离超级智能,还差两块拼图

业内聊 GPT-6 之后的路,说法出奇一致,真正的超级智能还差两块拼图,短期都补不上。头一块是自我改进,模型得学会从自己跑过的任务里长本事,不能每次进步都等工程师调参数喂新数据。再就是世界模型,杨立昆、李飞飞盯了很久的方向,让 AI 不光懂文字和代码,还得懂重力碰撞时间这些物理常识,能感知会决策,这两块多半要交给 GPT-7 和 GPT-8 来填。

视频最后博主也算了笔账,一个人带几十个 agent,干的是过去几百人公司才接得下的活,这话放在两年前,听着跟段子似的。