9月初,OpenAI正式发布新一代旗舰模型GPT-6 Astra。总裁Greg Brockman在媒体吹风会上撂下一句狠话:如果几年后回头问AGI什么时候诞生的,答案大概就是这段时间,甚至可能就是这款模型。翻译过来就是——OpenAI自己认为,AGI来了。
跟Astra一起出现的还有它的价签:标准模式每百万输入token收10美元、输出50美元,输入超过27.2万token后价格还会翻倍。这个单价是GPT-5.6 Sol促销价的2.5倍,和Anthropic刚发的Fable 5.1持平。贵,是真的贵。

跑分没横扫一切,但”会用电脑”是质的差别
看纸面数据,Astra更像一个偏科生。研究级数学FrontierMath Tier 4拿了97.6%,科学知识GPQA Diamond是96%,长程软件工程DeepSWE做到74.1%,漏洞利用测试ExploitBench直接满分。但在第三方Artificial Analysis的通用智能测试里,Astra max的61分和5.6 Sol持平,还低于Fable 5.1的66分——所谓”独一档的智能”,这次并没有出现。
它真正恐怖的地方在另一个维度:自己操作电脑。官方口径里,Astra不用等软件厂商为AI开发接口,也不需要一堆MCP配置,它直接看屏幕、点鼠标、敲键盘,用人类几十年来积累的图形界面干活。在衡量电脑操作能力的OSWorld 2.0上,Astra拿到72.6%,比Sol高出约7个百分点;平均完成一项任务只要40分钟,Sol要75分钟。用它找猫咪寄养服务,人类平均半小时,它5分27秒搞定;帮人找工作,从约5小时缩短到2分51秒。内测开发者甚至让它一次性生成了能玩的原版级Minecraft demo和完整网页游戏。
贵有贵的道理:token省到对手的三分之一
Astra省token省得离谱。同样干coding的活,它用的token只有5.6 Sol max的三分之一、Opus 5 high的五分之一。OpenAI估算,Astra最高配置完成一项DeepSWE任务的API成本反而比Sol低约57%。幻觉率也降了,第三方测出Astra max约51%,Sol是92%。一句话:单价翻倍,但活儿干得快、试错少,综合下来不一定更花钱。
安全方面OpenAI也打了预防针。Astra拒答恶意网络请求的比例是91.5%,远超Sol的59%;但它最强的网络攻击能力被定级为”Critical”,最高级版本只向网络防御机构开放。更强的”失对齐监控”意味着:偶尔,一个看起来正常的长时间任务可能被系统中途暂停,让你先审查再继续。
Astra目前先向小部分可信企业开放,ChatGPT各级会员和API会在未来几天陆续收到权限。它到底配不配”AGI”这顶帽子,第三方测试已经泼了冷水;但让AI直接接管人类软件世界的这条路线,这次是真的走通了。