8 月 12 日,xAI 推出 Grok 4.6,官方给的定位是三个方向:长时程 Agent 工作、复杂编码和视觉交互项目。相比 4.5,这版第一次在第三方评测里跟 OpenAI 旗舰站上同一台阶。

Artificial Analysis 智能指数上,4.5 是 56 分,4.6 升到 61 分,追平 GPT-5.6 Sol。榜单不一定算终审,但通用智能层面,Grok 正式进了第一梯队。开发者选型时,清单上多一个同级候选。
4.6 的补充训练周期比 4.5 更长,强化学习环节引入了三类训练环境:内核优化、Web 开发和 CAD。这三个环境的共同点是任务收不了尾,内核优化要反复调试,Web 开发牵扯多个文件,CAD 建模步骤冗长。在这种环境里练出来的能力,对得上 Agent 任务的特征,周期长,环节多,工具杂。单轮问答和连续几十步零失误,难度差着量级。
硬指标方面,上下文窗口 500K token,价格与 4.5 持平,输入 2 美元每百万 token,输出 6 美元每百万 token。首日渠道全通,Cursor 和 Grok Build 打头,xAI API 和 OpenRouter 随后开门。大窗口叠加上面的长时程优化,指向的适用面很明确:需要大量上下文、执行链条漫长的复杂任务,编程和自动化流程都在射程之内。
xAI 的打法清晰:通用能力对齐头部,Agent 场景做差异化,价格不动。三项都齐,这个模型值得放进选型清单实测一轮。长时程能力的真实成色,跑分说明不了问题,得放进实际多步骤任务里检验,建议从自己业务里最棘手的那条流程开始测。