一口气发 21 项更新:OpenAI 把智能体放进日常工作

9 月 30 日凌晨,OpenAI 开了一场开发者大会。

一口气放出 21 项产品和功能。

有智能体,有新模型,也有开发者工具和应用市场。

创始人奥特曼全程站台。

打头的是一个叫 Dot 的智能体。

它被定义成全天候的个人助理。

夜里也开着,白天也在。

它不用休息。

有自己的云端电脑。

能开浏览器,能写代码,能跑测试。

有意思的是域名。

马斯克旗下的公司抢注了 Dot.com。

现在打开这个域名,跳出来的是对家的聊天产品。

算是大会前的一点小插曲。

Dot 从今天起向付费用户开放。

它包含在原有订阅里。

对话也不占额度。

开发者大会 2026 主视觉

另一个新东西叫 ChatGPT Space。

它是一个可以多人共用的动态页面。

用户和队友都能挤进同一页。

智能体也在这页里。

想派活,在评论里 @ 一下 Dot 就行。

ChatGPT Space 界面

模型也有更新。

新模型 GPT-6.1 Sol 同时发布。

官方说它在 AI编程 和专业任务上追平了上一代旗舰。

价格却只要后者的五分之一。

模型阵容展示

配套的还有一串变化。

一个叫 Ultrafast 的高速推理模式,速度是标准版的 8 倍。

一个低延迟的接口,响应压到毫秒级。

订阅加了一档,另外一档也重新开了。

新模型发布画面

大会尾声还有个小高潮。

奥特曼请出被开发者叫作重置之神的提博。

提博当场按下重置键。

全球所有用户的额度被重新发了一遍。

场子一下就热了。

大会主视觉

另有消息说,这家公司在推迟上市之后准备再融一笔钱。

金额至少 300 亿美元。

投前估值接近 1.4 万亿美元。

如果谈成,会重新超过另一家明星公司的估值。

一、这个智能体,夜里也不下班

奥特曼给 Dot 的定位很直接。

他说这是他们一直为自己设想的那种形态。

驱动它的还是上一代旗舰模型。

但它是持续运行的那种。

会主动去看夜里的消息。

清晨把要紧的事推给用户。

顺手更新日历,筛掉噪音反馈。

把注意力还给用户。

这一句挺实在。

通过插件生态,它能连上 4000 多款应用。

在 AI对话 里能找到它。

短信里和 Slack 里也能找到它。

Teams 里同样可以。

同一件事,换哪个入口都接得上。

能力上,它能接复杂的工程项目。

盯问题报告,修缺陷,起草合并请求。

规划预算周期,也能查性能瓶颈。

每个 Dot 都有自己的云端电脑。

用户随时可以打开看它在干什么。

也可以授权它用自己的设备。

它就直接坐到工作环境里。

对很多人来说,这可能是第一个真能上手的 AI工具。

先干起来,再谈别的。

场景上,它可以当科学家。

先弄清研究问题和判断证据的方法。

拿到新数据就重跑分析,翻出意外结果。

论文里的图表也会跟着更新。

结论变了,它会改解释,并标出要人审的地方。

Dot 的插件面板

它也可以当内容助手。

先摸清作者的表达风格和受众口味。

收到访谈文字稿,它挑出适合剪的片段。

准备好节目笔记,再起草几条社交帖子。

作者改过一次,它会同步到所有材料上。

慢慢也就知道什么内容能打动人。

邮件里的协作场景

奥特曼还举了一个例子。

把一个应用从快要停用的旧接口上搬走。

这活儿过去要几个人协调,耗时很久。

Dot 能自己追依赖,找出要改的组件。

写代码,跑测试,最后交一份等着审的合并请求。

几天甚至几周的工程任务,被压进很短的时间。

企业版也一起发了。

它是由公司自己配置的虚拟队友。

能成规模地处理会计和营销这类密集工作。

公司定目标,审产出,给反馈。

反馈在全公司共享。

内部做过一次多角色测试,效果不错。

公司还在跟微软合作,把企业版塞进对方的管理工具里。

Dot 起草邮件

二、一页纸上,人和智能体一起干

奥特曼的判断是,现在几乎所有的生产力软件都不是为协作设计的。

这里说的协作,指的是人和智能体。

所以有了 ChatGPT Space。

它是一个用户和队友共用的地方。

智能体也占一个位置。

页面上能写计划,能查资料,能生成图像。

也能造数据,或者直接做一个新产品。

Space 新建页面

Dot 能直接在页面上跟人一起干。

比如请一个 Dot 盯着项目进度。

在评论里 @ 它一下,它马上接手。

页面里生成的文案

页面还能设固定指令。

比如让它盯着某个频道,每天更新发现。

页面里的内容就不会过期。

所有页面和文件放在一个像云盘的地方。

一起干活的时候,一页上能同时有多个 Dot。

后面还会上一个演示文稿功能。

团队和多个智能体能在里面同时改一份幻灯片。

演示环节里,Dot 把评审时间写进日历。

它自己分析隔夜的反馈。

还能把设计稿推过来等人审。

用语音就能问出测试进展。

顺手把整理常见问题这类活派出去。

它知道完整的工作上下文,很多活能直接做完。

在页面里 @ 它,可以把表格变成活的柱状图。

图能实时筛,也能定时刷新。

换个频道,把任务线程转给它也行。

内部有个实际案例。

工程师的 Dot 在反馈频道里自己发现缺陷。

自己调查,自己提交修复。

靠这个,每天能修掉几十个问题。

项目进度与评论

它还能指挥编程工具在笔记本上做一个应用。

做完直接装到手机上跑。

人可以全程看着,收尾也能再派给它。

三、新模型的价格,砍到前代的五分之一

除了产品,模型也换了一代。

新模型 GPT-6.1 Sol 正式发布。

奥特曼说它在某些方面比上一代旗舰还聪明。

会当开发者的日常主力。

编程能力测试

价格是这次最实在的地方。

只要上一代旗舰的五分之一。

输入每百万词元 2 美元。

输出每百万词元 10 美元。

标准输入还有 95% 的折扣。

省钱才是重点。

价格对比

在编程测试里,它的水平跟上一代旗舰相当。

但推理强度和成本都更低。

比更早那一代的最高分还高 6.4%。

复杂软件工程测试

专业问答上也赢。

各档推理设置下,它都高于带兜底机制的对手旗舰。

单任务成本不到对方一半。

专业问答测试

多步骤的工作流测试里,中等推理强度下它比对手高 2.2%。

成本只有对方三分之一。

比更早那代同设置高 4.8%。

多步骤工作流测试

要跟电脑应用打交道的任务也是一样。

OSWorld 2.0 里,最高推理强度下它比更早那代高 7%。

成本不到一半。

跟上一代旗舰的差距缩到 2.1% 以内。

单任务成本大约是后者的七分之一。

电脑操作类测试

科学研究类的测试同样如此。

最高推理强度下,它的得分是更早那代的两倍多。

成本还是不到一半。

科学工作流测试

换算成钱更直观。

最高推理强度下,它的平均单任务成本是 5.47 美元。

对手旗舰是 23.21 美元。

上一代旗舰是 23.80 美元。

数字很直白。

准确性也上来了。

超高推理强度下,它的事实错误率是 4.1%。

比更早那代的 4.5% 低。

离上一代旗舰的 4.0% 也更近。

单任务成本比后者低约 83%。

事实错误率对比

还有一个高速推理模式。

响应速度是标准版的 8 倍。

每秒能出 300 个词元。

价格是标准版的 6 倍。

三大平台都能用。

先支持上一代旗舰,后面会扩到新模型。

高速推理模式

现场有个演示。

同一个任务,开高速模式的火箭已经发射了。

常规版的火箭还在搭。

现场生成的火箭图

在自我优化的方向上,官方让模型循环着找框架里的改进点。

延迟被砍掉一半以上。

自我优化示意

更好的消息在安全上。

模型帮上一代旗舰在桌面和浏览器导航里提升了对齐度。

办法是在危险场景里训练拒答。

它因此在业界公认的电脑使用压力测试上拿到了领先水平。

安全压力测试

自主研究的能力也在涨。

今年 1 月,耗时一天以上的任务它基本都失败。

到了 7 月,靠高速推理,超过三分之一能自己做完。

全程不用人插手。

自主研究成功率

在科学贡献上,这套模型帮着解开了 100 多个悬了几十年的数学难题。

还在加速耐药菌的新药研发。

也在帮忙研究古代语言和历史。

顺便做可再生能源和能效优化。

研究场景用量增长

还有一个预览中的低延迟接口。

它让模型在零点几秒内给出结果。

几乎感觉不到等待。

原理是在一个轻量模型里放一组预设选项。

比如请求路由,或者图像分类。

再比如智能体的下一步动作。

把注意力集中到特定选择上,延迟就压得很低。

图像理解能力保留着。

多语言和安全能力也保留着。

低延迟接口演示

订阅也跟着改了。

新开一档最高的,用量是入门付费档的 25 倍。

还带高速模式的权限。

也能用在支持登录的合作应用里。

原来那档今天重新开放。

前沿模型全都能用。

新模型当日常主力。

新的订阅档位

四、开发者工具和应用市场一起补齐

开发者那部分,官方给的是一整套基础设施。

先是框架开源。

驱动编程工具和 Dot 的核心框架全部开放。

官方说它经过大量优化。

用最少的词元换来最快速度和最高准确率。

编程框架开源

然后是上云。

编程工具现在完全跑在云端。

手机上起一个任务,换到浏览器或者桌面能接着干。

进度不会丢。

笔记本合上,智能体还在云端干活。

云端运行界面

还有一款面向防守方的安全云。

它在云上持续跑。

主动找漏洞,准备好验证过的修复方案等人审。

新增了自动去重和定时扫描,界面也换了。

安全云界面

智能体接口也开了公测。

里面有托管和记忆,也有多智能体控制这些组件。

跟驱动编程工具和 Dot 的底层技术同源。

还支持操作电脑。

智能体接口调用示例

隐私这边有个预览版。

它结合了不存储内容的安全处理技术。

在不留客户内容的前提下给出前沿模型的能力。

推理阶段就做隐私保护。

隐私处理能力预览

基础设施的性能单子也不难看。

一个接口过去一年涨了 100 倍。

可靠性保持在 99% 以上。

首个词元的时间缩短 45%。

工具调用和工作流速度提升超过 30%。

接口性能提升

云厂商那边也接了。

在对方的平台上,客户可以直接搭自己的智能体。

就跟现有应用和数据放在一起。

还能用上前沿模型和编程工具。

现场还演示了新版的编程命令行。

终端界面换了新的。

并且接上了双向语音。

开发者可以用大白话跟终端聊。

不用打字就能下指令,也能确认结果。

比如把一张场地照片实时变成三维场景。

开着高速模式用语音指挥,场景能实时改。

大会现场画面

命令行里多了个智能体视图。

能直接看多个智能体的运行状态。

任务进度和输出结果也能查。

现场用语音指令做了一个抽门票的应用。

几乎是瞬间做完,还能当场用语音改。

终端安装过程

最抓眼球的环节是让上一代旗舰自己玩游戏。

它靠浏览器的操作能力,自己学会了一个太空飞行游戏。

自己选飞船,自己按键闯关。

游戏演示画面

还有一个能编程的机器人。

它集成了视觉、图像生成和语音能力。

能看着现场观众画画。

也能听懂语音指令。

这个机器人只花几个小时就通过编程工具接完了。

会画画的机器人

分发和商业化是最后一块。

先用一个登录功能开场。

用户拿聊天产品的账号登录第三方应用。

可以直接用订阅里的词元。

开发者不用先垫这笔初始成本。

登录功能的合作方

插件机制也正式放开了。

开发者能做出接近完整的应用。

原生融进聊天产品的体验里。

还能借官方渠道分发。

插件扩展机制

站点功能也增强了。

过去几个月,已经有几百万个站点用它搭起来。

现在这些站点能接插件和数据。

团队成员用自己的身份登录,带着自己的智能体进去。

看到的页面会跟着身份变。

插件发现和提交流程也顺了。

对话里就能被推荐合适的插件。

开发者也能跟踪审核状态,看到要修的问题。

插件发现页面

应用市场正式上线。

首批有 30 多家合作方。

企业可以把原来的额度拿去换第三方的产品。

开发者也能在自己的额度里消费市场里的东西。

跟另一家平台合作之后,用户从今天起还能直接拿到开源模型。

应用市场的合作方

整场大会几乎没有停顿。

从个人智能体讲到协作空间。

再从新模型讲到开发者云。

最后讲到插件生态和应用市场。

信息量给得很满。

门槛在往下走。

留在生态里的理由在变多。

开放才是关键。

对这家公司来说,影响力从模型层伸到了应用层。

再往下是分发层和交易层。

对开发者来说,选它的理由也多了一层。

这里有用户,有渠道,也有变现的可能。

工具链还在持续迭代。

AI竞争走到下半场,用户和开发者的粘性会变成关键。

这几条线能不能串起来,还得看后面几个月的落地。

别为了追新版本,把手上跑顺的流程掀掉。

宁可先把一个用透,也别同时上手五个。

不用急着换工具,再看新东西值不值得动。