云知声发布了 U2-Flash,一款主打「智能密度」的模型。它的后训练闭环里,模型已经开始深度参与自身演进,从生成训练数据、分析执行轨迹,到巡检和修复训练系统,这些环节都交了出来。按行业惯例,Flash 这个后缀一般默认是旗舰平替,更快更便宜,能力相应打折。U2-Flash 的答卷不太一样。

先看速度和成本。相比上一代 U2,U2-Flash 的生成速度提升 2.1 倍,Agent 任务完成时间缩短 35%,任务迭代步数和 Token 消耗降低 20% 到 30%。能力这边没打折,反而把上一代甩在了身后,DeepSWE v1.1 从 U2 的 32 分冲到 64.6 分,直接翻倍。TerminalBench 3.0 从 2.7 分飙到 24.3 分,是原来的九倍。SWE-Bench Pro 拿下 61.6 分,比前代高 10.5 分。
支撑这些成绩的是稀疏 MoE 架构。U2-Flash 总参数约 266B,单次推理只激活约 10B,不到总参数的 4%,但在代码和 Agent 任务上的表现已经能和主力模型正面掰手腕,部分成绩甚至闯进万亿参数级模型的区间。所谓「Flash 不可能三角」,也就是更快、更省、能力不缩水,在这款模型上被掀掉了。
三场实测,它自己找 Bug 也自己救场
接口层面,云知声 MaaS 平台上 U2-Flash 已经摆在首页,支持在线体验和申请 API 调用。API 同时兼容 OpenAI 和 Anthropic 两套主流协议,Claude Code、Trae、Cursor、Cline 这些常用工具都有官方接入方式,其他 Harness 只要支持自定义模型,换一下 Base URL、API Key 和模型 ID 就能接。模型还提供 none、low、high、max 四档思考强度,可以按任务难度在速度和推理深度之间切换。
价格方面,输入 0.6 元每百万 Tokens,输出 1.2 元每百万 Tokens,缓存命中 0.12 元每百万 Tokens,当前限时六折。另外从 9 月 15 日到 9 月 30 日,人人都能免费领取 1 亿 Tokens 使用额度。
真正能说明问题的是三场实测。第一场考主动发现问题,测试者虚构了一个全新的报销统计项目 ExpenseFlow,仓库不大、现有测试全部通过,表面看着一片祥和,但统计和日期处理链路里被悄悄埋了三个坑。一笔已经被驳回的报销能混进已报销总额,一笔北京时间 8 月 1 日凌晨提交的记录存成 UTC 时间后被塞回了 7 月,CSV 导出环节日期还会跟着串月。没给任何线索,只丢下一句「请独立完成发布前验收,自己找问题、改代码、补测试」,U2-Flash 用了 7 分 6 秒准确揪出全部问题,还附了一份验收报告。
第二场考撞墙之后能不能自己回来。这次的 ProfileSync 2.0 是个同步用户资料的项目,代码本该从新版 API 读取用户姓名,实际同步结果一片空白。更要命的是项目里的资料互相打架,README 给了错误的启动命令,旧文档写着过期字段,历史日志把问题甩给网络,模型得自己判断哪份资料可信。开局没多久第一堵墙就来了,README 让它运行 python app.py,项目里根本没有这个文件,但它没在错误指令上打转,只用 3 分 32 秒锁定真正故障并完成修复,还把测试从 1 项补到 7 项,最终全部通过。
第三场考 512K 长上下文。测试者模拟一场真实的产品发布,把 14 份文件、四种格式一股脑塞进去,里面有 Brief、采访、产品白皮书,也有 Release Notes、数据表、客户案例、会议纪要、合规说明和行业报告,核心信息散落在不同文件里,还混着大量无关内容。要求是交付一份完整 DOCX,包含 1200 到 1500 字发布稿、核心事实来源表、材料冲突清单以及五个发布前待确认问题。U2-Flash 用时 8 分 36 秒完成。抽查两个最容易翻车的细节,它没有沿用旧 Brief 里的 10 月 8 日,准确采用了最新版的 10 月 18 日,也没有误用旧版 81.2% 的成绩,更新为 78.4% 并注明属于内部测试。
后训练闭环的三个关键
一个单次只激活约 10B 参数的模型,凭什么把能力推到这一步。云知声给出的答案有两个,一是数据,二是后训练闭环。数据部分靠的是深耕行业十余年积累的真实场景数据和标注能力,这构成了后训练的数据质量壁垒。
后训练闭环里有三个关键。第一个是自主任务生成,解决「练什么」。固定题库迟早被刷穿,U2-Flash 会根据当前能力动态生成新任务,专门挑那些现在还做不好但已经接近突破的问题,模型每进步一截,题目就跟着升级。这套闭环目前已经自主构建出近 10 万道高质量 SWE 任务,覆盖多种主流编程语言。
第二个是异步 Agent RL,解决长任务「怎么练」。Agent 训练特别耗时间,一个任务可能要连续调用几十次工具,中间还得等代码运行和环境反馈。传统同步训练里只要有一条任务没跑完,其他环节就得跟着等。U2-Flash 把任务拆给多个 Worker,让它们同时进入不同沙盒执行,有人跑代码,有人调工具,有人尝试另一条路径,后方的策略更新持续进行。系统还会给关键 Action 做标记,把最终的成功或失败追溯到真正决定结果的那一步。相比同步训练,这套异步架构让单位时间内产出的有效训练轨迹数量提升约 60%。
第三个是多教师在线策略蒸馏,解决训练结果「怎么判」。多领域训练最怕按下葫芦浮起瓢,代码能力上去了,数学和指令跟随又掉下来。云知声先分别训练数学、代码、Agent 等专项教师模型,再让学生模型自己生成轨迹,由不同教师逐 Token 打分,模型在哪一步走对、从哪里开始跑偏都能拿到更细的反馈。这套方法让 U2-Flash 达到同等能力所需的训练步数减少约 55%。
闭环还延伸到了训练系统本身。U2-Flash 可以参与机器巡检、故障定位、修复和任务重启,官方数据显示训练故障的平均恢复时间已经缩短到人工介入模式的三分之一左右。参数不必每次全部上场,但被激活的每一步都尽量用在刀刃上,这就是它所说的高智能密度。
国产 RSI 的第一步
现在的 AI 圈多少有点「万物皆可 RSI」的意思,模型会反思叫 RSI,能生成训练数据也叫 RSI。这个概念本身并不新鲜。1965 年统计学家 I.J. Good 就设想过一种智能爆炸,一台足够聪明的机器可以设计出比自己更聪明的机器,后者再继续设计下一代。1993 年 Vernor Vinge 又把这套想象推向技术奇点,很长一段时间里它听起来更像科幻小说的剧情。
到了工程层面,OpenAI 和 Anthropic 给出的尺子并不一样。Anthropic 的口径相当严格,AI 只有能自主设计并开发出比自己更强的后继系统,才算实现完整的递归自我改进。OpenAI 划定的观察范围更宽,只要模型能够加速 AI 研究、推动自身能力提升,就已经属于 AI Self-Improvement,但到了 Critical 级别标准同样收紧,要求模型能完成全自动 AI 研发,或者持续把一代模型的升级周期压缩到原来的五分之一。两家的核心指向越来越清楚,真正的分水岭在于一次改进能否沉淀下来、进入下一轮,再推动新的改进。
国内刚好冒出一篇论文综述《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》,来自上海交大、清华、上海 AI Lab 等机构的研究者按模型接管自我改进闭环的程度,画了一张 L1 到 L5 的路线图。按这套分级,U2-Flash 已经显露出明显的 L3 特征,它仍运行在人工设定的沙盒、规则和授权边界内,却开始参与决定下一版自己该学什么。
还有一个经常被忽略的现实问题,对国内模型来说能否适配国产算力,直接关系到这套自我迭代体系能不能稳定、可控地长期运行。越往 L3 之后走,模型越需要反复生成数据、执行任务、接受训练和重新验证,循环跑得越快,对算力、推理框架和集群调度的要求就越高。U2-Flash 已经围绕主流国产算力平台,对模型架构、核心算子、推理框架和集群调度做了适配优化,官方说法是在国产平台上的吞吐、时延、并发和集群扩展效率持续提升,部分场景已经接近 NVIDIA GPU 方案。
「最后一个由人类造出的 AI」还没出现,但第一批参与打造下一版自己的国产模型已经上场了。对国内开发者来说,这类模型最直接的价值是压低日常调用成本,想在 AI编程 场景里换模型的,可以先把 API 兼容性和上下文长度看一遍再决定,偏办公类的用法可以参考 AI办公软件 的整理。
