用过 Fable 5 的人大概率碰过这么个情况:拿这个AI工具查健康问题,明明只是想让它帮忙看一眼化验单上的指标,或者问问孩子发烧该注意什么,模型却突然”变笨”了——回答变得保守、敷衍,好像换了个模型。这不是错觉,Anthropic 在 8 月 7 日的公告里承认了这个问题:此前 Fable 5 的生物学安全防护拦得太宽,大量正常的健康、教育类提问被误判,系统会自动把请求转给能力更弱的 Opus 5 处理,官方管这叫”回退”(fallback)。
这次更新之后,情况明显好转。Anthropic 给出的测试数据是:各产品面上,生物学相关的回退减少了约 85%。落到具体数字,回退总量(不限于生物学原因)预计在 Claude.ai 上减少约 67%,Cowork 上约 55%,Claude Code 上约 17%,Claude Platform 上约 7%。
当初为什么拦这么狠
答案不复杂:Fable 5 在生物学上的能力已经到了不好随便放手的程度。Anthropic 的能力评估显示,这个模型在一些高度复杂的生物学任务上已经超过人类专家,对另一些任务能提供实际的操作支持。用在正道上,它能帮研究人员推进新疗法;但同样的能力交给不怀好意的人,可能是在别处找不到的”能力外挂”,比如用于生物武器的开发。
麻烦在于,生物学里有用的研究和危险的研究常常长得一模一样。开发活疫苗,就得培养你想预防的那种病原体;研发降压药卡托普利,科学家当年是从蛇毒里分离出导致血压骤降的毒性成分。恶意使用者完全可以把危险任务包装成普通研究。美国情报界的《2026 年度威胁评估》也点名了这件事:合成生物学、基因编辑的进展”可能导致新的生物威胁”,而且若干国家行为体据信仍维持着进攻性生物和化学武器计划——前沿 AI 的原始能力可能加速这些计划。
所以 Anthropic 当初的选择是:上线 Fable 5 时几乎屏蔽所有生物学查询,宁可错杀。代价就是正当用户的体验——问个症状就被降级到弱模型。官方说得很直白,另一个选项是把模型捂到防护完善再发布,但那要再等数周到数月。
这次改的不是模型,是分类器
具体机制是这样的:Fable 5 前面挡着一层安全分类器——一组小型自动化 AI 系统,负责判断请求是否涉及受防护的生物学内容。分类器一旦触发,请求就被转给 Opus 5,它生物学能力弱得多,就算被恶意利用也帮不上太多忙。用户感知到的”模型变笨”,就是这一步。
过去几周,Anthropic 重写了分类器的”章程”——也就是帮模型区分什么该拦、什么该放行的那套规则,把良性用途细致地豁免出来,改完还找了内外部专家提意见,再基于新章程更新训练数据、重新训练。验证结果是:有害和双用途研究内容照样拦,但大量正常的生物学提问不再误伤。

图里的变化很直观:发布之初分类器边界画得很靠左,连几乎肯定无害的请求都落在拦截区;这次更新把边界往右移了一截,只有真正危险和处于模糊地带的内容才会被拦下。
专业生物学研究,暂时还是用不了
要说这次更新是不是意味着 Fable 5 可以搞科研了——还早。病毒学、毒理学、分子设计这类双用途请求,依然会被回退到 Opus 5,专业生物学研究和药物开发场景依旧不支持。Anthropic 的说法是,未来通过”可信访问途径”给研究人员开一条安全、可扩展的通道,但没有给出时间表。
对普通用户来说,实际的改善是看得见的:解读化验结果、了解症状、学习生物学知识,这些日常问题不会再动不动触发降级;医疗专业人员在临床任务上也能从模型拿到更多实质帮助。误报不会完全消失——分类器里留着一段”安全边际”,低风险但拿不准的请求仍可能被拦。
说点个人看法:先严后松、拿真实误报数据换信任,这个节奏在大模型公司里算走得稳的。比起上线时只宣传”能力最强”,愿意把 85% 这个回退降幅和各产品面的具体数字一起摆出来,至少说明防护策略是被拿上台面讨论的,而不是藏在服务条款里。接下来值得盯的是那条”可信访问途径”什么时候落地——专业研究者等这条路已经很久了。