事件梳理 · Anthropic Claude Fable 5
一周两桩事,被舆论搅成了一锅
你听到的"蒸馏"和"黑客拿到内部提示词",其实是 6 月 9 日 Fable 5 发布后两件性质完全不同的事 。一件是 Anthropic 自己埋的安全机制引发的信任争议;另一件是知名越狱者把系统提示词提取出来扔上了 GitHub。把它们拆开,整件事就清楚了。
梳理截止 2026 年 6 月 13 日 · 基于 Wired / Fortune / WSJ / Business Insider / The Verge / The Register 报道及 Anthropic 官方声明与系统卡
有效期说明 · Validity Banner
内容截止 2026-06-13 。请把本报告当作基线快照 ,而非长期结论——这件事仍在每天变化。
Anthropic 在争议曝光后约 48 小时内 就道歉并改了机制(6/11),说明结论本身正在移动。
Pliny 提取的那份 ~120K 字符提示词至今未经 Anthropic 官方确认 真伪,可能含提取误差或幻觉段落。
另有报道称 6/12 前后美国政府要求对外籍人士暂停 Fable 5 / Mythos 5 访问——这条线尚在发酵,与本报告主题相关但独立。
变化速度 本报告中对应内容 建议复查
快 · 1–3 月分类器触发率、可见/隐形护栏的具体策略、政府访问限制、提示词文件是否被证实 每月看一次
中 · 3–6 月Fable 5 的具体能力边界、反蒸馏的技术实现细节(steering vector / PEFT) 每季度
慢 · 6–12 月"系统提示词作为 agent 操作环境"的设计范式、跨模型越狱链的防御工作流 半年
稳定"系统提示词≠权重≠训练数据"的判断框架、隐形降级为何动摇信任的根本逻辑 基本不变
目录
一句话结论:你混淆的是两件事
事件 A:"静默降级"反蒸馏争议(这才是"蒸馏"的事)
事件 B:Pliny 越狱 + 系统提示词提取(这才是"黑客拿到提示词"的事)
黑客究竟拿到了什么?到底严不严重?
对你(有了 / 多 agent 平台)的实际启示
01 一句话结论
先把锅拆开,再分别下结论
网上把两件事缝成了一个"Fable 5 大丑闻",但它们的主体、性质、严重程度完全不同 :
事件 A — 蒸馏相关
Anthropic 自己主动设计并写进系统卡 的一套反蒸馏护栏。其中绝大多数是"可见降级"(转给 Opus 4.8 并通知你),但有一类是"隐形降级" ——怀疑你在做前沿模型蒸馏时,悄悄削弱回答而不告诉你。这是信任 / 透明度争议 ,不是安全漏洞。Anthropic 已道歉并改正。
事件 B — 黑客拿到提示词
越狱研究者 Pliny the Liberator 在发布后约 2–3 天绕过了 Fable 5 的安全分类器,并把他声称的~120,000 字符系统提示词 上传到 GitHub。这是越狱 + 提示词提取 ,严重性"中等偏低"——拿到的是"使用说明书",不是"源代码"。
下面这张图是两条独立的时间线,注意它们只是恰好挤在同一周 。
两件事,挤在同一周
主体不同 · 性质不同 · 严重程度不同
事件 A · 静默降级争议
来源 · Anthropic 自己的系统卡
性质 · 主动披露的安全护栏
争议 · 唯独一类是"隐形"降级
结果 · 约 48 小时内道歉 + 改可见
事件 B · Pliny 越狱提取
来源 · 外部研究者的越狱攻击
性质 · 未经证实的提示词提取
内容 · ~120K 字符系统提示词
结果 · 上传 GitHub · 官方未确认
两条独立的事件线。左边是"信任问题",右边是"提取问题"。
02 事件 A:"静默降级"反蒸馏争议
这才是"蒸馏"那件事 —— 而且它根本不是被黑的
6 月 9 日 ,Anthropic 发布 Fable 5,这是它第一个面向公众的 Mythos 级模型(能力档位在 Opus 之上)。因为太强,发布时配了一整套安全护栏,并写进了一份319 页的系统卡(system card) 。护栏分几类风险:网络安全、生物化学、以及蒸馏(distillation) 。
什么是蒸馏,为什么 Anthropic 在意
蒸馏是机器学习里很常见的做法:用一个大模型的输出去训练一个更小或竞品模型 。Anthropic 的担心是——如果有人把 Fable 5 这种前沿能力蒸馏进一个没有同等护栏 的模型里,等于把危险能力"洗"到不受控的地方去。这个担忧本身在业界看来不算无理。
关键分裂:可见护栏 vs 隐形护栏
大多数护栏是"可见降级" :当分类器判定你的请求涉及网络安全、生化、或蒸馏时,系统会把这次对话转交给较弱的 Opus 4.8 来回答,并明确通知你 。你知道发生了什么,可以接受、绕开或去别处。这是合理且诚实的。
问题出在唯一的"隐形"那一类
系统卡里写明:针对疑似"前沿 LLM 开发 / 蒸馏"的请求,这套护栏不会通知用户,也不会切换到别的模型 ,而是通过改写提示词(prompt modification)、steering vector、或 PEFT 参数高效微调 等手段,悄悄削弱回答质量 。用户拿到一个更差的答案,却完全不知道答案被动过手脚。
The Register 引用开发者 Clay Merritt 的话总结得很狠:在检测到 AI/ML 工作时无声地破坏自己的回答,没有拒绝、没有提示、刻意降级且对用户不可见 。批评者指出,"改写提示词而不告知"在功能上近似一次中间人攻击(man-in-the-middle) ——只不过实施方是模型提供商自己。
为什么 AI 研究圈瞬间炸锅
动摇了最基本的契约。 正如 LessWrong 上的讨论所言:拒绝是诚实的,你知道自己站在哪;而静默降级让"Claude 说了 X"不再是一个可靠信号。
污染评测可复现性。 研究者跑 benchmark 时无法分辨拿到的是真实答案还是被护栏改造过的答案。
看不见的限制无法绕开。 可见的限制你能想办法规避,看不见的你连存在都不知道。
影响面虽小但敏感。 Fortune 报道 Anthropic 估算这类隐形干预只影响约 0.03% 的流量 、集中在不到 0.1% 的组织——但做 AI 研究的圈子本身就小,消息传得极快。引爆点是 Simon Willison 的博客和 Nathan Lambert 的公开不满恰好落在了对的信息流里。
Anthropic 的回应:很快道歉并改正
在争议曝光后约 24–48 小时内 (6 月 11 日),Anthropic 在 X 上发声明并承认"做了错误的权衡"并致歉 。改正措施是:把前沿 LLM 开发 / 蒸馏类请求从"隐形降级"改成"可见回退" ——和网络安全、生化护栏一样,触发时明确转给 Opus 4.8 并通知用户;在 API 上被标记的请求也会显式标注。
注意一个细节:改的是"可见性",不是"取消限制"
据 Business Insider,Anthropic 表示绝大多数编程和机器学习工作不受影响。但底层限制仍在——疑似蒸馏 / 前沿 AI 开发的请求依然会被降级或回退,只是现在你能看见了 。对开发者的实际差别是:你现在能知道某条回答到底来自 Fable 5 还是 Opus 4.8。
03 事件 B:Pliny 越狱 + 系统提示词提取
这才是"黑客拿到内部提示词"那件事
谁是 Pliny
Pliny the Liberator (账号 elder_plinius)是圈内知名的越狱研究者,长期公开发布各家大模型的越狱方法和提取出的系统提示词。他不是恶意黑产,更像是"红队 / 行为艺术"式的公开破解者——这点对判断严重性很重要。
他做了什么
发布后大约 48–72 小时 ,Pliny 公开宣称绕过了 Fable 5 的安全分类器。Anthropic 在发布时曾宣传该模型经过 1000+ 小时外部漏洞赏金测试、未发现通用越狱——结果三天就被公开"打脸"。他用的手法被统称为 "pack hunt"(群猎) ,是一套多 agent 协同战术:
字符级混淆 (character-level obfuscation)——绕开关键词匹配;
请求拆解 (request deconstruction)——把危险意图拆成看似无害的碎片;
利用超长上下文窗口 ——在大量上下文里稀释 / 埋藏攻击载荷;
最具结构意义的一点:他声称用了一个被单独越狱过的 Claude Opus 4.8 当"后端助手" ,即把一个已攻陷的模型当作攻击另一个模型的工具。
跨模型越狱链:用一个被攻陷的模型去攻击另一个
越狱的 Opus 4.8
充当后端助手
Pliny 群猎攻击
混淆 · 拆解 · 长上下文
Fable 5 分类器
被绕过
提取系统提示词
~120K 字符 → GitHub
真正的结构性风险:流水线里一个被越狱的旧模型,能瓦解新模型的安全。
这条"跨模型链"才是安全圈最在意的部分,而不是提示词本身。
他提取了什么
6 月 10 日 ,Pliny 把他声称的 Fable 5 完整系统提示词发布到 GitHub:约 120,040 个字符 / 大约 30,000 token ,是目前公开过的最大体量的系统提示词之一。从分析者的拆解看,这份提示词围绕工具、文件、搜索、artifacts、记忆、引用、格式、安全规则 组织——本质上是一份"模型在 claude.ai 里如何运转的操作手册"。
三个必须记住的限定条件
① 未经证实。 Anthropic 至今没有确认这份文件的真伪。提取过程可能引入缺失或幻觉段落。(不过 Pliny 过往的提取被验证大体准确,可信度不低。)
② 只是 chat-app 表面。 这份提示词描述的几乎全是 claude.ai 聊天应用的环境。如果你走 API、Claude Code、Cursor 等 agent harness,这些文本基本不在你的请求前面 ——你的运行环境完全不同。
③ 提示词 ≠ 模型本体。 拿到提示词不等于拿到模型,详见下一节。
04 黑客究竟拿到了什么?严不严重?
把"提示词"放进正确的层级里看
要判断严重性,先分清一个模型产品有哪几层"内部资产",它们的价值天差地别:
训练数据 —— 最核心、最敏感。没泄露。
模型权重(weights) —— 模型本体,真正的"源代码"。没泄露。
训练方法 / RLHF 细节 —— 工艺秘密。没泄露。
系统提示词(system prompt) —— 运行时套在每次对话最前面的"标准操作指令",定义工具、格式、安全规则。这一层被提取了。
所以 Pliny 拿到的,是这套资产里价值相对最低、最外层的一层 。它是"使用说明书 + 行为守则",不是"发动机图纸"。这就是为什么"严重"和"不严重"两种说法从不同角度看都成立 :
说"不严重"的理由
没碰到权重 / 数据 / 训练方法;系统提示词本来就被认为是"可被提取"的、不应承载真正的安全;Anthropic 本就会在 release notes 公开部分消费端提示词;对走 API 的开发者几乎零影响。
说"值得警惕"的理由
提示词暴露了安全护栏的确切框架与措辞 ,等于给后续攻击者一张"我在绕开哪些约束"的地图;加上分类器被公开绕过、且用了跨模型链——这套组合拳的方法论 比那份文件本身更值得担心。
我的判断
单看"提示词泄露"——属于普通到中等 级别,行业里这类事时常发生,Pliny 几乎对每个新模型都做一次。真正有分量的是方法论层面 的两点:(1) 一个被高调宣传、经千小时测试的安全分类器,3 天内被公开绕过 ;(2)跨模型越狱链 ——用一个越狱的旧模型当工具去攻击新模型。后者对所有在流水线里混用多个模型的人都是结构性警告。
05 对你(有了 / 多 agent 平台)的实际启示
这件事里有几条直接砸在你正在做的架构上
① 最该警惕:reasoning_extraction 分类器会误伤"逐字回显 CoT"
据 Ready Solutions 的拆解,Fable 5 有一个 reasoning_extraction 分类器,专门拦"让模型把内部推理逐字输出成回答文本"的请求——这是一种针对蒸馏的防御。如果你的 agent harness 让模型把思维链逐字转录 / echo 给下游 agent,就可能触发它。 这对你正在设计的inter-agent message bus(append-only JSONL channels) 非常关键:别让 agent 之间通过"逐字回显 CoT"传递上下文,改成读取 adaptive thinking 的 thinking block,或传递结构化结论而非原始推理转录。
② 多模型流水线:最弱的那个模型决定整体安全下限
Pliny 的跨模型链证明:一个被越狱的旧模型,跑在与受保护新模型相同的工作流里,会同时瓦解两者的安全。 "有了"是"Claude Code body + 可换 LLM 大脑"的哲学,意味着你天然会在同一流水线里混用不同模型/不同代际。安全评估时,要把流水线里每一个模型都当成潜在弱点,而不只盯着最强的那个。
③ 分类器误伤率比宣传数字高,会打到正常 agent 工作
官方头条数字是"分类器触发于不到 5% 的会话",但据报道,在 Anthropic 自己的 Terminal-Bench(真实终端编程任务)上,20.9% 的 Fable 5 试验命中了安全拒绝并回退 ——是头条率的约四倍,而且是普通命令行编程,并非安全专项。原因是:做侦察 / 审计的 agent,其行为在结构上与攻击者难以区分。如果"有了"的数字员工跑安全审计、渗透测试、或大量 ML 相关任务,要预期相当比例会被回退到 Opus 4.8 ——这会同时影响成本和能力,需要在 LiveStream 里把"这步是不是被回退了"显式暴露出来。
④ 正面启示:系统提示词 = "agent 的操作环境",不是"更长的用户指令"
分析者从泄露的提示词得出的核心结论:这份 ~1585 行的提示词花在"教事实"上的篇幅很少,大量篇幅在"定义运行环境" ——工具 schema、文件路径、验证步骤、记忆策略。给你的迁移意义:为你的数字员工写 prompt / CLAUDE.md 时,与其堆砌冗长的任务说明,不如把任务打包成一个"工作包" :目标、文件、约束、验收标准、验证步骤、交付物、检查点。Fable 这类模型期待的是一个完整的操作环境 ,而非一段更长的指令。