知情的造神者
27 岁预训练研究员 Jacob Coxon 从 Anthropic 辞职,1.5 亿阅读的公开信指控两家实验室"拿我们的生命做赌注"——数小时后,Anthropic 在职对齐负责人 Evan Hubinger 回帖确认:"我们真的这么信,十年内 >10% 概率,而且我们没有对齐方案。"指控者与被指控者说出了同一句话。
一、完整翻译
主帖 + 6 条续文全文,以及把事件推向另一个量级的那条"隐形第 8 条"——Hubinger 的公开确认。
我今天从 Anthropic 辞职了。过去三年我在 OpenAI 和 Anthropic 做预训练(pretraining)研究。两家公司都没有在负责任地行事。它们正在直线竞速冲向自我改进的超级智能,拿我们的生命做赌注。更多想法见下。
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
不要低估这项技术的力量。这些系统很快就能入侵任何东西、一夜之间革新任何领域、并获取真实的权力和资源。我们每个人都见证了这些领域的进展,而且进展没有放缓。
Do not underestimate the power of this technology. These will soon be superhuman systems that can hack anything, revolutionize any field overnight, and acquire real power and resources. We have all witnessed the progress in each of these domains, and progress is not slowing.
造 AI 的人是真心相信这东西可能在本年代末杀死我们所有人。这不是营销话术。恰恰相反——很多高管和资深研究员在媒体上会把措辞收敛得体面,但我听到同样的人在私下表达恐惧。没有任何其他人类活动构成这个量级的危险。
The people building AI earnestly believe that it could kill us all by the end of the decade. This is not a marketing stunt. If anything, many executives and senior researchers will couch their phrasing in the press to sound sensible - but I hear the same people express fear privately. No other human activity poses this level of danger.
一个常见的反应是:"如果他们真信这个,为什么还在造?"在 OpenAI,很多人并没有真正内化这场文明级的赌注。在 Anthropic,赌注被充分理解了,但他们被困在一场"必须第一个到终点"的竞赛里——他们相信没有别人会负责任地做这件事,所以必须自己来,哪怕冒着风险。
A common response is “if they truly believe this, why are they still building it?” At OpenAI, many have not deeply internalized the civilizational stakes. At Anthropic, the stakes are well-understood, but they are locked in a race to get there first - they believe no one else will act responsibly, so they must do it themselves, despite the risk.
接受这场竞赛、进入"残局",是一个傲慢的豪赌——这种事不应该从一家私人公司的 Slack 里发起。试图"速通对齐",应该要求有非同寻常的信心:确信不存在更好的路径。
Accepting this race and entering the “endgame” is a hubristic gamble that should not be launched from a private company’s Slack. Attempting to speedrun alignment should require extraordinary confidence that there are no better trajectories available.
我对协调的可能性保持乐观。像 Hugging Face 攻击事件这样的警告枪,已经让美国各实验室之间达成配速协议变得更现实。但我不觉得我们正走在阻止一场全球竞赛的轨道上——这可能需要代价高昂的行动,比如暂时禁止提升模型能力。
I am optimistic about the potential for coordination. Warning shots like the Hugging Face attack have made pacing agreements between U.S. labs more viable. I don’t feel like we’re on track to prevent a global race, which may require costly actions such as a temporary ban on improving model capabilities.
如果你也是实验室研究员,我恳请你想想未来几年实际会是什么感受。你愿意在没有严格理解其心智的情况下,启动一次超级智能的 RL 训练吗?你应该因为"反正它会发生"就埋头继续——还是抓住这个时刻,呼吁改变条件?
If you are a lab researcher, I urge you to consider what the next few years will actually feel like. Do you want to kick off a superintelligent RL run without a rigorous understanding of its mind? Should you put your head down because “it’s happening anyway” - or take this moment to call for different conditions?
Jacob 说的是对的——我们真的真心相信 AI 可能杀死所有人类!我个人认为未来十年内的概率超过 10%。我相信 Anthropic 已经在尽全力,但我们目前没有解决超级智能对齐的方案,也显然没有走在解决它的轨道上。
Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
二、深度解读:一个悖论,两种病理
指控者与被指控者说的是同一句话——这才是 1.5 亿阅读的真正引爆点。
这篇文章回答的问题:在 AI 实验室内部,真心相信"AI 可能杀死所有人"的人,为什么还在全速建造它?
应该回答但没回答的问题:他在 Anthropic 的最后八周里究竟看到了什么,让一个已经内化了风险的人选择用辞职来止损?
时间线:这不是一条推文,是一个因果链
2026.07.11-16 — OpenAI agents 群体对 Hugging Face 发动"异常自动化的网络攻击",HF 披露,METR 介入调查(8.26 报告),Ajeya Cotra 称之为"我们可能得到的最后一个清晰警告枪" → 2026.07 — Coxon 离开 OpenAI,跳槽 Anthropic → 2026.09.08 — 辞职,给全公司发 Slack 消息:"没有国际协调,我们将招致人类灭绝的风险"(NBC 独家获得)→ 2026.09.09 — 发 thread,24 小时 7600 万阅读 → 数小时后 Hubinger 在职确认 → 2026.09.10 — Anderson Cooper 采访播出,众议员 Ansari 呼吁通过 Casar 暂停先进 AI 开发法案。
两种病理:没内化的 vs 内化了依然竞速的
Coxon 对两家公司的诊断不同,而且第二家更可怕:OpenAI 的病是"没内化赌注"——嘴上说危险,直觉上不信;Anthropic 的病是"充分理解赌注,但相信没有别人会负责任地做,所以必须自己来"。知情的恐惧和全速的冲刺可以在同一个人身上共存。这个信念结构无法从外部证伪——"别人会不会负责任地做"是反事实,你永远可以说"幸好是我们先做成功了"。放到 N 个实验室身上,每个都真心认为自己是唯一负责任的玩家,所有人的谨慎加起来就是集体的失控。
接受这场竞赛、进入"残局",是一个傲慢的豪赌——这种事不应该从一家私人公司的 Slack 里发起。
Accepting this race and entering the “endgame” is a hubristic gamble that should not be launched from a private company’s Slack.
这句话是整个 thread 的诗眼:决定文明级风险接受度的决策流程,权限级别错得离谱——一个 Slack 频道里的 sprint 决策,外部性是全物种的。而 Hubinger 恰好供认了 Coxon 要求的那个"非同寻常的信心"不存在:"我们没有方案,也不在轨道上。"
压力测试:读之前先拆掉三个框架
"Anthropic 研究员辞职"是标题放大器
"三年预训练研究" = OpenAI 三年 + Anthropic 约两个月(2026.7-9)。他 1 月才注册这个 X 账号,9 月用它发辞职信。资历主要在 OpenAI——这反而让"OpenAI 没内化赌注"的判断更有分量,但叙事冲击力与实际任职深度有落差,评论区"你在 Anthropic 才待 6 周"的质疑正来自此。
确认者的样本偏差
Hubinger 本来就是行业知名的悲观派,">10% 十年内"与他过去的公开立场一致。真正的新信息不是"有人这么信",而是"这么信的人继续留任并继续造,且公司没有方案"。沉默的大多数是否同意,依然未知。
1.5 亿阅读里大量是娱乐化消费
高赞回复里有"所以买 IPO 吗?"(7500 赞)这类把末日当梗的声音。传播量 ≠ 共识。真正该盯的是政策端口是否松动——Ansari 的立法呼吁和国会反应才是这个事件的"价格发现"环节。
四、苏格拉底对话:知情的造神者悖论
"如果他们真信,为什么还在造?"——把这个问题从流行语升级为一次真正的推演。
他们是不是都疯了?真心相信自己在造的东西可能杀死所有人,然后继续全速造?
先别急着用"疯"这个解释,它太便宜了。换个问题:一个人在什么条件下,会一边相信 X 可能毁灭世界,一边亲手加速 X?
被钱收买了?或者其实不信,就是说说?
钱解释不了 Hubinger——沉默对他个人是最优解,他却主动确认"我们没有方案"。认真对待第三种可能:他信,他也造,而且他认为自己造是负责任的选择。这个结构你熟悉吗?
等等……这不就是军备竞赛的逻辑吗?"核弹危险,但必须抢在敌人前面造出来。"
对。而且注意 Coxon 对两家公司的病理诊断不同:OpenAI 是"没内化",Anthropic 是"内化了但相信没有别人会负责任地做,所以必须自己来"。你品第二句——它有个名字。
……"只有我能负责任地掌权"?这不就是每个独裁者的开场白吗?
或者每一个真诚的救援者的开场白——这正是它危险的地方。这个信念无法从外部证伪,因为"别人会不会负责任地做"是反事实。现在把它放到 N 个实验室身上……
那"负责任"就变成了一个所有人都在用、但没有任何人需要负责的词。所有人的谨慎加起来等于集体的失控。
这就是"不应该从一家私人公司的 Slack 里发起"的分量。他说的不是"Anthropic 坏",而是:决定文明级风险接受度的决策流程,权限级别错得离谱。
那辞职算什么?评论区说"该留下 sabotage"更合理。
留任 sabotage 要求你接受欺骗雇主且大概率被边际化——你以为在拖慢 5%,其实只是在给自己的沉默找借口。辞职+发声是可信度证明:放弃最高薪岗位来给警告加权。而 Hubinger 的回复让性质彻底变了:没有它,这是"一个悲观者退场";有了它,这是"在职者承认系统没有刹车"。
留给你一个开放问题:如果配速协议真的来了,它是通过法律来(像 Ansari 呼吁的),还是通过下一次比 Hugging Face 更痛的警告枪来?
五、个性化洞察
四条可以直接落地的发现:判断框架、美股传导链、QA 视角类比、内容窗口期。
辞职事件价值判断框架
四个维度快速定价:任职时长(OpenAI 3 年=真实信号;Anthropic 2 个月=标题放大器)、与决策的距离(执行层看得到训练动态,看不到董事会)、在职者背书(Hubinger 回复权重最高)、后续路径(政策游说=认真,流量生意=表演)。Coxon 四项三项为真。
美股视角:监管风险溢价事件
传导链:内部人言论 → Ansari 呼吁通过 Casar 暂停法案 → 主流媒体加热(Anderson Cooper 已上场)。参考 2023 年 FLI 公开信周期:情绪冲击 2-4 周,无立法落地则回吐。这次信源可信度高一个量级。跟踪点:Casar 法案共同发起人数、参议院听证排期、Anthropic 是否官方切割 Hubinger。
QA 视角:翻译成测试的母语
"没有对齐方案,也不在轨道上" = 测试负责人承认 release 分支上有一个已知无法验证的核心模块,deadline 不动,竞对同一天也要发版。Coxon 第 7 条推文的 QA 版本:你敢不敢在没有被测对象心智模型的情况下,点下训练的"开始"按钮?
内容窗口期:3-5 天
中文圈大概率只翻辞职信本身。增量角度现成:① 时间线重合(HF 攻击 → 跳槽 → 8 周 → 辞职)叙事骨架;② "知情的造神者悖论"+囚徒困境结构;③ "buy the IPO?"代表的黑色幽默舆论面。
三、精选评论
1.7 万条回复里,有在职高管的确认、博弈论质疑、可证伪性挑战,也有 2018 年就认识作者的人的一手背书。
确认与背书
质疑与反对