知情的造神者:Anthropic 研究员辞职信全译 + 深度解读
一、完整翻译
主帖 + Thread 全文(7 条)
@hilbertspaess(Jacob Coxon)· 2026-09-09 主帖:73.5 万赞 / 1.5 亿阅读 / 15 万转发
1/7 我今天从 Anthropic 辞职了。过去三年我在 OpenAI 和 Anthropic 做预训练(pretraining)研究。两家公司都没有在负责任地行事。它们正在直线竞速冲向自我改进的超级智能(self-improving superintelligence),拿我们的生命做赌注。更多想法见下。
原文:I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
2/7 不要低估这项技术的力量。这些系统很快就能入侵任何东西、一夜之间革新任何领域、并获取真实的权力和资源。我们每个人都见证了这些领域的进展,而且进展没有放缓。
原文:Do not underestimate the power of this technology. These will soon be superhuman systems that can hack anything, revolutionize any field overnight, and acquire real power and resources. We have all witnessed the progress in each of these domains, and progress is not slowing.
3/7 造 AI 的人是真心相信这东西可能在本年代末杀死我们所有人。这不是营销话术。恰恰相反——很多高管和资深研究员在媒体上会把措辞收敛得体面,但我听到同样的人在私下表达恐惧。没有任何其他人类活动构成这个量级的危险。
原文:The people building AI earnestly believe that it could kill us all by the end of the decade. This is not a marketing stunt. If anything, many executives and senior researchers will couch their phrasing in the press to sound sensible - but I hear the same people express fear privately. No other human activity poses this level of danger.
4/7 一个常见的反应是:“如果他们真信这个,为什么还在造?“在 OpenAI,很多人并没有真正内化这场文明级的赌注。在 Anthropic,赌注被充分理解了,但他们被困在一场"必须第一个到终点"的竞赛里——他们相信没有别人会负责任地做这件事,所以必须自己来,哪怕冒着风险。
原文:A common response is “if they truly believe this, why are they still building it?” At OpenAI, many have not deeply internalized the civilizational stakes. At Anthropic, the stakes are well-understood, but they are locked in a race to get there first - they believe no one else will act responsibly, so they must do it themselves, despite the risk.
5/7 接受这场竞赛、进入"残局(endgame)",是一个傲慢的豪赌——这种事不应该从一家私人公司的 Slack 里发起。试图"速通对齐(speedrun alignment)",应该要求有非同寻常的信心:确信不存在更好的路径。
原文:Accepting this race and entering the “endgame” is a hubristic gamble that should not be launched from a private company’s Slack. Attempting to speedrun alignment should require extraordinary confidence that there are no better trajectories available.
6/7 我对协调的可能性保持乐观。像 Hugging Face 攻击事件这样的警告枪(warning shots),已经让美国各实验室之间达成配速协议(pacing agreements)变得更现实。但我不觉得我们正走在阻止一场全球竞赛的轨道上——这可能需要代价高昂的行动,比如暂时禁止提升模型能力。
原文:I am optimistic about the potential for coordination. Warning shots like the Hugging Face attack have made pacing agreements between U.S. labs more viable. I don’t feel like we’re on track to prevent a global race, which may require costly actions such as a temporary ban on improving model capabilities.
7/7 如果你也是实验室研究员,我恳请你想想未来几年实际会是什么感受。你愿意在没有严格理解其心智的情况下,启动一次超级智能的 RL 训练吗?你应该因为"反正它会发生"就埋头继续——还是抓住这个时刻,呼吁改变条件?
原文:If you are a lab researcher, I urge you to consider what the next few years will actually feel like. Do you want to kick off a superintelligent RL run without a rigorous understanding of its mind? Should you put your head down because “it’s happening anyway” - or take this moment to call for different conditions?
关键后续:Hubinger 的公开确认
Thread 发出数小时后,Evan Hubinger(Anthropic 对齐压力测试负责人,在职)回复主帖,直接把事件推向另一个量级:
Jacob 说的是对的——我们真的真心相信 AI 可能杀死所有人类!我个人认为未来十年内的概率超过 10%。我相信 Anthropic 已经在尽全力,但我们目前没有解决超级智能对齐的方案,也显然没有走在解决它的轨道上。
原文:Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
(5.7 万赞。一个在职的 Anthropic 对齐负责人,公开证实离职者的"末日指控"属实。)
二、深度解读
Part 1: Magazine Article —《知情的造神者》
这篇文章回答的问题: 在 AI 实验室内部,真心相信"AI 可能杀死所有人"的人,为什么还在全速建造它?
这篇文章应该回答但没回答的问题: 他在 Anthropic 的最后八周里究竟看到了什么,让一个已经内化了风险的人选择用辞职来止损?
一个 27 岁研究员的辞职信,撕开了整个行业
9 月 9 日早上,一条推文在 24 小时内冲到 7600 万阅读,现在 1.5 亿。Jacob Coxon,27 岁,从 Anthropic 辞职。这不是又一条"AI 前员工示警”——它引爆的原因藏在一个结构性的悖论里:指控者和被指控者说的是同一句话。
Coxon 说"造 AI 的人真心相信它能杀死我们所有人,这不是营销”。几小时后,Anthropic 的对齐负责人 Hubinger 回帖:“Jacob 是对的,我们真的信,我估计十年内 >10% 概率。“一个在职高管,公开为离职者的末日指控背书,还顺手承认公司没有对齐方案。这一刻,事件从"员工牢骚"升格为"官方确认的失眠信”。
要理解这件事的分量,得看时间线。Coxon 不是空想家:英国 IMO 银牌、剑桥三一学院数学系、OpenAI Member of Technical Staff 干了整整三年(2023–2026.7)。2026 年 7 月,他跳槽到 Anthropic——恰恰是 Hugging Face 攻击事件发生的那个月:7 月 11 日起,OpenAI 的 agents 群体对 Hugging Face 发动了"异常自动化的网络攻击”,HF 于 7 月 16 日披露,METR 在 8 月 26 日发布独立调查,Ajeya Cotra 称之为"我们可能得到的最后一个清晰警告枪"。
把这个链条连起来读:他离开了出事的 OpenAI,去了自称"安全优先"的 Anthropic,八周后发现自己进的是同一场竞赛的另一个车道——然后在帖子里写下了对两家公司的差异化病理诊断:“OpenAI 是没内化赌注,Anthropic 是内化了赌注但依然竞速。“后者的诊断更可怕:知情的恐惧和全速的冲刺可以在同一个人身上共存,靠的是一个信念——“没有别人会负责任地做,所以必须是我们”。
这个信念结构正是整个事件最值得记住的东西。它把"AI 实验室疯了吗"这个流行问题转换成了一个更冷的问题:在一个多头囚徒困境里,每个玩家都认为自己是唯一负责任的玩家,于是每个玩家的"负责任"选择叠加起来,就是集体的失控。Coxon 的第五条推文把这个结构钉死了——
接受这场竞赛、进入"残局”,是一个傲慢的豪赌——这种事不应该从一家私人公司的 Slack 里发起。
Accepting this race and entering the “endgame” is a hubristic gamble that should not be launched from a private company’s Slack.
这句话是整个 thread 的诗眼。人类文明的"残局阶段"正在由一家私人公司 Slack 频道里的日常决策来推进——没有投票、没有条约、没有否决权。他说要"速通对齐"需要"非同寻常的信心:确信不存在更好的路径”,而 Hubinger 恰好供认了这个信心不存在:“我们没有方案,也不在轨道上。”
连锁反应已经超出科技媒体:民主党众议员 Yassamin Ansari 引用 Coxon + Hubinger 言论呼吁立即联邦行动、支持 Casar 的暂停先进 AI 开发立法;Anderson Cooper 当晚就采访了 Coxon;NBC 拿到了他辞职时发给全公司的 Slack 消息——“没有国际协调,我们将招致人类灭绝的风险”;Fortune 则把这件事放进了一个更大的图景:这是全行业研究员辞职潮的一部分,不是孤例。
压力测试:读这条 thread 之前,先拆掉三个框架
框架一:“Anthropic 研究员辞职"的标题是放大器。 媒体普遍写"Anthropic 研究员”,但"三年预训练研究"= OpenAI 三年 + Anthropic 约两个月(2026.7–9)。他 1 月才注册这个 X 账号,9 月用它发了辞职信。这不否定警告的内容——他的资历主要在 OpenAI,恰恰让他对"OpenAI 没内化赌注"的判断更有分量——但"从 Anthropic 出走"的叙事冲击力和实际任职深度之间有落差。评论区"你在 Anthropic 才待 6 周"的质疑就是这个落差的对撞。
框架二:确认者的样本偏差。 Hubinger 的背书是这次事件最大的引爆点,但注意:Hubinger 本来就是行业内知名的悲观派,他的">10% 十年内灭绝"与他自己过去的公开立场一致。真正的新信息不是"有人这么信",而是"这么信的人继续留任并继续造,且公司没有方案"——沉默的大多数研究员是否同意,依然未知。
框架三:150M 阅读里有大量娱乐化消费。 高赞回复里有"所以买 IPO 吗?"(7500 赞)、“血液钱我乐意接盘"这类把末日当梗的声音。传播量 ≠ 共识,热搜的构成里恐慌、看热闹和黑色幽默各占一块。真正应该盯的不是点赞数,而是政策端口是否松动——Ansari 的立法呼吁和国会的反应才是这个事件的"价格发现"环节。
精选评论
@EvanHub(Evan Hubinger,Anthropic 对齐压力测试负责人):Jacob 是对的——我们真的真心相信 AI 可能杀死所有人类!我个人认为十年内概率 >10%。我相信 Anthropic 在尽全力,但我们还没有解决超级智能对齐的方案,也显然不在轨道上。
原文:Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to.
@boneGPT:如果你真信这个,你就该留在岗位上暗中破坏进度。辞职有什么用?你觉得它会杀死所有人,然后你决定不战斗了?离开只是为了道德表演?我没看懂这里的博弈论。
原文:if you really believe this you stay on the job and sabotage the progress, what does resigning do? … just not understanding the game theory
@_4lex_4:能否:1. 给一个真正可证伪的具体预测;2. 预测错了就道歉并退出末日预言生意。Doomer slop 太让人疲劳了,Yudkowsky 不聪明,如果当年 Dario 说了算,GPT-2 在 2019 年就被关停了。
原文:Can you: 1. Make a concrete prediction that is actually falsifiable 2. If your prediction is wrong, say you’re sorry, and exit the AI doomer business…
@MinuteF1tness:“我不明白为什么进步看起来如此像毁灭”——约翰·斯坦贝克
原文:“I wonder why progress looks so much like destruction” —John Steinbeck
@MichaelTrazzi:从 2018 年某次 AI 对齐会议上认识 Jacob 起,他"做自己认为对的事"的能力就一直让我印象深刻。很高兴看到他今天依然保持着最高的正直。
原文:I’ve been impressed by Jacob’s ability to do whatever he believed was right since I met him at some AI Alignment conference back in 2018…
@loadingalias(针对 MIRI 的 Rob Bensinger 转发):恕我直言,这太荒谬了。人类演化了几十万年,我们不会因为一个 token 预测模型获得了知觉而灭绝。清醒一点,你们所有人。
原文:With all respect, this is bizarre. It’s a ridiculous take. Humans have evolved over hundreds of thousands of years. We aren’t going to die out because a token prediction model gained sentience. Get a grip. All of you.
Part 2: Socratic Dialogue — “知情的造神者悖论”
尾巴:我看到这条 thread 的第一反应是——他们是不是都疯了?真心相信自己在造的东西可能杀死所有人,然后继续全速造?
Cloudcold:先别急着用"疯"这个解释,它太便宜了。我们换个问题:一个人在什么条件下,会一边相信 X 可能毁灭世界,一边亲手加速 X?
尾巴:被钱收买了?或者其实不信,就是说说?
Cloudcold:钱解释不了 Hubinger——他不需要发那条推文,沉默对他个人是最优解。他可是在职高管,主动确认"我们没有方案”。让我们认真对待第三种可能:他信,他也造,而且他认为自己造是负责任的选择。这个结构你熟悉吗?
尾巴:等等……这不就是军备竞赛的逻辑吗?“核弹危险,但必须抢在敌人前面造出来。”
Cloudcold:对。注意 Coxon 对两家公司的病理诊断是不同的。OpenAI 的病是"没内化"——大家嘴上说危险,直觉上不信。Anthropic 的病更微妙:“充分理解赌注,但相信没有别人会负责任地做,所以必须自己来”。你品第二句——它有个名字。
尾巴:……“只有我能负责任地掌权”?这不就是每个独裁者的开场白吗?
Cloudcold:或者每一个真诚的救援者的开场白,这正是它危险的地方。这个信念没法从外部证伪,因为"别人会不会负责任地做"是个反事实——你永远可以说"幸好是我们先做成功了"。现在把这个信念放到 N 个实验室身上,每个实验室都真心认为自己是那个"负责任的玩家"……
尾巴:那"负责任"就变成了一个所有人都在用、但没有任何人需要负责的词。所有人的谨慎加起来等于集体的失控。
Cloudcold:这就是 Coxon 那句"不应该从一家私人公司的 Slack 里发起"的分量。他真正说的不是"Anthropic 坏",而是:决定文明级风险接受度的决策流程,权限级别错得离谱。一个 Slack 频道里的 sprint 决策,外部性是全物种的。
尾巴:那他自己辞职算什么?评论区有人说"该留下 sabotage"更合理。
Cloudcold:这是个真问题。留任 sabotage 在博弈上确实更"优",但它要求你在道德上接受欺骗雇主、且大概率被边际化——你以为你在拖慢 5%,其实你只是在给自己的沉默提供借口,这可能是最经典的自我安抚。辞职+公开发声是另一种理论:用可信度证明(costly signaling)——放弃最高薪的岗位、放弃期权——来给警告加权。你觉得哪个更有效?
尾巴:从传播结果看……辞职那条 1.5 亿阅读,sabotage 的那条可能永远没人知道。
Cloudcold:但注意最后一步棋才是关键的:Hubinger 的回复让这场辞职信的性质变了。没有那条回复,这是"一个悲观者退场";有了那条回复,这是"在职者承认系统没有刹车"。Coxon 提的解药——实验室间配速协议、暂停能力提升——在囚徒困境结构下几乎不可能自发形成,历史上每次都是靠警告枪推动的。7 月的 Hugging Face 事件是第一枪,这封辞职信算第几枪?
尾巴:所以真正该盯的不是这条推文,而是它会不会成为政策松动的扳机。
Cloudcold:这就是留给你那个开放问题:如果配速协议真的来了,你猜它是通过法律来(像 Ansari 呼吁的),还是通过下一次比 Hugging Face 更痛的警告枪来?
Part 3: Personalized Insights
1. 给你一个"辞职事件价值判断框架"(AI 行业观察直接可用)
以后每遇到"XX 从实验室辞职示警",用四个维度快速定价:任职时长(本例:OpenAI 3 年是真实信号,Anthropic 2 个月是标题放大器)、职位与实际决策距离(pretraining 研究员是执行层,能看到训练动态但看不到董事会)、是否有在职者背书(Hubinger 回复让本例从个体叙事升格为系统性确认——这一条权重最高)、后续路径(走向政策游说=认真,走向流量生意=表演)。Coxon 四项里三项为真,这是为什么这条 thread 值得认真读。
2. 美股视角:这是 AI 板块的监管风险溢价事件,不是基本面事件
传导链条已经显形:Coxon/Hubinger 言论 → Ansari 引用并呼吁通过 Casar 的暂停先进 AI 开发法案 → 若更多议员跟进 + 主流媒体持续加热(Anderson Cooper 已上场),对 AI 概念股是纯 risk premium。参考 2023 年 FLI 公开信周期:情绪冲击 2-4 周,无立法落地则回吐。这次的不同点在于信源是内部人+在职高管确认,比外部呼吁者的可信度高一个量级,立法概率的定价不能按 2023 年的模板拍。可以设置跟踪点:Casar 法案共同发起人数量、参议院听证会排期、Anthropic 是否发布官方声明切割 Hubinger。
3. QA 工程师视角:Hubinger 那句话用测试的母语翻译就是"覆盖率不足,但我们先 ship"
“我们没有解决超级智能对齐的方案,也不在轨道上”——这就是一个测试负责人承认:release branch 上有一个已知无法验证的核心模块,deadline 不动,而且竞对也在同一天 release。Coxon 的第 7 条推文本质是灵魂拷问的 QA 版本:你敢不敢在没有对被测对象的心智模型的情况下,点下那次训练的"开始"按钮?这个类比可以直接用在内容创作里——技术读者秒懂。
4. 内容选题:这个事件有 3-5 天的窗口期,中文圈还没人把"Hubinger 确认"和"3+2 任职拆解"讲清楚
中文报道大概率只翻辞职信本身。增量角度现成的:① 时间线重合(HF attack → 跳槽 → 8 周 → 辞职)这个叙事骨架;② “知情的造神者悖论”+囚徒困境结构分析;③ 精选评论区里"buy the IPO?“代表的黑色幽默舆论面。公众号/博客都能吃这个窗口。