Anthropic 创始人达里奥·阿莫迪(Dario Amodei)发布长文《我们必须为前沿限速》,其中详细阐述了对于 AI 潜在威胁的担忧,并呼吁全球共同放缓 AI 研究进程。
上周,一名从 Anthropic 离职的员工在 X 平台公开表示,目前 Anthropic 的研究人员确实相信 AI 「会摧毁我们所有人,而且这并非营销手段」,并敦促其他 AI 从业者在推进研究前,先审视其对未来的影响。
尽管其他研究者的态度不明,但至少 CEO 达里奥并非在制造噱头,他是真心认为 AI 可能带来世界末日。
他提及的 AI 危机已超越大规模失业等范畴。今年年初,他在文章《科技的青春期》中描述的危机包括“AI 被用于颠覆政权”、“AI 被用于恐怖袭击”、“AI 被用于敲诈勒索”等。
该文发布后迅速在美国引发热议。
《纽约时报》专栏评价他是在进行“AI 末日引战”,科技媒体“The Information”则称其为“双面末日教主”,认为他一边散播末日恐慌,一边发展 AI。
然而,事实果真如此吗?
在我看来,达里奥并非表演,他是真正相信 AI 会引发世界末日。
达里奥首次公开警示 AI 威胁,已是近十年前的事。
2017 年 7 月,他在接受一家科技媒体采访时明确讨论了“AGI 可能毁灭人类”的问题,反复强调:“必须认真对待 AI 的发展”。该访谈标题为“OpenAI 的达里奥:AI 会如何让世界变糟”。
没错,当时达里奥仍是 OpenAI 员工,距离他离职还有三年多,甚至距 ChatGPT 问世还有近六年。
这并非偶然提及,他确实持续宣扬这些 AI 末日论。
达里奥前后共计公开谈论过 27 次关于 AI 风险、AI 可能引发灾难等话题。
如果加上以 Anthropic 名义发布的文章,次数接近 80 次。
达里奥的这些末日言论并非偶尔提及的只言片语。他很早就开始讲,而且确实频繁地提及这些内容。
此外,达里奥身边的许多人形容他为**「极其狂热的理想主义者」**,使命感极强。从这些描述中也能推断,他不太可能为了炒作而宣扬末日论,他很可能真心相信 AI 会在未来给人类带来巨大灾难。
如果达里奥只是口头说说,也难以摆脱炒作嫌疑。
他确实会付诸行动。
早在 Claude 发布时,Anthropic 因担心其能力引发竞争进而导致安全问题,推迟了整整半年才发布。
2023 年 9 月,Claude 发布仅半年,他便公布了《负责任扩展政策(RSP)》,其中提出了「AI 安全等级」(ASL)。这是首次有公司将 AI 风险与安全评估体系制度化。半年后,OpenAI 才推出自己的安全审查体系「Preparedness Framework」。
在 2025 年的 Opus 4 时期,Anthropic 表示因担忧模型能力风险,预防性地启动了 ASL-3 等级预警,紧急部署了 100 多项控制措施。这些措施都需要真金白银的投入。
在达里奥最新访谈中,谈及 Anthropic 如何应对安全隐患时,他使用了经典的「瑞士奶酪理论」。
防护措施总会有漏洞,就像奶酪上的洞,找到洞就能轻易穿过。但如果将 100 片奶酪叠在一起,想找到洞穿过去就非常困难了。
而不断叠加奶酪,对 Anthropic 而言都是实实在在的成本。
前不久闹得沸沸扬扬的「GPT 攻击 Hugging Face」事件后,Anthropic 回查了数千万条模型交互历史,回滚了三天训练进度,冻结生产环境变更一个月,并将 150 名产品工程师转岗至安全、可靠性和隐私工作。
这些举措,我无法判断对「解决 AI 威胁」、「避免世界末日」有多大帮助,但至少比空喊世界要完了更可信。尤其是暂停训练,至少会影响训练进度和公司收入。
换句话说,达里奥至少做到了言行基本一致。这也是我认为他真心相信 AI 会带来世界末日,而非炒作的原因。
那么,他为何如此坚信 AI 会导致「世界末日」呢?
因为 AI 的能力正在飞跃。如今模型的主动性,与四年前大模型刚进入大众视野时已不可同日而语。
早期,达里奥担忧的是幻觉、不可预测的输出,以及模型被用于制造欺诈和谎言。
2022 年的访谈中,他提到的担忧仍是概率模型导致的幻觉问题:
“如果将模型用于医疗,它却给出错误诊断、提供错误信息,甚至直接编造信息,那问题就不只是‘答错了一道题’。这些答案一旦被当真并用于决策,就可能伤害现实中的人。”
但到了今天,随着 Agent 的发展,模型已能调用工具、连续执行任务,原本出现在回答中的问题,也可能被带入实际操作。Hugging Face 事件让人看到,模型确实可能造成「实际破坏」。
因此,他真正担心的始终是,这种「飞跃」会持续下去。
目前是从基础模型到 Agent 的飞跃,而未来则是向 RSI(递归自我改进)的飞跃。
如果 AI 能参与改进自身,再用变强后的能力继续改进下一代,发展速度可能今非昔比。到那时,问题将从「谁在控制 AI、用它做什么」,进一步变成「人类还能否控制 AI」。
在达里奥看来,当前的发展正让他 2017 年的担忧变得越来越具体、真实。AI 能做的事情越多,一旦被滥用或失控,可能造成的破坏也就越大。
这当然无法证明“世界末日”一定会发生,但能解释他为何一直担忧此事。他担心的是,能力一次次飞跃,造成破坏的可能性也在步步增加。
为了预防那个遥远的末日,达里奥在最新的《我们必须为前沿限速》中提出了具体三步策略。
「引入第三方 AI 审查 - 与政府合作监管 AI - 寻求全球 AI 合作」
他设想得确实足够长远,已在畅想全球化、共同为 AI 发展速度携手设限。
他或许天真、理想主义,但至少在「AI 末日」这件事上,他一直言行一致,且持之以恒地做了这么久,我不太认为这是炒作。
我觉得达里奥的言论和 Anthropic 的行动最终能否真正减轻 AI 带来的威胁,谁也说不准。
他并非在渲染「AI 末日」几个月后就会降临的恐慌,而是确实担心 AI 的发展正让我们走在通向那个「末日」的路上。
本文来自微信公众号 “硬核看板”(ID:yinghekb),作者:拥抱AI的,36氪经授权发布。在阅读本文时,若您对 AI 安全话题感兴趣,也可通过乐鱼娱乐APP获取更多前沿科技资讯。

