English

Effective altruism is this century’s biggest idea

A reading note on how effective altruism helped shape AI safety, research priorities, talent, and funding.

  • English
  • Reading
  • Effective Altruism
  • AI Safety
  • Philosophy

如果你问:

今天推动 AI 发展的主要力量是谁?

大多数人会想到:

OpenAI。

Anthropic。

Google DeepMind。

英伟达。

还有一群机器学习研究员和工程师。

这些答案当然都对。

但 AI 最近十几年的发展,还有一条很容易被忽略的暗线。

这条线最初甚至和计算机没有太大关系。

它起源于牛津大学的一群哲学家。

他们最早讨论的问题非常朴素:

如果我真的想帮助别人,我的钱到底应该花在哪里?

然后问题一点一点变大。

钱应该怎么捐?

职业应该怎么选?

我们应该优先解决什么问题?

未来还没有出生的人算不算?

如果一种技术有极小概率毁灭人类,我们应该投入多少资源提前阻止它?

最后,他们撞上了人工智能。

最近一期《经济学人》甚至用了一个非常大胆的标题:

Effective altruism is this century’s biggest idea

有效利他主义,可能是本世纪最重要的思想之一。

这句话当然很有争议。

但有一件事已经很难否认。

过去十几年,一套最初讨论慈善效率的哲学思想,确实进入了 AI 研究、人才流动、慈善资金和技术政策的核心地带。

这条路是怎么走出来的?


故事从牛津的一次谈话开始

2009 年。

牛津。

哲学研究者 Toby Ord 正在思考一个问题。

如果一个人真的相信贫困和疾病造成的痛苦很严重,那他为什么只是在课堂里讨论伦理学?

为什么不真的做点什么?

Ord 最终做了一个非常激进的决定。

他承诺长期捐出自己收入中的很大一部分。

但他又遇到了第二个问题。

钱捐给谁?

同样是 1000 英镑。

捐给不同项目,效果可能相差几十倍,甚至几百倍。

于是,一个新的想法出现了:

做好事,也应该计算投入产出比。

Ord 后来与另一名牛津哲学家 William MacAskill 一起创建了 Giving What We Can。

这个组织鼓励人们把一部分收入捐给经过严格评估、能够产生较大实际效果的项目。

Giving What We Can 于 2009 年启动。

随后,MacAskill 等人在 2011 年又创办了 80,000 Hours。

名字来自一个很有意思的估算:

一个人的职业生涯,大约有 8 万小时。

既然捐款应该追求效果最大化,那么人生最宝贵的 8 万小时,是不是也应该仔细选择?

这个问题非常关键。

因为有效利他主义从这里开始发生第一次升级。

最开始的问题是:

钱怎么捐最有效?

后来变成:

一个人的人生怎样才能产生最大的正面影响?


Effective Altruism 到底是什么?

Effective Altruism,简称 EA。

通常翻译成:

有效利他主义。

它的核心思想其实非常容易理解。

如果你希望帮助世界,可以同时考虑三个问题。

第一:

问题有多大?

第二:

这个问题有没有办法解决?

第三:

现在有多少人在解决?

假设有两个公益项目。

A 项目投入 10 万元,可以帮助 10 个人。

B 项目投入 10 万元,可以帮助 1000 个人。

如果其他条件差不多,EA 会倾向 B。

听起来非常冷冰冰。

但它背后有一个很强烈的道德直觉:

如果资源有限,我们应该尽可能让这些资源产生更多实际效果。

这套思想受到功利主义、循证医学、发展经济学以及 Peter Singer 等哲学家的影响。

2011 年左右,牛津这群人开始寻找一个统一名称。

最后选中了:

Effective Altruism。

Centre for Effective Altruism 随后成立。

一个原本很小的哲学圈子,开始逐渐变成一个国际性社区。


然后,他们问了一个非常危险的问题

假设现在有两个问题。

一个问题会影响今天的 100 万人。

另一个问题只有 1% 的概率发生。

但如果发生,可能让整个人类文明终结。

我们应该优先处理哪一个?

这类问题把 EA 带向了第二次巨大转变。

Existential Risk。

中文通常叫:

生存性风险。

意思是:

一种可能导致人类灭绝,或者永久破坏人类未来发展潜力的风险。

例如:

全球核战争。

极端生物武器。

失控的人工智能。

某些全球性灾难。

这里还有一层更深的哲学问题。

今天地球上有 80 多亿人。

但如果人类文明继续存在几千年、几万年甚至更长时间,未来可能存在的人类数量会远远超过今天。

那么:

未来的人有没有道德价值?

如果有,那么避免人类灭绝的价值会变得非常大。

于是又出现一个关键词。

Longtermism

长期主义。

它主张:

未来世代的利益也应该进入今天的道德判断。

MacAskill 后来把这个思想写进了《What We Owe the Future》。

Toby Ord 则在《The Precipice》中系统讨论人类面临的生存性风险。

牛津的 Future of Humanity Institute,以及 Nick Bostrom 等研究者,也长期研究超级智能和文明级风险。

MacAskill 自己对长期主义的概括非常直接:

我们不应该因为一个人生活在未来,就降低其道德重要性。

到这里,问题已经从:

“怎样捐款更有效”

走到了:

“怎样避免整个人类失去未来”。

人工智能开始进入视野。


为什么最后偏偏是 AI?

从 EA 的逻辑看,AI 有一个非常特殊的位置。

假设先进 AI 最终只是一个更好用的软件。

问题不大。

但假设未来出现一种能力远超过人类、能够自主行动、设计技术、控制资源的人工智能。

哪怕只有很低概率出现严重失控,后果都可能非常大。

这恰好符合 EA 常用的分析方式。

可以简单写成:

影响规模
    ↑
    │
先进 AI 风险
    │
发生概率具有不确定性
    │
但潜在后果极大

如果一种风险:

影响巨大。

研究人员很少。

又存在降低风险的方法。

那么按照 EA 的逻辑,它就值得投入资源。

这也是为什么 AI Safety,也就是 AI 安全,逐渐成为这套思想体系中的核心议题之一。

今天的 80,000 Hours 已经明确把先进 AI 带来的挑战列为其认为“人类目前最紧迫的问题”。它估计,真正专门研究这些关键风险的人仍然只有数千名。

注意这里的变化。

2009 年,他们还在讨论:

哪个慈善项目救的人更多?

十几年以后,同一套推理开始讨论:

一个超级智能系统如果失控,会发生什么?


真正产生影响的地方,是他们开始把“理念”变成“人和钱”

很多哲学思想最后都停留在书里。

EA 比较特殊的地方,是它非常强调行动。

如果认为某个问题重要,那么下一步就会问:

谁来研究?

谁来工作?

谁来出钱?

80,000 Hours 长期给年轻人提供职业建议。

如果他们认为某个领域影响特别大,就会鼓励人才进入这个领域。

结果形成了一条很有力量的链条:

哲学判断
   ↓
问题排序
   ↓
职业建议
   ↓
人才进入
   ↓
资金支持
   ↓
研究机构
   ↓
形成新的研究领域

这可能就是 EA 对 AI 最重要的影响方式。

它影响了:

哪些问题值得研究。

哪些职业值得选择。

哪些项目值得融资。

哪些风险值得提前考虑。


钱随后开始进入 AI 安全

EA 生态中逐渐形成了一批慈善基金和资助组织。

其中一个典型例子是 Open Philanthropy。

它长期资助:

AI Alignment。

AI Governance。

可解释性。

灾难性风险研究。

人才培养。

例如 2025 年,Open Philanthropy 向 MATS Research 提供了约 232 万美元资金,用于 AI alignment、interpretability 和 governance 相关研究项目。

EA Funds 现在甚至有一个专门的:

Transformative AI Fund。

它的目标写得非常直接:

资助降低先进 AI 导致全球灾难风险的项目。

这个基金会向研究人员、新机构和早期项目提供资金。

也就是说:

二十年前,AI 生存风险还是一个极其边缘的话题。

今天已经出现:

研究机构。

专项基金。

职业路径。

政策研究机构。

学术项目。

技术团队。

这种变化很难完全归因于 EA。

但 EA 确实帮助建立了其中相当一部分基础设施。


然后,这套思想进入了硅谷

这里需要非常谨慎。

经常有人把故事讲成:

一群 EA 创办了 OpenAI 和 Anthropic。

这种说法过度简化。

现代 AI Safety 有很多不同来源。

其中有一条重要路线来自旧金山湾区的理性主义社区。

LessWrong。

Eliezer Yudkowsky。

Machine Intelligence Research Institute。

还有大量机器学习研究人员。

EA 与这群人的社区后来产生了很大的交集。

有效利他主义自己的历史资料也明确承认,EA 的形成来自多个社区,包括牛津、GiveWell,以及湾区理性主义圈。

所以更准确的关系是:

牛津哲学
   │
   ├─ Effective Altruism
   │
   └─ Longtermism
          │
          ↓
     生存性风险
          │
          ↓
        AI Safety
          ↑
          │
湾区理性主义社区
          │
          ↓
   AI Alignment 研究

两条路线逐渐汇合。

随后进入:

研究机构。

慈善基金。

大学。

政策圈。

以及一些顶级 AI 公司。


Anthropic 是一个特别有意思的例子

Anthropic 今天已经成为全球最重要的 AI 公司之一。

Claude 就来自这里。

这家公司成立时就把 AI 安全摆在非常核心的位置。

2022 年,Anthropic 完成 5.8 亿美元 B 轮融资。

官方公告当时直接写明,这些资金将用于研究:

可控性。

可解释性。

鲁棒性。

以及大型 AI 系统的安全问题。

这轮融资又和 EA 圈产生了一个非常著名的交叉点。

Sam Bankman-Fried 及其相关资金曾参与 Anthropic 的早期融资。

当时 Bankman-Fried 是 EA 圈最知名的捐助者之一。

不过这里同样需要划清边界。

Anthropic 创始人 Dario Amodei 和 Daniela Amodei 并没有简单把自己定义成 EA 成员。

近期报道也指出,他们与 EA 的关系比外界经常描述的更复杂。

但 Anthropic 对:

长期风险。

AI 失控。

Alignment。

灾难性风险。

这些问题的重视,与 EA 和长期主义社区长期讨论的问题存在明显重叠。

所以影响往往并不表现为:

“某个人属于某个组织”。

更常见的方式是:

大家开始使用同一套问题框架。


最厉害的影响其实是改变了一个词:Safety

如果回到十几年前。

谈 AI Safety,很多人想到的是:

系统别崩。

数据别泄露。

自动驾驶别撞人。

算法别歧视。

这些当然仍然非常重要。

但今天 AI Safety 这个词下面,又出现了一整套新的问题:

Alignment。

模型欺骗。

自主复制。

生物武器辅助。

网络攻击能力。

失控。

超级智能。

人类能不能继续控制比自己聪明的系统。

这种变化本身就是一种思想影响。

一个原本非常边缘的问题:

AI 会不会最终威胁人类?

慢慢变成了:

AI 公司内部研究议题。

政府监管议题。

国际峰会议题。

大学研究方向。

慈善投资方向。

到了 2026 年,EA 相关组织依然在持续资助 AI Safety 和 AI Policy 项目。

无论你是否同意他们的风险判断,这种“议程设置能力”已经相当惊人。


但故事到了这里,也开始出现严重的问题

如果一套思想一直问:

怎样产生最大的总体收益?

那么很容易出现另一个危险问题:

那些无法量化的东西怎么办?

假设:

帮助今天的一万人。

和降低未来人类灭绝概率 0.0001%。

哪个价值更大?

数学模型可能给出一个答案。

现实世界却很难验证其中的概率。

当未来人口被计算进来以后,这种问题更加极端。

假设未来可能存在数万亿人。

那么任何微小的灭绝风险,都可能在数学期望值里变成一个巨大的数字。

这也是长期主义遭到批评最多的地方之一。

批评者担心:

对遥远未来的巨大数字过度重视,可能压低今天真实存在的贫困、疾病、不平等和社会问题的重要性。

这场争论直到今天都没有结束。


然后 FTX 爆炸了

2022 年。

FTX 崩溃。

Sam Bankman-Fried 从全球最知名的年轻亿万富翁之一,变成一场巨大金融丑闻的核心人物。

这件事给 EA 带来了严重打击。

因为 Bankman-Fried 多年来一直公开宣称自己信奉 Effective Altruism。

他曾经和 William MacAskill 接触。

EA 社区也长期把他视为“earning to give”的代表人物。

所谓 earning to give:

先进入高收入行业。

赚很多钱。

然后把这些钱用于更重要的问题。

FTX 崩溃以后,这套模式遭遇了一个无法回避的问题:

如果赚钱的过程本身造成巨大伤害,那么最后再说“我要把钱捐出去”,还有意义吗?

FTX 事件也让 EA 社区开始反思:

过度关注最终结果,会不会让人低估过程中的伦理底线、治理和风险控制?

《华盛顿邮报》当时详细梳理了 Bankman-Fried 与 EA 社群之间长期而密切的关系,以及 FTX 事件给整个运动造成的信誉冲击。

这件事让 EA 从一个快速扩张的思想运动,进入了明显的自我反思期。


但有意思的是,AI 这条线没有消失

FTX 倒了。

EA 的声誉严重受损。

“长期主义”也遭遇大量批评。

但 AI Safety 继续发展。

甚至变得比以前更重要。

2026 年的 80,000 Hours 依然把先进 AI 风险列为最高优先级的问题之一。

EA Funds 也把原来的 Long-Term Future Fund 调整为更聚焦的 Transformative AI Fund。

这里出现一个非常有意思的现象。

一个思想运动可能遭遇严重丑闻。

但它曾经提出的问题,可以脱离原来的运动继续存在。

今天很多研究者讨论 AI Alignment 时,可能根本不认为自己属于 EA。

他们依然在研究:

如何让 AI 行为符合人类目标。

如何理解模型内部机制。

如何防止自主 Agent 失控。

如何建立 AI 治理制度。

思想已经跑出了最初的圈子。


所以,一群哲学家究竟对 AI 做了什么?

他们没有发明 Transformer。

没有设计 GPU。

没有训练 GPT。

也没有写出 Claude 的核心代码。

他们做了另一件非常重要的事情:

改变了一部分顶尖人才认为“什么问题值得用一生去研究”。

这件事情的影响很难量化。

但可以想象一条路径:

2009
牛津哲学家讨论慈善

        ↓

怎样帮助更多人?

        ↓

怎样让一生更有价值?

        ↓

什么问题影响最大?

        ↓

未来的人算不算?

        ↓

什么可能毁掉人类未来?

        ↓

先进 AI

        ↓

AI Alignment
AI Safety
AI Governance

        ↓

人才 + 资金 + 机构

这条链条走了十几年。

最后,它出现在了全球最重要的技术产业里。


这里还有一个我觉得特别值得思考的地方

技术发展通常给人一种感觉:

工程师决定技术。

科学家发现规律。

企业家把产品推向市场。

资本提供资金。

但 Effective Altruism 的故事提醒我们:

哲学也可能改变技术发展的方向。

因为任何技术背后最终都会出现几个问题:

我们应该造什么?

什么风险值得担心?

哪些后果能够接受?

谁的利益应该被计算?

今天重要,还是未来重要?

如果一个系统有 1% 的概率产生巨大灾难,我们应该怎么办?

这些已经超出了单纯的工程问题。

它们最终都会变成价值判断。


最后

我觉得《经济学人》把 Effective Altruism 称为“本世纪最大的思想之一”,真正有意思的地方就在这里。

你完全可以不同意它。

你可以认为长期主义太极端。

可以认为很多 AI 灭绝风险被夸大。

也可以认为 EA 过度依赖数字和期望值。

FTX 更证明了一套漂亮的道德理论并不能自动产生可靠的人。

这些批评都值得认真讨论。

但回头看过去十几年,有一件事情已经发生了。

一群原本讨论:

“怎样把慈善做得更有效”

的哲学家和研究者,最后帮助推动了一个全球性的讨论:

如果我们真的造出比人类更聪明的机器,我们应该怎样确保它不会把人类的未来一起带走?

他们没有造出 AI。

他们改变了一部分人看待 AI 的方式。

很多时候,思想真正产生影响,就是这样。

它先改变:

什么问题值得被问。

然后改变:

聪明的人去哪里工作。

最后改变:

钱流向哪里。

等我们回过头时,那个最初在牛津校园里讨论的哲学问题,已经进入了全球最重要的技术公司。

这也许才是 Effective Altruism 最值得研究的地方。


本文由《经济学人》2026 年 10 月 3 日刊关于 Effective Altruism 的文章引发。