AI 2040: Plan A – 综合报告

AI 2040: Plan A

人工智能 Futures Project 发布的关于如何安全导航超级智能时代的政策提案与场景分析报告

来源: ai-2040.com | 作者: Thomas Larsen, Romeo Dean, Daniel Kokotajlo 等 | 报告生成日期: 2025年7月

📋 概述

Plan A 是 AI Futures Project 提出的关于人类如何避免 AI 驱动的生存灾难并达到繁荣未来的积极愿景。它建议通过国际合作来避免危险的超级智能竞赛,涉及完全的研究透明度,使世界各国能够理解正在发生的事情并执行护栏。

AI 公司正在竞相构建在各方面都比人类更聪明的 AI。在 AI 2027 中,AI Futures Project 预测这将导致灭绝或不可逆转的权力集中。Plan A 是他们提出的积极替代方案。

在这个场景中,人类将超级智能的开发延迟到 2040 年,使所有 AI 研究公开,允许全球数十家公司赶上前沿水平,并有意进入”相互确保计算毁灭”(Mutually Assured Compute Destruction)的制度。

5核心计划对比

11补充材料

2040超级智能目标年

42%Plan A 伟大未来概率

🌍 背景与动机

为什么需要 Plan A?

AI 公司很可能在未来 1-10 年内成功构建比人类更聪明的 AI 系统。该行业已说服自己,控制超级智能 AI 可以在飞行中解决,因此没有足够完善的计划。

作者认为这种情况很糟糕,可能轻易导致人类灭绝。如果这场竞赛继续,他们不期望人类在 AI 变得超级智能时保持有效控制。此外,即使 AI 公司以某种方式对齐了他们的 AI,结果将是前所未有的权力集中——即极少数人可能有效控制世界唯一的超级智能军队。

五种可能的计划

Plan A

验证 slowdown + 完全研究透明度

Plan B

对抗中国并争取领先时间

Plan C

领先项目牺牲领先换取安全

Plan D

竞赛到 ASI

Plan A 的预测与推荐

类别内容置信度
预测AI R&D 将在未来 ~15 年内完全自动化>80%
AI 将在所有经济相关任务上超越人类>80%
如果构建远超人类的 AI,它们可能接管世界>80%
不确定预测确切时间线(2030 年左右)
起飞速度(默认 ~1 年)
对齐难度不确定

📅 场景时间线

2027 – 警钟之年

美国出现两个劳动力群体:1.65 亿人和数百万 AI 代理。AI 每月产生 100 亿美元收入。国会开始关注 AI,通过《AI 透明度法案》,但并未根本改变局势。建议的渐进政策包括:透明度、执行出口管制、投资验证 R&D、限制 AI R&D 预算、AI 计算追踪、改善政府 AI 能力。

2028 – AI 进入选票

在建数据中心成本是美国军费的两倍。大多数白领职业正在经历类似 2026 年软件工程的颠覆。其他国家开始感到恐惧和愤怒。AI 专家警告智能爆炸即将到来。两位总统候选人不断被问及将如何处理 AI 问题。

2029 – 选择道路

美中达成协议,避免鲁莽的竞赛。此时呈现五种计划选择:Plan D(竞赛到 ASI)、Plan C(燃烧领先)、Plan B(对抗中国)、Plan A(验证 slowdown)、Plan S(全部关闭)。最终选择了 Plan A。

2030 – 交易实施

如果没有交易,2030 年将实现完全自动化的 AI R&D,导致年底出现超级智能。感谢交易,避免了这一点。AI R&D 暂停,现有计算转为仅推理。冲刺建立可验证的训练和实验集群。

2030-2035 – 扩展阶段

在人类范围内扩展,达到相当于顶级人类专家的 AI 水平。所有 AI 相关晶圆厂在 2032 年前移至可销毁的特殊经济区(SEZ)。受控扩展至 TED-AI(顶级专家主导 AI)。

2035 – 暂停

在顶级人类专家水平的 AI 处暂停,以维持人类控制。开始大规模对齐研究。将 AIs 用于安全研究、认识论改善、验证技术等。

2040 – 交接

解除暂停,扩展至超级智能。将控制权交接给对齐的 AI 系统。全球 GWP 增长约 200 倍。公民红利达到每人每年约 1000 万美元(2025 年美元)。

📜 核心政策

1. 验证计划(Verification Plan)

Plan A 的前提是能够在不依赖信任的情况下执行国际 slowdown 协议。验证措施分为三个阶段:

  • 阶段一:准备交易选择(2026-2028) – 投资于验证 R&D,特别是推理专用验证方案;建立计算追踪和监控
  • 阶段二:实施交易(2029-2030) – 相互计算声明;推理专用验证改造;冲刺建立 R&D 验证
  • 阶段三:改善稳健性(2031-2036+) – 硬件安全;改善验证制度;减少退出交易的激励

关键验证技术

网络分接与重计算

将数据中心转换为推理单元组,添加被动网络分接,重定向流量到重计算服务器进行验证。

计算追踪

从半导体供应链上游到最终用户的全面追踪,确保计算资源的透明度和可验证性。

隐私保护验证

使用 AI 进行隐私保护的审核,允许验证而不泄露敏感国家机密。

2. 透明度计划(Transparency Plan)

四种透明度提案:

提案描述算法泄露比例
完全研究透明度 (推荐)几乎所有 AI 研究对公众完全透明~67%
过滤透明度在美中审计员可验证的安全边界内进行~47%
算法安全防止算法秘密外泄的极端安全~14%
全部关闭 (Plan S)禁止计算密集型 AI R&DN/A

3. 能力扩展策略(Capability Scaling Strategy)

Plan A 的高级别扩展策略是:在保持高信心认为扩展是安全的前提下,尽可能快地扩展。

两个阶段:

  • 阶段 1:扩展到最大可控 AI – 扩展至接近最大可控 AI(约 TED-AI),然后暂停进一步扩展
  • 阶段 2:几乎暂停,最终交接给 AI – 在最大可控 AI 处,联盟放慢至几乎暂停,然后交接信任给 AI

4. 安全计划(Security in Plan A)

三种安全类型,按难度递增:

  • 模型权重安全:防止模型权重外泄,目标 SL5-100TB-5y
  • 验证完整性安全:确保验证结果可信
  • 算法机密性:在完全透明度下,大部分算法故意透明

5. 秘密 AI 项目(Covert AI Projects)

秘密项目是 Plan A 的主要威胁之一。估计一个能力执行的中国秘密项目可获取约 1.5M H100e(约世界计算的 0.5%)。

缓解策略:

  • 防止秘密获取计算(供应链追踪、虚假退役检测)
  • 检测秘密 AI 基础设施(废热追踪、卫星监测、信号情报)
  • 限制软件泄露(限制算法进步、模型权重安全)
  • 限制合法 AI 的提升(蒸馏缓解)

💰 经济影响

爆炸性增长的核心论点

当 AI 和机器人能够完全自动化所有经济相关任务时,经济将能够自主自我复制。复制速度预计很快:即使使用当前技术和无人帮助,大约每年翻一番,随着时间推移可能达到数月或数日。

Plan A 经济成果

年均增长

从 2032 到 2037 年,实际产出年均增长约 90%。AI 和机器人每约 6 个月翻一番。

公民红利

2035 年每人每年约 100 万美元;2040 年约 1000 万美元(2025 年美元)。

收入平等

公民红利大幅改善收入平等,最贫困美国人收入大幅提升。

价格变化

AI 和机器人可生产的商品服务大幅降价;土地和位置商品相对涨价。

与主流经济学家的分歧

核心分歧在于对 AI 能力的预期。AI Futures Project 认为 AI 将在约 6 年内完全自动化所有经济相关任务,而大多数经济学家认为 AI 将表现得像正常技术。

对 Acemoglu (2024) 的反驳

  • Acemoglu 预测未来 10 年 AI 贡献 GDP 增长 0.9%
  • 仅 2025 年上半年,AI 投资就贡献了约 1% 的 GDP 增长
  • Anthropic 的收入在 6 个月内从 90 亿增至 470 亿美元

默认世界 vs Plan A

指标默认世界 (Plan D)Plan A
100% 自动化时间2031 年初2035 年左右
2033 年 GWP 增长~5000 倍受控增长
AI/机器人数量无限制~6 个月倍增时间
人类监督最小维持监管

⚖️ 计划比较

各计划评估表

指标Plan APlan BPlan C+Plan CPlan D
起飞长度(年到接管能力 AI)6 年3 年2 年1.5 年1.13 年
训练计算安全税(OOMs)2.810.750.460.13
安全计算(H100e-年)100B500M100M20M4M
安全研究员-年1M2,0001,0001,500500
认识论文化(1-5)31221
公众透明度(1-5)41221
权力分配(1-5)51221
p(对齐) = 1 – p(误对齐接管)72%50%45%40%25%
p(伟大未来 | 对齐)58%50%55%50%40%
p(伟大未来)42%25%25%20%10%

各作者对计划发生概率的估计

作者Plan APlan BPlan C+Plan CPlan D其他
Eli5%15%10%20%25%25%
Daniel15%10%20%10%30%15%
Thomas3%8%8%12%50%19%
Romeo8%12%18%12%30%20%
Ryan4%12%25%14%28%18%

⚠️ 风险分析

协议衰退(Deal Decline)

协议衰退是指协议解散或变得 substantially less effective 的可能性。这是 Plan A 最大的威胁之一。

年度衰退概率估计:

阶段(年)解散概率/年损害概率/年总衰退概率/年累计衰退概率
0-26%6%11.6%21.9%
2-53.5%3.5%6.9%37%
5-102.0%2.0%4.0%48%

秘密项目风险

秘密项目使用秘密数据中心进行 AI 开发。估计中国可秘密获取的计算资源:

  • 中位数估计:1.5M H100e(世界计算的 0.51%)
  • 80% 置信区间:[310K, 4.13M] H100e
  • 成本:约 150 亿美元

对齐路线图风险

对齐路线图分为四个阶段:

  1. 准备阶段:建立控制措施,构建误对齐类比
  2. 缓解 + 引出:防止 AI 采取灾难性行动,同时引出有用工作
  3. 在 Min-H 处暂停:避免对齐伪装,解决交接可行性
  4. 交接:将管理智能爆炸的权力交给 AI 系统

AI 用于认识论

目标是达到”理智盆地”(Basin of Sanity):社会足够理智,能够在 AI 持续改善时使自己更加理智。

关键干预措施:

集体认识论

AI 认知美德评估、隐私保护审计、社区笔记、追踪记录、说服防御

个人认识论

研究助手与预测者、情景规划、克服情感障碍

🏛️ 后 ASI 治理方案

空间治理计划

重点关注太阳系外资源(空间资源)的分配。最重要的决策是如何使用空间资源。

评估标准:

  • 偏好满足:帕累托主义、限制极端下行、满足有界观点
  • 满足常识伦理
  • 满足客观道德
  • 协调:保护产权、执行禁令、资助公共产品
  • 道德交易:双边交易、协调道德公共产品
  • 反思:使用 ASI 研究重要问题
  • 多元主义:分配资源追求不同价值观
  • 公平性:每个成年人有平等机会参与

最有希望的选项:

提案关键优势关键劣势
直接赠款 + 交易大多数观点至少有一些资源;双边交易简单道德公共产品因搭便车问题难以资助
投票使用资源straightforward 资助道德公共产品已知投票系统有严重问题
直接偏好聚合可能获得两全其美过程可能侵入、耗时

计算资源互毁(Mutually Assured Compute Destruction)

如果协议解散,世界上几乎所有计算资源都将被销毁,以防止极快的智能爆炸。

计算资源分布(2035 年):

计算类型数量 (H100e)协议解散时
AI 数据中心计算(世界)~100B自毁或被轰炸
验证的消费硬件100M因验证或设计不可用
限额交易的消费硬件30M~10% 可被转移
库存(美/中/其他)5M/500K/700K~100% 可被转移
秘密项目(美中)1M~100% 可被转移

👥 关于团队

AI 2040: Plan A 场景是 AI Futures Project 的第三个主要发布,与 AI 2027 和 AI Futures Model 并列。AI Futures Project 是一个研究非营利组织,致力于预测高级 AI 的未来并提供导航建议。

主要贡献者

Thomas Larsen

启动项目,对内容有最终决定权。帮助塑造许多核心思想,完成了大量写作。

Romeo Dean

领导验证研究和计算与经济学建模,撰写相应补充材料。

Daniel Kokotajlo

提出许多核心思想,为主要场景和视角撰写大量内容。

Ryan Greenblatt

提出 Plan A 背后的许多核心思想,提供广泛反馈。

Eli Lifland

项目管理,帮助编辑主要场景,撰写多个补充材料。

Brendan Halstead

领导秘密项目建模,撰写相应补充材料和起飞补充。

合作机构

网站由 Lightcone Infrastructure 的 Raymond Arnold、Oliver Habryka 和 Joanna Bregan 构建和设计。Scott Alexander 重写了各个部分并提供广泛反馈。

联系方式

电子邮件:info@aifutures.org

订阅 Substack 获取更多工作

本报告基于 ai-2040.com 网站内容整理生成

AI Futures Project | 原文采用英文撰写 | 本报告为中文摘要版本