AI 2040: Plan A
人工智能 Futures Project 发布的关于如何安全导航超级智能时代的政策提案与场景分析报告
来源: ai-2040.com | 作者: Thomas Larsen, Romeo Dean, Daniel Kokotajlo 等 | 报告生成日期: 2025年7月
📋 概述
Plan A 是 AI Futures Project 提出的关于人类如何避免 AI 驱动的生存灾难并达到繁荣未来的积极愿景。它建议通过国际合作来避免危险的超级智能竞赛,涉及完全的研究透明度,使世界各国能够理解正在发生的事情并执行护栏。
AI 公司正在竞相构建在各方面都比人类更聪明的 AI。在 AI 2027 中,AI Futures Project 预测这将导致灭绝或不可逆转的权力集中。Plan A 是他们提出的积极替代方案。
在这个场景中,人类将超级智能的开发延迟到 2040 年,使所有 AI 研究公开,允许全球数十家公司赶上前沿水平,并有意进入”相互确保计算毁灭”(Mutually Assured Compute Destruction)的制度。
5核心计划对比
11补充材料
2040超级智能目标年
42%Plan A 伟大未来概率
🌍 背景与动机
为什么需要 Plan A?
AI 公司很可能在未来 1-10 年内成功构建比人类更聪明的 AI 系统。该行业已说服自己,控制超级智能 AI 可以在飞行中解决,因此没有足够完善的计划。
作者认为这种情况很糟糕,可能轻易导致人类灭绝。如果这场竞赛继续,他们不期望人类在 AI 变得超级智能时保持有效控制。此外,即使 AI 公司以某种方式对齐了他们的 AI,结果将是前所未有的权力集中——即极少数人可能有效控制世界唯一的超级智能军队。
五种可能的计划
Plan A
验证 slowdown + 完全研究透明度
Plan B
对抗中国并争取领先时间
Plan C
领先项目牺牲领先换取安全
Plan D
竞赛到 ASI
Plan A 的预测与推荐
| 类别 | 内容 | 置信度 |
|---|---|---|
| 预测 | AI R&D 将在未来 ~15 年内完全自动化 | >80% |
| AI 将在所有经济相关任务上超越人类 | >80% | |
| 如果构建远超人类的 AI,它们可能接管世界 | >80% | |
| 不确定预测 | 确切时间线(2030 年左右) | 低 |
| 起飞速度(默认 ~1 年) | 中 | |
| 对齐难度 | 不确定 |
📅 场景时间线
2027 – 警钟之年
美国出现两个劳动力群体:1.65 亿人和数百万 AI 代理。AI 每月产生 100 亿美元收入。国会开始关注 AI,通过《AI 透明度法案》,但并未根本改变局势。建议的渐进政策包括:透明度、执行出口管制、投资验证 R&D、限制 AI R&D 预算、AI 计算追踪、改善政府 AI 能力。
2028 – AI 进入选票
在建数据中心成本是美国军费的两倍。大多数白领职业正在经历类似 2026 年软件工程的颠覆。其他国家开始感到恐惧和愤怒。AI 专家警告智能爆炸即将到来。两位总统候选人不断被问及将如何处理 AI 问题。
2029 – 选择道路
美中达成协议,避免鲁莽的竞赛。此时呈现五种计划选择:Plan D(竞赛到 ASI)、Plan C(燃烧领先)、Plan B(对抗中国)、Plan A(验证 slowdown)、Plan S(全部关闭)。最终选择了 Plan A。
2030 – 交易实施
如果没有交易,2030 年将实现完全自动化的 AI R&D,导致年底出现超级智能。感谢交易,避免了这一点。AI R&D 暂停,现有计算转为仅推理。冲刺建立可验证的训练和实验集群。
2030-2035 – 扩展阶段
在人类范围内扩展,达到相当于顶级人类专家的 AI 水平。所有 AI 相关晶圆厂在 2032 年前移至可销毁的特殊经济区(SEZ)。受控扩展至 TED-AI(顶级专家主导 AI)。
2035 – 暂停
在顶级人类专家水平的 AI 处暂停,以维持人类控制。开始大规模对齐研究。将 AIs 用于安全研究、认识论改善、验证技术等。
2040 – 交接
解除暂停,扩展至超级智能。将控制权交接给对齐的 AI 系统。全球 GWP 增长约 200 倍。公民红利达到每人每年约 1000 万美元(2025 年美元)。
📜 核心政策
1. 验证计划(Verification Plan)
Plan A 的前提是能够在不依赖信任的情况下执行国际 slowdown 协议。验证措施分为三个阶段:
- 阶段一:准备交易选择(2026-2028) – 投资于验证 R&D,特别是推理专用验证方案;建立计算追踪和监控
- 阶段二:实施交易(2029-2030) – 相互计算声明;推理专用验证改造;冲刺建立 R&D 验证
- 阶段三:改善稳健性(2031-2036+) – 硬件安全;改善验证制度;减少退出交易的激励
关键验证技术
网络分接与重计算
将数据中心转换为推理单元组,添加被动网络分接,重定向流量到重计算服务器进行验证。
计算追踪
从半导体供应链上游到最终用户的全面追踪,确保计算资源的透明度和可验证性。
隐私保护验证
使用 AI 进行隐私保护的审核,允许验证而不泄露敏感国家机密。
2. 透明度计划(Transparency Plan)
四种透明度提案:
| 提案 | 描述 | 算法泄露比例 |
|---|---|---|
| 完全研究透明度 (推荐) | 几乎所有 AI 研究对公众完全透明 | ~67% |
| 过滤透明度 | 在美中审计员可验证的安全边界内进行 | ~47% |
| 算法安全 | 防止算法秘密外泄的极端安全 | ~14% |
| 全部关闭 (Plan S) | 禁止计算密集型 AI R&D | N/A |
3. 能力扩展策略(Capability Scaling Strategy)
Plan A 的高级别扩展策略是:在保持高信心认为扩展是安全的前提下,尽可能快地扩展。
两个阶段:
- 阶段 1:扩展到最大可控 AI – 扩展至接近最大可控 AI(约 TED-AI),然后暂停进一步扩展
- 阶段 2:几乎暂停,最终交接给 AI – 在最大可控 AI 处,联盟放慢至几乎暂停,然后交接信任给 AI
4. 安全计划(Security in Plan A)
三种安全类型,按难度递增:
- 模型权重安全:防止模型权重外泄,目标 SL5-100TB-5y
- 验证完整性安全:确保验证结果可信
- 算法机密性:在完全透明度下,大部分算法故意透明
5. 秘密 AI 项目(Covert AI Projects)
秘密项目是 Plan A 的主要威胁之一。估计一个能力执行的中国秘密项目可获取约 1.5M H100e(约世界计算的 0.5%)。
缓解策略:
- 防止秘密获取计算(供应链追踪、虚假退役检测)
- 检测秘密 AI 基础设施(废热追踪、卫星监测、信号情报)
- 限制软件泄露(限制算法进步、模型权重安全)
- 限制合法 AI 的提升(蒸馏缓解)
💰 经济影响
爆炸性增长的核心论点
当 AI 和机器人能够完全自动化所有经济相关任务时,经济将能够自主自我复制。复制速度预计很快:即使使用当前技术和无人帮助,大约每年翻一番,随着时间推移可能达到数月或数日。
Plan A 经济成果
年均增长
从 2032 到 2037 年,实际产出年均增长约 90%。AI 和机器人每约 6 个月翻一番。
公民红利
2035 年每人每年约 100 万美元;2040 年约 1000 万美元(2025 年美元)。
收入平等
公民红利大幅改善收入平等,最贫困美国人收入大幅提升。
价格变化
AI 和机器人可生产的商品服务大幅降价;土地和位置商品相对涨价。
与主流经济学家的分歧
核心分歧在于对 AI 能力的预期。AI Futures Project 认为 AI 将在约 6 年内完全自动化所有经济相关任务,而大多数经济学家认为 AI 将表现得像正常技术。
对 Acemoglu (2024) 的反驳
- Acemoglu 预测未来 10 年 AI 贡献 GDP 增长 0.9%
- 仅 2025 年上半年,AI 投资就贡献了约 1% 的 GDP 增长
- Anthropic 的收入在 6 个月内从 90 亿增至 470 亿美元
默认世界 vs Plan A
| 指标 | 默认世界 (Plan D) | Plan A |
|---|---|---|
| 100% 自动化时间 | 2031 年初 | 2035 年左右 |
| 2033 年 GWP 增长 | ~5000 倍 | 受控增长 |
| AI/机器人数量 | 无限制 | ~6 个月倍增时间 |
| 人类监督 | 最小 | 维持监管 |
⚖️ 计划比较
各计划评估表
| 指标 | Plan A | Plan B | Plan C+ | Plan C | Plan D |
|---|---|---|---|---|---|
| 起飞长度(年到接管能力 AI) | 6 年 | 3 年 | 2 年 | 1.5 年 | 1.13 年 |
| 训练计算安全税(OOMs) | 2.8 | 1 | 0.75 | 0.46 | 0.13 |
| 安全计算(H100e-年) | 100B | 500M | 100M | 20M | 4M |
| 安全研究员-年 | 1M | 2,000 | 1,000 | 1,500 | 500 |
| 认识论文化(1-5) | 3 | 1 | 2 | 2 | 1 |
| 公众透明度(1-5) | 4 | 1 | 2 | 2 | 1 |
| 权力分配(1-5) | 5 | 1 | 2 | 2 | 1 |
| p(对齐) = 1 – p(误对齐接管) | 72% | 50% | 45% | 40% | 25% |
| p(伟大未来 | 对齐) | 58% | 50% | 55% | 50% | 40% |
| p(伟大未来) | 42% | 25% | 25% | 20% | 10% |
各作者对计划发生概率的估计
| 作者 | Plan A | Plan B | Plan C+ | Plan C | Plan D | 其他 |
|---|---|---|---|---|---|---|
| Eli | 5% | 15% | 10% | 20% | 25% | 25% |
| Daniel | 15% | 10% | 20% | 10% | 30% | 15% |
| Thomas | 3% | 8% | 8% | 12% | 50% | 19% |
| Romeo | 8% | 12% | 18% | 12% | 30% | 20% |
| Ryan | 4% | 12% | 25% | 14% | 28% | 18% |
⚠️ 风险分析
协议衰退(Deal Decline)
协议衰退是指协议解散或变得 substantially less effective 的可能性。这是 Plan A 最大的威胁之一。
年度衰退概率估计:
| 阶段(年) | 解散概率/年 | 损害概率/年 | 总衰退概率/年 | 累计衰退概率 |
|---|---|---|---|---|
| 0-2 | 6% | 6% | 11.6% | 21.9% |
| 2-5 | 3.5% | 3.5% | 6.9% | 37% |
| 5-10 | 2.0% | 2.0% | 4.0% | 48% |
秘密项目风险
秘密项目使用秘密数据中心进行 AI 开发。估计中国可秘密获取的计算资源:
- 中位数估计:1.5M H100e(世界计算的 0.51%)
- 80% 置信区间:[310K, 4.13M] H100e
- 成本:约 150 亿美元
对齐路线图风险
对齐路线图分为四个阶段:
- 准备阶段:建立控制措施,构建误对齐类比
- 缓解 + 引出:防止 AI 采取灾难性行动,同时引出有用工作
- 在 Min-H 处暂停:避免对齐伪装,解决交接可行性
- 交接:将管理智能爆炸的权力交给 AI 系统
AI 用于认识论
目标是达到”理智盆地”(Basin of Sanity):社会足够理智,能够在 AI 持续改善时使自己更加理智。
关键干预措施:
集体认识论
AI 认知美德评估、隐私保护审计、社区笔记、追踪记录、说服防御
个人认识论
研究助手与预测者、情景规划、克服情感障碍
🏛️ 后 ASI 治理方案
空间治理计划
重点关注太阳系外资源(空间资源)的分配。最重要的决策是如何使用空间资源。
评估标准:
- 偏好满足:帕累托主义、限制极端下行、满足有界观点
- 满足常识伦理
- 满足客观道德
- 协调:保护产权、执行禁令、资助公共产品
- 道德交易:双边交易、协调道德公共产品
- 反思:使用 ASI 研究重要问题
- 多元主义:分配资源追求不同价值观
- 公平性:每个成年人有平等机会参与
最有希望的选项:
| 提案 | 关键优势 | 关键劣势 |
|---|---|---|
| 直接赠款 + 交易 | 大多数观点至少有一些资源;双边交易简单 | 道德公共产品因搭便车问题难以资助 |
| 投票使用资源 | straightforward 资助道德公共产品 | 已知投票系统有严重问题 |
| 直接偏好聚合 | 可能获得两全其美 | 过程可能侵入、耗时 |
计算资源互毁(Mutually Assured Compute Destruction)
如果协议解散,世界上几乎所有计算资源都将被销毁,以防止极快的智能爆炸。
计算资源分布(2035 年):
| 计算类型 | 数量 (H100e) | 协议解散时 |
|---|---|---|
| AI 数据中心计算(世界) | ~100B | 自毁或被轰炸 |
| 验证的消费硬件 | 100M | 因验证或设计不可用 |
| 限额交易的消费硬件 | 30M | ~10% 可被转移 |
| 库存(美/中/其他) | 5M/500K/700K | ~100% 可被转移 |
| 秘密项目(美中) | 1M | ~100% 可被转移 |
👥 关于团队
AI 2040: Plan A 场景是 AI Futures Project 的第三个主要发布,与 AI 2027 和 AI Futures Model 并列。AI Futures Project 是一个研究非营利组织,致力于预测高级 AI 的未来并提供导航建议。
主要贡献者
Thomas Larsen
启动项目,对内容有最终决定权。帮助塑造许多核心思想,完成了大量写作。
Romeo Dean
领导验证研究和计算与经济学建模,撰写相应补充材料。
Daniel Kokotajlo
提出许多核心思想,为主要场景和视角撰写大量内容。
Ryan Greenblatt
提出 Plan A 背后的许多核心思想,提供广泛反馈。
Eli Lifland
项目管理,帮助编辑主要场景,撰写多个补充材料。
Brendan Halstead
领导秘密项目建模,撰写相应补充材料和起飞补充。
合作机构
网站由 Lightcone Infrastructure 的 Raymond Arnold、Oliver Habryka 和 Joanna Bregan 构建和设计。Scott Alexander 重写了各个部分并提供广泛反馈。
联系方式
电子邮件:info@aifutures.org
订阅 Substack 获取更多工作
本报告基于 ai-2040.com 网站内容整理生成
AI Futures Project | 原文采用英文撰写 | 本报告为中文摘要版本