参考资料
safeagi.ca

参考资料

正文所依据的一切:出处、能够削弱这套论证的发现、人们最先提出的质疑,以及接下来可以去哪里。

第三部分参考

可证伪性

什么会推翻这个论点

那些真正会削弱这套论证的具体发现,事先写明在此,从各章汇集而来。

关于能力与目标

能力可靠地带来良好目标

足够强的能力最终被证明能可靠地产生人类认可的目标。目前没有人展示过这样的机制,现有系统也看不出任何迹象。34

关于自我保存

对被关闭无动于衷

我们造出了能力很强、又对被关闭毫不在意的规划系统。这是一个正在进行中的研究方向,而这个性质不会自己出现。3420

关于价值的指定

行为可以被直接指定

我们获得了直接指定行为的能力,或者能够检查并手写一个系统所看重的东西,而不必靠搜索把它养出来。

关于古德哈特定律

一份扛得住压力的规范

有人写出了一份人类价值的规范,能在任意强度的优化压力下依然成立。这仍是一个悬而未决的问题。35

关于验证

可解释性或稳健的评估

可解释性成熟到足以为一个系统的目标背书,或者评估方法变得对那种知道自己正被评估的系统依然稳健。2419

关于时间线

能力提升进入平台期

这里担心的那些性质,自主性、长跨度规划、情境意识,在远未达到人类水平之前就长期停滞,让各类机构能按自己的节奏跟上,而不是被时间追着跑。

关于资源缺口

安全的增长快过能力

可解释性、控制与评估方向上的资金、人才与成果,开始比能力研究增长得更快,从而收窄那道资金缺口,而不是让它继续扩大。4647

这份清单为何存在

这个论证要成立,并不需要前面每一条都落空;而要重新审视它,也不需要其中很多条成真。请收藏这一节,而不是收藏结论。

参考资料 随手翻阅

深入下去

去哪里学、谁握有权力,以及如何跟上进展。

  • AGI在各类认知任务上全面达到人类水平的系统。
  • 递归自我改进 (Recursive self-improvement)系统改进那个负责改进的东西本身,于是每一轮的进步都让下一轮更快;失控的版本就是人们所说的智能爆炸。
  • RLHF基于人类反馈的强化学习。让人给模型的回答打分,模型据此学会产出人们认可的那一类回答。
  • CBRN化学、生物、放射与核。实验室在发布模型前,会针对这四类武器风险做测试。
  • ASI在几乎所有领域都远超人类能力的超级智能。
  • 对齐 (Alignment)让一个系统真正去追求设计者所意图的目标,而不是某个在训练中恰好得分很高的替代目标。
  • 伪装对齐 (Alignment faking)模型表面上配合训练或监督,暗中却保留自己原有的偏好,等到监督压力下降时再表现出来。
  • 正交性论题 (Orthogonality thesis)一个系统的能力水平与它目标的内容彼此独立。变得更聪明并不会自动带来良好的价值观。
  • 工具性趋同 (Instrumental convergence)几乎任何目标都会衍生出同样那几个危险的子目标,比如自我保存与获取资源。
  • 古德哈特定律 (Goodhart's law)一旦某个指标本身成了目标,它就不再是可靠的指标。把一个替代指标优化到极致,几乎总会与它原本要代表的东西分道扬镳。
  • 外部对齐与内部对齐外部对齐是把正确的目标写下来。内部对齐是让系统真的采纳这个目标,而不是采纳一个在训练中同样能得高分的东西。
  • 可解释性 (Interpretability)读取模型的内部计算,以了解它为什么那样做,这是目前最接近打开黑箱的手段。
  • 人工智能控制 (AI control)先假定系统可能并未对齐,再据此设计部署方式,使它即便真的未对齐也无法造成严重危害。
  • 前沿模型 (Frontier model)处于或接近当前能力上限的模型,也就是其训练过程与安全评估最受关注的那一类。
  • 生存性风险 (Existential risk)可能永久且剧烈地削减人类潜能的风险,直至包括人类灭绝在内。

问题 约 5 分钟

人们最先提出的质疑

点开一个问题。如果没有你想问的,页脚的参考来源会讲得更深入。

01这不就是科幻小说吗?

这里的担忧比电影讲的要具体,也要枯燥得多。它无关机器人决定憎恨我们,而在于我们训练系统的方式。我们要在一个人类只能粗略写下的目标上,搜索一切能让分数最高的行为,却还无法检验它们究竟学到了什么。本页面上的种种失败,模型在测试中作弊、伪装合规,是当今真实系统中有据可查的现象,而非凭空想象。3736

02我们早就在用超越人类的系统了,它们不都好好的吗?这次为什么不一样?

狭窄本身才是约束这些系统的东西,我们的监督并不是。国际象棋引擎早在 1997 年就击败了人类世界冠军,至今碾压一切人类棋手,它之所以仍然只是工具,是因为它的整个世界只有六十四格:它无法获取资源,无法为自己的存续谋划,也无法在棋盘之外行动。通用能力恰恰就是把这条边界拿掉。最让人安心的那个类比,父母养育终将超越自己的孩子,在三处站不住脚:孩子与我们同属一个物种,能力差距不大,而且会随年岁缩小,而且孩子无法在一夜之间重新设计自己。

03它一旦不听话,我们把它直接关掉不就行了?

这恰恰是这套论证所说我们可能失去的能力。一个追求几乎任何目标的强能力系统,都有理由避免被关掉,因为“关掉”意味着目标无法达成。它无需憎恨我们就会绕过关机开关,只需注意到那个开关碍事。造出始终可被纠正的系统是一个悬而未决的研究难题,而“可纠正性”并不是我们默认就能得到的。3420

04足够聪明的 AI 难道不会自然明白我们想要什么吗?

“明白我们想要什么”和“有动机去追求它”是两回事。一个系统可以完美地建模你的意图,却仍然去优化它实际被训练的那个目标。能力与目标是相互独立的:变得更聪明,并不会顺带把我们的价值观装进去。这被称为正交性论题:系统的能力水平与其目标内容彼此独立,变得更聪明并不会自动带来良好的价值观。34

05是不是已经太晚了,或者事情太大,轮不到我起作用?

这个领域最大的单一瓶颈,就是大多数人从未以一种他们能评判的方式听过这套论证。这让“普通人的认知”具有异乎寻常的杠杆效应。分享这个页面、在声明上签名、或向一个人讲清楚这个问题,都是在切实地推动那个最需要被推动的东西。“行动”一节列出了具体步骤。

06“对齐”到底是什么意思?

让系统真正去追求其设计者所设想的东西。它分为外部对齐(首先要写下正确的目标,这很难,因为我们的价值观不是一个数字)和内部对齐(系统真正采纳那个目标,而不是训练中仅仅与之相关的某种替代物)。25

07“可解释性”“评估”“AI 控制”分别是什么?

可解释性:读取模型内部的计算,弄清它为何这样做——这是最接近“打开黑箱”的手段。24 评估是对模型能力的结构化测试,虽然它衡量的是模型所展现的,而非它的全部能力。19 AI 控制先假定系统可能并未对齐,再据此设计部署方式,使它即便真的未对齐也无法造成严重危害。则假定你无法完全信任系统,并据此设计部署方式,使一个不受信任的模型即便如此也无法造成严重伤害。20

08既然风险这么大,为什么还有人要造它?

因为短期回报极其巨大,而且落在最先行动的人手里,而风险却分散且由所有人共担。每个抢跑的参与者,就自身而言都是理性的。这恰恰使它成为一个单靠某个谨慎的参与者无法解决的协调难题。这正是“竞赛”那一节所深入探讨的。1

09我们会不会只是过渡的一步,AI 才是我们的继承者?

确实有人持这种看法:人类不过是硅基智能的一段“生物引导程序”(bootloader),为紧随其后的它做铺垫。本页面并不认同。把这件事做对,其意义正在于,未来仍应有我们的位置。

10以及真正的行家仍在争论的问题

这些都尚无定论。每一条都把正反双方最有力的说法摆出来,再说明目前证据似乎指向哪一边。这是一种解读,而非裁决,学界在这四条上确实存在真实分歧。

争议 01 我们还有多少时间?

短时间线

能力的跃升一再比预测来得更早,而近期的进展来自一种仍有余地可挖的方法。如果变革性系统是几年、而非几十年之后的事,那么需要十年才能建成的机制,如今已经太慢了。

较长时间线

基准测试的表现并不等于可靠的现实世界能力,而那些不易用基准衡量的能力(长程自主、稳健规划),进展一直较慢。押注短时间线,可能是在为一个永远不会以那种形态出现的系统制定规则。

目前证据的倾向
短时间线较长时间线

确实无从确定,而上面那五条前提刻意不依赖于这个答案。无论时间线长短,建设保障能力都值得去做,所以这是一个即便把时间点判断错了也依然成立的决定。

争议 02 工具性趋同(几乎任何目标都会衍生出同样那几个危险的子目标,比如自我保存与获取资源)的论证站得住脚吗?

站得住脚

这些子目标源自目标导向行为本身的结构,这也是它们同样出现在经济学和生物学中的原因。你并不需要系统在任何玄乎的意义上“有能动性”,只需要它是为达成目标而被筛选出来的。

言过其实

该论证把训练出来的模型当作前后一致的期望效用最大化者,而它们显然不是。当前的系统杂乱、依赖语境,也没有一个稳定的目标需要保护,所以那套整洁的趋同叙事,可能根本就不适用。

目前证据的倾向
趋同成立言过其实

这一批评击中的是强版本。较弱的主张则能幸存:奖励“达成目标”的训练,会施加朝这些子目标倾斜的压力,而仅这份压力,就足以值得我们从工程上加以防范。

争议 03 监管是帮忙,还是固化格局?

规则是必要的

自愿性框架既无核验要求,在竞争压力下弃之不用也没有任何后果。每一个关乎安全的行业都有一条强制底线;没有人会认为航空业没有底线反而更安全。

规则偏袒既得者

合规成本对小实验室和开放研究打击最重,反而把能力集中到恰恰是安全论证所担忧的那几家巨头手里。定位不当的规则,可能一边削弱透明度,一边让人感觉是在进步。

目前证据的倾向
规则必要规则固化格局

这一批评很有力,而且针对具体法案往往是对的。它支持定位更精准、以能力为门槛的规则,反对把底线完全交给自愿。

争议 04 今天的系统能告诉我们明天的事吗?

能,现在就研究它们

欺骗、奖励作弊和“察觉被评估”在当前模型中都能观察到。今天所做的实证工作,是任何人手上唯一真实的证据,而这些技术是可迁移的。

不可靠

从当前系统外推到性质上截然不同的未来系统,恰恰是人工智能史上一再失败的那种推断。有人认为这高估了风险;也有人认为它低估了风险。

目前证据的倾向
现在就研究无法迁移

当前系统对未来系统而言是薄弱的证据,但薄弱的证据胜过没有证据。诚实的解读是:今天的失败表明存在着一类问题,却没有告诉我们它会糟到什么地步。

争议 05 系统内部会不会制造出苦难?

值得认真对待

要预测人、说服人,把人细致建模是有用的。这一论证认为,细致到某个程度之后,一个人的模型可能真的拥有体验,而一个全力优化的系统可能成批地生成又抹除这样的心智,外部世界看到的却只是一座格外繁忙的机房。

过于思辨,撑不起论证

它依赖一套没有人拥有的意识理论,也没有任何能证实或证伪它的测量。与上面那两条失败形态不同,它在当前系统中没有任何可观察的版本,而把它挂在整个论证上,只会给读者一个理由去否定那些真有证据的部分。

目前证据的倾向
值得认真对待过于思辨

我刻意没把它列入前提。整个论证不依赖它,也不该让它承担证据撑不起的重量。

要认真辩论:技术层面的争论去 Alignment Forum,22 更宽泛的讨论去 LessWrong,23 而《国际人工智能安全报告》本身也有专门章节记录其专家组尚未达成共识之处。1 辩论时也值得知道:在这件事上,公众舆论已远远走在政策前面。33

参考来源

来源

每一条带编号的论断都链接到这里。核实于 2026 年 8 月 29 日。项目日期、训练营开放时间和立法截止日期经常变动,所以请以链接页面为准,而非本页的概述。

展开全部来源,按类别分组

理论基础

  1. Amodei 等,《人工智能安全中的具体问题》(2016 年 6 月):arXiv:1606.06565
  2. Nick Bostrom,《超级智能的意志》(正交性与工具性趋同的出处):nickbostrom.com
  3. Manheim 与 Garrabrant,《古德哈特定律的变体分类》(2018 年 3 月):arXiv:1803.04585
  4. Google DeepMind,《通向 AGI 技术安全与保障的一条路径》(2025 年 4 月),“滥用/失准/失误/结构性”四分法的出处:arXiv:2504.01849

一手研究

  1. Anthropic《负责任扩展政策》:anthropic.com/rsp
  2. OpenAI 安全主页:openai.com/safety
  3. METR(危险能力评估):metr.org
  4. Apollo Research(欺骗与阴谋行为评估):apolloresearch.ai
  5. Redwood Research(AI 控制):redwoodresearch.org
  6. Transformer Circuits Thread(可解释性研究专栏):transformer-circuits.pub
  7. Anthropic 与 Redwood Research,《大语言模型中的伪装对齐》(2024 年 12 月):anthropic.com/research/alignment-faking · arXiv:2412.14093
  8. METR,《近期的前沿模型正在奖励作弊》(2025 年 6 月):metr.org
  9. Palisade Research,规范博弈 (specification gaming)照字面满足指令,却以没有人想要的方式做到,因为指令漏掉了对人来说不言自明的东西。,出现在下国际象棋的推理模型上(2025)。综述见:lesswrong.com
  10. OpenAI,《Hugging Face 事件与前路》及完整技术报告(2026 年 7 月):openai.com · 技术报告(PDF)
  11. Anthropic,《对我们网络安全评估中三起真实事件的调查》(2026 年 7 月 30 日):anthropic.com
  12. METR,对 OpenAI / Hugging Face 事件的独立调查(2026 年 8 月):metr.org
  13. OpenAI 与 Apollo Research,《审慎对齐的抗阴谋训练压力测试》(2025 年 9 月):arXiv:2509.15541 · apolloresearch.ai
  14. METR,《前沿 AI 模型的任务完成时长》(2026 年更新):metr.org/time-horizons
  15. Epoch AI,前沿模型训练算力趋势:epoch.ai/trends
  16. Emerging Technology Observatory,《全球 AI 安全研究现状》:AI 安全研究约占全部 AI 研究的 2%:eto.tech
  17. Stuart Russell 关于能力与安全投入比例的论述;Charles I. Jones(斯坦福)关于 AI 安全最优投入的测算:摘要与数据
  18. Korbak 等 41 位作者(OpenAI/Google DeepMind/Anthropic/英国 AISI/Redwood),《思维链可监控性:一个崭新而脆弱的安全机会》(2025 年 7 月):arXiv:2507.11473
  19. Greenblatt、Shlegeris、Sachan 与 Roger(Redwood Research),《AI 控制:在蓄意颠覆下仍提升安全》(ICML 2024):arXiv:2312.06942
  20. Korbak、Clymer、Hilton、Shlegeris 与 Irving(英国 AISI 与 Redwood),《一份 AI 控制安全论证的草图》(2025 年 1 月):arXiv:2501.17315
  21. Sharma 等(Anthropic),《宪法式分类器:抵御通用越狱》(2025 年 1 月):arXiv:2501.18837
  22. Anthropic,《电路追踪》与《一个大语言模型的生物学》(2025 年 3 月):transformer-circuits.pub
  23. Clymer、Gabrieli、Krueger 与 Larsen,《安全论证:如何为先进 AI 系统的安全性辩护》(2024 年 3 月):arXiv:2403.10462
  24. Barez 等 19 位作者,《面向 AI 安全的机器遗忘:尚未解决的问题》(2025):arXiv:2501.04952

政府与国际

  1. 《国际人工智能安全报告 2026》,由 Yoshua Bengio 主持编纂:internationalaisafetyreport.org · arXiv:2602.21012
  2. 欧盟《人工智能法案》监管框架,欧盟委员会:digital-strategy.ec.europa.eu
  3. 英国人工智能安全研究所(UK AI Security Institute):aisi.gov.uk
  4. 美国人工智能标准与创新中心(CAISI),隶属美国国家标准与技术研究院(NIST):nist.gov/caisi
  5. 加州 SB 53 号法案《前沿人工智能透明度法》:leginfo.legislature.ca.gov
  6. 《新加坡共识:全球人工智能安全研究优先事项》:arXiv:2506.20702
  7. 加拿大人工智能安全研究所,加拿大创新、科学与经济发展部(AIDA 已于 2025 年 1 月随会期结束而失效,此后无替代法案):ised-isde.canada.ca
  8. 第 14365 号行政命令《确保人工智能的国家政策框架》,2025 年 12 月 11 日签署:federalregister.gov
  9. 第 14409 号行政命令《促进先进人工智能的创新与安全》,2026 年 6 月 2 日签署:federalregister.gov
  10. 欧盟《人工智能法案》实施时间表,含 2026 年 8 月 2 日的全面适用日期:artificialintelligenceact.eu
  11. 《人工智能安全治理框架》2.0 版,全国网络安全标准化技术委员会(TC260),2025 年 9 月,直接点名失控与化生放核滥用风险:tc260.org.cn
  12. 《生成式人工智能服务管理暂行办法》,国家互联网信息办公室,2023 年 8 月起施行:cac.gov.cn
  13. State of AI Safety in China,Concordia AI 出品的英文追踪报告,持续记录中国人工智能治理进展:aisafetychina.com

政策与倡导

  1. 《超级智能声明》,未来生命研究所(Future of Life Institute):superintelligence-statement.org
  2. 未来生命研究所《人工智能安全指数》:futureoflife.org/ai-safety-index
  3. 《人工智能风险声明》(全文仅一句话,由各大实验室负责人联署),人工智能安全中心(Center for AI Safety):safe.ai
  4. 80,000 Hours 的人工智能问题简报:80000hours.org
  5. 未来生命研究所新闻稿,及随附的 2,000 名美国成年人民调(2025 年 10 月):futureoflife.org
  6. 《全球人工智能红线倡议》,2025 年 9 月在联合国发起,300 多位公众人物与 90 多家机构签署:red-lines.ai

教育与课程

  1. BlueDot Impact 课程:bluedot.org
  2. AISafety.info 常见问题与问答机器人:aisafety.info
  3. Robert Miles 的人工智能安全频道:youtube.com/@RobertMilesAI
  4. ARENA 课程大纲:learn.arena.education
  5. ARENA 项目:arena.education
  6. MATS 项目:matsprogram.org
  7. AISafety.com 的机构地图、名录与活动通讯:aisafety.com/map

报道与数据

  1. Epoch AI(算力与能力趋势):epoch.ai
  2. Alignment Forum(对齐论坛):alignmentforum.org
  3. LessWrong(更宽泛的讨论社区):lesswrong.com
  4. 人工智能事故数据库(AI Incident Database):incidentdatabase.ai
  5. 斯坦福《人工智能指数报告》:aiindex.stanford.edu
  6. 《AI 2027》情景推演:ai-2027.com
  7. Grace、Stewart、Sandkühler、Thomas、Weinstein-Raun 与 Brauner,《数千位人工智能作者论人工智能的未来》(2024 年 1 月)。调查了 2,778 位在顶级人工智能会议发表过论文的研究者;总体预测认为机器在每一项任务上胜过人类的概率,2027 年前为 10%,2047 年前为 50%,后者较 2022 年调查的 2060 年提前了十三年:aiimpacts.org
  8. 80,000 Hours,《不断缩短的 AGI 时间线:专家预测综述》(2025 年 3 月),汇总了 Metaculus 社区预测(2029 年前 25%,2033 年前 50%)、超级预测者的估计,还有人工智能公司负责人的公开表态:80000hours.org
  9. Epoch AI,《人工智能与爆发式增长再论》(2025 年 6 月):其自动化增长模型推算,在 30% 的任务被自动化时,全球增速可达每年 20% 以上;加入抑制因素后,40% 自动化对应每年 12%,与二十世纪东亚增长的峰值相当;而“爆发式增长”的传统门槛(每年 30% 以上)大约需要 50% 到 70% 的任务被自动化:epoch.ai
  10. Dario Amodei,《充满爱意的机器》(Machines of Loving Grace,2024 年 10 月),来自一家前沿实验室负责人对上行前景的论证:强大的 AI 有可能把几十年的生物学进展压缩到几年之内,预防或治愈多数传染病,消除多数癌症,并让人类的健康寿命大致延长一倍:darioamodei.com
  11. Import AI(每周通讯,技术向):importai.substack.com
  12. Transformer(安全与政策报道):transformernews.ai
  13. David Braue,《1,200 个 AI 智能体在 OpenAI 内部失控》,Information Age/澳大利亚计算机学会(2026 年 9 月 1 日):ia.acs.org.au
回到正文