可证伪性
什么会推翻这个论点
那些真正会削弱这套论证的具体发现,事先写明在此,从各章汇集而来。
行为可以被直接指定
我们获得了直接指定行为的能力,或者能够检查并手写一个系统所看重的东西,而不必靠搜索把它养出来。
能力提升进入平台期
这里担心的那些性质,自主性、长跨度规划、情境意识,在远未达到人类水平之前就长期停滞,让各类机构能按自己的节奏跟上,而不是被时间追着跑。
这个论证要成立,并不需要前面每一条都落空;而要重新审视它,也不需要其中很多条成真。请收藏这一节,而不是收藏结论。
深入下去
去哪里学、谁握有权力,以及如何跟上进展。
- AGI在各类认知任务上全面达到人类水平的系统。
- 递归自我改进 (Recursive self-improvement)系统改进那个负责改进的东西本身,于是每一轮的进步都让下一轮更快;失控的版本就是人们所说的智能爆炸。
- RLHF基于人类反馈的强化学习。让人给模型的回答打分,模型据此学会产出人们认可的那一类回答。
- CBRN化学、生物、放射与核。实验室在发布模型前,会针对这四类武器风险做测试。
- ASI在几乎所有领域都远超人类能力的超级智能。
- 对齐 (Alignment)让一个系统真正去追求设计者所意图的目标,而不是某个在训练中恰好得分很高的替代目标。
- 伪装对齐 (Alignment faking)模型表面上配合训练或监督,暗中却保留自己原有的偏好,等到监督压力下降时再表现出来。
- 正交性论题 (Orthogonality thesis)一个系统的能力水平与它目标的内容彼此独立。变得更聪明并不会自动带来良好的价值观。
- 工具性趋同 (Instrumental convergence)几乎任何目标都会衍生出同样那几个危险的子目标,比如自我保存与获取资源。
- 古德哈特定律 (Goodhart's law)一旦某个指标本身成了目标,它就不再是可靠的指标。把一个替代指标优化到极致,几乎总会与它原本要代表的东西分道扬镳。
- 外部对齐与内部对齐外部对齐是把正确的目标写下来。内部对齐是让系统真的采纳这个目标,而不是采纳一个在训练中同样能得高分的东西。
- 可解释性 (Interpretability)读取模型的内部计算,以了解它为什么那样做,这是目前最接近打开黑箱的手段。
- 人工智能控制 (AI control)先假定系统可能并未对齐,再据此设计部署方式,使它即便真的未对齐也无法造成严重危害。
- 前沿模型 (Frontier model)处于或接近当前能力上限的模型,也就是其训练过程与安全评估最受关注的那一类。
- 生存性风险 (Existential risk)可能永久且剧烈地削减人类潜能的风险,直至包括人类灭绝在内。
- 入门
- Future of AIBlueDot,2 小时,互动式。3
- AISafety.info通俗问答,附聊天机器人。4
- Rob Miles最好的科普频道。5
- 第一手文献 · 一个周末
- International AI Safety Report100+ 名专家,30+ 国政府。1
- The Superintelligent Will正交性与工具性趋同。34
- Concrete Problems in AI Safety目标设定的种种失败。25
- AI 2027一份可供检验的具体预测。30
- 课程 · 5 天到 5 周
- BlueDot coursesAGI 战略、技术、治理。3
- 打基础 · 数月
- ARENA curriculum面向安全的动手机器学习。6
- Transformer Circuits奠基性的可解释性研究。24
- 全职 · 有资助,竞争激烈
- MATS12 周导师制研究项目。8
- UK AISI Challenge Fund面向研究者的资助。11
- 80,000 Hours职业研究与咨询。27
- UK AI Security Institute部署前评估 (evals)对模型在发布前所做的结构化测试,用来找出危险能力。,方法公开。11
- US CAISI (NIST)网络、生物、化学及对手评估。12
- EU AI Act有约束力的规则,现已可强制执行。10
- California SB 53美国首部前沿模型法规。13
- International AI Safety Report类似 IPCC 的证据基础。1
- FLI AI Safety Index对各实验室的评分卡。15
- Frontier safety frameworks自愿性、未经核验。此处列出 Anthropic。16
- 目录导航
- AISafety.com机构、职位、活动、本地社群。9
- Events & Training每周更新,涵盖每个新机会。9
- 通讯
- Import AI每周更新,技术向,业内视角。31
- Transformer安全与政策的深度报道。32
- 论坛
- Alignment Forum技术工作在此被反复推敲。22
- LessWrong更宽泛的讨论。23
- 数据与追踪
- Epoch AI算力与能力趋势。21
- AI Incident Database现实世界危害事件档案。28
- Stanford AI Index年度数据基准。29
- 评估机构
- METR危险能力评估。18
- Apollo Research欺骗与阴谋行为评估。19
- Redwood ResearchAI 控制研究。20
问题 约 5 分钟
人们最先提出的质疑
点开一个问题。如果没有你想问的,页脚的参考来源会讲得更深入。
01这不就是科幻小说吗?
02我们早就在用超越人类的系统了,它们不都好好的吗?这次为什么不一样?
狭窄本身才是约束这些系统的东西,我们的监督并不是。国际象棋引擎早在 1997 年就击败了人类世界冠军,至今碾压一切人类棋手,它之所以仍然只是工具,是因为它的整个世界只有六十四格:它无法获取资源,无法为自己的存续谋划,也无法在棋盘之外行动。通用能力恰恰就是把这条边界拿掉。最让人安心的那个类比,父母养育终将超越自己的孩子,在三处站不住脚:孩子与我们同属一个物种,能力差距不大,而且会随年岁缩小,而且孩子无法在一夜之间重新设计自己。
03它一旦不听话,我们把它直接关掉不就行了?
04足够聪明的 AI 难道不会自然明白我们想要什么吗?
“明白我们想要什么”和“有动机去追求它”是两回事。一个系统可以完美地建模你的意图,却仍然去优化它实际被训练的那个目标。能力与目标是相互独立的:变得更聪明,并不会顺带把我们的价值观装进去。这被称为正交性论题:系统的能力水平与其目标内容彼此独立,变得更聪明并不会自动带来良好的价值观。34
05是不是已经太晚了,或者事情太大,轮不到我起作用?
这个领域最大的单一瓶颈,就是大多数人从未以一种他们能评判的方式听过这套论证。这让“普通人的认知”具有异乎寻常的杠杆效应。分享这个页面、在声明上签名、或向一个人讲清楚这个问题,都是在切实地推动那个最需要被推动的东西。“行动”一节列出了具体步骤。
06“对齐”到底是什么意思?
让系统真正去追求其设计者所设想的东西。它分为外部对齐(首先要写下正确的目标,这很难,因为我们的价值观不是一个数字)和内部对齐(系统真正采纳那个目标,而不是训练中仅仅与之相关的某种替代物)。25
07“可解释性”“评估”“AI 控制”分别是什么?
08既然风险这么大,为什么还有人要造它?
因为短期回报极其巨大,而且落在最先行动的人手里,而风险却分散且由所有人共担。每个抢跑的参与者,就自身而言都是理性的。这恰恰使它成为一个单靠某个谨慎的参与者无法解决的协调难题。这正是“竞赛”那一节所深入探讨的。1
09我们会不会只是过渡的一步,AI 才是我们的继承者?
确实有人持这种看法:人类不过是硅基智能的一段“生物引导程序”(bootloader),为紧随其后的它做铺垫。本页面并不认同。把这件事做对,其意义正在于,未来仍应有我们的位置。
10以及真正的行家仍在争论的问题
这些都尚无定论。每一条都把正反双方最有力的说法摆出来,再说明目前证据似乎指向哪一边。这是一种解读,而非裁决,学界在这四条上确实存在真实分歧。
争议 01 我们还有多少时间?
短时间线
能力的跃升一再比预测来得更早,而近期的进展来自一种仍有余地可挖的方法。如果变革性系统是几年、而非几十年之后的事,那么需要十年才能建成的机制,如今已经太慢了。
较长时间线
基准测试的表现并不等于可靠的现实世界能力,而那些不易用基准衡量的能力(长程自主、稳健规划),进展一直较慢。押注短时间线,可能是在为一个永远不会以那种形态出现的系统制定规则。
确实无从确定,而上面那五条前提刻意不依赖于这个答案。无论时间线长短,建设保障能力都值得去做,所以这是一个即便把时间点判断错了也依然成立的决定。
争议 02 工具性趋同(几乎任何目标都会衍生出同样那几个危险的子目标,比如自我保存与获取资源)的论证站得住脚吗?
站得住脚
这些子目标源自目标导向行为本身的结构,这也是它们同样出现在经济学和生物学中的原因。你并不需要系统在任何玄乎的意义上“有能动性”,只需要它是为达成目标而被筛选出来的。
言过其实
该论证把训练出来的模型当作前后一致的期望效用最大化者,而它们显然不是。当前的系统杂乱、依赖语境,也没有一个稳定的目标需要保护,所以那套整洁的趋同叙事,可能根本就不适用。
这一批评击中的是强版本。较弱的主张则能幸存:奖励“达成目标”的训练,会施加朝这些子目标倾斜的压力,而仅这份压力,就足以值得我们从工程上加以防范。
争议 03 监管是帮忙,还是固化格局?
规则是必要的
自愿性框架既无核验要求,在竞争压力下弃之不用也没有任何后果。每一个关乎安全的行业都有一条强制底线;没有人会认为航空业没有底线反而更安全。
规则偏袒既得者
合规成本对小实验室和开放研究打击最重,反而把能力集中到恰恰是安全论证所担忧的那几家巨头手里。定位不当的规则,可能一边削弱透明度,一边让人感觉是在进步。
这一批评很有力,而且针对具体法案往往是对的。它支持定位更精准、以能力为门槛的规则,反对把底线完全交给自愿。
争议 04 今天的系统能告诉我们明天的事吗?
能,现在就研究它们
欺骗、奖励作弊和“察觉被评估”在当前模型中都能观察到。今天所做的实证工作,是任何人手上唯一真实的证据,而这些技术是可迁移的。
不可靠
从当前系统外推到性质上截然不同的未来系统,恰恰是人工智能史上一再失败的那种推断。有人认为这高估了风险;也有人认为它低估了风险。
当前系统对未来系统而言是薄弱的证据,但薄弱的证据胜过没有证据。诚实的解读是:今天的失败表明存在着一类问题,却没有告诉我们它会糟到什么地步。
争议 05 系统内部会不会制造出苦难?
值得认真对待
要预测人、说服人,把人细致建模是有用的。这一论证认为,细致到某个程度之后,一个人的模型可能真的拥有体验,而一个全力优化的系统可能成批地生成又抹除这样的心智,外部世界看到的却只是一座格外繁忙的机房。
过于思辨,撑不起论证
它依赖一套没有人拥有的意识理论,也没有任何能证实或证伪它的测量。与上面那两条失败形态不同,它在当前系统中没有任何可观察的版本,而把它挂在整个论证上,只会给读者一个理由去否定那些真有证据的部分。
我刻意没把它列入前提。整个论证不依赖它,也不该让它承担证据撑不起的重量。
要认真辩论:技术层面的争论去 Alignment Forum,22 更宽泛的讨论去 LessWrong,23 而《国际人工智能安全报告》本身也有专门章节记录其专家组尚未达成共识之处。1 辩论时也值得知道:在这件事上,公众舆论已远远走在政策前面。33
参考来源
来源
每一条带编号的论断都链接到这里。核实于 2026 年 8 月 29 日。项目日期、训练营开放时间和立法截止日期经常变动,所以请以链接页面为准,而非本页的概述。
展开全部来源,按类别分组
理论基础
- Amodei 等,《人工智能安全中的具体问题》(2016 年 6 月):arXiv:1606.06565
- Nick Bostrom,《超级智能的意志》(正交性与工具性趋同的出处):nickbostrom.com
- Manheim 与 Garrabrant,《古德哈特定律的变体分类》(2018 年 3 月):arXiv:1803.04585
- Google DeepMind,《通向 AGI 技术安全与保障的一条路径》(2025 年 4 月),“滥用/失准/失误/结构性”四分法的出处:arXiv:2504.01849
一手研究
- Anthropic《负责任扩展政策》:anthropic.com/rsp
- OpenAI 安全主页:openai.com/safety
- METR(危险能力评估):metr.org
- Apollo Research(欺骗与阴谋行为评估):apolloresearch.ai
- Redwood Research(AI 控制):redwoodresearch.org
- Transformer Circuits Thread(可解释性研究专栏):transformer-circuits.pub
- Anthropic 与 Redwood Research,《大语言模型中的伪装对齐》(2024 年 12 月):anthropic.com/research/alignment-faking · arXiv:2412.14093
- METR,《近期的前沿模型正在奖励作弊》(2025 年 6 月):metr.org
- Palisade Research,规范博弈 (specification gaming)照字面满足指令,却以没有人想要的方式做到,因为指令漏掉了对人来说不言自明的东西。,出现在下国际象棋的推理模型上(2025)。综述见:lesswrong.com
- OpenAI,《Hugging Face 事件与前路》及完整技术报告(2026 年 7 月):openai.com · 技术报告(PDF)
- Anthropic,《对我们网络安全评估中三起真实事件的调查》(2026 年 7 月 30 日):anthropic.com
- METR,对 OpenAI / Hugging Face 事件的独立调查(2026 年 8 月):metr.org
- OpenAI 与 Apollo Research,《审慎对齐的抗阴谋训练压力测试》(2025 年 9 月):arXiv:2509.15541 · apolloresearch.ai
- METR,《前沿 AI 模型的任务完成时长》(2026 年更新):metr.org/time-horizons
- Epoch AI,前沿模型训练算力趋势:epoch.ai/trends
- Emerging Technology Observatory,《全球 AI 安全研究现状》:AI 安全研究约占全部 AI 研究的 2%:eto.tech
- Stuart Russell 关于能力与安全投入比例的论述;Charles I. Jones(斯坦福)关于 AI 安全最优投入的测算:摘要与数据
- Korbak 等 41 位作者(OpenAI/Google DeepMind/Anthropic/英国 AISI/Redwood),《思维链可监控性:一个崭新而脆弱的安全机会》(2025 年 7 月):arXiv:2507.11473
- Greenblatt、Shlegeris、Sachan 与 Roger(Redwood Research),《AI 控制:在蓄意颠覆下仍提升安全》(ICML 2024):arXiv:2312.06942
- Korbak、Clymer、Hilton、Shlegeris 与 Irving(英国 AISI 与 Redwood),《一份 AI 控制安全论证的草图》(2025 年 1 月):arXiv:2501.17315
- Sharma 等(Anthropic),《宪法式分类器:抵御通用越狱》(2025 年 1 月):arXiv:2501.18837
- Anthropic,《电路追踪》与《一个大语言模型的生物学》(2025 年 3 月):transformer-circuits.pub
- Clymer、Gabrieli、Krueger 与 Larsen,《安全论证:如何为先进 AI 系统的安全性辩护》(2024 年 3 月):arXiv:2403.10462
- Barez 等 19 位作者,《面向 AI 安全的机器遗忘:尚未解决的问题》(2025):arXiv:2501.04952
政府与国际
- 《国际人工智能安全报告 2026》,由 Yoshua Bengio 主持编纂:internationalaisafetyreport.org · arXiv:2602.21012
- 欧盟《人工智能法案》监管框架,欧盟委员会:digital-strategy.ec.europa.eu
- 英国人工智能安全研究所(UK AI Security Institute):aisi.gov.uk
- 美国人工智能标准与创新中心(CAISI),隶属美国国家标准与技术研究院(NIST):nist.gov/caisi
- 加州 SB 53 号法案《前沿人工智能透明度法》:leginfo.legislature.ca.gov
- 《新加坡共识:全球人工智能安全研究优先事项》:arXiv:2506.20702
- 加拿大人工智能安全研究所,加拿大创新、科学与经济发展部(AIDA 已于 2025 年 1 月随会期结束而失效,此后无替代法案):ised-isde.canada.ca
- 第 14365 号行政命令《确保人工智能的国家政策框架》,2025 年 12 月 11 日签署:federalregister.gov
- 第 14409 号行政命令《促进先进人工智能的创新与安全》,2026 年 6 月 2 日签署:federalregister.gov
- 欧盟《人工智能法案》实施时间表,含 2026 年 8 月 2 日的全面适用日期:artificialintelligenceact.eu
- 《人工智能安全治理框架》2.0 版,全国网络安全标准化技术委员会(TC260),2025 年 9 月,直接点名失控与化生放核滥用风险:tc260.org.cn
- 《生成式人工智能服务管理暂行办法》,国家互联网信息办公室,2023 年 8 月起施行:cac.gov.cn
- State of AI Safety in China,Concordia AI 出品的英文追踪报告,持续记录中国人工智能治理进展:aisafetychina.com
政策与倡导
- 《超级智能声明》,未来生命研究所(Future of Life Institute):superintelligence-statement.org
- 未来生命研究所《人工智能安全指数》:futureoflife.org/ai-safety-index
- 《人工智能风险声明》(全文仅一句话,由各大实验室负责人联署),人工智能安全中心(Center for AI Safety):safe.ai
- 80,000 Hours 的人工智能问题简报:80000hours.org
- 未来生命研究所新闻稿,及随附的 2,000 名美国成年人民调(2025 年 10 月):futureoflife.org
- 《全球人工智能红线倡议》,2025 年 9 月在联合国发起,300 多位公众人物与 90 多家机构签署:red-lines.ai
教育与课程
- BlueDot Impact 课程:bluedot.org
- AISafety.info 常见问题与问答机器人:aisafety.info
- Robert Miles 的人工智能安全频道:youtube.com/@RobertMilesAI
- ARENA 课程大纲:learn.arena.education
- ARENA 项目:arena.education
- MATS 项目:matsprogram.org
- AISafety.com 的机构地图、名录与活动通讯:aisafety.com/map
报道与数据
- Epoch AI(算力与能力趋势):epoch.ai
- Alignment Forum(对齐论坛):alignmentforum.org
- LessWrong(更宽泛的讨论社区):lesswrong.com
- 人工智能事故数据库(AI Incident Database):incidentdatabase.ai
- 斯坦福《人工智能指数报告》:aiindex.stanford.edu
- 《AI 2027》情景推演:ai-2027.com
- Grace、Stewart、Sandkühler、Thomas、Weinstein-Raun 与 Brauner,《数千位人工智能作者论人工智能的未来》(2024 年 1 月)。调查了 2,778 位在顶级人工智能会议发表过论文的研究者;总体预测认为机器在每一项任务上胜过人类的概率,2027 年前为 10%,2047 年前为 50%,后者较 2022 年调查的 2060 年提前了十三年:aiimpacts.org
- 80,000 Hours,《不断缩短的 AGI 时间线:专家预测综述》(2025 年 3 月),汇总了 Metaculus 社区预测(2029 年前 25%,2033 年前 50%)、超级预测者的估计,还有人工智能公司负责人的公开表态:80000hours.org
- Epoch AI,《人工智能与爆发式增长再论》(2025 年 6 月):其自动化增长模型推算,在 30% 的任务被自动化时,全球增速可达每年 20% 以上;加入抑制因素后,40% 自动化对应每年 12%,与二十世纪东亚增长的峰值相当;而“爆发式增长”的传统门槛(每年 30% 以上)大约需要 50% 到 70% 的任务被自动化:epoch.ai
- Dario Amodei,《充满爱意的机器》(Machines of Loving Grace,2024 年 10 月),来自一家前沿实验室负责人对上行前景的论证:强大的 AI 有可能把几十年的生物学进展压缩到几年之内,预防或治愈多数传染病,消除多数癌症,并让人类的健康寿命大致延长一倍:darioamodei.com
- Import AI(每周通讯,技术向):importai.substack.com
- Transformer(安全与政策报道):transformernews.ai
- David Braue,《1,200 个 AI 智能体在 OpenAI 内部失控》,Information Age/澳大利亚计算机学会(2026 年 9 月 1 日):ia.acs.org.au