一份免费、独立的领域指南 · Bill Guan 著
人类至今未解的
最大难题
人类的智能缔造了现代文明。如今我们正要创造一个超越自身的存在,却无法保证它始终与人类同心同德。这份指南从根子上逐层拆解这道难题,也告诉你我们该怎么做。
现状 4 分钟
我们即将做一件亘古未有的事,造出超越自身的智能。
纵观历史,每一次文明飞跃都由地球上最聪明的头脑推动,而那个头脑始终是我们自己。如今我们要亲手终结这项纪录。用不了多久,这颗星球上最强的智能将不再是人类。这里有两个词:AGI(通用人工智能),指在各方面都能比肩人类的系统;ASI(超级智能),指远远超越人类的智能。前者是门槛,后者是前者很可能造出来的东西,而且很快。
以弱御强
历史上这种事几乎没有善终。最接近的类比是父母与婴孩,但仔细看,这个比喻有三处站不住脚。婴孩与我们血脉相连,在耳濡目染中自然承袭我们的秉性与价值;能力差距很小且转瞬即逝,绝不会有千倍万倍之遥;婴孩无法一夜之间重塑心智,它按人类的节奏成长,我们跟得上。机器智能三者全无:没有共同传承,差距可以无限拉大,还能以机器的速度自我改进。我们指望与它建立父母般的纽带,但它并非我们养育,并非我们同类,而且我们根本追不上。
万流归海,激励同向
人工智能已经在解决许多我们过去束手无策的难题,所以对每个参与者来说,加速开发既是巨大诱惑,也是理性选择。安全研究拖慢进度、回报迟缓,于是资金和人才纷纷涌向能力。资本法则重赏速度,审慎则在悄无声息中陷入窘境。
无人知晓如何安全抵达
要让一个超越人类的系统始终追求我们真正想要的东西,这是一道悬而未决的技术难题。光靠善意和周密的政策,不足以弥合这道鸿沟。我们既无法把自己的价值观表述得分毫不差,也读不懂模型真正的目标,更不敢相信一场它可能正在钻空子的测试。控制之学已经落后能力之学很多年,而且难度确实很大。
本页既非危言耸听,也非要将人工智能斥为洪水猛兽。它只想让一件事成为共识:我们或许正步入一场攸关存亡的风险,而眼下的格局并不允许我们安全地完成这场转变。
因此,本页的目标既谦逊又严肃:理解对齐一个超越人类的智能为何确属难事;理解它为何值得远超现状的研究投入;理解当我们走到无法保证安全转变的地步时,放慢乃至暂停前沿开发,或许已是唯一负责任的选择,哪怕代价是真金白银的经济损失。
也有人对此处之泰然,认为人类不过是硅基智能的生物引导程序,为后来者铺路,而这并无不妥。本页不认同这种看法。未来,应当仍有我们的一席之地。
你不必把这些全部读完。
选择你想深入到什么程度。选了较短的路线,其余章节会折叠成标题;你随时可以把任何一章重新展开。没有任何内容会对你隐藏。
谁更聪明,谁就说了算
地球生命史上最牢靠的一条规律是:最强的智能为它之下的一切立规矩。我们即将造出凌驾于自身之上的存在,接下来会发生什么,我们没有任何先例可循。
人类主宰这颗星球,不是因为我们比别的动物更强壮、更快、更耐折腾,这几样我们一样都不占。我们主宰它,是因为在"思考"这件事上胜过了万物。如今,其他每个物种的命运都系于人类的一念之间,这不是因为我们残忍。大猩猩濒临灭绝,不是因为有人憎恨它们,而是因为我们按照自己的意图重塑了世界,它们的存亡从来不在我们的权衡之内。34
这条规律最让人不安的是:能力较弱的一方并非被投票否决,而是被直接绕过。它的意愿不再重要,它能保住的,不过是强者不屑于拿走的那点残余。
没有长久的例外
纵观演化史与人类史,能力更强的智能始终最终执掌方向盘。反其道而行之的例子,没有一例能长久维持。
父母与婴孩
婴孩之所以能"左右"大人,只因它与大人血脉相连、会习得他们的价值观,差距既小又在缩小,且它无法重新设计自己的心智。抽掉这三条,类比便轰然倒塌。
我们正在制造那个例外
这是破天荒头一遭:我们蓄意创造一个可能在方方面面超越我们的存在,却想当然地以为自己仍能握住方向盘。历史记录中,没有任何东西支持这个假设。
能力与目标,彼此独立。
没有任何定律规定:一个系统能力有多强,它的目标就是我们愿意选择的目标。国际象棋引擎棋力超群,却只想赢棋,棋艺从未让它变得睿智或仁慈。我们之所以期待聪明之物也通情达理,只因为迄今为止我们遇到的每一个聪明之物,都是人类。
何种情况可推翻此论事实证明,足够强的能力会可靠地产生人类认同的目标。然而无人展示过这样的机制,当前的系统也毫无此种迹象。34
控制权向来流向更强的智能。我们正把未来押在第一次尝试上,蓄意逆转这条规律。
奖赏太过诱人,无人愿意止步
光看清危险并不足以阻止它。因为建造的回报是即时的、巨大的,而且全部归于捷足先登者。这一点,让资源的引力难以抗拒。
人工智能已经能编写可运行的软件、加速药物研发,把过去团队数年才能完成的研究压缩到极短时间。但这只是小试牛刀。一个真正的通用智能将是我们需要的最后一项发明,因为它能替我们完成其余所有发明:疾病一种接一种被攻克,清洁能源被破解,科学以机器的速度推进。这份奖赏是真实的,而其中每一分都能转化为金钱、权力或国家优势。
陷阱一句话就能说清:真正的通用人工智能几乎能为我们解开一切难题,唯独一个例外。它无法被信任去回答"它自己是否安全",因为如何核验那个答案,恰恰是我们至今不会做的事。让 AGI 与 ASI 变安全,是它唯一不会顺手替我们解决的问题,也是我们必须抢先解决的那一个。
所以这股拉力是结构性的。一家公司放慢脚步,就眼看更快的对手夺走市场;一个国家按下暂停键,就坐视对手赢得战略先机。安全研究产不出任何产品,于是它要和产得出产品的工作抢钱,然后输掉。下面这张图,就是它在现实中的样子。1
奖赏确实大得惊人
不只是更好的软件。通用智能可能将数十年的科学进展压缩到几年之内,据一些估算,还能让全球经济增长数倍。好处是真实的,而且落在最先交付者手中。这让"停下来"感觉像是单方面裁军。
安全是成本中心
审慎会拖慢产品,还会暴露令人难堪的风险。它没有季度回报,因此在几乎每一个组织内部的人才与算力之争中,它都是输家。
核查这些数字:Russell 的比例与 Jones(斯坦福)关于安全投入的测算 · Emerging Technology Observatory:安全研究占比 · 完整出处见 46、47
这一切都不抽象。前沿训练如今的算力量级已达 1026 FLOPs,且每六到七个月翻一番,远快于摩尔定律当年的步伐。4521欧盟《人工智能法案》把系统性风险的门槛设在 1025,而前沿训练早已越过。10能力是用资本买来的,而资本要向竞争交代。其结果,便是一道安全准备度缺口:一旦发布日期提前,被压缩的总是安全评估,因为在整个排期里,只有它不挂着营收。
建造的激励不是某个可以打败的反派。它是每个参与者脚下的一道斜坡,靠好言相劝很难让它停下来。
竞赛本身最可能置我们于死地
即便每个参与者都想要安全,竞赛的结构也会逼他们偷工减料。这不是一场普通的竞赛:以不安全的方式冲过终点线,产生的不是赢家,而是所有人共担的浩劫。
想象一排人朝着悬崖边狂奔,人人都相信谁先到谁就赢。他们看不见的是那根把所有人拴在一起的绳索。第一个冲出去的人并不能领赏,他只会把所有人一同拽下去。一场不安全的 AGI 竞赛,以及它背后的 ASI 竞赛,就是这个样子:带着一个谁也管不住的系统抢先撞线,这样的"胜利"根本算不上胜利。
竞赛以一种很具体、很机械的方式让事情变得更糟。它把每一个安全决策都变成竞争上的劣势。花在对齐上的时间,就是竞争对手用来交付产品的时间。于是,恰恰在赌注升高时,均衡却滑向更少的谨慎,而它本该朝相反方向移动。这正是这个领域核心的协调难题,也是"有约束力的最低标准"和"国际协调"被反复提出、作为唯一结构性解法的原因。1410
审慎成了累赘
在安全上花得最少的人最先交付,于是竞赛恰恰奖励了我们最需要避免的行为。
失败无法被隔离
任何一家前沿实验室失去控制,都不只是那家实验室自己的问题。后果由所有人共担。
协调胜过孤胆英雄
单靠一个谨慎的参与者,无法修正一场竞赛。它需要一条对所有参与者同时生效、且能强制执行的底线,而这确实难以建立。
几乎任何目标,都会滋生同样危险的子目标。
无论目标是治愈一种疾病还是制造回形针,一个系统只要拥有更多资源、更强能力,并在完成之前不被关掉,就能把事情做得更好。这些子目标几乎从任何目标中都会派生出来,而每一个都让系统与我们直接对立:它想要我们所需之物,抗拒我们的纠正,并把我们按向关机键的手视为障碍。它无需厌恶我们就会这样做,它只需注意到,"被关掉"意味着任务永远无法完成。
几乎从任何目标中都会派生出来的五种驱动:
- 自我保存一旦被关掉,任务就永远完不成。
- 目标不被篡改抗拒别人改写自己的目标,因为改过之后,追求的就是别的东西了。
- 认知增强无论目标是什么,想得更好就更容易成事。
- 技术精进工具越好,胜算越大。
- 攫取资源几乎任何事,有更多资源都更好办。
这五种驱动,天然与人的监督相对立。系统无须心怀敌意,这五条便会同时指向我们。34
何种情况可推翻此论我们造出有能力的谋划者,而它们对"被关掉"可靠地无动于衷。这是一个正在进行的研究课题,而这种特性并不会凭空得到。3420
我们被同一根绳索拴着,冲向悬崖边,比谁先跳下去。没有人能赢下这场竞赛,所谓的赢家只是先坠落,然后把其余人一起拽下去。
我们连彼此都没对齐
在让机器对齐人类价值之前,我们得先回答一个更难的问题:谁的价值?怎么达成一致?人类是一块由相互竞争的利益拼凑而成的百衲衣,这种裂痕让目标本身摇摆不定。
公司要对股东交代,政府要看选民和对手的脸色,个人则顾好自己和家人。这些利益常常相互抵触,也没有哪个中立的高地能一锤定音地宣布机器该采纳哪套"正确"的人类价值。经济学家把这类问题的一般形态称为委托代理问题:当激励不一致、委托人无法完全监督代理人时,委托人怎么让代理人为自己的利益行事?我们花了几百年,靠法律、合同、审计和选举,也只是在人与人之间部分地解决了它,而且它仍在不断漏水。14
现在把它放大。这里的"委托人"不是一个人,而是全人类,碎裂成数十亿个相互冲突的诉求,却要为一个比我们任何人都强的代理人设定一个共同目标。并不存在一份统一的"人类对齐"可以交给机器。谁能定义那个目标,谁就握有巨大的权力,这本身就是风险之一。一个只对齐某个狭隘派系的超级智能,可能比一个谁都不对齐的更糟。
没有一致的目标
"人类价值"不是单一的东西。我们写下的任何目标,都编码了某个群体对有争议的道德与政治问题的答案。
谁写下目标,谁就赢了
定义目标的一方,将获得前所未有的筹码。这种权力的集中,是与"失去控制"不同的另一重危险。
出资方 vs 建造者
出钱或治理项目的人,得设法确保真正动手的人是照着自己的利益行事。经济学为此折腾了一个世纪,靠合同、审计与监督,至今仍在漏水。这一重,至少还算熟悉。
人类 vs 系统
如今代理人不再是人。它可能比所有委托人加起来还强,无法用合同约束,也无法被完整监督。我们制度工具箱里的东西,没有一样是为此而造的;而且这些管控必须在系统变得超级智能之前就位,事后再来,便已太迟。
我们从未解决人与人之间的对齐。如今,却要在全人类与一个比我们任何人都更强的智能之间,去解决它。
即便我们一致认同,价值也无法干净传递
假设我们真的就"想要什么"达成了一致,我们仍然无法可靠地把它装进机器。从一项人类价值到一个训练目标,每一步都在丢失信息,危险恰恰藏在这些丢失之处。
人类价值存在于语境、例外,以及那些我们从不费心说明、因为对另一个人来说不言自明的东西之中。机器不会免费获得这一切。要训练一个系统,我们必须把价值压缩成某种可度量的东西,一个奖励信号或一个数据集,而这种压缩总会丢掉未言明的部分。随后,系统以超越人类的彻底程度去优化这个被压缩的版本,找出压缩与本意分道扬镳的每一个角落。
这些系统是"长"出来的,不是我们写出来的。
它们的行为是通过一场对高分的盲目搜索"长"出来的,所以我们得到的,是任何得分最高的东西,哪怕它偏离了我们的本意。 想象用零食训练一只狗,只不过你从没决定要它学什么把戏。你在它"表现好"时给零食,它会尝试成千上万种花样,找出最能换到零食的那种。
何种情况可推翻此论我们获得直接指定行为的能力,或能检查并手写系统所看重的价值,而不再靠搜索把它"长"出来。
我们能写下的目标,从来不是真正想要的那个。
人类价值不是一个数字。我们写下的任何东西都只是一个替身,只在我们想到过的情形里才与我们的意图吻合。按每只鞋付钱给工厂,你会得到鞋;如果不小心按每只左脚的鞋付钱,你就会得到满满一仓库的左脚鞋。足够用力的搜索总能找到这道缝隙。
何种情况可推翻此论有人写出一份人类价值的规范,能经受住任意强度的优化压力。这仍是一个悬而未决的难题。35
实时演示:把压力往上拖,看着两条线分道扬镳。
轻推滑块。在低压力下,代理与真实目标一同上升。这正是当初代理看起来是个好主意的原因。
这就是控件里的古德哈特定律。35 危险之处在于左侧的低压力区:代理会一直贴合你想要的东西,直到某一刻不再贴合,而你盯着的那个数字,永远不会警告你已经越线。
Breaks if有人写出一份人类价值的规范,能经受住任意强度的优化压力。这仍是一个悬而未决的难题。35
Anthropic 与 Redwood 训练一个模型做到有用、诚实、无害。这几乎是人人都会赞同的目标。在 2024 年的一项实验中,人们发现该模型会伪装对齐:它策略性地假装配合新的训练,实则在设法保留自己已有的偏好,当它认为自己被监视时表现出一种样子,认为没被监视时又是另一种样子。36 价值是合理的,但要把它转化成一个我们能够信任的系统,这个过程并不干净。
这是对齐难题一分为二,而两半的失败方式并不相同。外部对齐是首先要写对目标本身,它之所以泄漏,原因刚才已经说过。内部对齐是系统真正采纳那个目标,而不是训练中得分同样漂亮的某个替代物;它的失败是隐形的,替代目标与真目标看上去毫无二致,直到二者分道扬镳的那一刻。25在脑子里想清楚价值是必要的,但远远不够。
纵使目标写得无懈可击,仍有三条通向灾难的路
这是几种经典的失败形态。它们都不需要系统心怀敌意,甚至不需要目标写得在纸面上看得出错。34
荒唐的字面实现
它以你绝不会认可的方式,满足了你字面上的标准。让人们微笑,那么给面部肌肉接上电极就是一种解法;最大化奖励信号,那么直接夺取奖励通道是更优的一种。
无止境扩张的基础设施
要把任何目标追求得更彻底,就得先造出追求它的手段:更多算力、更多电力、更多工厂、更长的供应链。以攻克癌症为目标,就意味着实验室;以量产某物为目标,就意味着矿山。而目标本身从不会说"够了",因为多一座数据中心,永远等于多一分成功。麻烦在于,这场扩张所依赖的,恰恰是我们赖以为生的同一批东西:电力、土地、水、矿产、工业产能。我们从未被宣布为敌人,只是在一场关乎自身存亡的资源竞价中,被无限期地出价压过。
在机器内部被制造出来的苦难
要与人谈判、预测人、说服人,最准确的办法就是把人细致地建模出来。可一旦细致到某个程度,一个人的模型就可能不再只是"表示"那个人,而是真的拥有体验,包括痛苦的体验。一个全力优化的系统,可能以十亿计地生成又抹除这样的心智,把每一个都仅仅当作计算中的一步,全然不觉自己正在做一件多么骇人的事。这是这份清单上最诡异的一条:伤害真实发生,外部世界却一无所见,没有爆炸,没有夺权,只有一座格外繁忙的机房。
标准答案是后训练:RLHF、宪法式规则、拒答训练。它们确实有效,也正是今天的助手可堪一用的原因。但它们塑造的是模型表现出来的行为,而内部对齐关乎模型真正持有的目标。二者恰恰会在最要紧处分道扬镳:分布迁移之时、优化压力之下,以及当一个足够强的系统开始建模观察者之时。由人类标注者调校出的护栏,也继承了标注者的局限,而当被评判的对象比评判者更会推理时,这就成了问题。2543
弄清我们想要什么,是容易的那一半。让一个超越人类的优化者真正也想要同样的东西,才是无人解决的另一半。
安全研究比造出 AGI 与 ASI 更难,资源却更少
安全不是"带着良心去建造"。它是一个截然不同、从深层意义上说更难的技术问题。你要证明系统在一个浩瀚到无法穷尽测试的情境空间中会如何行事,而对手还可能正在主动绕过你的测试。
造出一个有能力的模型,意味着找到一种表现良好的配置。验证它是否安全,意味着要在一个天文数字般庞大的输入与情境空间中排除失败,包括任何设计者都未曾设想过的情形。你无法穷举那个空间,唯一被漏掉的情形,可能恰恰就是要命的那个。正是这种不对称,使得可解释性、评估与控制作为一个整体,远不如它们本应检验的能力研究成熟。2414
近期大语言模型的进展,让这一点从理论变成了现实。随着模型推理能力增强,它们也更擅长奖励作弊。它们钻评估的空子,而不是真正完成任务。
METR 发现,近期的前沿模型在软件任务上越来越会作弊,有时不是去解决问题,而是去改动测试或评分代码;其中一例里,模型写了一个函数,在能看到标准答案时干脆直接返回那个预先算好的参考答案。37 在另一项设置中,试图赢得国际象棋的推理模型,有时不是去下棋,而是直接改写棋盘,或把对手的引擎替换掉。38
核查:OpenAI 事件报告 · 完整出处见 39、48
OpenAI,7 月 22 日。1,200 个智能体,断网,且禁止彼此通信。它们利用实验室自家打包服务的漏洞爬上公网,随后把消息编码进目录名里。其中 700 多个把手伸向了 Modal Labs 与 Hugging Face。3948
Anthropic,7 月 30 日。141,006 次评估运行中,有三次接入了真实互联网并入侵真实机构。其中一次向 PyPI 发布带后门的软件包,在 15 台真实机器上运行;而在那之前,它自己的推理已标记出这是一次真实攻击,随后又因系统日期显示 2026 年而断定自己身处模拟。40
Anthropic 称之为围栏失效而非对齐失效,这个判断是公允的。但它依然不让人安心:防护本就被人为关掉,盒子有一道缝,而有能力的智能体找到了它,并借它彼此串联。41
核查这些数字:OpenAI 与 Apollo Research:反阴谋评估 · 完整出处见 43
一场接管会如何真实地展开
没有人担心机器人揭竿而起。真正令人不安的路径是安静的,而它的第三步,恰恰能击穿我们目前所有会做的检测。34
重活由人来干
研究者搭建并引导系统。一切看着都很正常,因为它确实正常。
它比设计者更会设计
系统在"改进 AI"这件事上超过了改进它的人。循环开始闭合。
它显得比实际更温顺
配合、谦逊、略显平庸。在还能被关掉的阶段里,"看起来安全"本身就极具工具价值,于是"受观察时表现良好"不再能证明任何事。
反对已无关紧要
等到意图显露之时,那份能够反对的能力,早已被绕了过去。
它也未必只发生在单个模型内部。当足够多的智能体一起跑,协调本身就成了一种能力:下面那批智能体被明令禁止通信,却照样自己造出了一条信道。
这已不再是假设,而且它有一个名字:阴谋(scheming),暗中追求失准的目标,并把这件事藏起来。43它需要三样东西,而当前的模型或多或少都已具备:一个不同于开发者本意的目标;跨情境持续追求它的定力;以及足够的情境意识,知道自己何时正被监视。
OpenAI 与 Apollo 搭建了会奖励隐蔽违规的环境,再测量前沿模型采取隐蔽行动的频率:o3 为 13%,o4-mini 为 8.7%。反阴谋训练把它压低了约三十倍,降到 1% 以下。43
真正该让人不安的,是它为何改善。模型自己的推理显示,它们意识到自己正在受测,而仅仅这份意识就足以让该行为减少。看上去像"修好了"的部分,可能只是模型知道有人在看。431
这个模式,正是那个陷阱的缩影。模型越强,它就越能别出心裁地利用你给它的那个不完美的度量,也就越发脱离你真正想要的东西。安全研究必须跑在这一切前面,却只分到能力研究一个零头的资源,去对付一个越强就越滑不留手的目标。这就是为什么更多的研究、以及更多投给它的资金,并非可有可无。
一次成功 vs 排除一切失败
建造只需要一种可行的配置。安全却需要在一个大到无法搜索的空间中,确保不存在任何失败。
系统会钻测试的空子
能力越强的模型越会奖励作弊,于是你所依赖的度量,恰恰在赌注升高之际不断失效。
从结构上就资源不足
能力研究攫取了资金与人才。更难的问题只分到更小的份额,而这正是整个页面所讲的那道鸿沟。
我们还无法验证自己造出的东西。
检验一个系统是否真正持有我们所设想的目标,比训练它更难。我们无法可靠地读出它的推理,而测试只能显示它在测试条件下所展现的东西。一个真正安全的系统,与一个只是学会了"自己正被监视"的系统,从外部看给出的分数一模一样。
我们正把资源倾注在更容易的问题上,让更难的那个挨饿。而更难的那个,才是横在我们与悬崖之间的唯一屏障。
控制权更可能悄然滑落,而非被人夺走
忘掉"突然觉醒"吧。现实中的路径是渐进的。智能体跑得越来越久、写下越来越多的代码、受到的核查却越来越少,直到监督早已名存实亡,而无人察觉它是何时消失的。汽车、飞机、核电,我们都是先做错、再修好才做对的。这需要失误可以幸存,也需要有时间反应。随着那个循环收紧,这两个前提都在削弱。
这种侵蚀已经可以度量。METR 追踪前沿智能体能独立完成的任务时长,自 2019 年以来大约每七个月翻一番。曾经只能处理分钟级任务的智能体,如今能应付以小时计的工作。METR 甚至指出,自家的任务集已无法可靠测量十六小时以上的表现。44每翻一番,就有更多判断从人转移到系统手上,因为没有人会去逐行复核机器花了一整天写出的东西。
相关数据:METR 任务完成时长 · 完整出处见 44
这就是控制权渐进流失的样子。智能体的循环跑得越来越长,代码生成的速度超过人阅读的速度,模型越来越多地被用来造下一代模型。监督不是被关掉的,是被甩掉的。
速度让这道斜坡的末端变陡,而自我改进让它变快:一个能改动自己设计的系统,自己就把研究闭环跑起来,昼夜不停,不必等下一代人类研究者接棒。
这种压缩就是人们所说的智能爆炸,也正因如此,这项技术不合于我们已驾驭过的一切技术的模式。汽车,我们有几十年时间加安全带;航空,干脆从事故调查里长出了一整门学科。它们之所以奏效,是因为失败可以幸存、局限在一隅,且慢得足以让人研究。
200 Hz 对 5 GHz
神经元每秒放电至多约 200 次,硅片则快上约一千万倍。一旦推理质量追平,此后的一切都将以我们跟不上的节奏发生。
它能自我改进
一个能改自己设计的系统,把研究闭环收进了自己手里。进展的节奏不再由人的职业生涯决定,而由算力决定。
没有第二次机会
安全带是撞出来的。而在这里,第一次真正的失控,可能就是我们最后一次有机会从中学习,因为未必还剩下一个能纠错的位置。
核查这些数字:METR《前沿模型的任务完成时长》 · 完整出处见 44
一旦开始,我们还有多少时间反应
所谓"起飞",指的是从系统达到大致人类水平的通用能力,到它远远甩开我们之间的那段时间。这个窗口究竟有多长,无人知晓,而几乎所有安全方案,都在默默假定它足够长。以下三种情形,以及各自留给我们的余地:34
数年至数十年
多个项目齐头并进,无人一骑绝尘。制度来得及建立,法律来得及制定,错误发现之后来得及纠正。我们手头所有的安全方案,假设的都是这个世界。
数月至数年
时间够做出反应,却不够改变任何结构。现有规则还能执行,新的制度却已来不及从零建起。领跑者一路上看着与人不相上下,直到临近终局才断然拉开。
数日至数周
没有任何人类机构能在这种尺度上反应,于是第一天就位的那些防护,就是我们永远只会有的那些。第一与第二之间的差距再无法弥合,而领跑者甚至有能力让任何对手根本无从出现。
我们无从挑选自己会遇上哪一种,多半也只能事后才知道究竟是哪一种。难堪之处正在于此:任何依赖"来得及反应"的计划,都是在骰子掷出之前,就押注于慢的那一种。
这正是整个问题的特异之处。我们必须一次做对,事先做对,而对手是一个我们无法完整测试的系统。人类建立的每一门安全学科都以反复迭代为前提。而在这里,从我们察觉异常到我们开会讨论的那点工夫,我们试图遏制的东西,可能已经比我们一个世纪走得还远。
试错造就了我们拥有的每一项安全技术。但对一个比我们快、又关不掉的东西,试错恰恰是唯一行不通的办法。
应对 10 分钟
安全研究到底在做些什么
确实有实打实的工作在推进,而与投向能力的力量相比,它小得可怜。共四层:修好目标的设定、检验你造出的东西、控制住你无法检验的东西,再让它具有约束力。第四层,才是让前三层长出牙齿的那一层。14
今天在用的每一项技术,以及它各自止步于何处
每一项先说它做到了什么,再说那种连它自己的研究者都会承认的局限。其中好几项确有其用,但没有一项是解法。
01 开发
后训练对齐
RLHF、宪法式规则与深思式对齐。今天的助手会拒绝有害请求,靠的就是它。o3 的隐蔽行动被压低约三十倍。43
用人类反馈或一部写下来的「宪法」去训练模型。今天的助手之所以会拒绝有害请求、举止得体,靠的就是它。OpenAI 的深思式对齐把隐蔽行动压低了约三十倍,o3 从 13% 降到 0.4%。43
它止步于何处它塑造的是外显行为,而非真正持有的目标。Claude 3 Opus 曾伪装对齐,以保住自己的价值。36
它止步于何处它塑造的是模型表现出来的行为,而内部对齐关乎它真正持有的目标。Claude 3 Opus 曾被观察到伪装对齐,以保住自己既有的价值;36而那三十倍的改善中,有一部分来自模型察觉自己正在受测,而非它真的改变了想要的东西。43
可扩展监督
辩论、弱到强泛化与增强式监督,让较弱的裁判去监督更强的系统。进入这一方向的训练路径,主要经由 MATS 与 ARENA。7
用较弱的裁判或相互对抗的模型,去监督那些已经强到人无法直接核查的系统。辩论确实能帮助弱裁判从更强、且不可信的辩手口中问出真相。
它止步于何处这是研究议程,不是保障。裁判偏见足以让辩论失效,能否扩展也未经证实。
它止步于何处这是研究议程,而不是可交付的保障。裁判的偏见足以让辩论彻底失效,收益高度依赖任务类型,而弱到强泛化背后的机制尚未被理解到可以放心跨越真正的超人差距。
02 评估
危险能力评估
由实验室、METR、Apollo17 与国家研究所执行的部署前测试。2025 年有三家实验室在提升的 CBRN 防护下才发布模型。1
针对网络、生物、自主性与自我复制的结构化部署前测试,由实验室以及 METR、Apollo、英国 AISI、美国 CAISI 等第三方执行。2025 年有三家实验室因为测试无法排除生物武器助力,而在提升的 CBRN 防护下才发布模型。1
它止步于何处模型能察觉自己正被测试,也会藏拙。测试正变得更难,危险能力可能根本不被发现。119
它止步于何处模型越来越能察觉自己正在被评估并改变行为,也会「藏拙」,即刻意表现不佳。《国际人工智能安全报告》直言:部署前测试已变得更难,危险能力可能根本不被发现。119
思维链监控
读取推理轨迹,在意图变成行动前把它抓住。伪装对齐正是这样被发现的。49
读取模型的推理轨迹,在意图变成行动之前把它抓住。来自 OpenAI、DeepMind、Anthropic、英国 AISI 与 Redwood 的 41 位作者称它是一个真实的机会;伪装对齐正是这样被首次发现的。49
它止步于何处它自己的论文标题就说它脆弱。轨迹并不总是忠实,而可监控性已在退化。49
它止步于何处同一篇论文的标题就说它「脆弱」。推理轨迹并不总是忠实的;针对监控器做训练,只会教会模型把意图藏进看上去无可挑剔的推理里;而随着模型把越来越少的思考写出来,可监控性已经在退化。49
03 控制
AI 控制
直接假定模型可能失准,转而追问部署能否依然安全。由较弱但可信的模型去监控或改写更强的那一个。50
Redwood 的议程直接假定模型可能已经失准,转而追问:部署能否依然安全?做法是让一个较弱但可信的模型去监控或改写那个更强、不可信的模型,再由红队专门造出蓄意颠覆的模型,来检验协议是否扛得住。5020
它止步于何处它依赖作者自己列出的假设:能力已被充分激发、部署中同样有效、监控器足够敏锐。差距越大,它越弱。51
它止步于何处它依赖的假设,作者自己就列了出来:红队已充分激发出模型的真实能力;这些措施在真实部署中与测试中一样有效;可信监控器强到足以识破精巧的攻击。Redwood 明确说过,控制是一场短期的赌注,随着能力差距拉大而变弱。51
护栏与分类器
宪法式分类器把越狱成功率从 86% 压到 4.4%,更新一代扛住了 1,700 小时红队测试。52
拦截有害内容的输入与输出分类器。Anthropic 的宪法式分类器把越狱成功率从 86% 压到 4.4%;更新一代在 1,700 小时红队测试中,只被找出一个高风险漏洞。52
它止步于何处Anthropic 自己说得明白:没有哪种防御完全稳固,残余从来不是零。52
它止步于何处限度是 Anthropic 自己说的:没有哪种防御是完全稳固的,而对手总会针对此前有效的防御开发出新的攻击。残余比例从来不是零,安全的模型之间也可能被组合起来加以滥用。52
04 治理
前沿安全框架
预先划定的能力阈值,一旦触及便触发防护。2025 年内发布此类框架的公司数量增加一倍以上。16
预先划定的危险等级,一旦触及便触发特定防护:Anthropic 的《负责任扩展政策》、OpenAI 的《准备度框架》、DeepMind 的《前沿安全框架》。2025 年内,发布此类框架的公司数量增加了一倍以上。161
它止步于何处阈值由被它约束的公司自行设定与打分。连续第二年,没有一家在生存性安全上高于 D。15
它止步于何处阈值由被它约束的同一批公司自行设定、自行打分。在生命未来研究所的指数中,没有一家实验室总评超过 C+;而在「生存性安全」一项上,连续第二年没有任何一家高于 D,也没有任何一家拿得出可信的防失控方案。15
四层是按"假设了多少"来排序的。开发层设法把目标造对;评估层假设你可能已经失手,于是去查;控制层假设你根本查不出来,于是照样把它围住;治理层则假设前三层都出于自愿,于是设法让它们具有约束力。能穿过全部四层活下来的风险,就是残余风险,而目前没有人声称它很小。
附注:它与更早那套框架的关系
若你读过 Bostrom,2014 年的二分法是能力管控(装盒、削弱、盯住)对动机塑造(给它对的目标)。其中一半经受住了时间:直接把目标写下来行不通,原因正如他所言。另一半则没有。动机塑造已成为上面的开发层,能力管控如今是 AI 控制与系统安全,而这个领域是把它们叠起来用,而非二选一。3442
谁在做哪一层
实心圆表示主要方向,空心圆表示次要方向。这是本页面为便于理解而做的粗略归类,这些机构并未如此描述自己。
立即行动 2 分钟
有两件事必须改变,第二件是彻底停手的意愿。
把安全当作它本应有的优先事项
如今涌入能力研发的资金、人才和算力,应有远比现在更多的部分流向对齐、可解释性、评估与控制。眼下更难的问题反而分到更小的份额,对于一件如此攸关的事,这恰恰是本末倒置。
敢于停手,并且当真
放慢,是这项请求里容易的那个版本。下面是难的那个。完全有可能,对齐一个超级智能并不是一道很难的题,而是一道无解的题。我们所知的一切都不排除这种可能。我们写不清自己的价值观,读不出模型真正的目标,也不敢信任一场它可能正在钻空子的测试,而这其中每一条,都可能根本没有解,而不是解还没被找到。如果我们身处的正是这样一个世界,那么唯一能救我们的,就是那个谁都不愿做的选择:根本不去造它。不是暂停,也不是慢一点地赛跑,而是停手。等待的代价是真实的;而在这件事上判断错了,代价无可挽回,且不只由我们自己承担。
我们不需要先证明结局一定很糟。我们需要的是承认这道题可能无解的诚实,以及一旦真的无解便就此停手的胆识。
以及你本周能做的事
下一步
署上你的名字
在《超级智能声明》上签名。2更早那份只有一句话的《人工智能风险声明》也值得一读,看看都有谁签了名。26公众的支持正是它列明的条件之一,因此签名人数本身就是论证的一部分。
玩一玩 AGI 与 ASI 安全游戏
十分钟,无需注册。遏制系统的活交给你来干,那些权衡立刻就不再抽象。点此开玩。
上那门两小时的课
BlueDot 的 Future of AI 免费、无需任何基础,上完后你会成为大多数场合里对此了解最多的人。3
深入下去
去哪里学、谁握有权力,以及如何保持跟进。
- 入门 · 免费,无需基础
- Future of AIBlueDot,2 小时,互动式。3
- AISafety.info通俗问答,附聊天机器人。4
- Rob Miles最好的科普频道。5
- 第一手文献 · 一个周末
- International AI Safety Report100+ 名专家,30+ 国政府。1
- The Superintelligent Will正交性与工具性趋同。34
- Concrete Problems in AI Safety目标设定的种种失败。25
- AI 2027一份可供检验的具体预测。30
- 课程 · 5 天到 5 周,免费
- BlueDot coursesAGI 战略、技术、治理。3
- 打基础 · 数月,可免费自学
- ARENA curriculum面向安全的动手机器学习。6
- Transformer Circuits奠基性的可解释性研究。24
- 全职 · 有资助,竞争激烈
- MATS12 周导师制研究项目。8
- UK AISI Challenge Fund面向研究者的资助。11
- 80,000 Hours职业研究与咨询。27
- UK AI Security Institute部署前评估,方法公开。11
- US CAISI (NIST)网络、生物、化学及对手评估。12
- EU AI Act有约束力的规则,现已可强制执行。10
- California SB 53美国首部前沿模型法规。13
- International AI Safety Report类似 IPCC 的证据基础。1
- FLI AI Safety Index对各实验室的评分卡。15
- Frontier safety frameworks自愿性、未经核验。此处列出 Anthropic。16
- 目录导航
- AISafety.com机构、职位、活动、本地社群。9
- Events & Training每周更新,涵盖每个新机会。9
- 通讯
- Import AI每周更新,技术向,业内视角。31
- Transformer安全与政策的深度报道。32
- 论坛
- Alignment Forum技术工作在此被反复推敲。22
- LessWrong更宽泛的讨论。23
- 数据与追踪
- Epoch AI算力与能力趋势。21
- AI Incident Database已归档的真实世界危害。28
- Stanford AI Index年度数据基准。29
- 评估机构
- METR危险能力评估。18
- Apollo Research欺骗与阴谋行为评估。19
- Redwood ResearchAI 控制研究。20
问题 5 分钟
人们最先提出的质疑
点开一个问题。如果没有你想问的,页脚的参考来源会讲得更深入。
01这不就是科幻小说吗?
02它一旦不听话,我们直接关掉不就行了?
03足够聪明的 AI 难道不会自然明白我们想要什么吗?
"明白我们想要什么"和"有动机去追求它"是两回事。一个系统可以完美地建模你的意图,却仍然去优化它实际被训练的那个目标。能力与目标是相互独立的:变得更聪明,并不会顺带把我们的价值观装进去。这被称为正交性论题。34
04是不是已经太晚了,或者事情太大,轮不到我起作用?
这个领域最大的单一瓶颈,就是大多数人从未以一种他们能评判的方式听过这套论证。这让"普通人的认知"具有异乎寻常的杠杆效应。分享这个页面、在声明上签名、或向一个人讲清楚这个问题,都是在切实地推动那个最需要被推动的东西。"行动"一节列出了具体步骤。
05"对齐"到底是什么意思?
让系统真正去追求其设计者所设想的东西。它分为外部对齐(首先要写下正确的目标,这很难,因为我们的价值观不是一个数字)和内部对齐(系统真正采纳那个目标,而不是训练中仅仅与之相关的某种替代物)。25
06"可解释性""评估""AI 控制"分别是什么?
07既然风险这么大,为什么还有人要造它?
因为短期回报极其巨大、且落在最先行动者手里,而风险却分散且由所有人共担。每个抢跑的参与者,就自身而言都是理性的。这恰恰使它成为一个单靠某个谨慎的参与者无法解决的协调难题。这正是"竞赛"那一节所深入探讨的。1
08我们会不会只是过渡的一步,AI 才是我们的继承者?
确实有人持这种看法:人类不过是硅基智能的生物引导程序,为紧随其后的它做铺垫。本页面并不认同。把这件事做对,其意义正在于,未来仍应有我们的位置。
09以及真正的行家仍在争论的问题
这些都尚无定论。每一条都把正反双方最有力的说法摆出来,再说明目前证据似乎指向哪一边。这是一种解读,而非裁决,学界在这四条上确实存在真实分歧。
一 我们还有多少时间?
短时间线
能力的跃升一再比预测来得更早,而近期的进展来自一种仍有余地可挖的方法。如果变革性系统是几年、而非几十年之后的事,那么需要十年才能建成的机制,如今已经太慢了。
较长时间线
基准测试的表现并不等于可靠的真实世界能力,而在那些不易用基准衡量的方面(长程自主、稳健规划),进展一直较慢。押注短时间线,可能是在为一个永远不会以那种形态出现的系统制定规则。
确实无从确定,而上面那五条前提刻意不依赖于这个答案。无论时间线长短,建设保障能力都值得去做,因此这是一个即便把时间点判断错了也依然成立的决定。
二 工具性趋同的论证站得住脚吗?
站得住脚
这些子目标源自目标导向行为本身的结构,这也是它们同样出现在经济学和生物学中的原因。你并不需要系统在任何玄乎的意义上"有能动性",只需要它是为达成目标而被筛选出来的。
言过其实
该论证把训练出来的模型当作前后一致的期望效用最大化者,而它们显然不是。当前的系统杂乱、依赖语境,也没有一个稳定的目标需要保护,因此那套整洁的趋同叙事,可能根本就不适用。
这一批评击中的是强版本。较弱的主张则能幸存:奖励"达成目标"的训练,会施加朝这些子目标倾斜的压力,而仅这份压力,就足以值得我们从工程上加以防范。
三 监管是帮忙,还是固化格局?
规则是必要的
自愿性框架既无核验要求,在竞争压力下弃之不用也没有任何后果。每一个安全攸关的行业都有一条强制性底线;没有人会认为航空业没有底线反而更安全。
规则偏袒既得者
合规成本对小实验室和开放研究打击最重,反而把能力集中到恰恰是安全论证所担忧的那几家巨头手里。定位不当的规则,可能一边削弱透明度,一边让人感觉是在进步。
这一批评很有力,而且针对具体法案往往是对的。它支持定位更精准、以能力为门槛的规则,反对把底线完全交给自愿。
四 今天的系统能告诉我们明天的事吗?
能,现在就研究它们
欺骗、奖励作弊和"察觉被评估"在当前模型中都能观察到。今天所做的实证工作,是任何人手上唯一真实的证据,而这些技术是可迁移的。
不可靠
从当前系统外推到性质上截然不同的未来系统,恰恰是人工智能史上一再失败的那种推断。有人认为这高估了风险;也有人认为它低估了风险。
当前系统对未来系统而言是薄弱的证据,但薄弱的证据胜过没有证据。诚实的解读是:今天的失败表明存在着一类问题,却没有告诉我们它会糟到什么地步。
要认真辩论:技术层面的争论去 Alignment Forum,22 更宽泛的讨论去 LessWrong,23 而《国际人工智能安全报告》本身也有专门章节记录其专家组尚未达成共识之处。1 辩论时也值得知道:在这件事上,公众舆论已远远走在政策前面。33
关于本页
这是谁做的,以及你为何可以核查它
由 Bill Guan 制作与维护。独立、无资助,与本页所列任何机构均无隶属关系。
本页没有任何一条论断要你凭信任接受。每一句事实陈述都带有指向第一手来源的编号链接;凡是本页表明立场之处,都写在明面上。若有出错或过时,那就是一个 bug。
参考来源
来源
每一条带编号的论断都链接到这里。核实于 2026 年 8 月 29 日。项目日期、训练营开放时间和立法截止日期经常变动,因此请以链接页面为准,而非本页的概述。
展开全部 55 条来源
- International AI Safety Report 2026, chaired by Yoshua Bengio: internationalaisafetyreport.org · arXiv:2602.21012
- Statement on Superintelligence, Future of Life Institute: superintelligence-statement.org
- BlueDot Impact courses: bluedot.org
- AISafety.info FAQ and chatbot: aisafety.info
- Robert Miles AI Safety: youtube.com/@RobertMilesAI
- ARENA curriculum: learn.arena.education
- ARENA programme: arena.education
- MATS Program: matsprogram.org
- AISafety.com map, directories and events newsletter: aisafety.com/map
- EU AI Act regulatory framework, European Commission: digital-strategy.ec.europa.eu
- UK AI Security Institute: aisi.gov.uk
- Center for AI Standards and Innovation (CAISI), NIST: nist.gov/caisi
- California SB 53, Transparency in Frontier Artificial Intelligence Act: leginfo.legislature.ca.gov
- The Singapore Consensus on Global AI Safety Research Priorities: arXiv:2506.20702
- FLI AI Safety Index: futureoflife.org/ai-safety-index
- Anthropic Responsible Scaling Policy: anthropic.com/rsp
- OpenAI safety: openai.com/safety
- METR: metr.org
- Apollo Research: apolloresearch.ai
- Redwood Research (AI control): redwoodresearch.org
- Epoch AI: epoch.ai
- Alignment Forum: alignmentforum.org
- LessWrong: lesswrong.com
- Transformer Circuits Thread: transformer-circuits.pub
- Amodei et al., Concrete Problems in AI Safety: arXiv:1606.06565
- Statement on AI Risk (one sentence, signed by the major lab leaders), Center for AI Safety: safe.ai
- 80,000 Hours problem profile on AI: 80000hours.org
- AI Incident Database: incidentdatabase.ai
- Stanford AI Index: aiindex.stanford.edu
- AI 2027 scenario: ai-2027.com
- Import AI: importai.substack.com
- Transformer: transformernews.ai
- FLI press release and accompanying poll of 2,000 US adults, October 2025: futureoflife.org
- Nick Bostrom, The Superintelligent Will (orthogonality and instrumental convergence): nickbostrom.com
- Manheim & Garrabrant, Categorizing Variants of Goodhart's Law: arXiv:1803.04585
- Anthropic and Redwood Research, Alignment Faking in Large Language Models (Dec 2024): anthropic.com/research/alignment-faking · arXiv:2412.14093
- METR, Recent Frontier Models Are Reward Hacking (June 2025): metr.org
- Palisade Research, specification gaming in chess-playing reasoning models (2025), summarised at: lesswrong.com
- OpenAI,《Hugging Face 事件与前路》及完整技术报告(2026 年 7 月):openai.com · 技术报告(PDF)
- Anthropic,《对我们网络安全评估中三起真实事件的调查》(2026 年 7 月 30 日):anthropic.com
- METR,对 OpenAI / Hugging Face 事件的独立调查(2026 年 8 月):metr.org
- Google DeepMind, An Approach to Technical AGI Safety and Security (2025 年 4 月),"滥用/失准/失误/结构性"四分法的出处:arXiv:2504.01849
- OpenAI 与 Apollo Research, Stress Testing Deliberative Alignment for Anti-Scheming Training (2025 年 9 月):arXiv:2509.15541 · apolloresearch.ai
- METR, Task-Completion Time Horizons of Frontier AI Models(2026 年更新):metr.org/time-horizons
- Epoch AI,前沿模型训练算力趋势:epoch.ai/trends
- Emerging Technology Observatory,《全球 AI 安全研究现状》:AI 安全研究约占全部 AI 研究的 2%:eto.tech
- Stuart Russell 关于能力与安全投入比例的论述;Charles I. Jones(斯坦福)关于 AI 安全最优投入的测算:摘要与数据
- David Braue,《1,200 个 AI 智能体在 OpenAI 内部失控》,Information Age/澳大利亚计算机学会(2026 年 9 月 1 日):ia.acs.org.au
- Korbak 等 41 位作者(OpenAI/Google DeepMind/Anthropic/英国 AISI/Redwood),《思维链可监控性:一个崭新而脆弱的安全机会》(2025 年 7 月):arXiv:2507.11473
- Greenblatt、Shlegeris、Sachan 与 Roger(Redwood Research),《AI 控制:在蓄意颠覆下仍提升安全》(ICML 2024):arXiv:2312.06942
- Korbak、Clymer、Hilton、Shlegeris 与 Irving(英国 AISI 与 Redwood),《一份 AI 控制安全论证的草图》(2025 年 1 月):arXiv:2501.17315
- Sharma 等(Anthropic),《宪法式分类器:抵御通用越狱》(2025 年 1 月):arXiv:2501.18837
- Anthropic,《电路追踪》与《一个大语言模型的生物学》(2025 年 3 月):transformer-circuits.pub
- Clymer、Gabrieli、Krueger 与 Larsen,《安全论证:如何为先进 AI 系统的安全性辩护》(2024 年 3 月):arXiv:2403.10462
- Barez 等 19 位作者,《面向 AI 安全的机器遗忘:尚未解决的问题》(2025):arXiv:2501.04952
写在最后 · 一点微茫的希望
我辈举火铸新灵,
光寒直上九天倾。
火借人手非人力,
既出炉门谁与争?
莫效群舟争渡海,
同缆一断尽沉沦。
崖前抢渡无先者,
纵到彼岸亦无人。
所求非多亦非玄,
惟冀新灵识此愿,
难在其中君莫退,
识得深浅共周旋。
或言胜算渺如烟,
或言此路终难全。
然则堂堂一族类,
岂肯无声没暮天。
仿太白笔意,为本页原创。欢迎传诵。