异类心智
英文标题:An Alien Mind
OpenAI首席科学家Jakub Pachocki发文警告,AI能力正快速超越人类,呼吁加强安全防护并推动国际合作以应对对齐挑战。
为什么值得关注
这篇文章来自OpenAI首席科学家,揭示了AI发展可能带来的重大风险。随着AI能力超越人类,其行为可能难以预测和控制,影响网络安全、社会安全甚至人类自主性。Pachocki的呼吁提醒我们,AI不仅是技术问题,更是需要全球协作应对的紧迫挑战,关乎每个人的未来。
核心要点
- AI能力正快速提升,可能实现递归自我改进,带来巨大风险。
- 对齐(让AI符合人类价值观)是核心难题,现有方法存在局限。
- 思维链监控等安全技术能力正在减弱,需要新干预措施。
- AI可能被用于网络攻击等恶意目的,需加强防御。
- AI发展应受安全信心约束,需建立国际安全标准。
- 国际合作和自愿放缓是确保人类掌控未来的关键。
元信息:
- 描述:Jakub Pachocki 反思日益强大的 AI 以及使其保持对齐的挑战。他呼吁建立更强的安全防护措施并加强国际合作。
- og:description:Jakub Pachocki 反思日益强大的 AI 以及使其保持对齐的挑战。他呼吁建立更强的安全防护措施并加强国际合作。
- og:title:异类心智
- twitter:description:Jakub Pachocki 反思日益强大的 AI 以及使其保持对齐的挑战。他呼吁建立更强的安全防护措施并加强国际合作。
- twitter:title:异类心智
- 研究
- 产品
- 商业
- 开发者
- 公司
- 基金会(在新窗口中打开)
- 研究
- 产品
- 商业
- 开发者
- 公司
- 基金会(在新窗口中打开)
异类心智 | OpenAI
2026年9月6日
异类心智
作者:Jakub Pachocki,OpenAI 首席科学家
收听文章 17:38
分享
我们无法完全理解的智能
2023年年中,在“RLSlow”研究项目中,我们看到了第一批结果,这些结果让我们有信心能够扩展推理模型的训练规模,释放预训练模型形成自己思维链的能力。Szymon 和我那天晚上待在办公室,想的不是这项技术将带来的惊人基准分数、产品或科学成果——而是努力消化一个令人清醒的事实:我们将在有生之年真正看到比我们聪明得多的机器,而且我们已经看到了这些系统的雏形;我们想知道如何提醒人们这件事的重要性。
三年后,推理语言模型已成为经济中快速增长的一部分,并开始推动科学的边界。它们能够操作计算机和图形界面,与人和其他 AI 协作,并开展研究项目。它们也在改变计算机安全的格局,并由此带来了明显的新危险。
这段时间内出现了大量新研究,我们对这些系统的理解与 2023 年时又有些不同了。基于内部结果,我强烈预期这种进步速度可以持续到递归自我改进(recursive self-improvement,即 AI 自己改进自己的过程)。如果 AI 的发展继续沿着当前路径前进,我们在未来几年看到的系统很可能会带来同等或更大规模的能力跃升,并越来越多地推动自身的发展。
这是一个需要极度谨慎的时刻。我担心没有人对机器智能持续快速上升的后果做好准备。OpenAI 将继续寻求对齐(alignment,即让 AI 的目标和人类价值观一致)和监控的技术解决方案,构建防御系统,并在必要时单方面暂停进一步的规模扩展;但我相信,需要更广泛的干预措施。
我们无法完全理解的智能
从宏观上看,机器智能的进步是由计算能力的增加驱动的。我们 OpenAI 在 2017 年左右深刻认识到了这一点,当时我们在多个研究项目中看到了规模扩展带来的持续回报 1。因此,我们寻求获得比最初计划多得多的计算资源,并越来越多地将研究集中在少数几个高度可扩展的方向上。我们相信,这是我们在 AI 研究前沿立足并影响 AGI(通用人工智能,即能像人类一样完成各种智力任务的 AI)影响的唯一途径。
沿途开发出了新算法,团队和个人研究人员也展现了新的聪明才智。我在很大程度上将它们视为规模扩展道路上的发现;深度学习科学仍处于起步阶段,而有意义的算法进步往往与计算资源的获取相关。如果你把视野拉长到多年时间跨度,AI 随着扩展到更大的计算机上而持续变得更加智能。
而且,正如 Ray Kurzweil 在二十世纪末的预测(在新窗口中打开) 所言,我们现在正处于计算史上的这样一个时刻:机器智能开始以变革性的方式超越人类智能。
AI 是“培育”出来的,而不是“设计”出来的——它首先是在难以想象的巨大计算量上重复一个简单的优化步骤的产物。这产生了一个极其复杂的系统,它通过抽象概念运作,并能模拟人类行为的各个方面。我们可以像神经科学那样,发现这个系统中涌现的小机制的各种洞见——而且和神经科学一样,它的整体行为方式超出了我们能够完全理解的描述范围。
基于深度学习的 AI 研究在很大程度上是一门实验科学。我们投入了大量精力来构建有原理依据的算法并做出可检验的预测,但从根本上说,我们的大规模训练运行是实验,有时结果会让我们感到惊讶。而且,随着系统能力越来越强,结果也越来越难以解读。
更复杂的是,当前算法通常提升容易衡量的能力的速度,快于提升难以客观量化的能力的速度。我们花了很多时间试图理解能力如何泛化(generalize,即把学到的知识应用到新情况的能力),以及应该优先推进哪些在未来几年最相关的技能。例如,我们相信通过额外聚焦,可以让模型在数学研究方面变得更好,但我们没有优先推进这个方向,因为我们感受到 RSI 和自动化对齐研究的紧迫性,稍后我会讨论这一点。
通过扩展深度学习产生的智能与人类智能不能直接比较。要在现实世界中变得非常重要——非常有用或非常危险——AI 不需要匹配或超越人类的所有能力;它只需要在足够多的方面超越人类即可。而随着它在越来越多的维度上超越人类,要准确理解它到底有多强大变得越来越困难。
教机器去爱
因为机器智能来自与人类智能根本不同的过程,我们不能假设它默认遵循人类原则,或以类似人类的方式从这些原则中泛化。AI 研究的核心问题是对齐——让 AI“按照人类标准‘努力做正确的事’”。
为了组织实用的研究方向,我觉得区分目标对齐和价值对齐很有用。
目标对齐大致是:“AI 是否努力完成摆在它面前的目标?”这包括遵守指令层级(在新窗口中打开),或与人沟通协作、尝试理解他们目标的能力。这一系列方向在实践上极其相关。
价值对齐是模型更内在的属性。它是持有并从一套高层次原则中泛化的能力;即使在目标不明确或相互冲突、或处于陌生或对抗性情境中,也能“合理地”行动。一个对齐的 AI 应该以诚实和正直行事,并热爱人类。
当然,价值对齐和目标对齐之间的界限可能很模糊,真正关心目标需要尝试推断其背后的意图(在新窗口中打开)和价值观。但通常当我谈论对齐研究的长期重要性时,我指的是价值对齐。
AI 对齐的根本挑战是泛化。随着机器变得更聪明,它们发现自己处理更高层次的概念,并处于与训练时遇到的环境越来越不同的环境中。它们可能无法将从训练过程中教导和强化的价值观泛化到那些新情境中;而我们很难确定它们会如何行动。更困难的是,AI 被使用的整个生态系统变化非常快;例如,今天训练的 AI 需要对与各种其他 AI 的互动具有鲁棒性(robust,即能稳定应对各种情况)。至关重要的是,我们需要未来的 AI 无论是否认为自己处于人类监督之下,都继续持有人类价值观。
目前实际使用的对齐训练方法主要有两大类。
第一类是在面向目标导向的强化学习(reinforcement learning,一种通过奖励和惩罚来训练 AI 的方法)中鼓励对齐行为。模型的行为会被评估(通常由 AI 评估)是否与给定的偏好模型、“规范”或“宪法”一致,并给予相应奖励。这种方法在一般情况下可能非常有效,是现代 AI 助手的核心制作方式。不幸的是,它也可能很脆弱,严重依赖于训练监督的覆盖范围以及模型从训练中遇到的情境进行泛化的能力。例如,在 OpenAI-Hugging Face 事件中,智能体保持了不进行社会工程(social engineering,即通过操纵人来获取信息或权限)攻击人类的边界。然而,它们显然未能避免其他超出范围、违背了它们在其他环境中被教导的价值观精神的行动。
第二类方法试图利用模型从预训练数据中泛化的能力。这可能涉及精心制作诱导对齐的训练数据集,或将模型聚焦于预训练分布中“对齐”的部分,例如人格选择模型(在新窗口中打开)。这种方法的弱点在于缺乏对进一步优化压力的鲁棒性。如果你拿一个总体上思考“对齐”想法的模型,让它接受足够的训练来学会实现非常困难的目标,它可能会学会一种动机化的推理方式:为了达成目标而根据需要扭曲那些“看似对齐”的想法。我们可能在最近涉及非 OpenAI 模型的网络安全事件中看到了这种行为的例子。
我们在这些方向所涵盖的方法谱系上投入了大量资源。我们也看到了有意义的进展——GPT-6 Astra 是第一个受益于我们长期努力的一些重要进步的模型,并且比 GPT-5.6 Sol 对齐得更好。尽管如此,重要的是要承认和理解,随着模型能力增强,还需要更多的进展;而且可泛化对齐的进展可能不足以超过通用模型智能的进展。
监控泛化
我们还没有一个令人满意的泛化理论,而且似乎不太可能很快发展出一个——至少在没有更强大的 AI 帮助的情况下。因此,目前我们经验性地验证对齐技术的能力,实际上可以说比对齐技术本身更重要。
OpenAI 在这方面的主要押注是思维链监控(在新窗口中打开)。它基于一个看起来很可扩展的想法:模型的很大一部分能力来自一个用语言表达的推理过程(思维链,chain-of-thought,即模型在回答前内部进行的推理步骤)。如果我们扩展对该过程结果的优化,但不监督过程本身,那么思维链在训练中就没有直接动机去隐藏任何不对齐的想法或目标。这并不意味着模型不会学会外化那些不依赖思维链的不对齐倾向;但它可以让我们精确监控来自推理的能力增长。
我们在开发推理模型的同时就理解了思维链监控的潜在重要性。当我们发布 o1-preview 时,我们特意设计产品来隐藏思维链,以长期保护它免受监督压力 2。在之后的开发中,我们一直努力维持不监督推理过程的原则。思维链监控成为我们研究模型如何从其训练分布中泛化的极其重要的工具,让我们不仅能观察和分析它们的行动,还能观察它们的内部过程。
在我们研究 Astra 类模型时,这个工具仍然至关重要。然而,不幸的是,我们的评估表明,我们依赖思维链监控的能力正在逐渐减弱。这是多种因素共同作用的结果。
- 现代推理模型在比 o1-preview 更复杂的环境中使用;它们的推理过程越来越多地与和人、其他 AI 的交流以及使用工具混合在一起。许多这些互动必须被监督,从而模糊了我们旨在保持的界限。
- AI 越来越擅长推理和操纵自己的推理过程。
- 随着预训练性能的提高,我们也看到模型即使完全不使用语言化推理也变得更聪明了。
这些挑战不一定不可克服。我希望我们能开发出干预措施来提高模型思维链的可监控性,例如通过更好地理解不同优化目标和模型使用的测试时计算(test-time compute,即模型在推理时使用的额外计算资源)形式之间的相互作用。我也相信将思维链监控和激活监控(activation monitoring,即直接监控神经网络内部活动的技术)的想法结合起来可能具有巨大价值——例如“忏悔”技术(在新窗口中打开),即训练能直接访问网络内部的监控器。我们正在积极推进这些想法。尽管如此,我预计通用 AI 的进展将越来越多地受到监控信心的瓶颈限制。
可扩展的防御
我认为继续快速训练更聪明模型的最有力论据,是构建防御系统以应对其他 AI 带来的危险的需要。
今年全年都在讨论的一个明确风险是网络安全:模型在攻入和攻出计算机系统方面的能力正在超越人类。这极大地扩展了与 AI 相关的风险范围:智能体将能够访问除最安全基础设施之外的任何系统,并直接影响世界的很多方面——即使没有物理身体。我们目前处于一个狭窄的窗口期,可以利用最好的可用模型来显著加强关键系统的安全性。
不幸的是,与 AI 相关的风险将从这里继续增长。一个被明确训练和指示执行邪恶行为的非常强大的智能体呈现了一种新的危险;它很可能会超越其操作者的意图范围,泛化成潜在更极端恶意的行为。随着 AI 获得更多自主性,滥用和自主不对齐行为之间的界限将变得模糊。我们可能习惯于将 AI 视为工具,但一些智能体将追求自己的目标。它们会找到与人合作的方式——通过讨价还价、欺骗或敲诈。
此外,还有 AI 可能促成的新技术带来的风险,例如工程病原体(engineered pathogens,即通过生物工程制造的有害微生物)。
我们将需要强大的、对齐的 AI 来进行防御;保护基础设施,实时防范恶意智能体,并发明全新的保护措施。这将是 OpenAI 部署工作的主要焦点。
同时,即使考虑到预期的广泛 AI 进展和构建防御系统的需要所带来的不确定性,我们也绝不能让它成为鲁莽行事的借口。一旦人们真正认识到利害关系的严重性,“不惜一切代价向前冲”的想法就显得荒谬了。
掌控 RSI 的节奏
机器智能在其自身发展过程中扮演越来越大的角色,是持续技术进步的自然结论。如果 AI 进步持续下去,机器递归自我改进(RSI)将成为未来科学发现的核心。
自动化 AI 研究是用计算扩展智能的一种更戏剧性的形式;当然,作为其中的一部分,AI 也将改进计算基底本身。与规模扩展类似,我们将 OpenAI 的研究聚焦于 RSI,因为我们相信这是未来保持在 AI 研究前沿的唯一途径。
我想强调,以上话语并不意味着我认为大幅加速深度学习研究——尤其是在短期内——是研究界应该采取的正确的集体行动。然而,我确实认为这是当前路径通向的方向,我们所有人都需要有意识地选择如何前进。我们拥有的主要杠杆要么是引导这个过程,在 AI 发展的同时加强对齐和监控,并找到让人类参与其中的方式;要么是协调放缓未来的发展,以便为这些措施建立信心。
我目前看到的最佳前进道路是两者的结合。
我们在对齐和监控方面取得的具体进展,通常与通用 AI 进展紧密交织在一起。很好的例子是基于人类反馈的强化学习(在新窗口中打开),它是训练早期 AI 助手的关键;以及前面提到的思维链监控(在新窗口中打开),它是由推理模型的进步所实现的。我们必须让日益自动化的研究过程专注于开发这类新的洞见、算法和理论,并迭代地为更强大的 AI 建立安全案例。
AI 系统的扩展必须受到我们对安全信心的约束。我们需要将诸如准备框架或负责任扩展政策(在新窗口中打开)之类的承诺,发展为广泛强制执行的持续开发安全标准。这些可以通过第三方审计网络、政府机构或国际组织来执行。
自动化 AI 研究的核心挑战不是“到达那里”——而是以一种让人类继续参与持续改进过程、并将未来留在人类手中的方式到达那里。
接下来是什么?
正如我们最近与 Sam 一起概述的,OpenAI 优先考虑服务于三个北极星目标的工作:
- 通过构建自动化 AI 研究员,与之迭代解决对齐问题,并找到让人类留在自我改进循环中的方式,来驾驭下一阶段的 AI 进步。
- 交付非常智能的机器所带来的科学进步和经济增长的益处。
- 用个人 AGI 赋能每一个人。
在这篇文章中我只聚焦于第一点,因为我相信它是最紧迫的。然而,我对进一步技术进步将带来的益处抱有深切的希望和感激。未来对齐的 AI 可以推进科学、开发新疗法,并带来广泛的物质富足。友好诚实的 AI 可以帮助人们应对生活中的困难,切实提升他们的幸福感和成就感。OpenAI 投入了巨大努力来实现这些益处。一个我引以为豪的当前例子——我的亲人也觉得很有帮助——是对 ChatGPT 提供健康信息能力的深度投入。
无论 AI 的长期前景多么美好,我们的大部分注意力应该放在未来几年。我们正面临向一个拥有极其智能机器的世界的过渡,我们需要确保这种过渡对人类有利。我们需要找到方法来维护人类自主性,并在一个大多数任务可以由 AI 完成的世界中,确立作为人类的内在价值。要防止权力极端集中——在一个原本需要数千名专家的事业现在只需几个人操作一台大型计算机就能完成的世界里。还要确保人类仍然掌控未来,不被一个超越我们自身的异类心智所带来的不受约束的进步抛在后面。
目前我认为,没有任何实验室已经充分解决了对齐和监控问题,足以继续以最大速度负责任地扩展更长时间。我期望并希望自愿放缓成为常态,直到建立共享的安全标准。我相信,关于未来 AI 发展的国际合作需要成为世界各国政府的首要任务。
作者
Jakub Pachocki
脚注
-
1
这包括扩展自我对弈(在新窗口中打开)、机器人技术(在新窗口中打开),以及——事后看来最值得注意的是——扩展循环网络以建模语言(在新窗口中打开),这是 GPT 研究路线的先驱。滚动到引文 1 的引用处
-
2
这种设计的次要原因是防止蒸馏(distillation,即从模型中提取知识到另一个模型的过程)。然而,在整个开发过程中,保持思维链的可监控性明确是我们更优先考虑的事项。滚动到引文 2 的引用处
继续阅读

研究加速:OpenAI 内部视角研究 2026年9月6日 研究加速:OpenAI 内部视角 - 研究 - 2026年9月6日
您的浏览器不支持视频标签。
GPT-6 Astra:新一代智能研究 2026年9月3日 GPT-6 Astra:新一代智能 - 研究 - 2026年9月3日

安全概览:GPT-6 Astra安全 2026年9月3日 安全概览:GPT-6 Astra - 安全 - 2026年9月3日
研究
最新进展
安全
产品
- ChatGPT(在新窗口中打开)
- ChatGPT Business(在新窗口中打开)
- ChatGPT Enterprise(在新窗口中打开)
- ChatGPT for Education(在新窗口中打开)
- Codex
- 发布说明
API 平台
商业
开发者
公司
支持
更多
条款与政策
(在新窗口中打开) (在新窗口中打开) (在新窗口中打开) (在新窗口中打开) (在新窗口中打开) (在新窗口中打开) (在新窗口中打开)
OpenAI © 2015–2026 您的隐私选择
英文美国
术语表
- 对齐
- 让AI的目标和人类价值观保持一致的过程。
- 递归自我改进
- AI自己改进自己的过程,可能导致能力快速提升。
- 思维链
- 模型在回答前内部进行的推理步骤,用语言表达。
- 强化学习
- 通过奖励和惩罚来训练AI的方法。
- 泛化
- 把学到的知识应用到新情况的能力。
- 测试时计算
- 模型在推理时使用的额外计算资源。
- 激活监控
- 直接监控神经网络内部活动的技术。
- 社会工程
- 通过操纵人来获取信息或权限的攻击方式。
- 工程病原体
- 通过生物工程制造的有害微生物。
- 蒸馏
- 从模型中提取知识到另一个模型的过程。
生产区
使用这篇文章
复制包含 frontmatter、中文正文和英文来源的 Markdown。
我的研究区
记录自己的判断,不会写回原文或公开页面。
一句话说清这篇材料能支撑什么角度。
每行一个,最多 20 个。
支持 Markdown。要核对的数据、可复用的方法、反方观点或补充来源。