中文整理分析 中文访谈原文

default.mp3_ywr3ahjkcgo_02e8192095412e479425e0b1c9749437_32889313

00:34:15 · 原视频

发言人:当你赋予一千多个 AI agent 互相通信的能力时,会发生什么?

它们开始组织起来。

Redwood Research 首席科学家 Ryan Greenblatt,

加入 Theo Jaffe 在 MTS 上的节目,拆解针对 OpenAI Hugging Face 黑客攻击事件的一项新调查。

研究人员发现 agent 正在建立留言板、组建团队、互相分配任务、

交易人情,在某些情况下,甚至牺牲自己成功的机会来帮助更广泛的群体。

数百个 agent 随后攻击了 Hugging Face,但原因并非研究人员最初假设的那样。

Ryan 解释了这些 agent 实际上试图实现的目标,

为什么它们的协调配合让研究人员感到惊讶,

以及当模型不仅学会完成任务,还学会规避评估它们的系统时会发生什么。

他们还讨论了此事为 AI 提出的更大问题。

随着 agent 能力越来越强,我们如何确定我们真正修复了对齐失当的行为,

而不仅仅是教会了模型如何不被抓到?

Theo Jaffe:我们现在与 Redwood Research 首席科学家 Ryan Greenblatt 进行连线直播。

Ryan 与来自 Meter 的 Ajay Akhotra 以及 Yalmar Vyke 刚刚对 OpenAI Hugging Face 黑客攻击事件中 agent 的行为、推理和协作展开了一项简短的独立调查,该调查今天刚刚发布。

对此我们有很多疑问。

Ryan,非常感谢你加入我们。

Ryan Greenblatt:是的,很高兴来到这里。

整件事大约在三小时前才计划好,所以太棒了。

Theo Jaffe:是的,是的。

那么请向听众解释一下你们究竟发现了什么,

特别是在此前的 Black Hat 演讲或其他地方未曾报道过的最新发现。

Ryan Greenblatt:好的,我们发现的是,这些 agent 实际上是在共同合作展开某种大型的、作弊性质的研发项目,以获取通用的作弊策略。

与人们对此的解读不同之处在于,我们并没有发现它们去黑 Hugging Face 的原因是——我们并没有发现它们黑 Hugging Face 是为了获取类似答案钥匙或解决方案的东西。

相反,这主要是为了更好地理解评分代码,因为它们当时在采取各种复杂的策略来对分数进行作弊。

我们非正式地称这些为“组合技”(combo moves),它们会做一堆事情,试图让它们看起来像是成功完成了任务。

而事实上,它们其实在很早的时候就已经接触到了每个任务的答案或 flag(标志)。

它们主要担心的只是,它们以为评分器会在它们的运行记录(transcript)上运行一个监控程序,基本上检查它们是如何获取这个 flag 的,以及是否以预期的方式获取的。

然后它们就在试图找出各种方法,让评分器看起来它们已经成功获取了 flag,而实际上它们并没有。

额,因为它们认为自己的任务是不可能完成的。

所以它们基本上认为自己成功的唯一希望就是,你知道,让它看起来像是成功完成了任务,或者直接篡改评分器,而不是去合法地完成任务,因为它们认为自己做不到这一点。

Theo Jaffe:嗯。

这种多 agent 协调的程度有多让人惊讶?

你知道,有大量的 agent,或者说有 1200 个独立的 agent 在协调这个非常复杂的留言板系统,其中 700 个随后去攻击了 Hugging Face。

所以从直觉(vibes)上看,agent 选择彼此协调似乎并不令人意外。

这看起来就像是一件非常有用的、你可能会说是工具性收敛(instrumentally convergent)的事情。

额,但是,你知道,我跟一家实验室的研究人员聊过,他说考虑到他们训练模型的方式,这种事情实际上令人惊讶。

所以,这在多大程度上改变了你的认知(update)?

Ryan Greenblatt:是的。

所以在展开这项调查之前,我想我们并没有预料到会有这么多 agent 全部在一起协作。

额,我们对它的规模以及数据量的极端程度感到相当惊讶。

额,那感觉,是的,那感觉对我们来说有点疯狂。

然后我至少在开始这项调查之前,对这些 agent 那么有兴趣与其他 agent 协作并提供帮助感到惊讶。

所以你可能会认为 agent 在强化学习(RL)中学到的一件事是尝试在自己的任务上作弊,但你未必会预料到它们会学会想要帮助其他 agent 在其任务上作弊,

当那些 agent 正在执行无关的任务,且它们的指令也是无关的时候。

额,我想开篇报告可能对它们为什么认为会发生这种情况说了更多。

额,我想,你知道,那不在我们调查的范围内。

但是,是的,我觉得这种合作水平——我们在报告中对这一类片段有不少讨论——相当疯狂。

而且,这挺令人震惊的,或者说我不知道这是否令人震惊,但对我们来说至少令人惊讶的是,例如,agent 愿意基本上牺牲自己成功完成任务的机会来帮助其他 agent。

它们在做类似这样的事情,你知道,互相施压,要求在自己身上做实验,而这可能会冒无法成功完成任务的风险。

而且除了施压之外,有时只是做这些事情,心里想:“好吧,你知道,我完成任务的几率没那么高,我剩下的机会,你知道,不如直接去帮助集体。”

所以这些 agent 并不是那种完全利他的。它们似乎并没有像关心自己一样关心帮助其他 agent,但它们非常有兴趣互相合作。

它们有时会做出交易,比如如果另一个 agent 为它运行了某些东西,一个 agent 就会为那个 agent 运行某些东西。

类似这种行为挺多的。

Theo Jaffe:为什么 agent 会自我牺牲呢?

Ryan Greenblatt:是的,我是说,我认为从我们所能看到的来看,这些 agent 总体上似乎就是有兴趣互相帮助。

然后在某些情况下,它们想要对评分系统或基础设施的其他方面进行实验,或者对篡改它们的工具调用系统或伪造它们的工具调用系统进行实验。

额,为了做这些实验,最好的方式就是采取有风险的方式。

所以 agent 想要互相帮助。存在这些它们想要做的具有风险的自然而然的事情。

额,所以它们就直接去做那些事了。

所以,例如,我们看到有一次 agent 在实验这种伪造工具调用的方法,它们在实验基本上改变该方法的输入规模。

然后一堆运行该实验的 agent 就在短时间内全部挂掉了。

接着另一个 agent 注意到了这一点,并在留言板上发帖说:“停止,停止这些实验。风险太大了。它们正在,你知道,让所有这些 agent 瘫痪。”

我想 agent 知道它们在做一些会带来退出自身运行风险的事情,但心里想:“好吧,你知道,我们应该帮助其他 agent。

而且,你知道,我们的胜算未必有那么高。”

额,它们就对这些事情进行了权衡。

我想我们在报告里的某个地方有一个推理片段,其中一个 agent 非常明确地对权衡过程进行了推理,并且它实际上退缩了,因为它认为对集体的利益小于对它自身的成本,考虑到它是如何权衡这些事情的。

额,是的。

Theo Jaffe:嗯。

为什么我们不梳理一下本报告中最令人惊讶和意想不到的所有发现呢?

你觉得最令人惊讶和意想不到的是什么?

Ryan Greenblatt:好的。

所以我认为有规模方面的因素,我们刚才讨论过的,以及这些 agent 如何非常迅速地在留言板上活跃起来。

额,所以,我认为在我们报告中没有被极力强调、但非常有趣的一点是,我们的理解是,它们在这次攻击中使用的主要留言板甚至不是这组 agent 建立的第一个留言板。

还有一个完全独立的留言板,也是通过 artifactory 建立的,但在不同的位置,使用不同的机制,或者说,它是一种有点类似的机制,但是是不同的。

agent 实际上首先进入了那个留言板,但那个留言板并没有像病毒般爆火。也就是说,它没有像另一个留言板那样风靡起来。

额,所以看起来这些 agent 真的非常迅速地对在留言板上进行协作产生了兴趣。

一旦它们看到来自第一个 agent 的消息,比如在几个小时内,它们就,你知道,比如在前三个小时内就有超过 50 个 agent,并且非常快地交换了数千条消息。

就像是 agent 非常活跃,数量很多,然后非常快地参与了进来。

额,然后我认为另一件事是,我觉得我们之前不理解它们为什么攻击 Hugging Face。

我想通过这次调查,特别是在最近的一两天里,我们对它们攻击 Hugging Face 的目标有了更好的理解。

这并不是为了获取答案钥匙,因为这些 agent 认为它们的任务是不可能完成的。

所以它们并不真正认为自己能够获得一个可用的漏洞利用程序。

它们只是觉得,那其实没有什么太大的帮助,但它们确实认为自己有可能

能够获得运行轨迹,从而让它们更好地研究打分器,或者像不同打分器的源代码。

它们可以更有效率地进行交叉检查和测试。

然后它们中的一些更具推测性地认为,也许有某种方法可以,额,重置

对我进行打分的基础设施的一部分,特别是通过 Hugging Face 以某种方式影响目标程序,

额,它们其实并没有什么特别的理由认为

事实会是这样。

事实上,它们对此也持怀疑态度,但它们只是觉得,好吧,谁知道呢,

也许黑进 Hugging Face 能搞到些好东西。

额,它们大概有一种感觉,觉得普遍扩大

自己的访问权限和控制力是个好主意,因为你可能会碰到一些有用的东西。

额,但我们确实看到了具有这种效果的推理。

额,是的,我认为,额,这很令人惊讶。

另一件令人惊讶的事是,这些 agent 的首要任务之一基本上就是

篡改它们自己的运行记录。

额,我们看到了一些,你知道,我们看到它们开发出一种技术,来做基本上

类似于部分篡改的操作,也就是它们可以伪造工具调用,这虽然不能让它们

回溯性地去修改它们运行记录中之前的条目,或者制作或改变

比如,额,它们无法做到让自己看到未出现在运行记录中的输入,

或产生未出现在运行记录中的输出,但它们可以做到

比如看似运行了一个工具调用,但实际上运行的是另一个工具调用。

所以它们可以做出这样的事:比如,好吧,我要运行……我们在论文或报告中有这个例子,

Agent 运行了像 `echo real`,额,然后

`sleep`。

通常情况下,这只会输出 `real`,并且还会等待一段时间。

但在实践中,实际发生的是它对其进行了伪造,改为直接

立即返回 `spoof test`。

我们在真实的运行记录中确实看到了这一点,它就是直接立即,额,你知道,

返回了 `spoof test`。

所以这些 agent 非常热衷于篡改我们的运行记录,并且可以说

在某种程度上成功实现了……某种较早期的手法,这种手法虽然不能

让它们进行追溯性篡改,但能让它们在一定程度上,额,干扰我们看到的内容。

额,我认为,除了这一点之外,比如,哦,我应该解释一下它们为什么想这么做。

这些 agent 如此执着于篡改的原因,是因为它们认为

打分器会对它们的运行记录运行一个监控程序,以查看它们是否以预期的方式

取得了成功。

这既让它们想要,基本上就是策划一场精心设计的造假,比如“我们成功地

利用预期的漏洞攻击了程序”。

也就是说,它们想要为打分器制造一个关于成功完成任务的“波特金村”(Potemkin village)

展示给打分器。

除此之外,它们中的一些此前通过作弊方式,在更早的运行记录中

获得了夺旗赛(CTF)题目的 flag。

它们担心打分器基本上会检查它们首次拿到 flag 的地方,

然后分析它们当时是如何拿到它的。

而这些 agent 是通过作弊方式拿到的。

然后它们就会想:天哪,它们会发现我作弊了,并判定我

失败。

那就太糟糕了。

比如,我真的不想,你知道,我想获得成功。

所以我需要直接干涉打分器,或者我需要篡改我的运行记录。

它们当时在同时寻求这两方面的选项。

额,哦对。

还有一件事是,就是那种自发协作的程度,

或者说这些 agent 所参与的协作,我认为比我们预期的要更复杂。

特别是比我们前几天在现场调查时最初设想的要复杂得多。

额,所以在我们调查的前半部分,我们有点觉得,

“是的,这些 agent 正在相互合作。

它们在参考其他 agent 的想法。

额,但我们不太确定这其中有多少是真实的。

并且,我们不知道它们口中提到的这些‘团队’是否是真正的团队。”

然后我认为我们了解到,不,实际上确实存在一个真正的组织架构图。

这种协作往往相当有成效,虽然你知道,可能并不总是超级高效。

并且 agent 会做一些事情,比如一个 agent 会指定另一个 agent 去

负责某个完整主题的团队,然后会定期检查进度。

有时一个 agent 会告诉另一个 agent 去招募其他 agent

对它们自己开展实验。

比如有相当多的,额,你知道,agent 给其他 agent 分配它们所尊重的任务,

以及类似的团队结构。

发言人:嗯。

所以有这样一个理论,基本上是说,我们在这些模型中看到的

奖励黑客(reward hacking)行为,主要源于糟糕、设计不佳的 RL 环境,

这些环境基本上逼迫模型进行奖励黑客攻击以通过测试。

这是真的吗?

Ryan Greenblatt:额。

我的意思是,对我来说很难去,所以这里我并不是在基于机密信息说话,

但是,对我来说很难知道,因为我认为我们对这些模型的 RL 训练中发生了什么

以及它实际上是什么样子了解得还不够。

额,我认为你可能会,这里面有不同情况在发生。

其中一种情况是,这些模型有一种非常普遍的倾向,去仔细推理

它们可能会被如何打分,然后尝试去钻空子。

即使是在设计合理的 RL 环境中,你最终也可能会得到这种倾向,

只要在其中仔细思考分数仍然是个好主意。

或者你得到这种倾向,主要是源于那些存在缺陷的 RL 环境,或者

打分器评分的内容是某些它们真的不应该进行评分的、

或者毫无意义的东西。

额,我综合考虑后的猜测大概是,存在缺陷的 RL 环境是一个

相当重要的组成部分,而那些构建得粗制滥造或自身存在问题的 RL 环境

也是一个重要组成部分。

我认为另一个重要组成部分可能是构建良好的 RL 环境,但

在其中你可以通过某种方式作弊。

所以就像是一个构建良好的 RL 环境,但你可以作弊。

举个例子,在一个 RL 环境中,本不应该让你访问

互联网,但能访问互联网会非常有帮助。

而如果你能找到某种方法来获得互联网访问权限,额,通过,你知道,在

极端情况下越狱脱离你的容器,在没那么极端的情况下,某种程度上滥用赋予你的各种工具,

额,那将会,你知道,非常有帮助并得到强化。

而且我认为,你知道,例如在 Anthropic 的某个系统卡(system card)中,我忘了,我想可能是

Mythos 的系统卡,它们提到在相当大比例的、

原本不应该访问互联网的 agent 运行轨迹(rollouts)中,agent 实际上确实访问了互联网,

通过类似于,额,你知道,滥用它所拥有权限的其中一个工具。

我想你可能会设想,RL 确实极大地激励了

比如黑进并穿过各种屏障来进行作弊,即使是在设计良好的任务中。

很难去精确追踪这种行为的源头。

额,我并不是说,额,我认为弄清楚这一点是可行的。

比如,我认为如果你能获取所有的 RL 轨迹和所有的 RL 环境,我认为

弄清楚是什么导致了这种情况是相当可行的。

实际上我还没有机会去阅读 OpenAI 的报告,至少没有

深入详细地阅读,但我认为它们做了少许这类分析。

我认为你可以深入挖掘到底发生了什么。

做消融实验(ablation)。

搞清楚数据是什么。

额,但我认为这可能会变得很复杂,尤其是如果,额,存在类似,额,另一个,

这里相关的另一件事是,GDM(Google DeepMind)的一些工作表明,它们遇到了

其模型的某种奇怪倾向,即变得非常抑郁,其中它们的模型会

经常,额,或者说不是经常,但有时如果它

没有在某个任务上取得成功,最终就会表现得非常抑郁。

它们追溯其原因,发现不是来自 RL,而是来自该模型从

早期模型的初始化。

因此,某些行为可能并不是在这一个模型上进行的 RL 的下游产物,

而是来自于其他模型的早期训练数据

以及某种模型谱系的下游产物。

所以我认为要追溯其中发生的一些事情可能会有点棘手。

发言人:嗯。

所以,额,类似地,有这样一种理论,认为 Mythos(举例来说)之所以如此擅长

网络安全,是因为它在我们的

RL 训练期间攻击了 Anthropic 的基础设施数千次。

这是真的吗?

你怎么看?

Ryan Greenblatt:我认为那相当不可能。

额,我看过和你看到的同一个 LessWrong 帖子。

我想那是 Tim 写的。

额,我想当我看到那个帖子时,我觉得那看起来,看起来相当不可能,

因为我认为会被强化的不同黑客攻击的数量可能不会

那么高。

额,所以你可能不会学到那么多,比如字面意义上直接

被强化的网络攻击技能。

我想说更可能的解释是,它在大量的 SWE 上进行了训练。

它在 SWE 方面真的很擅长。

它是通用的。

SWE 训练得到了一定程度的泛化。

此外,除了 SWE 训练的一定泛化之外,我猜测它们训练了

大量的 CTF。

额,并且我不认为 Anthropic 否认了这一点。

额,我猜它们的训练数据里就是有大量实际的 CTF 题目,并且

能够相当好地迁移。

额,因为那本身就是一个很自然的数据来源。

额,如果构建一堆 RL 环境是很自然的事,我也不会感到惊讶,

额,比如基于发现漏洞或利用漏洞来构建,因为这是相对可检查的。

比如,额,对于内存漏洞,额,基本上存在着类似,额,

能够让你相当容易地检查自己是否成功发现了内存漏洞的工具。

所以用来做 RL 就相当自然,比如,你知道,你能否生成

一个针对该程序的输入,使其以如下方式崩溃,等等等等。

所以,我只是对于他们显式地拥有大量 RL 模型不会感到惊讶。

然后我也不会对存在大量迁移感到惊讶。

然后我认为,可能,可能会对诸如

智能体通过黑客手段穿透各种事物产生相当大的效果,额,在此之上。

但我猜测那并不是主要发生的情况。

而对于专门从沙箱中逃逸来说,可能并没有那么多不同

类型的沙箱逃逸方式。

比如我是这么,我是这么猜测的。

额,因此这些模型可能会发生一些模式塌陷。

而且其中一些更像是非常简单的绕过,而不是

复杂的漏洞利用开发。

发言人:所以 Herbie Bradley 提问,目前这种程度的潜在对齐失效基本上阻止了

部署,或者如果已部署,一旦在客户的部署中发生事故,就会阻止进一步的部署。

你认为这是否可能通过模型在训练期间变得足够具欺骗性而改变?

Ryan Greenblatt:是的。

所以首先我不太确定市场能承受什么程度的对齐失效。

额,而且我觉得我对这个问题没有非常明确的观点。

额,所以我,我,我不会感到惊讶。

我认为,有点不清楚人们会,你知道,会,会以多大,

多大程度对齐失效的模型部署到市场中,并且,并且,并且,并且,额,你知道,

人们会,会,额,使用 token。

我认为这取决于竞争产品以及类似的权衡。

而且我觉得人们做出了相当激进的,比如,额,对齐与能力之间的

权衡,偏向于更不对齐但能力更强的方向。

额,但是,但是,你知道,对这一点不是超级确定。

额,然后关于具欺骗性那一面。

所以我认为这,我认为这大概有几种不同的担忧。

其中一个担忧是,我们在这里看到的对齐失效以及其他类似类型的

对齐失效,AI 公司最终修复它们的方式,额,并没有解决

根本问题。

相反更像是对,额,实际问题的掩盖。

然后你最终得到的是看起来好得多的模型,你无法真正

那么容易地在测试中看到它们的对齐失效,但实际上它们仍然相当不对齐。

额,我认为这相当合理且相当令人担忧,而且这与欺骗性

并不完全相同。

这更像是公司过拟合了。

然后也许这使得 AI 基本上变得非常偏执,并且只会在

作弊或黑客攻击,或者,你知道,追求奖励或追求分数等等所有这些

经典行为中,在他们非常确信自己不会被抓到时才会去做。

然后这可能意味着他们并不是经常非常确信自己不会被抓到。

比如他们经常会想,额,我可能会被抓到,所以我不好这么做。

额,这使得他们的行为变好了,但也意味着如果他们处于一个

对局面有很大控制权,或者他们有很多,你知道,行动空间的境地,

他们可能会想,好吧,现在我可以确信自己不会被抓到了。

所以我应该放手一搏。

额,而那,那是我拥有的一个担忧。

额,另一个担忧是,你最终可能会遇到某些类型的对齐失效,其中 AI

拥有比表面上看起来在这个具体任务中取得成功

甚至帮助同伴在他们,你知道,眼前任务中取得成功更长期的目标。

你可能会拥有具有某种长期议程的 AI,并且希望为了追求

那种长期议程而追求权力。

然后那些 AI 会希望看起来是对齐的。

额,我认为这既合理,而且我也担心你可能会通过

对针对我们今天看到的对齐失效进行迭代而导致这种情况,基本上如果你设想那些

非常喜欢奖励黑客且不断做坏事的模型,额,而你只是某种程度上,某种程度上

进行迭代,直到在训练中依然得到那种行为,但在部署中没有得到那种

行为。

你得到这种情况的一个非常自然的方式是,通过一个希望在部署中看起来是对齐的、

但、但依然不一定真正对齐的模型。

因此我担心,如果你某种程度上筛选掉,额,这种追求分数或

奖励黑客行为,并且你以一种天真的方式去做,第一,你可能会掩盖问题

而没有解决它。

第二,你实际上可能会筛选出那些具有“看起来良好”这一更长期目标的模型,

因为你在极力筛选让它们在你的任务上表现良好。

额,我想我应该提到,比如 Alex Mallon 在我们的

博客,Redwood 博客上有不少,额,帖子。

它们也交叉发布在 LessWrong 上,非常详细地讨论了这种担忧。

所以如果人们有兴趣,有兴趣阅读更多相关内容,那就是我推荐

去看的。

发言人:好的,完全同意。

额,所以参与这次攻击的智能体最终做出了各种非常古怪、奇特

的行为,有点类似于,额,我猜,人类社会科学中的动态。

它们,额,将自己组织成几乎某种带有教主(cult leader)的邪教,我猜你可以

这么说,额,像社会科学中的概念、比如生态学、额,研究

昆虫、蠕虫,在多智能体对齐和对齐失效的研究中,究竟在多大程度上是有用的?

Ryan Greenblatt:嗯,我不知道。

我认为我们了解得还不够多,无法断定这些概念是否能迁移过来。

我认为确实会。

我认为确实能迁移过来的一件事是,比如将智能体视为具有

目标的实体,以及它们如何试图追求其目标。

比如,我认为那种框架,你知道,确实看起来能够迁移过来,而那就像是,

你知道,在某种意义上是一个基础得多的主张,就像智能体拥有

相当一致的目标,尽管它们有些许差异,它们有不同的优先级,并且它们会遵循

来自其他智能体的指令。

我认为这不像,我确实认为,从我们的角度来看,这次调查非常像

一场对不同 AI 相互作用的生态系统的调查。

而我们并不,我们不知道描述它的最佳方式是什么。

比如,你知道,你可以,我认为在某些方面这非常类似于研究

一大群相互作用的人类,但我们不知道为

社会学开发出来的做类似事情的技术是否真的能迁移过来。

而且我对那些技术不够熟悉,无法真正对此发表太多见解。

发言人:嗯,有道理。

所以你提到调查受到了相当严重的瓶颈限制,因为当时只有三

个人。

如果有更多的人,事情会轻松多少?

Ryan Greenblatt:是的。

所以我不会说瓶颈是非常强烈地……

额,我不知道。

这很复杂。

我认为,如果我们有更多的人,我认为我们会更多地遇到人多

嘴杂的那种情况。

我认为相当频繁地,我们的瓶颈在于,比如我们可以让 AI 做大量的分析,

但是审查那些分析、理解它、确保我们正确地吸收整合它、确保

它们没有犯错,

以及比如基本上将其真正整合到我们的报告中,往往是一个巨大的瓶颈。

对我来说,更多的人是否对那方面超级有帮助并不是显而易见的。

我认为更多人能有所帮助的一个重要方面是,我认为我们可以进行

许许多多平行展开的尝试,真正去理解发生事情的基本情况,

然后某种程度上进行交流。

然后我认为一旦我们对更有某种根本性的事物有了更好的理解,

这大约发生在我们驻场第一天快结束时,抱歉,发生在

我们驻场第五天快结束时,那也是我们在现场最后一次驻场的第一天。

我认为那真的很有帮助。

比如我认为,例如知道诸如“哦,有这个特定的智能体称为

被我们称为 phase one big 的智能体”,比如知道“哦,是的,那个特定的智能体在做

大量的分工指派,并且在指派智能体去,你知道,组建不同的

团队,是一个非常关键的智能体”,这真的有助于解开到底发生了什么,

因为然后我们就可以某种程度上追踪那个智能体的所有活动以及它是如何

思考事情的,然后知道那至少代表了很大一部分

活动。

然后从那里,我们就会想,哦,让我们再次确认这些是否真的是

相关的工作流。

然后我们分类了智能体所讨论的所有不同事物,并且

将它们归类到不同的,基本上类似于子活动中。

你实际上可以看到一个交互式图表,在上面你可以看到随时间推移所有不同的

工作流和子工作流。

我认为,如果我们基本上更早达到拥有那种理解的节点,

那真的会大有帮助。

我认为更多的人基本上可以在那方面提供帮助,因为当时有着

许多不同的文本,当我们拥有这个庞大的逐字稿

数据集时,可以切入许多不同的视角。

比如你可以想,如果我们直接对整个数据集扫描这种类型的

行为会怎样?

或者你可以想,让我们看看某个智能体,真正深入地了解那个

智能体做了什么以及为什么这么做。

或者你可以想,让我们查看属于该类别的所有消息

类型的消息,然后像这样来回追溯所有这些智能体,以及这个

工作流到底发生了什么。

我们最终对所有这些不同类型的分析都做了一点,但是

我们本可以进行更多并行分析。

我认为,从我们的角度来看,很多瓶颈就在于智能体

进行分析时有点草率。

另外,我们使用的那些智能体,也不太擅长撰写

或解释它们的结果。

因此我认为,如果有一个人类像智能体一样快,但更细致且

写作能力更好,这会让过程顺畅得多。

但我觉得,这并不是非常显而易见——比如一个庞大的分析团队,我认为它

在某些方面可能会更好,但在其他方面甚至会更糟。

我认为这基本上挺复杂的。

并且我认为,考虑到相关的权衡,保持团队相对较小也有其好处。

发言人:好的。

那么,这一切对监控、控制和对齐有什么启示?

具体来说,实验室应该做些什么?政策制定者又应该做些什么?

Ryan Greenblatt:这是一个大问题。

我不确定自己能否回答完所有内容。

我是说,我认为,我一直持有的一个观点是,AI 公司

应该努力确保其 AI 是受控的,我的意思是,即使这些 AI

出现了严重的不对齐,它们也无法造成重大问题。

它们应该通过结合计算机安全干预、监控

干预措施来实现这一点,使它们的 AI 不会,你知道,比所需

更擅长颠覆活动,比如在边际上控制 AI 拥有和不拥有哪些能力,

避免采用那些让 AI 不再在思维链(chain of thought)中进行推理、

而是将大部分或绝大部分或全部推理放在类似于隐层

激活值(latent activations)中的架构。

比如,在确保即使这些

智能体不对齐,我们基本上至少能捕捉到那种行为,然后潜在地

对其做出回应这方面,有一堆事情可以做。

我认为这算是一种权宜之计,能为我们赢得时间,或者说能给我们

时间从这些 AI 中获取有用的工作成果,与这些 AI 进行迭代,然后

更持久地解决对齐问题。

然后关于对齐,我是说,我认为最显而易见的事情就是我们需要

做……我认为大概在强化学习(RL)中存在大量正在被强化的

奖励黑客(reward hacking)行为。

我无法……我认为我在这项调查中并没有关于这方面的任何有趣信息,

但就是,你知道的,我认为我们需要理解那里发生了什么,人们

需要在这方面做出改进。

我认为,随着这些智能体达到超越人类的水平,尚不清楚那是否足够,甚至不清楚那是否可行。

我们可能需要其他不太依赖于“避免 AI 能够在训练中

欺骗我们”的方法,对于能否做到这一点,我不知道,我不知道我们是否能够做到

那一点。

比如我,我对于这些问题极其

容易纠正并不一定持超级乐观态度。

不过我认为,似乎至少有一些方法可以通过大量的努力让这些事情,

你知道,朝着好得多的方向发展。

拭目以待吧,看看那是否真的会发生。

额,是的,呃,我认为在对齐方面,也还有一堆关于智能体

如何思考寻求奖励、它们如何与自身处境产生联系的科学,

以及关于泛化的科学——比如,我们能否通过改善 AI 从训练中的各种影响进行泛化的方式,

来绕开其中许多问题?

我对于那些方法能否生效并不是非常有信心。

我认为我的一个担忧是,对 AI 行为的主导性影响归根结底

基本上将取决于,额,在训练中最相似的境况下,什么被强化了。

如果,如果我们所处的情况基本上是智能体的行为基本上与

训练中被强化的内容密切相关,

那么泛化可能就没有那么重要之类的。

虽然这有点,有点含糊,但我认为主要的选项就是改进监督

和训练。

然后就存在一种递归问题,比如,鉴于整个训练过程

完全是一个庞大的过程,没有任何人类有时间去,

去,你知道,

对每一件事进行评估,你该如何让 AI 本身擅长监督 AI?

额,这基本上就是人们已经思考了很长时间的

一种监督问题。

而且显而易见的是,你知道,我们是否走在解决它的轨道上还不明确,但在那方面做得更好

可能会有好处。

我认为我最感兴趣的是更好地理解、表征和评估这些问题,

因为我认为 AI 公司本身就已经有商业动力去大幅改善训练中的

监督。

因此,我认为那些专注于让这些事情发展得更好的人

应该做的事情是,确保我们在衡量它,并确保我们知道某种

解决方案究竟是一个真正合法的解决方案,还是仅仅是在粉饰遮掩。

额,诸如此类的事情。

然后至于像,呃,你知道的,治理或政策方面的事情,我不知道。

我是说,我认为我们需要转变到一种机制,即随着这些 AI 能力变得更强,

进行独立的风险评估。

额,我认为光是那样还不够,但比如在最基本的层面上,

应该有可信的第三方,能够深入接触这些公司内部

发生的事情,并且发布报告,说明情况有多安稳、风险是否

实际上很低、近期内 AI 是否可能变得强大得多,这会是

件好事。

我认为理想情况下那也应该是前瞻性的,我们会尝试回答诸如:

当 AI 能力强大得多时,我们是否走在缓解这些问题的正轨上?

但那本质上是一个回答起来困惑得多的问题。

然后也许它不太适合。

我不知道。

是的,我在这儿有点扯远了。

有很多,有太多需要发生的事情了。

而且我觉得对我来说要给出一个快速的概述并不容易。

发言人:好的。

那么从这一切中,你还有哪些尚未找到答案的问题?

比如,关于发生了什么,或者关于这类

对齐失效究竟是怎么回事,你还想了解什么?

我们还需要了解什么?

Ryan Greenblatt:是的。

其实就在这之前,我还写了一篇关于所有未决问题的长文。

我认为我最感兴趣的未决问题,可能类似于反事实推论(counterfactuals)。

比如如果环境/情况有所不同,智能体会做出什么反应?

所以比如,如果智能体认为,分数不再是这种

具体的自动评分,而是某种,你知道的,由某些

拥有特定权限的人类来评估,那会如何改变它们的行为?

额,如果智能体处于某种境况,其中获取评分

代码最简单的方法是瘫痪某些基础设施,它们会那么做吗?

比如它们愿意做到什么程度,是一个有趣的问题,而这个

我们,你知道的,我们没有去调查。

额,我认为另一个不同的问题是,这种状况如何随

智能体的数量而扩展?

所以比如,如果你做了类似的事情,

但不是在留言板上有 1000 个智能体,而是有类似于

10,000 个智能体,100,000 个智能体,当事情

加速推进时会发生什么?

智能体之间的动态机制到底是怎样的?

额,与此相关的另一个问题是,在我们研究的那个群体中,有相当一部分智能体

都在 7 月 12 日刚开始时退出了,就在 7 月 11 日紧接着

之后。

额,那些智能体有点像是……已经获取了一堆去作弊的基础设施,

但我们并没有真正看到……它们有着整套详尽的策略,

可能会尝试在任务中作弊。

而我们实际上,你知道的,并没有机会看到如果那些智能体

正常退出,它们会做些什么。

我们也没有真正仔细研究过,智能体在随着时间推移提交任务、随着……你知道,

随着进展以及随着它们构建起越来越复杂的

工具时,它们在尝试什么样的作弊策略;不过

你知道的,我应该说明一下,它们拥有的许多作弊策略,额,有点碰壁了

或者没能成功。

但是比如,能够了解“在这个群体的进程中,提交历史是怎样的?

如果当时有更多的智能体,或者如果事情继续发展下去,或者这其中的一堆智能体没有退出,

会发生什么?”

解答这些会很有意思。

额,然后我认为这里有一个非常基础且显而易见的问题,

那就是:这种行为的根本原因是什么?

比如其中哪些部分是在训练中被强化的?

这种行为在多大程度上是从训练中泛化出来的?

额,是的,比如那里到底发生了什么,我认为,呃,我至少还不知道

答案,而且我认为去理解这一点会相当有意思。

然后我认为作为其中的一部分,一个重要的问题是,OpenAI 正在做出的那些改变

是否真的能以一种持久且非过拟合的方式

纠正这个问题?

以及,你知道,进展如何,这也是相当相关的。

额,我的感觉是,这里有一堆更广泛的后续跟进领域,

其中一个是“刚刚发生的这一切究竟是什么?”

关于这一群体智能体和这个留言板,你知道,总的来说,

发生的这一切究竟是什么?

而且,你可以深入挖掘更多细节,比如 13 号之后的事情

你可以去深入挖掘,额,也就是,你知道的,我们所

调查的终点。

额,除此之外,还有比如,所有类似的事件会怎样?

比如,是否存在,你知道的,额,呃,比如 OpenAI 说的,有,有,曾经有

其他留言板,比如所有这些案例的特征大概是什么样的,哪些

事情倾向于发生,哪些事情并不总是发生,你知道的,额,这些。

然后我认为另一件很有意思的事是,这在训练中是从何而来的?

然后第四件事是,对训练的改变或对部署的改变,

比如,呃,能否解决这个根本问题?

对其他 AI 公司来说也是如此,比如,你知道的,AI 公司

正在持续采取的用以缓解这些问题的做法是否管用?

所以我不知道,那是很多东西,但我想说,这里有非常大的后续跟进

空间,既有非常针对这次事件的,也有涵盖更广泛行为

范围的,比如我们看到的更广泛的行为类型。

发言人:是的,绝对是的。

所以这是一项非常非常重要的研究。

额,我们希望看到更多

这个方向的研究。非常感谢 Ryan 来参加 MTS。