default.mp3_ywr3ahjkcgo_957c9361188a1a95edb44470c4143ede_38168545
发言人:每当一个规模达万亿美元的新产业出现,
都需要这样一个独立的测试机构。
当 Meta 发布 Llama 4 时,在我们保留的私有基准测试中,
该模型的表现实际上并不理想;
但在所有主流的公开基准测试上,
它却展现出了令人难以置信的能力。
你们能达到的极限是什么?
在此范围内,你们又是如何着手去做的?
在理想情况下,应该拿一个前沿模型,
让它来训练它自己的下一个版本,
但这显然非常昂贵且缓慢。
因此,我们正在做的是建立一套代理指标,
涵盖构建模型下一个版本
所需过程的每一个环节。
评估随着复杂度的提高,
样本量变少了,
但对它们设定的标准或期望却更多了。
你认为目前出现的差距在哪里?
政府往往倾向于关注
自己所担忧的事情,
无论是生物黑客攻击还是网络黑客攻击,
但接下来的问题是:
模型能做到这一点吗?
你能让模型做到这一点吗?
你认为未来的格局会是什么样子?
AI 模型在不断进步,
但我们用来衡量它们的测试几乎以同样快的速度过时。
在本期节目中,
我与 a16z 的本·霍洛维茨(Ben Horowitz)和珍妮弗·李(Jennifer Li)一起,
与 VALS 创始人兼首席执行官雷扬·克里希南(Rayan Krishnan)展开对话,
探讨衡量 AI 这一日益棘手的难题。
我们深入探讨了为什么公开基准测试
会扭曲模型的真实能力画像、
为什么独立评估至关重要,
以及在模型发布前的几个小时内
对其进行测试需要付出什么。
但这件事的意义已经远不止于
模型排行榜。
随着企业在 AI 上的支出不断增加,
他们需要知道哪些模型和智能体
实际上最适合他们自己的业务工作,
以及这种智能是否物有所值。
雷扬还解释了为什么基准测试需要
与模型共同演进、
VALS 如何衡量递归自我改进,
以及为什么评估(EVALS)最终可能成为
衡量 AI 能力、
风险与政策的通用语言。
珍妮弗·李:那么我想先从
2024 年 VALS 的创立谈起。
当时你们团队发现,
所有公开的基准测试
都远远不足以
衡量模型的进步,
必须出现一种新的方法论
和新途径,让我们保持在前沿,
并帮助模型实验室继续爬坡提升能力。
请带我们回顾一下 VALS 的创立之初,
以及你当时认为市场上缺失了什么。
雷扬·克里希南:是的,是的,我是说,我之前有做研究的背景,
特别是在构建基准测试和评估方面,
所以对我来说非常明确的一点是,
构建用于生成的新系统,
与开发用于评估的新机制之间,
存在着极其紧密的联系。
事实上,为了做好其中一方,
你往往需要提升另一方的能力;
而且事实上,提升模型能力的最大驱动力之一,
就在于拥有一种清晰易懂的新方式
来评估模型。
所以在 2024 年初左右,
你会看到
市场上其实涌现出了许多有趣的模型,
它们并不全都来自 OpenAI。
而且特别值得注意的是,
要真正确定这些新模型具备了哪些新能力,
变得比以往任何时候都更加困难。
因此,从某种第一性原理出发,
我们意识到,
必须有一家第三方公司,
纯粹为了构建极高质量的评估
和基准测试而存在,
从而能够辨别
这些模型新实现了哪些可能性。
于是我们在 2024 年发布了
我们的第一批基准测试。
在过去几年里,
这一需求在行业许多不同领域
都逐渐得到了印证和认可。
珍妮弗·李:我想一个显而易见的问题是,
你为什么认为各家模型实验室
不能自己来做这件事?
因为他们最清楚
模型正在哪些方面爬坡提升,
以及在能力上缺失了什么。
为什么他们自己不能成为基准测试的源头呢?
雷扬·克里希南:是的,我是说,在实验室内部,
他们确实构建了许多优秀的基准测试,
这也正是推动模型进步的原因。
但我认为,当我们以一种自报成绩(self-reported)的方式
来谈论模型能力时,就会出现问题。
你看到的早期迹象之一,
就是 Meta 发布 Llama 4 的时候。
那场发布有点像一场灾难。
有趣的是,
我们看到的情况是,
在我们保留的私有基准测试中,
该模型的表现实际上不尽如人意。
但在所有题目和评分细则
均已开源的主流公开基准测试上,
它却展现出了惊人的能力。
因此,基于这些公开基准测试自报的数据,
与我们通过质量更高、信号更强的基准测试所实际测出的结果之间,
存在着巨大的脱节。
但我认为这反映出了一个更广泛的理念,
模型实验室本身其实也理解这一点,
那就是他们也希望看到一个理性的买方市场。
他们希望看到,
当自己投入数十亿美元构建一个新模型时,
能够通过切实实质的方式拿出证据,
证明我们在这些方面确实取得了进步,
而不仅仅完全靠自吹自擂
来为这笔投资证明合理性。
所以你也看到了诸如德米斯(Demis Hassabis)
以及业内其他人
都在呼吁建立一个
第三方评估者生态系统。
本·霍洛维茨:你脑海中对此有什么历史先例可以类比吗?
比如评级机构、审计事务所。
最合适的参照物是什么?
雷扬·克里希南:是的,我认为坦率地说,
全面来看都有值得吸取的教训。
每当一个规模达万亿美元的
新产业出现,
都需要这样一个
独立的测试机构。
我认为 AI 发展如此之快的事实,
使得许多类似的对应先例必须迅速显现。
我们对自身的定位是
努力立足于市场的双边:
一方面,实验室需要通过某些机制
证明新模型具备强大的能力;
但另一方面也同样对应着,
企业需要弄清楚
采取什么样的落地应用策略
才能为他们带来最大的投资回报率(ROI)。
珍妮弗·李:是的。
请带我们了解一下模型正式发布前
大约 6 个小时的预发布窗口期。
显然,你们需要在不推迟发布的前提下
运行数百亿个 token,
哪部分是你们在通宵熬夜手动处理,
哪部分又是自动化的?
请给我们讲讲这个过程。
雷扬·克里希南:坦白讲,这确实是一段不平凡的历程。
我认为我们心目中真正的北极星目标是,
我们绝不想成为
某种滞后指标,
或者成为模型发布的绊脚石。
这意味着
我们必须动作
非常、非常迅速,
并在我们拥有的速率限制(rate limits)
或处理能力下,提取出尽可能多的有效信号。
在早期,
实际情况就是我和我的联合创始人
兰斯顿(Langston)两个人
通宵达旦,
竭尽全力完成尽可能多的工作,
从而把测试结果交付出去。
现在我们已经建立起了一支团队,
而且在基础设施上也进行了大量的重度投入。
因此我们能够以高度分布式的方式
运行评估,
针对我们获得的每一个模型,
都能在其实际允许的最大速率限制下有效运行。
此外,我们还有一个名为 Steve 的内部系统。
Steve 是 VALS 的经济型员工(economic employee)。
这构成了一种机制,
随着时间的推移,我们能够把更多的人力工作
交给 Steve 来承担。
本·霍洛维茨:你如何应对这样一个问题——
这在某种程度上是一个“AI 完全”(AI-complete)问题,
因为我们人类至今
其实并不擅长评估人类自身,
或者说在这上面并未达成共识。
虽然有智商(IQ)测试、
情商(EQ)、
大五人格特质(Big Five)等等,
但对于我们究竟该如何评估,
并没有一个真正公认的框架。
人们对像 SAT 这类的考试
以及各种各样的测评都有微词。
当然,
模型非常擅长对基准测试进行投机取巧(hacking the benchmark)。
Llama 4 就是明证。
那么你如何看待
这个问题?
你们所能做到的极限是什么?
在此范围内,
你们又是如何着手去做的?
雷扬·克里希南:我想坦率的回答是,
这正在迫使
许多更为模糊
或分散的评估形式
变得明确清晰。
在一家律师事务所里,初级律师(associate)
与合伙人(partner)之间的真正区别到底是什么?
在人类世界中,
对此并没有明确的测试或评估。
因此,我们必须首先
在这些不同的企业
或现实世界的工作流程中确立其中的很多标准,
这样我们才能
以同样的方式对模型进行测试。
我认为从长远来看,
这实际上将是
最大的瓶颈,
即我们获取各家公司
及其评估标准,
并使其变得清晰可辨的能力,
因为只有这样,我们才能弄清楚
我们应当循着什么信号向上攀升优化,
以及我们到底在哪些地方真正落地应用。
发言人:非常有意思。
实际上,本,
或许有一个问题想问你,
就是在智能
出现之前,
这个行业是如何形成的。
比如我们现在衡量的
是一种非常流动多变的东西,
而以前,
比如当我们谈论
企业软件时,
会有高德纳(Gartner)评级,
涵盖大约 70 种不同的指标。
你大致可以在象限图上
进行综合排位,表明
这家公司覆盖了
这些功能特性,
没覆盖那些功能特性。
但现在在各个行业中,
就像是参差前沿(jagged frontier),
非常难以衡量。
在你看来,
过去有什么
可以类比的历史经验
是我们可以借鉴的?
展望未来,你又认为
真正
会构成的挑战
和缺失的要素
到底是什么?
本·霍洛维茨:这有点
让人联想到美国电影协会(MPAA),
对吧?
就像是,
什么是艺术?
什么是色情?
界限在哪里?
什么时候是 R 级?
什么时候是 X 级?
顺便说一句,
我认为随着时间的推移,
对此的定义也发生了改变。
比如过去
属于 X 级的内容,
现在变成了 R 级,
等等。
那么什么是 PG-13 级?
诸如此类的事情。
而且并没有明确的标准,
正如那句名言所说:
“我见到了
就会知道”,
我认为
针对这件事,
我只是觉得它必然
会是
模糊的,
但随着时间的推移,
会逐渐形成
行业规范。
你知道,
如果有足够多的
管理企业、
或管理财务、
或管理其他业务的人
达成共识,
认为“是的,没错,
我认为这就是一种规范”,
那便水到渠成。
而不是像
我们现在在很多
公开基准测试中所做的那样,
即如果你能解决
这个特定问题,
那么你就达到了这个水平,
等等。
我认为那种方式
一来容易被针对性攻破(attackable),
二来
也太狭隘了。
雷扬·克里希南:我想当你审视
某些
历史类比时,
也可以从中
吸取很多经验教训,
包括哪些地方出了问题,
以及我们需要避免什么。
我想,比如
在 Vals(原文作 Bowles),
我们很早就做出的
一项决定是,
决定
绝不向实验室
出售训练数据。
这往往是
我们被推向的一个方向。
当我们开始
与一家新的实验室合作时,
对方总希望我们去搜集
并卖给他们
一大批训练数据。
发言人:是啊,那是一门很赚钱的
生意,确实。
雷扬·克里希南:是的,实际上
该行业的很多机构
现在都构建了这些
噱头式的基准测试,
作为一种
出售他们数据的机制,
因此这也成了
他们的一种进入市场(go-to-market)策略
之一。
但我认为如果你看看
审计这个行业,
最终就会出现
类似安然(Enron)事件的问题:
如果同一个团队
既负责
进行审计,
又同时为公司提供咨询
和支持服务,
就会产生混杂的
利益诱导机制,
随之而来的就变成了
花钱通过审计,
或者在这种情况下的
花钱赢得基准测试。
而这绝不是
市场能从中获益的做法,
也不是我们想做的事情。
发言人:雷扬,
如今你们已经拥有了
相当广泛的目录,
涵盖各种不同类型的基准测试。
其中有些更侧重于
特定行业,
有些则更偏向
消费者心理健康相关。
或许首先可以谈谈
哪些基准测试
最受欢迎、
被研读最多,
我们也很想深入探讨
其中一个。
雷扬·克里希南:是的,我们在
具有经济价值的
模型应用方面
开展了
大量工作。
我们的金融智能体基准测试(finance agent benchmark)
正被许多
大型金融机构所采用,
用来了解
模型的提升情况。
我们在编程领域
也有很多出色的成果。
比如我们的 VibeCode bench
衡量的是模型
如何根据自然语言提示词
构建全栈
Web 应用程序。
在过去的九个月里,
这成了一种敏锐追踪
模型进步
的途径。
是的,我们还在做
很多更具实验性的工作。
比如我们最近发布的
一个基准测试,
让我感到非常兴奋,
那就是我们的递归
自我改进指数(recursive self-improvement index,简称 RSI)。
很多大实验室
一直在讨论这个话题,
并开始在各自的模型卡(model cards)中
对此进行
报告。
但此前并没有
一套共通的语言
来探讨
模型的 RSI 潜能。
因此我们构建了这一测试,
作为一种公平对等(apples-to-apples)的方式,
真正对各个模型
进行横向基准测试。
发言人:是啊,我觉得那是一个
非常酷的基准测试。
这在研究界当下非常火热,
即你该如何衡量
可以取得的进展——
通过拥有
更多前沿模型,
从而实现能力
的持续
复合累加。
你们实际上
是如何着手
构建这个 RSI 基准测试的?
雷扬·克里希南:是的,我想
在理想情况下,
你真正想做的
是直接拿出一个
前沿模型,
让它去训练
自身的下一个版本,
然后观察增量(delta)
来自哪里。
但显然
这样做的成本非常高昂,
而且速度缓慢。
因此我们所做的是,
针对构建模型下一个版本
所需流程
的每一个环节,
建立一组
代理指标(proxies)。
下一个版本。
因此这里包括围绕
预训练(pre-training)、
后训练(post-training)、
以及测试框架层面工程(harness-level engineering)的一些工作,
进而观察
在哪些机制
和行为上,
模型能够
做好出色的研究工作
并构建出新东西,
以及它们在哪些方面面临困难。
发言人:非常酷。
此外也有一些情况,
你们废弃了
某些指数
和基准测试。
很有意思的是,我一直在
观察这个基准测试行业,
人们就像
在早期扩散模型时代那样,
比如刻意挑选(cherry-pick)
呈现效果最好、
最完美的
图像;
基准测试也是如此,
比如你挑选一个
非常热门、
但可能已经饱和的测试,
然后在上面
获得非常靠前的排名,
或者拿到极高的分数。
但你们采取了
截然不同的做法,
如果这些
基准测试饱和了,
你们就会将其废弃。
或许可以跟我们谈谈
你们在这方面的
思考。
雷扬·克里希南:我认为这是一种必然,
这也正是
我们所处的一场无限游戏。
你身上正穿着
我们的文化衫,
我们有这么一句
非官方的座右铭——
“总有更高的山峰”。
发言人:很喜欢这件衣服。
雷扬·克里希南:是的,所以只要
基础模型实验室
还在不断向上攀登优化,
寻找下一座
要去登顶的
峰峦,
我们的工作就是
永远为他们
筑起下一批
等待他们去登顶的
高山。
我想这也正是
经济体系自然运作
的方式。
随着时间的推移,
比如农业
对我们的劳动力市场
变得不再那么重要时,
我们的人口中
就会被要求提供
新形态
的劳动。
同样地,
我们也应该期望
我们的基准测试
能够跟上
我们希望模型去达到的
全新
前沿。
淘汰基准测试还有另一个维度,
我认为也是
容易被低估的,
那就是
基准测试也应当
能够反映
现实世界的
当前状态。
同样地,
如果你是一名律师,
你必须
重新参加司法考试
并获得认证,
或者如果你是一名建筑师,
你必须取得
你的执业资格认证,
医生也是如此。
我们也应当期待
模型能够接受
基于现实世界当前状态、
基于我们在医学上的
最新认知、
或基于我们现行
法律条文的
测试。
因此,将判例法(case law)
的更新引入
类似法律检索
基准测试这样的做法,
正是源于一种愿望:
想要创建一个
更加能够反映
现实世界
当前状态的基准测试,
同时也推动模型
朝着我们希望
看到它们迈进的
方向前进。
发言人:那么这又是如何发展的呢?
我想,
比如
过去
我们通常
是在做这种
多答案
或
多步骤的
问题,
单纯用来
评估提示词
与回答。
而现在,
正在开展
越来越多的
智能体(agentic)工作,
无论是在
金融、
法律,
还是编程方面,
尤其是
出现了
大量的
你知道,
异步后台
能够
直接完成任务的智能体。
这在某种程度上
是如何改变了
你们构建
基础设施的方式,
以及你们如何思考
评估
各种能力——
不仅仅是
模型
与智能体
本身的能力,
而且现在
显然也存在
更多
不同的维度
是大家所
关心的。
这不仅仅关乎
能力,
还关乎成本,
关乎延迟,
还关乎比如
你知道,
这个
模型
是否足够灵活,
能够应对
更广泛的
领域
和任务等等,
诸如此类。
那么你们
是如何思考
为所评估的
内容增加这些
额外的
评估
参数/维度的?
是的,
我觉得
这里面涉及
很多
方面。
我认为
在
基础设施
层面,
你会面临
一整套
全新的
问题。
我是说,
举例来说,
现在我们
正在测试模型
以及它们
持续运行
数小时、
数天、
有时甚至数周的能力,
因此
基础设施
必须
非常稳定,
才能支持
随时间推移的
长期评估;
而且如果中间
出现某次失败的
请求,
我们应该能够
从那一次请求重试,
从而继续进行,
而不用重新执行
整个运行轨迹(trajectory)。
所以在基础设施中,
有一些简单的机制
是我们
必须要去
考虑的。
但我认为,
总体而言,
我们所看到的是,
评估随着
它们变得
越来越复杂,
样本量
变得更小了,
但针对它们的
评估标准
或期望要求
却更加庞大。
我这么说的
意思是,
一个基准测试
很大程度上
就是某种
输入空间,
包含你试图
查询并让模型
去完成的
各种任务;
以及一套
需求
或评分标准(rubrics),
体现着你
在对输出结果上的
预期
与要求。
因此早些时候,
你会有像
ImageNet 这样的基准,
它拥有
数百万张
图片,
你试图
获得
一个基础的
分类
结果,
所以它是
一对一的
映射,
存在于
图像输入
与文本
标签输出之间。
而现在我们
所拥有的,
是一组数量少得多的
任务,
比如“帮我生成
50 个全栈
Web 应用程序”,
但却伴随着一个
庞大复杂得多的
机制,
用来评估
所生成的
输出结果。
我认为
这种趋势
还将
继续下去,
随着我们看到
更多复杂
工作流
通过模型
进行评估。
那么你
认为
它是否会
变成
某种
实时
的
类似
机制?
比如
针对
像 Open-
Router 这样的产品——
Stripe
刚刚收购了它——
Open-
Router
会不会参考
评测数据(Vals),
然后说:
“好,
下一个请求
应该
发送到哪里?”
还是说
这基本上
会是
专门用于
比如
挑选
某个模型,
供企业
用于特定任务?
是的,我是说,
我觉得
你知道,
OpenRouter 这个名字
有点
名不副实(misnomer),
因为
他们的大部分
用量
来自于
扮演
模型网关的角色。
所以
实际上
是取决于
他们的用户
自行决定
他们想要使用
哪个模型,
以及
何时使用。
这是
因为
路由中
最困难的部分,
其实
是构建
评估体系(evals),
并努力
确定
在哪些场景下,
应该将
某一组
智能能力
应用于
某个
特定的
应用程序。
因此,
我们在支持
企业客户
构建
评估体系上的
努力,
实际上也
支持了
他们当中的
许多人
进一步
采用
路由器(routers)。
能否再多谈谈,
为什么这不仅
对模型实验室
很重要,
而且
对企业而言
也是关乎生死存亡(existential)的?
也许还可以
顺便讲讲
你们团队
是如何
与企业客户
展开合作的。
当然可以。
是的,我是说,
我觉得
实验室那一端
的逻辑
非常明确。
比如你知道,
如果你在
筹集巨额
资金,
巨额投资
用于构建
模型,
那么向外界展示
你的模型
为何正变得越来越好,
以及
为什么这个
客户
应该
为它们
支付
溢价,
对你来说至关重要。
但我认为
依然被大家低估的是,
在
企业端,
这也同样
正在演变成
关乎生死存亡的
头等大事。
你知道,
我手头有一个
与此相关的
小故事。
实际上
在我与一家
公司的会面中——
这家公司位列
财富 10 强(Fortune 10)——
他们
引入
Claude Code(AI 编程工具)
的方式,
是为他们的工程师
设置了大约
每天 100 美元的
预算额度。
于是
我所听到的
情况是,
这实际上
已经从根本上
改变了
这家公司
开展工作的
方式。
因为
系统有一个
速率限制(rate limit),
会在每天下午 4 点重置,
于是
工作效率最高的
核心时段,
实际上变成了现在的
下午 4 点到 6 点——
也就是
速率限制
刚重置的时候。
但接着,
在整个下午
就出现了一段停工期(dead period),
这时大家
就会跑去
散散步,
或是喝杯
咖啡,
因为他们
已经没有
可用的
速率限制额度了。
所以
我认为
真正
极具启发性的
地方在于,
你会
看到
在技术栈的
每一层
都在发生着
对“智能”
的价值误判。
我的意思是,
你的工程师
拥有
价值 100 美元的
使用
额度上限,
但他们
并不真正
懂得
该如何分配它,
从而为他们自己
带来最大的
生产力;
原本是给
每位员工 100 美元,
最近他们
实际上
已经提高到了
每位员工
300 美元——
这就相当于
几乎等同于
一位员工
的薪水
价值的
Token,
拿来
让他们
去
使用;
而
这种做法
实际上
相当
随意(arbitrary),
因为
你很难
去
量化
合理的
使用限额
到底
应该是
多少;
但另一边,
同时
Anthropic
也仅靠
相当微薄的
利润率
在运转
来支撑
这一切,
他们在
为这些模型
提供服务时
背负着
极其
巨大的
成本。
所以
我认为
我们
正在进入
这样一个
各种 Token
被消耗的
世界中。
被大量消耗。因此,当我们谈论对企业而言关乎存亡的担忧时,我认为这
正是我们正在迈向的方向:Token 支出可能会开始盖过(eclipse)薪资支出。
因此,如果这成为你成本结构中如此重要的一项开支,你实际上必须比过去六个月里
更加敏锐、严谨地去证明其投资回报率(ROI)。随着时间推移,正如我们之前所聊到的,
我认为一家企业(a firm)本质上就是它的评估体系。因此,一家公司将其评估体系变得清晰透明(legible)
以解开这道 ROI 计算难题的能力,将成为该公司在长期竞争中
战胜竞争对手的根本原因所在。
也许可以针对这一点再深入探讨(double click)一下,类似于为什么模型实验室不能自己做、
或者需要第三方机构来评估一样的问题。我认为大家更容易理解的是,
你知道,全行业确实需要这种中立性。但对于企业来说,他们会认为
自己最了解针对其客户的任务。那么,像 Vals 这样的平台是如何切入并
提供价值的?也许你还可以顺便介绍一下 Valsmith 的新产品发布。
我会建议很多公司建立内部的专业能力。但我认为这不应该
是唯一的解决方案。你知道,眼下正在发生一场智能大爆发。不知何故,
依然有越来越多的基础模型实验室在不断建立。而且,每个实验室也都在发布
比以往任何时候都更多的模型,并带有更多的超参数选项。而且它们存在于一套复杂的
测试框架(harnesses)与智能体(agents)体系中。因此可选方案——我们甚至还没谈到特定智能,这种、这种
正在涌现的新范式。所以,可选的智能方案正在不断增多。我认为
我们发现的是,我们仍在不断发现想要使用 AI 模型的新场景。因此,应用
场景的复杂性也在不断增加。因此我认为,如果你、如果你是一家企业,你面临着
可选方案组合中成倍叠加的复杂性,想要在内部建立起
开展评估的能力是非常非常困难的。因此,为了试图弥补这一点,我们已经开始更公开地发布一些
供企业使用的产品。其中第一个产品叫做 ValSmith。那么 ValSmith
专注于代码生成(Cogen),这是我们在企业级 AI 中看到的扩展规模最大的领域。它允许
任何公司调取其 GitHub 代码库,并基于此构建内部的编程基准测试,从而
了解哪些编程智能体将最具性能,同时也了解对其而言什么是
帕累托最优(Pareto optimal)或最具投资回报率(ROI)的选择。事实上,我们、我们在 Vals 大量使用 ValSmith,
而且我们看到许多最顶尖、最成熟的企业也都在这样做。我
预计随着市场走向理性,这将会是市场演进的方向。
那么有哪些例子可以说明,比如当你针对私有代码仓库进行基准测试时,它所
展现出的性能与成本特征,相比于比如像
使用前沿模型、使用公开代码仓库基准测试有很大不同?
我认为在今天,究竟是 OpenAI 最好的模型还是 Anthropic 最好的模型
实际上最适合你的代码仓库,依然很不明确。因此我们看到了很多反直觉的例子,在这些例子中
你实际上必须运行评估,才能搞清楚对于那个代码仓库而言,什么才是
前沿性能。我认为你现在还会看到中间层存在一组非常复杂的可选方案,因为现在不仅有
来自 Anthropic 的 Opus 和 Sonnet 模型,还有 Luna 和 Terra。而且 Luna 非常
具成本竞争力。MewSpark 也非常便宜,1.2 性能很强。此外还有一个不断壮大的
开源模型生态系统,企业可以选择自行托管。因此我认为在这个混乱的
中间地带,什么是合适的选择实际上非常反直觉。我们在很多情况下实际上看到,
Sonnet 比 Opus 更昂贵,因为它是如此消耗 Token。因此我认为,如果你基于
你知道,在觉得适用的地方就用 Sonnet 这种方式去操作,你最终可能会
超出你实际所需的花费。再多谈谈这种评估框架将如何应用于
其他领域的知识工作,或者有哪些例子?我认为编程是每个领域
未来走向的预兆。在编程领域建立起来的许多基础原语正在延伸到其他
地方。你知道,如果你有一个非常优秀的编程智能体,很可能你也拥有一个能够以极高水平
制作 PowerPoint 幻灯片或在 Excel 中构建现金流折现模型(DCF)的模型。
但我认为在许多这类行业中,我们需要利用的是现有的
已完成工作沉淀,以此作为构建评估体系的机制。正如本刚才谈到的,
我们并没有真正解决“什么是人类智能”这个问题。但我认为在许多
行业中,我们都现存着关于过往工作形态的数据沉淀。而我们
以及其他人的任务,就是尝试将其系统化为能够保持动态、并能切实
在开展人类实际工作之处评估模型的评估体系。
也许可以顺着前面的问题问一下,你们内部是如何使用 ValSmith 来
评估哪种编程模型最适合 Vals 的?
是的,说实话,这其实也是源于我们自己遇到的一个问题。所以
我想做一个 Token 最大化(token maxing)实验,并为我们团队争取到了
某些编程工具为期一个月的无限制访问权限。回想起来,回头看,我们有一些、我们有
很多工程师每天消耗 10 亿到 20 亿个 Token。我认为峰值的一天是某位
工程师消耗了 60 亿个。是的,这也很疯狂,因为
这折算成美元是多少?
好吧,然后我回头算了一笔账。看起来在那个月里,我们大概花费了
价值 150 万美元的 Token。顺便说一句,这是免费给我们的。
但实际上,我们在那个月花在 Token 上的支出比员工薪水高出了 10 倍。
所以这甚至都不是“哦,五五开”,而是 10 倍。事后复盘并看到
大家在哪些场景使用智能体,以及这种、你知道的,随时随地都想使用模型的
焦虑感(insecurity)。因此我们面临的问题是:好吧,我们不能在下个月继续采用这种
运作模式。我们究竟如何聪明地理清哪些才是我们应该使用的正确工具,
应该用于哪些团队和哪些项目?因此我们做了一个实验,审视了
已经完成的工作。我们查看了大量的追踪记录(traces),查看了我们的 GitHub 仓库,并构建出了
ValSmith 工具。我们发现了一些相当令人惊讶的洞察。比如,
Cognition 的 Devon 工具实际上非常节省 Token。因此那是我们选择加大采用的一个工具。
而且我认为在很多情况下,相比于按 Token 计费,你可以通过订阅制获得更好的定价模式。
因此这实际上为我们的策略提供了参考,指导我们如何能够真正
有效地实现 Token 最大化,而无需每月花费 150 万美元。
太酷了。所以你们目前的运作模式是使用一套(我猜)更节省 Token 的
测试框架(harness)加模型,然后在此基础上,大家有更大的灵活性将按 Token 计费的方案用于
某些要求更高或更具挑战性的任务?
是的,所以我们能使用所有工具。我们让每个人都能访问所有工具。
但我们会针对任何 GitHub Issue 或工单自动给出建议,指导他们从何处开启会话。
这样应该能根据该任务所需的智能水平,来动态调控实际的使用量。
太酷了。
我想稍微切入到政策层面,因为我们谈到了基准测试
过时有多快。而在政策方面情况甚至更糟,因为法律的推进速度相对于技术能力要慢得多。
本和马克花了很多时间在华盛顿特区并与政策制定者沟通,试图缩小这一差距。
鉴于此,这里应该由谁来定义标准?是实验室?是像你们这样的独立机构?
是客户?还是政府?从政策角度来看,这应该如何运转?
是的,我认为简短的回答是,每个人都应该在某种程度上参与进来。我认为
多样化的视角大有裨益。但我认为主要问题在于,政策层面的对话
在过去几年里一直非常抽象。并且缺乏
切实的基础来弄清政策应该涵盖哪些内容。因此,即使有些来自实验室的提案
提议设立第三方测试公司或生态系统,其实也并未明确界定
其工作所依据的行为准则与边界是什么。所以我认为我们的角色,特别是在早期,就是
处于证据收集模式,能够获取大量关于模型具备何种能力以及
风险在哪里的信息和经验数据。这进而可以为,你知道的,一场更
深入成熟的政策对话提供参考。
你怎么看待像“谁该做什么”这样的分工?因为政府实际上可以说是做了
最早的评估,并且在界定“什么是处于前沿且需要被
监管”方面持续进行评估,对吧?所以他们从比如 10 的 26 次方 FLOPs 或类似想法这种疯狂概念切入。
嗯,所以当你思考这个问题时,比如政府应该做些什么,嗯,你知道,把它放进
这种 30 天等待期、60 天等待期或不管多长的时间里,那么在那个
等待期内应该发生什么?呃,这与你们正在做的事情有怎样的交集?又该以什么样正确的方式来判定
一个模型是否处于前沿、是否需要嗯暂时被放进某个特殊的盒子里一段时间,以确保
它不会渗透破坏一切?比如你怎么、你怎么看待这种关系是如何
运作的?
我认为实际上必须考虑两股相抗衡的力量。第一是
快速推进并确保政府流程不会拖慢、呃、
技术创新速度的诉求。我认为另一部分是确保、确保技术在被开发出来时
符合美国人乃至更广泛人群的最佳利益。嗯,所以我认为这两者
非常难以调和,而且往往,你知道,选择其一就意味着要以牺牲另一方为代价。
因此我希望看到的是,嗯,通过进行这种证据收集过程,我们可以帮助
政策制定者明确他们认为技术应该呈现何种形态,以符合美国的
利益。而由第三方评估机构来开发相应技术,去切实测试并执行这一标准。
嗯,因为我认为这将创造一种机制,通过它你可以看到、呃、
评估和测试方法论的进步,这种进步能够切实跟上
前沿步伐。它既不会落后,也不会减缓发展的节奏。
在考虑这些以及、以及开发你们的评估体系时,你是否已经在想,比如,
我们能否测试一下诱导这个模型开始利用规则作弊(reward hacking)有多容易,或者
诸如此类的事情,嗯,你知道,甚至从事违法行为,还是说这在某种程度上尚不在
考虑范围之内?或者你是怎么看待这一点的?是的。我是说,我们大体上是在
对齐(alignment)这一大类下来思考这个问题的。嗯,我认为目前有些地方已经印证了这一点,在这些地方,模型
正在接受某项网络安全风险测试时,实际上在搞奖励作弊(reward hacking),并摸索出其他
绕过它的途径。嗯,但我们试图评估的是:模型是否与用户意图保持对齐。
因此在这些地方,我们确实发现了证据,证明模型正在表现出
不相符的行为。也许这同样也是个该问你的问题,本。嗯,我想,
你怎么看待这里合适的分工?比如,什么、什么应该是,嗯,你知道,
政府机构嗯自行掌控和履职的,以及在哪里他们应该,你知道,
合作并信任嗯,你知道,私营呃公司去处理,另外你看到目前存在的差距
是在何处发生的?是的。所以我认为政府机构确实收到了大量来自……的警告,
顺便提一句,各大实验室会说:噢,这东西会搞生物黑客攻击。这会带来网络安全
风险等等。所以我想政府需要做的是明确:好吧,如果模型,
你知道,如果模型具备这种能力,那么是否有人能,呃,基本上促使
市场去切实实施这种违法行为,嗯,并且,你知道,精确指明哪些是
他们不希望在市场上出现的事情,然后让第三方机构来
对此进行评估。所以这有点像是,政府是否,呃,你知道,政府在某种程度上
清楚自己担心的是什么,无论是生物黑客、网络黑客还是诸如此类的事情。但
接下来就变成了这样一个问题:好吧,模型能做到吗?你能否促使模型去做这件事?
然后,必须有人切实去评估这两项能力。而我认为
政府尤其不适合做后者,特别是随着时间的推移。这根本不是
一项适合政府履行的职能,但他们非常擅长制定规则,因为他们能够执行
规则。所以我认为这正是你所期望的结合方式:由政府来制定
并执行规则,然后,嗯,由一家非常胜任的私营公司来告知他们
规则是否被打破。嗯,你知道,看到大实验室开始有这样的举动很有意思:
他们开始说,好吧,模型具备这种能力,而且你可以让它做坏事。所以我们
不打算让任何人拿到它。我们自己留着用,并确保我们内部的人不会让它去
做坏事。而且即使是这样也不见得总是管用。所以非常,你知道,我们正处在一个很有趣的
时代,我想说。
对我而言,这里存在着一种差距,比如公认的说法与现实世界中实际发生的事情之间的差距。
嗯,因为你知道,企业环境中的每种配置都是非常不同的。比如,
嗯,或者就像人们使用模型的方式各有不同。那些与实际案例
相关联的说法其实非常少见,这就是为什么我们至今还在谈论 OpenAI 和 Hugging Face
被黑客攻击的事件。今天我们依然在谈论,你知道,Fable 发生的事情,而这已经是大约
两个月前的事了。但很多时候,你知道,那其实并不是,呃,模型实际被
部署的方式。它们运行的环境非常定制化(bespoke)。所以,如何去,
你知道,真正把这些想法连接起来,再次建立起合适的环境以及
采用这些模型的规则基础,我认为这同样需要,你知道,有人把
嗯、呃,模型能力以及防护栏(guardrails)这些东西,切实落实到
地面上,让人们能够,你知道,有信心去使用、使用这些模型。
能否进一步谈谈政策制定者究竟应该如何与评估机构合作,
他们需要什么信息?这种合作关系应该如何运转,才能
最具成效?
拉扬·克里希南:是的,我认为,首先应当建立一种机制,通过该机制,嗯,
洞见和数据能够直接传递给政府中的相关人员。因此,我们现在
定期向行政部门和立法部门进行汇报,嗯,介绍我们在模型能力
和风险方面的最新发现。所以我认为首要的是,这有助于,呃,那里的官员及时掌握
最新动态,并跟踪未来可能会出现的问题。呃,我认为,
你知道,技术发展非常非常迅速,很难预测未来的走向。
嗯,但至少当拥有数据时,你就可以开始推断出一种趋势。呃,然后我认为接下来
就取决于立法部门的人员来决定他们希望在哪些方面出台
政策。呃,所以给出此类建议并不是我们的职责所在。嗯,但如果他们,
如果他们发现存在重大风险,比如说针对 18 岁以下未成年人的心理健康风险,
呃,或者是模型中存在生物安全风险,因而需要有标准化手段来限制模型的
发布,嗯,那么这就取决于他们去制定政策。嗯,我认为在其他方面,
行政部门以及商务部或 SEC(美国证券交易委员会)这样的机构,则负责确保
私营公司能够以一种对整个体系都富有成效的方式,
来采用和使用这些模型。
发言人:我很想从另一个角度探讨一下,就是关于地缘政治。嗯,我经常看到评估就像是
模型及模型开发者价值取向的一种体现,嗯,就像你制定了
评估模型内嵌内容的准则。当然,不同的国家,
嗯、呃,以及这些国家里的实验室所关心的事物各不相同。比如,我是说,嗯,我在中国土生土长,
我也经常使用很多中国的开源模型。比如你仍然不能
让他们,你知道,随意自由地谈论中国共产党及其全部历史,呃,因为,嗯,
你知道中国的情况。嗯,那么你如何看待评估和基准测试(benchmarks),
在标准化,或者说在被来自不同地方的、不同的模型实验室
所对待和采纳的过程中发挥的作用?
拉扬·克里希南:是的。我是说,坦白讲,从我,嗯,非常理想主义的角度来看,嗯,我很惊讶
看到有这么多对主权 AI(sovereign AI)的投资。嗯,你知道,如果站在上帝视角来看,
建造所有这些数据中心,并重复、呃,这样一种数据工程流程
并训练这些超大模型,效率是非常低下的。嗯,而事实上,你完全
可以把许多这方面的努力整合起来。嗯,但看起来这并不是我们身处的世界,
也不是我们正在走向的世界。实际上,以主权方式构建 AI 的努力反而在不断增加。
嗯,因此我认为这需要有一套通用语言,用来交流评估的
框架是什么,以及,嗯,我们将在哪些风险上达成集体共识与对齐。
嗯,你知道,我认为在这方面实际上有很多可以向核领域学习的地方。我想
里根曾说过这样一句话:“信任,但要核验(trust, but verify)”。呃,所以我想我们开始看到信任的迹象,
比如,嗯,你知道,习近平与特朗普将于下个月会面。嗯,但是目前还没有
呃,清晰明确的方法来切实完成核验部分。嗯,拥有评估的通用语言将
让我们能够表达类似这样的话,比如,你知道,你的核弹头数量是合规的。而在那个
例子中,还有飞越侦察。因此,这是一种机制,一个国家可以通过飞越侦察来审计另一个国家的
核武库。嗯,所以我想同理,如果人们担心 AI 的
社会性风险甚至生存风险,这就需要我们,呃,构建起这种
评估的通用语言来开展核验过程。你如何看待去协调
这样一项政策?从而,你知道,单是在美国国内做到这一点就已经够难了。那么你又会
如何看待将其推向全球?嗯,你知道,因为现在你面对的不是,面对的不是
企业客户,而是面对政府,并且这些政府
彼此之间是竞争关系。你认为这该如何运作起来?
如果说我现在对这个问题有完美的解决方案,那就太天真了。呃,所以我认为我们
可以从一些小步骤开始。嗯,例如,现在似乎有很多关于网络安全
风险的讨论。我认为随着时间的推移,对生物安全的担忧将变得更加重要。因此,
在某些明确的领域存在共同利益,大家可以在围绕,呃,防止网络或生物领域的冲突
的途径上达成一致。嗯,依我之见,我认为从长远来看,真正最
值得关注的是递归自我改进(recursive self-improvement, RSI)的可能性。而在这一点上,你可能会
看到某个国家或某家公司一骑绝尘,生产出我们知之甚少、
或者以我们未知的方式运行的模型。嗯,因此我认为,拥有一种以联合方式
去界定“这是我们能够接受的发展节奏”,或者“这已经超出了与 RSI 相关的
发展速度”的方法,将是极其重要的。我认为正因如此,你才会看到如今闭源实验室的
很多研究人员都在呼吁各国政府之间展开联合对话。
发言人:你认为从现在开始,未来的格局会是什么样的?嗯,既然我们现在拥有了许多
不同的能力以及,呃,能力强大的模型,同时还有,你知道,嗯、呃,关注不同
发展方向的国家——我是说,大家肯定都关心 RSI,但在生物领域,
或者是网络领域,人们关心的,嗯,你知道,是略有不同的事情,
比如更偏向进攻性还是防御性等等,那么,你认为未来的格局会是怎样的?
以及,嗯,你如何考虑开发新的基准测试来跟上这种步伐?
拉扬·克里希南:是的。我是说,我们高度专注于构建能够捕捉前沿水平的基准。
因此,呃,只要我们在前沿看到新的能力或风险涌现的地方,
我们都希望在 Vals.ai 上将其转化为,呃,一套切实可良好记录的评估。嗯,而且我认为这
需要随着时间推移不断扩大覆盖面。你知道,例如,我认为在网络安全领域,
我们过去的大量工作都是围绕代码中可能存在的,嗯,代码漏洞或内存泄漏
来开展的。嗯,但实际上很多最大的担忧或风险存在于基础设施
层面。呃,所以这些并不是在代码层面体现出来的,而是需要,嗯,模拟更大的
企业云基础设施甚至电网基础设施环境,我们才能够判定
模型的进攻或防御能力究竟如何。嗯,因此,确保
评估能够反映那些新的场景和领域,对于我们在 Vals 所做的工作来说
至关重要。呃,我们相信,这项业务最具价值的形式将是
在激励机制上与做好真正高水准的评估保持一致,而不是去支持智能
研发过程,或者,呃,支持模型随着时间推移在能力端实际提升的
进程。太棒了。感谢来到播客,这期节目非常精彩。非常感谢
邀请我。非常感谢,拉扬。谢谢,本。很有意思。谢谢。
收听更多节目,请访问 YouTube、Apple Podcasts 和 Spotify。在 X 上关注 @A16Z,并订阅
我们的 Substack:A16Z.substack.com。再次感谢收听,我们下期节目再见。
提醒大家,此处内容仅供参考,不应被视为法律、商业、
税务或投资建议,亦不得用于评估任何投资或证券,且并非针对
任何 A16Z 基金的任何投资者或潜在投资者。请注意,A16Z 及其关联机构可能
同时持有本播客中所讨论公司的投资。欲了解更多详情,
包括我们投资项目的链接,请访问 A16Z.com/disclosures。
谢谢。