公开基准失效与Token吞噬利润:第三方独立评估如何重构AI战略中枢
1. 内容概览
在本期 a16z 播客中,a16z 联合创始人 Ben Horowitz、合伙人 Jennifer Li 与前沿 AI 评估机构 VALS 创始人兼 CEO Rayan Krishnan 围绕“在公开基准失效的时代,谁来客观评估 AI 模型”展开深度对谈。
对话揭示了当前大模型生态中一个严峻的现实:开源或公开基准测试(如各类知名学术刷榜单)因题目泄露与过拟合已严重失真,Meta 发布 Llama 4 时在公开榜单与私有隐蔽测试之间的巨大落差正是典型例证。与此相对,企业端正经历“智能大爆发”带来的选择混乱与成本失控——某财富 10 强企业的工程师因额度限制出现作息异化,VALS 内部测试中 Token 开销甚至超出员工薪资 10 倍。Rayan Krishnan 提出“一家企业本质上就是它的评估体系”,指出评估正在从静态、单一的多选题测试转向复杂、端到端、长时间跨度的智能体(Agentic)工作流度量。对谈进一步延伸至商业伦理(严守不卖训练数据的裁判底线)、递归自我改进(RSI)量化以及地缘政治与监管核验(类比核军控体系的通用评估语言)。
2. 核心判断
- 公开基准与自报成绩(Self-reporting)彻底失效:模型实验室自报的基准测试存在不可调和的激励冲突,模型极易针对公开题目进行作弊(Reward Hacking)与过拟合,公开排行榜已无法真实反映前沿能力。
- Token 支出正在超越(Eclipse)人力薪资:AI 落地已越过“调 API 试试看”的阶段,由于企业缺乏精准的任务-模型分配基准,正在导致巨额的算力浪费与负 ROI,成本结构发生不可逆的颠覆。
- 一家企业(A firm)本质上就是它的评估体系:企业的核心商业壁垒将取决于其能否将自身业务标准与人类工作流沉淀为清晰、可度量的私有评估体系(Rubrics),从而在模型选型与路由中实现帕累托最优。
- 评估机构必须斩断“既当裁判又卖考题”的利益链:借鉴安然事件与审计行业教训,第三方评估机构如果向模型实验室出售训练数据或咨询服务,必将沦为“花钱买榜”的腐败工具;绝对的中立性是独立评估存活的前提。
- 评估(Evals)是 AI 治理与地缘互信的通用语言:面对网络攻击、生物安全与递归自我改进(RSI)等前沿风险,政府缺乏敏捷测试能力,唯有建立基于独立第三方的 Evals 框架,才能践行“信任,但要核验(Trust, but verify)”的监管与跨国安全协议。
3. 关键论据
- Llama 4 的评测落差:Meta 发布 Llama 4 时,在题目与评分标准开源的主流公开基准上分数惊艳,但在 VALS 保留的私有隐蔽基准上表现逊色,证明公开测试已无法衡量模型在未知分布上的真实泛化力。
- 真实的极端财务数据:
- 某财富 10 强企业为工程师设置每日 100 至 300 美元的 Claude Code 额度,导致工程师作息被系统限流重置时间绑架(下午 4 点重置后疯狂工作,额度耗尽后停工散步)。
- VALS 内部进行“Token 最大化”实验时,部分工程师单日消耗高达 60 亿 Token,单月账单飙升至 150 万美元,Token 开销达到全体员工总薪水支出的 10 倍。
- 评估范式的底层迁移:从 ImageNet 时代的“数百万图片对应单一标签的一对一映射”,演变为智能体时代的“少量长尾任务(如自主构建 50 个全栈 Web 应用)配合庞大、复杂的端到端打分机制(Rubrics)与长时间异步轨迹追踪”。
- 反直觉的模型成本表现:在私有代码仓库的实际评测(ValSmith)中,更高级的模型未必最具经济效益。例如,部分场景中 Sonnet 因上下文与 Token 吞吐极度密集,实际使用成本反而超越 Opus;而专业智能体系统(如 Devin)通过更紧凑的架构显著节省 Token。
- 无限游戏与基准折旧:基准测试一旦饱和就丧失了辨识度,必须像过时的农耕劳动力标准一样被坚决废弃。VALS 将判例法(Case law)更新引入法律检索测试,确保测试始终映射现实世界动态。
4. 对 AI 创业者意味着什么
4.1 战略与选型:撕毁大厂的“模型卡”,建立私有评测集
创业公司切忌根据基础模型厂商自吹自擂的公开基准选型。无论是代码生成、垂直客服还是金融分析,必须调取企业私有业务痕迹(Traces、GitHub 仓库、历史交互),构建非公开的 Golden Dataset。只有在自身私有数据上跑出的性能/成本曲线,才是真实的选型依据。
4.2 财务与工程:警惕“Token 焦虑”,搭建动态智能路由器
不要盲目对员工或系统推行“Token 最大化”。无节制的调用将迅速击穿毛利。CEO 应推动工程团队建立类似 ValSmith 的内部审计机制,根据 Issue 或任务难度实现动态路由(Routers)——轻量任务走高性价比模型或订阅制工具,高难攻坚走顶级闭源模型,将 Token 消耗控制在帕累托最优边界内。
4.3 组织沉淀:将专家隐性经验转化为显性 Evals
从初级律师到合伙人、从初级码农到系统架构师,人类知识工作的核心差异在于难以量化的“标准”。AI 创业公司的壁垒不在于微调几个开源模型,而在于能否把本行业的隐性工作流规范转化为精密的 Prompt 和评分细则(Rubrics)。谁的业务标准更清晰,谁的 AI 渗透率和生产力杠杆就更高。
4.4 商业道德:恪守中立,不碰双边利益冲突
如果你的创业方向涉及安全评测、AI 审计或效能打分,切记不可在商业模式中夹带“向被测方出售训练数据或定制微调”的业务。保持独立客观是建立行业信任资产的唯一护城河。
5. 可信度与边界
可信度强项
- 一手实战数据与行业中枢地位:发言人 Rayan Krishnan 作为 VALS 创始人,在模型发布前 6 小时的核心窗口期直接测试顶尖厂商数百亿 Token 的未发布模型,掌握全行业最前沿的私有盲测对比数据。
- 商业教父的宏观对照:Ben Horowitz 结合传统软件行业 Gartner 评级、MPAA 电影审查、会计审计等历史先例,对 AI 评估模糊性与制度演进给出了深刻的商业与历史定性。
- 数据真实且反共识:敢于披露自身团队 150 万美元 Token 账单与行业巨头内部效率扭曲的真实细节,揭示了“Token 成本超薪资 10 倍”的行业深层隐患。
局限与认知边界
- 存在商业自利宣传:VALS 自身作为商业评估服务商与企业软件(ValSmith)提供商,天然具备强化“公开基准不可信、自建评估极其困难、必须采购独立评估”叙事的动机。
- “AI 完全”难题的未决性:对谈坦承人类至今未能解决对人类自身智能的客观量化(如 SAT、智商测试均有争议)。将复杂的现实工作完全量化为机器评测指标,仍受制于长尾场景与主观判断。
- 国际治理设想过于理想:将冷战时期的核军控“核验模式”套用至地缘 AI 治理,在全球主权 AI 投资白热化、各国意识形态与国家利益冲突加剧的背景下,短期内落地阻力极大。
6. 原始来源
- 对话出处:a16z 官方播客 (The a16z Podcast)
- 英文原题:Who Grades the AI Models? | Ben Horowitz & Rayan Krishnan
- 核心嘉宾:Ben Horowitz(a16z 联合创始人)、Jennifer Li(a16z 合伙人)、Rayan Krishnan(VALS 创始人兼首席执行官)
- 对话发布时间:2026 年 9 月
- 音频源索引:
ba494c31-cd47-4bae-a5d5-89304f960936