Anthropic 量化智能体编码评测中的基础设施噪声
Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。
推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。
Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。
推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。