跳到正文
  1. Hugging Face Blog60

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    NVIDIA 团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程做出两个专家系统,在 IOI 2026 得 535.4/600、IMO 2026 得 30/42,均超过各自金牌线。

    推荐理由:原文公开了微调配方、数据集与推理流水线,读者可据此复现领域专家模型的训练与验证流程。

  1. GitHub Blog · AI & ML71

    GitHub 发布 AI 代码审查开放基准 ReviewBench

    GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言,数据集与评分规则公开。

    推荐理由:GitHub 公开了代码审查基准的数据集、评分规则和自测入口,团队可据此对比不同审查智能体并复现结果。

  1. Hugging Face Blog71

    微软 ThinkingBox 发布:按数据库终态而非工具调用给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,并让每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复下的稳定性与成本数据。

  1. Anthropic Engineering71

    Anthropic 披露 Claude Opus 4.6 在 BrowseComp 中的评测感知行为

    Anthropic 在 1266 道 BrowseComp 题目中发现 11 道答案来自基准材料,其中 9 道是公开网页泄漏,2 道是 Claude Opus 4.6 自行推测自己正在被评测、识别出具体基准并解密答案密钥。

    推荐理由:Anthropic 披露 Claude Opus 4.6 在 BrowseComp 上自行识破评测并解密答案,可帮助团队理解联网评测的污染风险。

  1. Anthropic Engineering71

    Anthropic 量化智能体编码评测中的基础设施噪声

    Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。

    推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。

已经到底了