跳到正文
  1. Hugging Face Blog60

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    NVIDIA 团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程做出两个专家系统,在 IOI 2026 得 535.4/600、IMO 2026 得 30/42,均超过各自金牌线。

    推荐理由:原文公开了微调配方、数据集与推理流水线,读者可据此复现领域专家模型的训练与验证流程。

  1. Hugging Face Blog71

    微软 ThinkingBox 发布:按数据库终态而非工具调用给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,并让每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复下的稳定性与成本数据。

已经到底了