Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平
NVIDIA 团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程做出两个专家系统,在 IOI 2026 得 535.4/600、IMO 2026 得 30/42,均超过各自金牌线。
推荐理由:原文公开了微调配方、数据集与推理流水线,读者可据此复现领域专家模型的训练与验证流程。
NVIDIA 团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程做出两个专家系统,在 IOI 2026 得 535.4/600、IMO 2026 得 30/42,均超过各自金牌线。
推荐理由:原文公开了微调配方、数据集与推理流水线,读者可据此复现领域专家模型的训练与验证流程。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,并让每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复下的稳定性与成本数据。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,生成并验证新的可执行训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项属性。随着模型改进,课程会自动转向其仍难以完成的能力缺口。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,把评测耗时从数周投票缩短到数小时。