跳到正文
  1. Hugging Face Blog60

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    NVIDIA 团队从 Nemotron 3 出发,用 SFT、RL 和反馈驱动的推理流程做出两个专家系统,在 IOI 2026 得 535.4/600、IMO 2026 得 30/42,均超过各自金牌线。

    推荐理由:原文公开了微调配方、数据集与推理流水线,读者可据此复现领域专家模型的训练与验证流程。

  1. Google · Gemini60

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍 Gemini 3.8 Flash 在软件工程、智能体任务和复杂多步推理上较 3.7 Flash 有明显提升,性能常接近成本更高的前沿模型,原因是模型在复杂任务上会执行更多推理步骤并迭代调用工具。

    推荐理由:官方给出 3.8 Flash 在软件工程与多步推理上的提升方向,并附四个开发者实例,可作选型参考。

  1. Ollama Blog62

    Ollama 0.31 为 Gemma 4 加入多 token 预测,编码智能体基准提速近 90%

    Ollama 0.31 在 Apple Silicon 上为 Gemma 4 默认开启多 token 预测(MTP),在 Aider polyglot 基准上生成速度平均提升近 90%,且不改变模型输出。

    推荐理由:原文给出 MTP 在 Ollama 0.31 上的默认开启方式与实测加速幅度,可据此判断本地跑 Gemma 4 编码智能体的收益。

已经到底了