JetBrains 发布 Mellum2.1:面向编码智能体的 12B 开源 MoE 模型
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 全面可用,面向子智能体、快速编辑和终端任务等高频工作。
推荐理由:原文给出 Haiku 5.5 在 Copilot 的可用范围与计费方式,便于团队评估是否把它用于子智能体和终端任务。
GitHub 发布与 Microsoft Applied Sciences 联合微调的分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开了密钥扫描的九季度数据和新分类器,读者可据此判断推送前拦截能力与 AI credits 成本。
GitHub 发布专用于泄露密钥检测的微调模型,可读取上下文代码识别无固定格式的密码等凭据,且不生成代码或文本。现有 AI 检测密码告警已自动升级到新模型,推送保护中的 AI 密钥检测进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入该检测。
推荐理由:GitHub 把微调后的密钥检测模型接入推送保护和 Copilot 安全审查,开发者可据此判断是否开启并预估 AI Credits 消耗。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、52B 激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:官方给出 1 万亿参数、52B 激活的多模态模型在编码与智能体基准上的具体分数,可据此判断开源权重模型的选型空间。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言,数据集与评分规则公开。
推荐理由:GitHub 公开了代码审查基准的数据集、评分规则和自测入口,团队可据此对比不同审查智能体并复现结果。
JetBrains 为 IDE 推出 Air 智能体开发体验的 Early Access Program,现已作为插件上线 JetBrains Marketplace,或内置于 JetBrains IDE 的 2026.3 EAP 版本。
推荐理由:JetBrains 把多智能体并行会话做进 IDE,并支持接入已有订阅,读者可据此判断现有编码工作流是否值得迁移。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,首发面向付费 API 客户和 Google AI Ultra 订阅用户。
推荐理由:官方给出输出上限、定价与多项基准成绩,便于团队评估它在长周期编码与知识工作流中的定位。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:Gemini 4 Argon 把输出上限提到 1M token 并给出编码与安全基准成绩,可据此判断长任务与代码迁移场景的选型。
Cursor 推出 Rollouts 和 Security Review 两个 bot,均已在团队版和企业版上线。Rollouts 会为每个 PR 附加监控项,读取 diff 生成监控规划,并在部署事件触发后基于日志、指标和链路追踪按环境报告变更健康状态,检测到回归时可创建回滚 PR 或交给云端智能体修复,目前不会自行合并或回滚。
推荐理由:官方说明了两个 bot 的监控与审查流程和启用方式,可据此判断是否接入现有 PR 与部署链路。
JetBrains 撰文分享其为 Air Context 构建语义代码搜索 RAG 流水线的第一阶段经验,覆盖解析、分块与向量化。其结构感知分块支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go 和 Rust 九种语言,其他语言回退到按行切分。
推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化的取舍经验。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个无测试套件、无集中文档的物理储层模拟器。团队先搭建数值一致性校验框架,再用 Vibe CLI 启动上百个智能体解析调用树并补文档,最终采用人工把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:Mistral 用智能体迁移 4 万行 Fortran 的完整流程,可迁移到自家遗留代码改造。
JetBrains Air 新版本通过 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,并新增本地模型支持与 Java/Kotlin 代码智能。
推荐理由:原文给出 Air 接入 ACP 智能体、本地模型与 Java/Kotlin 代码智能的具体配置方式,可据此判断能否沿用公司已批准的编码工具。
JetBrains 发布仓库智能层 JetBrains Context,通过增量语义索引和语义检索让编码智能体直接查询仓库知识,减少反复搜索和读文件。它支持 Claude Code、Codex CLI 和 Junie CLI,可在 JetBrains IDE、Air、VS Code 等编辑器中使用,并支持跨组织代码库的多仓库搜索。
推荐理由:官方给出多仓库语义检索的接入方式和三项基准降幅,可据此判断是否值得给现有编码智能体接上。
Ollama 0.31 在 Apple Silicon 上为 Gemma 4 默认开启多 token 预测(MTP),在 Aider polyglot 基准上生成速度平均提升近 90%,且不改变模型输出。
推荐理由:原文给出 MTP 在 Ollama 0.31 上的默认开启方式与实测加速幅度,可据此判断本地跑 Gemma 4 编码智能体的收益。
Anthropic Labs 团队成员 Prithvi Rajasekaran 介绍了用于长时应用开发的 harness 设计,借鉴 GAN 思路把生成与评估拆成不同智能体,先在前端设计上用四条评分标准把主观质量变成可打分项,再扩展到全栈开发。
推荐理由:Anthropic 工程团队公开了生成器加评估器的多智能体 harness 设计细节,可迁移到自家长任务编码流程。
Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。
推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。
Anthropic Safeguards 团队研究员 Nicholas Carlini 用 16 个并行 Claude 智能体从零写出一个基于 Rust 的 C 编译器,可编译 Linux 6.9 的 x86、ARM 和 RISC-V 版本。
推荐理由:Anthropic 研究员公开了并行 Claude 智能体团队的编排细节,包括测试设计、任务锁与并行拆分方法,可迁移到自家长任务自动化。