JetBrains 发布 Mellum2.1:面向编码智能体的 12B 开源 MoE 模型
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
作者在 HuggingChat 中开启 ML-intern,用提示词驱动智能体完成数据构建、训练、评测与发布,几天内做出六个模型,总计算成本约 103 美元。其中把 Qwen-Image 2.1 的 9B 提示词改写器蒸馏成 0.8B 版本,可在 CPU 上运行,输出有效率 99.7%,token 用量约为教师模型的四分之一。作者公开了七个提示词,并建议在提示中要求基线分数、冒烟测试和预算上限。
推荐理由:作者用 ML Intern 从零训练六个小模型的完整提示词与成本清单,可迁移到自己的微调与蒸馏流程。
Claude Code v2.1.293 新增 Claude Haiku 5.5(claude-haiku-5-5),它成为 Anthropic API 上默认的 Haiku 模型,支持 1M 上下文,价格为每 Mtok $0.10/$0.50,超过 100K 的提示词为 $0.50/$2.50。
推荐理由:更新日志给出 Haiku 5.5 的 1M 上下文与价格,以及一批 Agent、MCP 与权限相关修复,便于评估升级成本。
Mistral AI 发布 Mistral Large 4 公开预览,这是一个 1 万亿参数、52B 激活参数的原生多模态模型,权重将于本月底开放。
推荐理由:官方给出 1 万亿参数、52B 激活的多模态模型在编码与智能体基准上的具体分数,可据此判断开源权重模型的选型空间。
Cursor 推出本地智能体远程控制功能,用户可在 Cursor iOS 应用中查看电脑上正在运行的本地智能体并直接回复消息。该功能除企业组织外默认对所有用户开启,智能体仍在本机运行,App 只建立连接,因此电脑需保持开机联网;桌面端设置中可开启 Keep this computer awake 防止休眠。
推荐理由:原文说明了远程查看和回复本地智能体的具体操作与限制,便于开发者判断能否把等待中的编码任务挪到手机上处理。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言,数据集与评分规则公开。
推荐理由:GitHub 公开了代码审查基准的数据集、评分规则和自测入口,团队可据此对比不同审查智能体并复现结果。
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,并让每个任务重复 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复下的稳定性与成本数据。
JetBrains 为 IDE 推出 Air 智能体开发体验的 Early Access Program,现已作为插件上线 JetBrains Marketplace,或内置于 JetBrains IDE 的 2026.3 EAP 版本。
推荐理由:JetBrains 把多智能体并行会话做进 IDE,并支持接入已有订阅,读者可据此判断现有编码工作流是否值得迁移。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,首发面向付费 API 客户和 Google AI Ultra 订阅用户。
推荐理由:官方给出输出上限、定价与多项基准成绩,便于团队评估它在长周期编码与知识工作流中的定位。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:Gemini 4 Argon 把输出上限提到 1M token 并给出编码与安全基准成绩,可据此判断长任务与代码迁移场景的选型。
Ollama 0.35 新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 端点把文本作为 state 连同多个命名问题一次性提交,由本地模型一次请求返回全部答案。
推荐理由:Ollama 新增决策模型接口与三个可本地运行的模型,开发者可据此评估低延迟分类与路由场景的落地方式。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub 把模糊测试的 harness 编写、覆盖率追踪和崩溃分诊交给 LLM 智能体,可参考其任务流与工具分层设计。
Cursor 推出 Rollouts 和 Security Review 两个 bot,均已在团队版和企业版上线。Rollouts 会为每个 PR 附加监控项,读取 diff 生成监控规划,并在部署事件触发后基于日志、指标和链路追踪按环境报告变更健康状态,检测到回归时可创建回滚 PR 或交给云端智能体修复,目前不会自行合并或回滚。
推荐理由:官方说明了两个 bot 的监控与审查流程和启用方式,可据此判断是否接入现有 PR 与部署链路。
Cursor 推出「项目」功能,用于承接一项功能、一次迁移或完整应用这类长达数月的工作,目前处于 beta 阶段并逐步向所有用户开放。项目中的协调智能体不写代码,负责规划并把任务委派给具体实现的智能体,可按需并行运行任意多个智能体,并在云端独立计算机上运行。每个项目维护一组文件,在云端和本地机器间同步共享上下文,还可监听 Slack 频道、按计划运行或跟踪 PR 以主动触发工作。
推荐理由:原文说明了项目如何用协调智能体与共享上下文承接长期任务,可据此判断多智能体协作的适用边界。
Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个无测试套件、无集中文档的物理储层模拟器。团队先搭建数值一致性校验框架,再用 Vibe CLI 启动上百个智能体解析调用树并补文档,最终采用人工把关的 coder、tester、reviewer 结构化工作流逐模块迁移。
推荐理由:Mistral 用智能体迁移 4 万行 Fortran 的完整流程,可迁移到自家遗留代码改造。
Cursor 支持自托管机器,让工具执行完全留在你自己的网络内,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 可将单台笔记本电脑或 VM 连接到账户用于个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,还可让闲置机器休眠并在重连窗口内恢复。
推荐理由:原文说明了自托管机器的池化调度与沙箱接入方式,可据此判断工具调用能否留在自有网络内。
Cursor 云端智能体不再需要连接 GitHub 或其他第三方 SCM 提供商即可开始使用,用户可直接输入提示,Cursor 会在后台创建 Origin 代码仓库。满意后点击创建代码仓库按钮,可自定义名称并将可见性设为私有或内部。此外,Cursor 支持将云端智能体实时环境通过端口转发在浏览器中预览,连接 Vercel 账户后点击发布即可生成可访问 URL。
推荐理由:云端智能体不再依赖 GitHub 即可起步,读者可据此判断无仓库场景下的原型开发流程变化。
MCP 官方发布更新版路线图,覆盖下一次规范发布及之后的工作,由核心维护者与社区共同制定。路线图分为五个优先方向:Agent 消息原语、HTTP 原生传输统一与加固、Agent 身份与企业级安全、原语改进、SDK 开发体验改进。
推荐理由:官方路线图列出五个优先方向,可据此判断 MCP 后续在传输、Agent 身份和工具发现上的演进节奏。
NVIDIA Nemotron 3.5 Lightning 已在 Ollama 上线,可完全在本地设备运行,这是一个 30B 总参数、每 token 仅 3B 激活的开放模型,采用混合 MoE 架构,面向持续运行的智能体任务。
推荐理由:想在本机跑长时智能体的团队,可据此了解这款 30B 总参数、3B 激活的 MoE 模型在吞吐和工具调用上的定位。
Meta Superintelligence Labs 的首个开源模型 Muse Glimmer 已在 Ollama 上线,这是一个 30B 多模态模型,面向本地运行的智能体工作负载,上下文长度 128K+,采用 Apache 2.0 许可。
推荐理由:Meta 新开源模型在本地跑智能体,开发者可据此判断本地编码智能体的模型与硬件选择。