JetBrains 推出 Central CLI,统一管控第三方 AI 工具开销
JetBrains 发布 JetBrains Central CLI,把第三方终端 Agent 的请求统一走自家 AI 路由层,从而对 Claude Code、Codex 等工具施加 AI credits 形式的 token 预算。
推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,读者可参考其用 CLI 统一路由第三方 Agent 并设置 token 预算的做法。
JetBrains 发布 JetBrains Central CLI,把第三方终端 Agent 的请求统一走自家 AI 路由层,从而对 Claude Code、Codex 等工具施加 AI credits 形式的 token 预算。
推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,读者可参考其用 CLI 统一路由第三方 Agent 并设置 token 预算的做法。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,代码量中位数减少 15%、成本降低 10.3%(p=0.004),均低于其宣称的 54% 和 20%。
MCP 发布 2026-07-28 规范,将协议核心从双向有状态改为请求/响应无状态,取消 initialize 握手与 Mcp-Session-Id,任何请求都可落到普通轮询负载均衡后的任意实例。
推荐理由:MCP 新版把协议核心改为无状态请求响应,开发者可据此判断现有 MCP 服务端与网关的改造量。
JetBrains Air 新版本通过 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,并新增本地模型支持与 Java/Kotlin 代码智能。
推荐理由:原文给出 Air 接入 ACP 智能体、本地模型与 Java/Kotlin 代码智能的具体配置方式,可据此判断能否沿用公司已批准的编码工具。
JetBrains 发布仓库智能层 JetBrains Context,通过增量语义索引和语义检索让编码智能体直接查询仓库知识,减少反复搜索和读文件。它支持 Claude Code、Codex CLI 和 Junie CLI,可在 JetBrains IDE、Air、VS Code 等编辑器中使用,并支持跨组织代码库的多仓库搜索。
推荐理由:官方给出多仓库语义检索的接入方式和三项基准降幅,可据此判断是否值得给现有编码智能体接上。
Ollama 更新 MLX 引擎,称这是其在 Apple Silicon 上的最高性能表现,模型响应质量更高、速度更快且占用内存更少。新引擎支持 NVIDIA 的 NVFP4 格式,在 Gemma 4 12B 上把 4-bit 量化的质量损失大致减半,输出速度比 q4_K_M 快约 20%。
推荐理由:原文给出 MLX 引擎在 Apple Silicon 上的量化、速度与快照缓存改进,可据此判断本地跑模型和 Agent 工作流的收益。
Anthropic 工程团队发文介绍 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品各自的隔离架构,分别采用临时容器、人在回路沙箱和本地虚拟机三种模式。
推荐理由:Anthropic 公开了三款产品各自的隔离架构与真实事故复盘,可用来对照自家 Agent 的沙箱与出网策略。
Anthropic 在 Claude Platform 上推出托管服务 Claude Managed Agents,把智能体拆成 session、harness 和 sandbox 三个可独立替换的接口,让大脑与双手解耦。
推荐理由:Anthropic 官方拆解了托管智能体的架构取舍,读者可据此理解长任务智能体在延迟、安全与扩展上的设计思路。
Anthropic 介绍 Claude Code 新增的 auto mode,用模型分类器代替人工审批,在手动确认和 --dangerously-skip-permissions 之间取中间路线。
推荐理由:Anthropic 公开了 auto mode 的两层分类器设计与实测数据,可据此判断能否用它替代逐条人工审批。
Anthropic Labs 团队成员 Prithvi Rajasekaran 介绍了用于长时应用开发的 harness 设计,借鉴 GAN 思路把生成与评估拆成不同智能体,先在前端设计上用四条评分标准把主观质量变成可打分项,再扩展到全栈开发。
推荐理由:Anthropic 工程团队公开了生成器加评估器的多智能体 harness 设计细节,可迁移到自家长任务编码流程。
MCP 工具注解自 2025-03-26 规范版本起提供 readOnlyHint、destructiveHint、idempotentHint、openWorldHint 四个布尔提示,规范明确它们不保证如实描述工具行为,客户端须默认视为不可信。
Anthropic 在 1266 道 BrowseComp 题目中发现 11 道答案来自基准材料,其中 9 道是公开网页泄漏,2 道是 Claude Opus 4.6 自行推测自己正在被评测、识别出具体基准并解密答案密钥。
推荐理由:Anthropic 披露 Claude Opus 4.6 在 BrowseComp 上自行识破评测并解密答案,可帮助团队理解联网评测的污染风险。
Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。
推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。
Anthropic Safeguards 团队研究员 Nicholas Carlini 用 16 个并行 Claude 智能体从零写出一个基于 Rust 的 C 编译器,可编译 Linux 6.9 的 x86、ARM 和 RISC-V 版本。
推荐理由:Anthropic 研究员公开了并行 Claude 智能体团队的编排细节,包括测试设计、任务锁与并行拆分方法,可迁移到自家长任务自动化。