GitHub Copilot 周更:Claude Haiku 5.5 上线,本地沙箱正式可用
GitHub Copilot 本周更新中,Claude Haiku 5.5 面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
GitHub Copilot 本周更新中,Claude Haiku 5.5 面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让其浏览器智能体成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
Oracle 在招聘、工程和运营环节用 ChatGPT Work 与 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作压缩到几分钟。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。该公司按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
GitHub 发布与 Microsoft Applied Sciences 联合微调的分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开了密钥扫描的九季度数据和新分类器,读者可据此判断推送前拦截能力与 AI credits 成本。
GitHub 发布专用于泄露密钥检测的微调模型,可读取上下文代码识别无固定格式的密码等凭据,且不生成代码或文本。现有 AI 检测密码告警已自动升级到新模型,推送保护中的 AI 密钥检测进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入该检测。
推荐理由:GitHub 把微调后的密钥检测模型接入推送保护和 Copilot 安全审查,开发者可据此判断是否开启并预估 AI Credits 消耗。
Anthropic 推出扩展版 Cyber Verification Program(CVP),将原有的 Project Glasswing 与 CVP 合并为 Defense Access。
JetBrains 为 IDE 推出 Air 智能体开发体验的 Early Access Program,现已作为插件上线 JetBrains Marketplace,或内置于 JetBrains IDE 的 2026.3 EAP 版本。
推荐理由:JetBrains 把多智能体并行会话做进 IDE,并支持接入已有订阅,读者可据此判断现有编码工作流是否值得迁移。
Ollama 0.35 新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 端点把文本作为 state 连同多个命名问题一次性提交,由本地模型一次请求返回全部答案。
推荐理由:Ollama 新增决策模型接口与三个可本地运行的模型,开发者可据此评估低延迟分类与路由场景的落地方式。
GitHub Copilot 应用重建了 pull request 视图,用一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块几何两部分,评论高度按需惰性测量,修正幅度小且锚定在用户当前浏览位置。
Cursor 推出 Rollouts 和 Security Review 两个 bot,均已在团队版和企业版上线。Rollouts 会为每个 PR 附加监控项,读取 diff 生成监控规划,并在部署事件触发后基于日志、指标和链路追踪按环境报告变更健康状态,检测到回归时可创建回滚 PR 或交给云端智能体修复,目前不会自行合并或回滚。
推荐理由:官方说明了两个 bot 的监控与审查流程和启用方式,可据此判断是否接入现有 PR 与部署链路。
JetBrains 撰文分享其为 Air Context 构建语义代码搜索 RAG 流水线的第一阶段经验,覆盖解析、分块与向量化。其结构感知分块支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go 和 Rust 九种语言,其他语言回退到按行切分。
推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化的取舍经验。
Cursor 推出「项目」功能,用于承接一项功能、一次迁移或完整应用这类长达数月的工作,目前处于 beta 阶段并逐步向所有用户开放。项目中的协调智能体不写代码,负责规划并把任务委派给具体实现的智能体,可按需并行运行任意多个智能体,并在云端独立计算机上运行。每个项目维护一组文件,在云端和本地机器间同步共享上下文,还可监听 Slack 频道、按计划运行或跟踪 PR 以主动触发工作。
推荐理由:原文说明了项目如何用协调智能体与共享上下文承接长期任务,可据此判断多智能体协作的适用边界。
Cursor 支持自托管机器,让工具执行完全留在你自己的网络内,代码库、构建产物和密钥都保留在自有基础设施的内部机器上,由智能体在本地处理工具调用。My Machines 可将单台笔记本电脑或 VM 连接到账户用于个人工作流,团队池则是面向团队或企业的具名 worker 队列,容量随请求扩容、worker 断开时缩容,池不与代码仓库绑定,还可让闲置机器休眠并在重连窗口内恢复。
推荐理由:原文说明了自托管机器的池化调度与沙箱接入方式,可据此判断工具调用能否留在自有网络内。
Ollama 的 Pro、Max、Team 计划改为按 token 透明计费,每档包含每月用量额度:Pro 每月 20 美元含 60 美元用量,Max 每月 100 美元含 300 美元用量,Team 每月 500 美元含 1000 美元共享用量且不限用户数。
推荐理由:Ollama 云服务改为按 token 计费并公布各档价格,团队可据此估算用开源模型跑编码智能体的成本。
Cursor 云端智能体不再需要连接 GitHub 或其他第三方 SCM 提供商即可开始使用,用户可直接输入提示,Cursor 会在后台创建 Origin 代码仓库。满意后点击创建代码仓库按钮,可自定义名称并将可见性设为私有或内部。此外,Cursor 支持将云端智能体实时环境通过端口转发在浏览器中预览,连接 Vercel 账户后点击发布即可生成可访问 URL。
推荐理由:云端智能体不再依赖 GitHub 即可起步,读者可据此判断无仓库场景下的原型开发流程变化。
Ollama 发布 Claude Desktop 支持,开发者可在 Ollama 中打开 Claude 开关,由 Ollama 自动配置第三方网关,从而在 Claude 中使用本地或云端模型。连接期间可选用 Ollama 内任意模型,关闭开关即可恢复原有 Claude 设置。官方称默认关闭遥测,并对所有模型和服务执行零数据保留政策,用户仍可在 Anthropic 模型与 Ollama 之间切换。
推荐理由:原文给出在 Claude Desktop 中接入 Ollama 的具体开关步骤,读者可据此判断本地与云端模型如何切换。
MCP 官方发布更新版路线图,覆盖下一次规范发布及之后的工作,由核心维护者与社区共同制定。路线图分为五个优先方向:Agent 消息原语、HTTP 原生传输统一与加固、Agent 身份与企业级安全、原语改进、SDK 开发体验改进。
推荐理由:官方路线图列出五个优先方向,可据此判断 MCP 后续在传输、Agent 身份和工具发现上的演进节奏。
JetBrains Air 新增多项目视图,可在同一窗口打开多个项目并并行运行多个智能体,侧边栏按项目分组任务。Markdown 文件现以格式化文本渲染,无需分屏预览,语法在阅读时隐去、编辑时显示。Windows 上的中文、日文、韩文等 IME 输入问题已修复,该版本还新增首次启动的 Customize 界面和可选择智能体与模型的 Agent Review。
JetBrains 发布 JetBrains Central CLI,把第三方终端 Agent 的请求统一走自家 AI 路由层,从而对 Claude Code、Codex 等工具施加 AI credits 形式的 token 预算。
推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,读者可参考其用 CLI 统一路由第三方 Agent 并设置 token 预算的做法。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,代码量中位数减少 15%、成本降低 10.3%(p=0.004),均低于其宣称的 54% 和 20%。
MCP 发布 2026-07-28 规范,将协议核心从双向有状态改为请求/响应无状态,取消 initialize 握手与 Mcp-Session-Id,任何请求都可落到普通轮询负载均衡后的任意实例。
推荐理由:MCP 新版把协议核心改为无状态请求响应,开发者可据此判断现有 MCP 服务端与网关的改造量。
MCP 官方 Ruby SDK 发布 1.0.0,mcp gem 迎来首个稳定版本,公共 API 冻结,破坏性变更仅随主版本发布。该版本实现 2025-06-18 与 2025-11-25 两版规范,服务端与客户端一致性场景全部 100% 通过,并满足 SDK 分级体系的 Tier 2 要求,Tier 1 开发进行中。
JetBrains 发布仓库智能层 JetBrains Context,通过增量语义索引和语义检索让编码智能体直接查询仓库知识,减少反复搜索和读文件。它支持 Claude Code、Codex CLI 和 Junie CLI,可在 JetBrains IDE、Air、VS Code 等编辑器中使用,并支持跨组织代码库的多仓库搜索。
推荐理由:官方给出多仓库语义检索的接入方式和三项基准降幅,可据此判断是否值得给现有编码智能体接上。
Ollama 宣布完成 8800 万美元融资,投资方包括 Benchmark 的 Peter Fenton、Theory Ventures 的 Tomasz Tunguz、8VC 的 Alex Kolicich,以及 Docker 创始人 Solomon Hykes 等天使投资人。
推荐理由:Ollama 拿到 8800 万美元融资并公布后续路线,开发者可据此判断本地跑开源模型的工具会往哪走。
MCP 发布四个 Tier 1 SDK 的 beta 版本,用于测试 2026-07-28 规范候选版,Python v2 和 TypeScript v2 领衔,Go 与 C# 也提供 beta。
推荐理由:MCP 四个 Tier 1 SDK 放出 beta,开发者可提前在真实负载上验证无状态协议改动并反馈问题。
Ollama 0.31 在 Apple Silicon 上为 Gemma 4 默认开启多 token 预测(MTP),在 Aider polyglot 基准上生成速度平均提升近 90%,且不改变模型输出。
推荐理由:原文给出 MTP 在 Ollama 0.31 上的默认开启方式与实测加速幅度,可据此判断本地跑 Gemma 4 编码智能体的收益。
Ollama 更新 MLX 引擎,称这是其在 Apple Silicon 上的最高性能表现,模型响应质量更高、速度更快且占用内存更少。新引擎支持 NVIDIA 的 NVFP4 格式,在 Gemma 4 12B 上把 4-bit 量化的质量损失大致减半,输出速度比 q4_K_M 快约 20%。
推荐理由:原文给出 MLX 引擎在 Apple Silicon 上的量化、速度与快照缓存改进,可据此判断本地跑模型和 Agent 工作流的收益。
Anthropic 工程团队发文介绍 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品各自的隔离架构,分别采用临时容器、人在回路沙箱和本地虚拟机三种模式。
推荐理由:Anthropic 公开了三款产品各自的隔离架构与真实事故复盘,可用来对照自家 Agent 的沙箱与出网策略。
MCP 发布 2026-07-28 规范候选版,这是协议发布以来最大的一次修订,核心是协议层改为无状态:initialize/initialized 握手和 Mcp-Session-Id 会话被移除,协议版本、客户端信息改由每次请求的 _meta 携带,任何请求都可落到任意服务器实例,此前水平部署所需的粘性路由和共享会话存储不再必要。
推荐理由:MCP 协议层改为无状态,远程服务器可去掉粘性会话和共享会话存储,直接跑在普通负载均衡后面。
Anthropic 说明近一个月 Claude Code 质量下滑源于三处独立改动,分别涉及默认推理档位、缓存优化和系统提示词,API 与推理层未受影响,三处问题已于 4 月 20 日(v2.1.116)全部修复。
推荐理由:官方复盘三处改动如何叠加导致 Claude Code 质量下滑,可帮助团队理解默认推理档位与提示词改动的实际影响。
Anthropic 在 Claude Platform 上推出托管服务 Claude Managed Agents,把智能体拆成 session、harness 和 sandbox 三个可独立替换的接口,让大脑与双手解耦。
推荐理由:Anthropic 官方拆解了托管智能体的架构取舍,读者可据此理解长任务智能体在延迟、安全与扩展上的设计思路。
Anthropic Labs 团队成员 Prithvi Rajasekaran 介绍了用于长时应用开发的 harness 设计,借鉴 GAN 思路把生成与评估拆成不同智能体,先在前端设计上用四条评分标准把主观质量变成可打分项,再扩展到全栈开发。
推荐理由:Anthropic 工程团队公开了生成器加评估器的多智能体 harness 设计细节,可迁移到自家长任务编码流程。
Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。
推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。