GitHub Copilot 周更:Claude Haiku 5.5 上线,本地沙箱正式可用
GitHub Copilot 本周更新中,Claude Haiku 5.5 面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
GitHub Copilot 本周更新中,Claude Haiku 5.5 面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
CodeQL 2.27.2 发布,新增 C++ 正则表达式解析器,并改进 Go、Rust、JavaScript/TypeScript 分析能力。
Sophos 使用 OpenAI 的 Daybreak 将网络威胁调查时间缩短 96%,并自动化处理 52% 的 MDR 案例,同时保留人工监督。
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让其浏览器智能体成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
GitHub Copilot 代码审查新增组织计费选项与权限控制:组织所有者可将拥有 Copilot 许可证成员的代码审查请求计入组织成本中心,而非消耗成员个人配额,该选项需为组织启用 AI Credits 付费使用,并可设置预算。组织所有者与仓库管理员还可开启设置,仅允许由本组织或企业提供 Copilot 许可证的用户发起审查请求,开启后外部或个人许可证将无法请求审查。
Oracle 在招聘、工程和运营环节用 ChatGPT Work 与 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作压缩到几分钟。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。该公司按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
Pollo AI 借助 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者把创意转化为精细图像和电影级视频广告。
Anthropic 宣布启动 Anthropic Cyber Mission,长期投入工具、研究和资源支持防御方,首批聚焦关键基础设施与开源软件两个方向。
推荐理由:Anthropic 把前沿模型接入关键基础设施与开源安全扫描,开发者可据此判断自家代码库能否用上免费扫描。
Anthropic 发布新版 Usage Policy,将于 11 月 12 日生效,多数改动是对现有规则的澄清。新增“Do Not Engage in Deceptive Campaigns or Artificial Activity”章节,整合选举、欺诈、隐私与虚假信息条款;武器禁令明确覆盖武器制导与控制软件、无人机武装等。
Anthropic 宣布三年投入 1.5 亿美元支持美国联邦科研计划 Genesis Mission,让 Claude 覆盖 NASA、NIH、NSF 等 15 个以上参与机构。
OpenAI 打击了两起借助 AI 开展的影响力行动,这些行动利用虚假身份的“记者”和一家智库传播地缘政治信息。
Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 全面可用,面向子智能体、快速编辑和终端任务等高频工作。
推荐理由:原文给出 Haiku 5.5 在 Copilot 的可用范围与计费方式,便于团队评估是否把它用于子智能体和终端任务。
GitHub 发布与 Microsoft Applied Sciences 联合微调的分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开了密钥扫描的九季度数据和新分类器,读者可据此判断推送前拦截能力与 AI credits 成本。
GitHub 发布专用于泄露密钥检测的微调模型,可读取上下文代码识别无固定格式的密码等凭据,且不生成代码或文本。现有 AI 检测密码告警已自动升级到新模型,推送保护中的 AI 密钥检测进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入该检测。
推荐理由:GitHub 把微调后的密钥检测模型接入推送保护和 Copilot 安全审查,开发者可据此判断是否开启并预估 AI Credits 消耗。
OpenAI 为 ChatGPT for Teens 上线 College Planner,帮助学生管理大学申请,同时新增 flashcards 和 quizzes 功能。OpenAI 还组建了一个青少年 AI 委员会。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,让旅客在规划行程时即可查找、比较并预订酒店。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:原文给出 740M 参数、量化后内存占用和 8K 上下文等具体指标,便于开发者判断端侧多模态检索能否落地。
Anthropic 推出扩展版 Cyber Verification Program(CVP),将原有的 Project Glasswing 与 CVP 合并为 Defense Access。
Cursor 推出本地智能体远程控制功能,用户可在 Cursor iOS 应用中查看电脑上正在运行的本地智能体并直接回复消息。该功能除企业组织外默认对所有用户开启,智能体仍在本机运行,App 只建立连接,因此电脑需保持开机联网;桌面端设置中可开启 Keep this computer awake 防止休眠。
推荐理由:原文说明了远程查看和回复本地智能体的具体操作与限制,便于开发者判断能否把等待中的编码任务挪到手机上处理。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言,数据集与评分规则公开。
推荐理由:GitHub 公开了代码审查基准的数据集、评分规则和自测入口,团队可据此对比不同审查智能体并复现结果。
GitHub 提出开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其会用第二个模型对计划、代码和测试进行批判性审查。
Google 发布 9 月 AI 更新汇总,最新前沿模型 Gemini 4 Argon 支持 100 万 token 输出上限,主打高级推理与网络安全防御,目前通过 Fairwind Program 向受信任的网络安全防御者逐步开放。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元,目标到 2027 年底培养 1 万名 Frontier Deployed Engineer(FDE)。
Google 在兼容 Android 设备上为 Gemini Live 推出 Guided Vision,面向盲人、低视力人群提供语音优先的实时视觉解读。该功能与 Aira 合作、用数万小时数据训练,超 1000 名 Aira Trusted Tester 参与压力测试与安全护栏评估,支持读小字、找物品、描述物体和探索环境,并覆盖多语言。
JetBrains 为 IDE 推出 Air 智能体开发体验的 Early Access Program,现已作为插件上线 JetBrains Marketplace,或内置于 JetBrains IDE 的 2026.3 EAP 版本。
推荐理由:JetBrains 把多智能体并行会话做进 IDE,并支持接入已有订阅,读者可据此判断现有编码工作流是否值得迁移。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率,预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,首发面向付费 API 客户和 Google AI Ultra 订阅用户。
推荐理由:官方给出输出上限、定价与多项基准成绩,便于团队评估它在长周期编码与知识工作流中的定位。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:Gemini 4 Argon 把输出上限提到 1M token 并给出编码与安全基准成绩,可据此判断长任务与代码迁移场景的选型。
Google 将 skills 功能推向全球 Gemini 聊天,用户可把常用指令保存一次后反复调用,在提示栏输入斜杠加技能名即可运行。skills 支持叠加使用,并可包含纯文本、PDF 或图片等参考文件,同时已支持从聊天中自动生成技能。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,可在生物代码中嵌入不可感知签名,并在合成出的实体蛋白质上验证,同时保持其生物功能。
Ollama 0.35 新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 端点把文本作为 state 连同多个命名问题一次性提交,由本地模型一次请求返回全部答案。
推荐理由:Ollama 新增决策模型接口与三个可本地运行的模型,开发者可据此评估低延迟分类与路由场景的落地方式。
Google 介绍 Gemini 3.8 Flash 在软件工程、智能体任务和复杂多步推理上较 3.7 Flash 有明显提升,性能常接近成本更高的前沿模型,原因是模型在复杂任务上会执行更多推理步骤并迭代调用工具。
推荐理由:官方给出 3.8 Flash 在软件工程与多步推理上的提升方向,并附四个开发者实例,可作选型参考。
布鲁克林 Edy's Grocer 店主 Edy Massih 用 Gemini 把家族黎巴嫩菜谱直接换算成大份量宴席批次,避免手工计算香料和酥皮比例出错。Gemini 还能把活动菜单转成分区购物清单、汇总共用食材并提前排出备餐时间表,同时为无麸质、无坚果等饮食限制给出保留原有风味的替换方案。
GitHub Copilot 应用中的 canvas 是一种可自定义界面,用户与智能体共享同一份状态,可做成看板、issue 分诊板、发布清单或仪表盘。创建时无需写代码或手动设计,在智能体会话中输入 /create-canvas 技能并用自然语言描述工作流、界面可做的操作和智能体可做的操作即可,生成的界面会显示在右侧面板。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈应用,可与 Copilot 智能体双向通信,也能调用第三方 API 并在本地执行代码。作者认为聊天框只适合未知任务,明确任务下应让智能体生成可复用工具,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免反复消耗 token。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub 把模糊测试的 harness 编写、覆盖率追踪和崩溃分诊交给 LLM 智能体,可参考其任务流与工具分层设计。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让 AI 能听、能看、能说并具备动态视觉形象。该功能支持异步工具调用、97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 上线,自定义头像需企业白名单申请。
Google 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让企业智能体在对话中能听、能看、能说,并具备精准唇形同步与自然表情。