Google Gemini 4 "Carbon" 据称编程能力追平 Anthropic Opus 5.5
据 Business Insider 看到的内部文件、截图和聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已在内部编程平台 Jetski 部署数日,编程任务上主要强于 Argon,一名员工将其与 Anthropic 最强编程模型 Opus 5.5 相提并论,但仍需更多测试。
据 Business Insider 看到的内部文件、截图和聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已在内部编程平台 Jetski 部署数日,编程任务上主要强于 Argon,一名员工将其与 Anthropic 最强编程模型 Opus 5.5 相提并论,但仍需更多测试。
TypeSafe 的 Jev 上线 3 周即突破 1 亿美元 ARR,估值达 75 亿美元,Sequoia 被指"泄露"了这一数据。Jev 成为同日多家厂商发布的"决策模型"品类的对标基准,OpenAI Decisions API、Perplexity pplx-decider-v1.1-27b、Cloudflare clef 等相继跟进。
GitHub Copilot 本周更新中,Claude Haiku 5.5 面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
哈佛大学研究人员 Fiona Chen 和 James Stratton 基于 Jellyfish 的工程团队分析数据,覆盖 2021 年至 2026 年 3 月间 700 多家软件开发公司、70 多万名员工的 3 亿条工作事件,发现 AI 编码工具带来的编码阶段效率提升被下游约束吸收,几乎没有证据表明企业因此提高了软件产出或减少了用工。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里为博客开发出 Newsletters 页面,包含新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页和站内搜索集成,模型为 GPT-6 Astra High。
GitHub Copilot 代码审查新增组织计费选项与权限控制:组织所有者可将拥有 Copilot 许可证成员的代码审查请求计入组织成本中心,而非消耗成员个人配额,该选项需为组织启用 AI Credits 付费使用,并可设置预算。组织所有者与仓库管理员还可开启设置,仅允许由本组织或企业提供 Copilot 许可证的用户发起审查请求,开启后外部或个人许可证将无法请求审查。
Ramp 和 Stripe 为不会写代码的员工搭建了可自行构建内部网站和工具的平台,这类“内部 vibe-coding 应用”正在两家公司内部快速普及。The Pragmatic Engineer 的 The Pulse 专栏将这一现象列为中型科技公司的新趋势,并预计会有更多公司跟进。
Oracle 在招聘、工程和运营环节用 ChatGPT Work 与 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作压缩到几分钟。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
LegalOn 将 Codex 每日预估成本降低 65%,同时保持开发速度。该公司按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:Haiku 5.5 的定价、token 消耗与第三方评测数据,能帮开发团队判断它是否适合做高并发子智能体。
Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 全面可用,面向子智能体、快速编辑和终端任务等高频工作。
推荐理由:原文给出 Haiku 5.5 在 Copilot 的可用范围与计费方式,便于团队评估是否把它用于子智能体和终端任务。
GitHub 发布与 Microsoft Applied Sciences 联合微调的分类器,用代码上下文识别无固定格式的密钥,可在 2 毫秒内评估一批候选密钥,据称能把可拦截的密钥数量提升一倍以上。
推荐理由:GitHub 公开了密钥扫描的九季度数据和新分类器,读者可据此判断推送前拦截能力与 AI credits 成本。
GitHub 发布专用于泄露密钥检测的微调模型,可读取上下文代码识别无固定格式的密码等凭据,且不生成代码或文本。现有 AI 检测密码告警已自动升级到新模型,推送保护中的 AI 密钥检测进入私有预览,Copilot CLI 与 Copilot App 的 /security-review 命令也将加入该检测。
推荐理由:GitHub 把微调后的密钥检测模型接入推送保护和 Copilot 安全审查,开发者可据此判断是否开启并预估 AI Credits 消耗。
在纽约 LDX3 工程领导力大会的主题演讲中,演讲者基于走访 OpenAI、Anthropic 及 Ramp、Uber 等公司并获取 GitHub、Factory AI、Linear 未公开数据,梳理了 2026 年科技行业趋势。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言,数据集与评分规则公开。
推荐理由:GitHub 公开了代码审查基准的数据集、评分规则和自测入口,团队可据此对比不同审查智能体并复现结果。
GitHub 提出开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其会用第二个模型对计划、代码和测试进行批判性审查。
JetBrains 为 IDE 推出 Air 智能体开发体验的 Early Access Program,现已作为插件上线 JetBrains Marketplace,或内置于 JetBrains IDE 的 2026.3 EAP 版本。
推荐理由:JetBrains 把多智能体并行会话做进 IDE,并支持接入已有订阅,读者可据此判断现有编码工作流是否值得迁移。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率,预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,首发面向付费 API 客户和 Google AI Ultra 订阅用户。
推荐理由:官方给出输出上限、定价与多项基准成绩,便于团队评估它在长周期编码与知识工作流中的定位。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:Gemini 4 Argon 把输出上限提到 1M token 并给出编码与安全基准成绩,可据此判断长任务与代码迁移场景的选型。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在播客中回顾从开源到 Google 再到创办数据库公司的经历,并讨论如何让系统在大规模下保持快速、可靠与正确。
Shopify 宣布原生开发成为其移动端未来方向,将用 AI 把全部移动应用迁移到 Swift 和 Kotlin,其中 Shop 应用已在 12 周内完成原生重写。
Rails 创始人 David Heinemeier Hansson 在 Rails World 主题演讲中宣布,至少在 37signals,专业工作中手写代码的时代已经结束。这一表态引发“手写代码之死”的新一轮争论,讨论该转变是否已不可逆转。
GitHub Next 的 staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用名为 jigs 的交互原型(带滑块和取色器)实时调整 AI 生成的设计,并已停止查看工作中由 AI 生成的 PR 代码,改为撰写详细 spec 让智能体自行验证。
Cursor 推出 Rollouts 和 Security Review 两个 bot,均已在团队版和企业版上线。Rollouts 会为每个 PR 附加监控项,读取 diff 生成监控规划,并在部署事件触发后基于日志、指标和链路追踪按环境报告变更健康状态,检测到回归时可创建回滚 PR 或交给云端智能体修复,目前不会自行合并或回滚。
推荐理由:官方说明了两个 bot 的监控与审查流程和启用方式,可据此判断是否接入现有 PR 与部署链路。
作者用 ChatGPT Pro 中的 GPT 6 Astra 生成可实时交互的 3D 网页《桃源·豁然开朗》,把《桃花源记》全文拆成 20 幕,支持“循文入境”连贯体验与逐章慢读,并可在“原文+白话”“只看原文”“只看白话”间切换。
Shopify 宣布放弃 React Native,改用 Swift 和 Kotlin 开发移动版,六年前它曾高调从原生语言转向 React Native。文章认为 AI 已能便捷翻译语言,让 React Native 这类中间翻译层失去存在价值,加之其自 2015 年发布以来部分基础技术问题长期未解决。本期周刊还提到联合国投票决定废除墨卡托投影、建议改用平等地球投影法绘制世界地图。
JetBrains 撰文分享其为 Air Context 构建语义代码搜索 RAG 流水线的第一阶段经验,覆盖解析、分块与向量化。其结构感知分块支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go 和 Rust 九种语言,其他语言回退到按行切分。
推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化的取舍经验。
AI 博主宝玉在腾讯内部以自己做了三年的字幕翻译 App 为主线,分享 AI 产品从找需求、判边界、最小验证、重设计到落地交付的完整过程。他提出找需求要盯模型能力边界线,评估需求看能力、成本、价值三条边界,并以一次真实优化为例把调用从 33 次降到 12 次、单集处理从 31 分钟降到 18 分钟。
Addy Osmani 提出"Agentic Skill Decay"概念:智能体可跳过写代码、调试、读他人代码等大量练习,导致代码产出速度快于工程师的判断力。他认为好的智能体工作依赖深厚领域专长与应用判断力,建议新手先形成假设再提示、多问"为什么"、读 diff、预测失败点,并主动让智能体边做边讲解以保留学习机会。
宝玉解读 Claude 博文《How Warp builds self-improving agents on Claude》,介绍 Warp 用两个 Skill 解决代码审查 Agent 缺乏记忆的问题:一个基础 Skill 做代码审查,一个改进 Skill 定期收集工程师在 PR 上对 Agent 审查结果的评论,据此自动更新审查 Skill,人只需自然写评论。
推荐理由:Warp 用人类 PR 评论自动改进代码审查 Skill 的闭环,以及 6 条 Skill 编写原则,可直接迁移到团队的 Agent 工作流。
宝玉以给字幕转录翻译 App BaoCut 添加远程转录功能为例,复盘了 AI 原生开发的完整流程:可行性分析、设计文档、高精度原型设计、编码实现、测试验证。核心结论是流程没变但执行主体从人变成 Agent,人只在关键路径做确认和决策,文档成为人和 Agent 之间以及 Agent Session 之间传递上下文的核心媒介。
JetBrains Air 新增多项目视图,可在同一窗口打开多个项目并并行运行多个智能体,侧边栏按项目分组任务。Markdown 文件现以格式化文本渲染,无需分屏预览,语法在阅读时隐去、编辑时显示。Windows 上的中文、日文、韩文等 IME 输入问题已修复,该版本还新增首次启动的 Customize 界面和可选择智能体与模型的 Agent Review。
Addy Osmani 分享了他日常并行运行 5 到 10 个智能体的 Loop Engineering 实践,并梳理 Claude Code 中 goal、loop、schedule 三类原语的用法。
作者宝玉复盘自己使用 Coding Agent 的角色转变,从盯代码层的 TL 变成管结果的 EM。转折点在 Fable 5 前后,他发现 AI 写的代码质量已相当可以,于是改为先和 Agent 做技术方案,确认后用 /goal 加方案让 Agent 执行写代码和自动化测试,人只做验收,有 Bug 就描述给 Agent 重现修复并补测试。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,代码量中位数减少 15%、成本降低 10.3%(p=0.004),均低于其宣称的 54% 和 20%。
针对 @cellier_ 提出的通用 Agent 吃掉垂直 Agent、开放吃掉封闭、下沉吃掉傲慢三个判断,宝玉补充了自己的六点看法:通用 Agent 赛道本身也会是少数赢家通吃。
JetBrains Air 新版本通过 Agent Client Protocol(ACP)接入 GitHub Copilot、OpenCode、Pi、Cline 等兼容智能体,并新增本地模型支持与 Java/Kotlin 代码智能。
推荐理由:原文给出 Air 接入 ACP 智能体、本地模型与 Java/Kotlin 代码智能的具体配置方式,可据此判断能否沿用公司已批准的编码工具。
JetBrains 发布仓库智能层 JetBrains Context,通过增量语义索引和语义检索让编码智能体直接查询仓库知识,减少反复搜索和读文件。它支持 Claude Code、Codex CLI 和 Junie CLI,可在 JetBrains IDE、Air、VS Code 等编辑器中使用,并支持跨组织代码库的多仓库搜索。
推荐理由:官方给出多仓库语义检索的接入方式和三项基准降幅,可据此判断是否值得给现有编码智能体接上。