a16z 第七版 Top 100 AI 榜单:ChatGPT 居首,仅 4.5% 美国消费者付费订阅
Andreessen Horowitz 发布第七版 Top 100 AI 消费产品榜单,首次通过 YipitData 追踪美国消费者实际支出,ChatGPT 在网页端领先 Gemini 和 Claude,OpenAI 与 Anthropic 领跑新增支出排名。
Andreessen Horowitz 发布第七版 Top 100 AI 消费产品榜单,首次通过 YipitData 追踪美国消费者实际支出,ChatGPT 在网页端领先 Gemini 和 Claude,OpenAI 与 Anthropic 领跑新增支出排名。
TypeSafe 的 Jev 上线 3 周即突破 1 亿美元 ARR,估值达 75 亿美元,Sequoia 被指"泄露"了这一数据。Jev 成为同日多家厂商发布的"决策模型"品类的对标基准,OpenAI Decisions API、Perplexity pplx-decider-v1.1-27b、Cloudflare clef 等相继跟进。
GitHub Copilot 本周更新中,Claude Haiku 5.5 面向 Copilot Pro、Pro+、Max、Business 和 Enterprise 用户开放。
Anthropic 为 Claude Managed Agents 新增动态工作流,由主智能体制定计划、把任务分发给子智能体并汇总结果,单次执行最多可并行运行 1000 个智能体。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里为博客开发出 Newsletters 页面,包含新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页和站内搜索集成,模型为 GPT-6 Astra High。
Anthropic 的 Claude Science 首次绘制出完整的紫外天图。该系统协调 AI 智能体下载多个太空任务的数据,完成校准与合并,并用 inpainting 填补缺失区域,测试中预测值与实际测量平均偏差约 10%。此前 NASA 的 GALEX 任务仅覆盖约三分之二天空,且跳过了明亮恒星形成区。
Asana 借助 Codex 中的 GPT-6 Astra,在测试中让其浏览器智能体成本降低 76 倍、速度提升 5 倍,从而为客户提供能力更强的模型。
Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk 提出"合成超级智能"(synthesis superintelligence)路线,主张以物理实验为环境的强化学习推动材料发现,而非单纯扩大互联网数据训练。他们讨论让每台实验仪器具备"140 IQ"、用 AI 做材料表征、结合 DFT 与高通量实验室,并认为失败实验可能是最有价值的训练数据。
Oracle 在招聘、工程和运营环节用 ChatGPT Work 与 Codex 把专家知识转化为快速、可复用的工作流,将原本需要数天的工作压缩到几分钟。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的下一版,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可,主要改进来自后训练阶段的强化学习。
推荐理由:JetBrains 开源 12B MoE 编码模型,给出与 Qwen3.5-9B、Gemma 4 E4B 的同口径对比和自托管入口,便于团队评估本地编码智能体选型。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:Haiku 5.5 的定价、token 消耗与第三方评测数据,能帮开发团队判断它是否适合做高并发子智能体。
Artcraft 从"面向艺术家的可控 AI"转向推出七款开源应用,复刻 Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 和 Acrobat Pro 的界面与工具。
Sam Newman 在新书《Building Resilient Distributed Systems》中提出分布式系统三原则:信息传输需要时间、资源可能离线、资源终会耗尽,并指出多数故障源于资源池耗尽。他认为微服务应被视作"最后手段",其核心是独立可部署与业务边界清晰,同时强调可观测性及根据业务场景决定 fail open 还是 fail closed。该书于 10 月 7 日出版。
Kubernetes 创始人 Craig McLuckie 和 Joe Beda 创办的 Stacklok 推出云端 harness Mecatl,把 Agent 循环与客户端、模型供应商、状态存储和执行环境解耦,使会话管理和记忆不再以 JSONL 文件形式存在本地磁盘。
OpenAI 为 ChatGPT for Teens 上线 College Planner,帮助学生管理大学申请,同时新增 flashcards 和 quizzes 功能。OpenAI 还组建了一个青少年 AI 委员会。
Radisson Hotel Group 与 Accenture 合作,基于 OpenAI 技术打造了一款 ChatGPT 插件,让旅客在规划行程时即可查找、比较并预订酒店。
在纽约 LDX3 工程领导力大会的主题演讲中,演讲者基于走访 OpenAI、Anthropic 及 Ramp、Uber 等公司并获取 GitHub、Factory AI、Linear 未公开数据,梳理了 2026 年科技行业趋势。
Reflection 发布 Beam,一个面向编码、智能体和科学工作的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重将于本月发布。
Cursor 推出本地智能体远程控制功能,用户可在 Cursor iOS 应用中查看电脑上正在运行的本地智能体并直接回复消息。该功能除企业组织外默认对所有用户开启,智能体仍在本机运行,App 只建立连接,因此电脑需保持开机联网;桌面端设置中可开启 Keep this computer awake 防止休眠。
推荐理由:原文说明了远程查看和回复本地智能体的具体操作与限制,便于开发者判断能否把等待中的编码任务挪到手机上处理。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言,数据集与评分规则公开。
推荐理由:GitHub 公开了代码审查基准的数据集、评分规则和自测入口,团队可据此对比不同审查智能体并复现结果。
GitHub 提出开发者应强化的三项技能:学会指挥 AI 智能体而非仅使用它、不轻信 AI 的首次答案、用 AI 节省的时间去解决更大的问题。文中以 GitHub Copilot 内置的 Rubber Duck agent 为例,说明其会用第二个模型对计划、代码和测试进行批判性审查。
Anthropic 推出 Claude Frontier Academy,投入 1 亿美元,目标到 2027 年底培养 1 万名 Frontier Deployed Engineer(FDE)。
JetBrains 为 IDE 推出 Air 智能体开发体验的 Early Access Program,现已作为插件上线 JetBrains Marketplace,或内置于 JetBrains IDE 的 2026.3 EAP 版本。
推荐理由:JetBrains 把多智能体并行会话做进 IDE,并支持接入已有订阅,读者可据此判断现有编码工作流是否值得迁移。
Barclays 扩大与 Anthropic 的战略合作,在全行范围部署 Claude,用于加速软件开发、现代化遗留系统并提升运营效率,预计到 2026 年底 Claude Code 覆盖 50% 开发者,2027 年覆盖多数软件工程师。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,首发面向付费 API 客户和 Google AI Ultra 订阅用户。
推荐理由:官方给出输出上限、定价与多项基准成绩,便于团队评估它在长周期编码与知识工作流中的定位。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:Gemini 4 Argon 把输出上限提到 1M token 并给出编码与安全基准成绩,可据此判断长任务与代码迁移场景的选型。
Cockroach Labs 联合创始人兼 CTO、GIMP 原始作者 Peter Mattis 在播客中回顾从开源到 Google 再到创办数据库公司的经历,并讨论如何让系统在大规模下保持快速、可靠与正确。
Google 将 skills 功能推向全球 Gemini 聊天,用户可把常用指令保存一次后反复调用,在提示栏输入斜杠加技能名即可运行。skills 支持叠加使用,并可包含纯文本、PDF 或图片等参考文件,同时已支持从聊天中自动生成技能。
Shopify 宣布原生开发成为其移动端未来方向,将用 AI 把全部移动应用迁移到 Swift 和 Kotlin,其中 Shop 应用已在 12 周内完成原生重写。
Ollama 0.35 新增基于 TypeSafe Jev API 的决策模型支持,通过 /v1/systemone 端点把文本作为 state 连同多个命名问题一次性提交,由本地模型一次请求返回全部答案。
推荐理由:Ollama 新增决策模型接口与三个可本地运行的模型,开发者可据此评估低延迟分类与路由场景的落地方式。
GitHub Copilot 应用中的 canvas 是一种可自定义界面,用户与智能体共享同一份状态,可做成看板、issue 分诊板、发布清单或仪表盘。创建时无需写代码或手动设计,在智能体会话中输入 /create-canvas 技能并用自然语言描述工作流、界面可做的操作和智能体可做的操作即可,生成的界面会显示在右侧面板。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈应用,可与 Copilot 智能体双向通信,也能调用第三方 API 并在本地执行代码。作者认为聊天框只适合未知任务,明确任务下应让智能体生成可复用工具,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免反复消耗 token。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。
推荐理由:GitHub 把模糊测试的 harness 编写、覆盖率追踪和崩溃分诊交给 LLM 智能体,可参考其任务流与工具分层设计。
Rails 创始人 David Heinemeier Hansson 在 Rails World 主题演讲中宣布,至少在 37signals,专业工作中手写代码的时代已经结束。这一表态引发“手写代码之死”的新一轮争论,讨论该转变是否已不可逆转。
GitHub Next 的 staff research engineer Maggie Appleton 在 Pragmatic Engineer 播客中分享设计工程实践:她用名为 jigs 的交互原型(带滑块和取色器)实时调整 AI 生成的设计,并已停止查看工作中由 AI 生成的 PR 代码,改为撰写详细 spec 让智能体自行验证。
Anthropic 成立生命科学研究组与实验室,让 Claude 自主搜索 DNA 序列数据库,约 950 个智能体耗时 21 小时、消耗 2.1 亿 token 后发现一种与 DNA 重复序列关联的新型酶系统,命名为 array-associated reverse transcriptases(ART)。
Cursor 推出 Rollouts 和 Security Review 两个 bot,均已在团队版和企业版上线。Rollouts 会为每个 PR 附加监控项,读取 diff 生成监控规划,并在部署事件触发后基于日志、指标和链路追踪按环境报告变更健康状态,检测到回归时可创建回滚 PR 或交给云端智能体修复,目前不会自行合并或回滚。
推荐理由:官方说明了两个 bot 的监控与审查流程和启用方式,可据此判断是否接入现有 PR 与部署链路。
作者用 ChatGPT Pro 中的 GPT 6 Astra 生成可实时交互的 3D 网页《桃源·豁然开朗》,把《桃花源记》全文拆成 20 幕,支持“循文入境”连贯体验与逐章慢读,并可在“原文+白话”“只看原文”“只看白话”间切换。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的专家经验,后者是智能体连接工具与数据的标准;RAG 并未消亡,检索能让模型更接近答案、减少 token 浪费。节目还讨论了企业招聘看重的是使用 AI 的判断力,以及微调需求往往暴露的是代码库可维护性问题。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者主打规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。