跳到正文
10月9日周五
10月8日周四
10月2日周五
9月28日周一
  1. Google · Gemini10

    布鲁克林杂货店主如何用 Gemini 为 200 位客人备餐:3 种用法

    布鲁克林 Edy's Grocer 店主 Edy Massih 用 Gemini 把家族黎巴嫩菜谱直接换算成大份量宴席批次,避免手工计算香料和酥皮比例出错。Gemini 还能把活动菜单转成分区购物清单、汇总共用食材并提前排出备餐时间表,同时为无麸质、无坚果等饮食限制给出保留原有风味的替换方案。

9月26日周六
  1. GitHub Blog · AI & ML58

    GitHub Copilot 应用入门:如何用 canvases 构建自定义工作流

    GitHub Copilot 应用中的 canvas 是一种可自定义界面,用户与智能体共享同一份状态,可做成看板、issue 分诊板、发布清单或仪表盘。创建时无需写代码或手动设计,在智能体会话中输入 /create-canvas 技能并用自然语言描述工作流、界面可做的操作和智能体可做的操作即可,生成的界面会显示在右侧面板。

9月25日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot 的 canvas:当聊天框不是与 AI 交互的正确界面

    GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈应用,可与 Copilot 智能体双向通信,也能调用第三方 API 并在本地执行代码。作者认为聊天框只适合未知任务,明确任务下应让智能体生成可复用工具,例如用 canvas 管理 Winget 包或操作 SQLite 数据库,避免反复消耗 token。

  2. GitHub Blog · AI & ML71

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub 把模糊测试的 harness 编写、覆盖率追踪和崩溃分诊交给 LLM 智能体,可参考其任务流与工具分层设计。

9月24日周四
  1. GitHub Blog · AI & ML28

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个包含 2,200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块几何两部分,评论高度按需惰性测量,修正幅度小且锚定在用户当前浏览位置。

9月19日周六
9月17日周四
  1. JetBrains AI Blog66

    JetBrains 分享语义代码搜索 RAG 流水线:解析、分块与向量化

    JetBrains 撰文分享其为 Air Context 构建语义代码搜索 RAG 流水线的第一阶段经验,覆盖解析、分块与向量化。其结构感知分块支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go 和 Rust 九种语言,其他语言回退到按行切分。

    推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化的取舍经验。

9月14日周一
  1. Addy Osmani71

    Addy Osmani 谈在遗留代码库中引入智能体工程

    Addy Osmani 撰文讨论在遗留(brownfield)代码库中引入智能体工程的做法,核心是把隐藏约束显性化,让廉价改动变得可信。他提出按绿、黄、红三区划分代码库,绿区可让智能体在紧循环中自主迭代,黄区需先写特征测试,红区涉及认证、计费、权限等敏感逻辑必须人工逐步配对;并强调迁移应以完整单元收尾、删除旧路径,否则智能体面对矛盾先例会出错。

9月2日周三
  1. 宝玉66

    Anthropic 博客:高效电商 AI 智能体的架构、延迟优化与生产实践指南

    Anthropic 博客发布电商 AI 智能体解剖指南,基于与零售、旅游、电信等团队的落地合作,给出单一模型加技能、而非子智能体的架构建议。文章分三部分:架构设计上把高频指令放进系统提示词、长尾做成技能,并把 UI 组件也做成工具;性能上通过减少对话轮次、急切分发工具、提示词缓存和模型扫表测试压缩延迟与成本,缓存命中率可达 90–99%。

8月31日周一
  1. 宝玉58

    宝玉:AI 原生思维,像训练大模型一样训练自己

    AI 博主宝玉在腾讯内部以自己做了三年的字幕翻译 App 为主线,分享 AI 产品从找需求、判边界、最小验证、重设计到落地交付的完整过程。他提出找需求要盯模型能力边界线,评估需求看能力、成本、价值三条边界,并以一次真实优化为例把调用从 33 次降到 12 次、单集处理从 31 分钟降到 18 分钟。

8月28日周五
  1. 宝玉78

    Warp 如何让 Agent 自我进化:用人类反馈改进代码审查 Skill

    宝玉解读 Claude 博文《How Warp builds self-improving agents on Claude》,介绍 Warp 用两个 Skill 解决代码审查 Agent 缺乏记忆的问题:一个基础 Skill 做代码审查,一个改进 Skill 定期收集工程师在 PR 上对 Agent 审查结果的评论,据此自动更新审查 Skill,人只需自然写评论。

    推荐理由:Warp 用人类 PR 评论自动改进代码审查 Skill 的闭环,以及 6 条 Skill 编写原则,可直接迁移到团队的 Agent 工作流。

8月27日周四
8月24日周一
  1. 宝玉62

    我的 AI 原生开发流程:一个真实案例的完整复盘

    宝玉以给字幕转录翻译 App BaoCut 添加远程转录功能为例,复盘了 AI 原生开发的完整流程:可行性分析、设计文档、高精度原型设计、编码实现、测试验证。核心结论是流程没变但执行主体从人变成 Agent,人只在关键路径做确认和决策,文档成为人和 Agent 之间以及 Agent Session 之间传递上下文的核心媒介。

8月14日周五
8月3日周一
  1. JetBrains AI Blog62

    JetBrains 推出 Central CLI,统一管控第三方 AI 工具开销

    JetBrains 发布 JetBrains Central CLI,把第三方终端 Agent 的请求统一走自家 AI 路由层,从而对 Claude Code、Codex 等工具施加 AI credits 形式的 token 预算。

    推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,读者可参考其用 CLI 统一路由第三方 Agent 并设置 token 预算的做法。

7月29日周三
  1. 宝玉62

    从 TL 到 EM:我终于不再盯着 AI 写代码了

    作者宝玉复盘自己使用 Coding Agent 的角色转变,从盯代码层的 TL 变成管结果的 EM。转折点在 Fable 5 前后,他发现 AI 写的代码质量已相当可以,于是改为先和 Agent 做技术方案,确认后用 /goal 加方案让 Agent 执行写代码和自动化测试,人只做验收,有 Bug 就描述给 Agent 重现修复并补测试。

7月28日周二
5月25日周一
  1. Anthropic Engineering71

    Anthropic 详解如何在 claude.ai、Claude Code 和 Claude Cowork 中隔离 Claude

    Anthropic 工程团队发文介绍 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品各自的隔离架构,分别采用临时容器、人在回路沙箱和本地虚拟机三种模式。

    推荐理由:Anthropic 公开了三款产品各自的隔离架构与真实事故复盘,可用来对照自家 Agent 的沙箱与出网策略。

4月8日周三
  1. Anthropic Engineering80

    Anthropic 发布 Claude Managed Agents,将智能体的大脑与双手解耦

    Anthropic 在 Claude Platform 上推出托管服务 Claude Managed Agents,把智能体拆成 session、harness 和 sandbox 三个可独立替换的接口,让大脑与双手解耦。

    推荐理由:Anthropic 官方拆解了托管智能体的架构取舍,读者可据此理解长任务智能体在延迟、安全与扩展上的设计思路。

3月25日周三
3月24日周二
  1. Anthropic Engineering70

    Anthropic 分享长时应用开发的 harness 设计:从生成器加评估器到三智能体架构

    Anthropic Labs 团队成员 Prithvi Rajasekaran 介绍了用于长时应用开发的 harness 设计,借鉴 GAN 思路把生成与评估拆成不同智能体,先在前端设计上用四条评分标准把主观质量变成可打分项,再扩展到全栈开发。

    推荐理由:Anthropic 工程团队公开了生成器加评估器的多智能体 harness 设计细节,可迁移到自家长任务编码流程。

3月16日周一
2月5日周四
  1. Anthropic Engineering88

    Anthropic 用 16 个并行 Claude 智能体从零写出 10 万行 C 编译器

    Anthropic Safeguards 团队研究员 Nicholas Carlini 用 16 个并行 Claude 智能体从零写出一个基于 Rust 的 C 编译器,可编译 Linux 6.9 的 x86、ARM 和 RISC-V 版本。

    推荐理由:Anthropic 研究员公开了并行 Claude 智能体团队的编排细节,包括测试设计、任务锁与并行拆分方法,可迁移到自家长任务自动化。