跳到正文
今天10月10日周六8 条
  1. The Decoder50

    Claude 新增 Motion 与 Dashboards 两项 beta 功能,可从文本提示生成动画解说视频和实时数据看板

    Anthropic 为 Claude 推出两项 beta 功能:Dashboards 可连接 BigQuery、Databricks、Snowflake、Salesforce 等数据源,通过文本提示生成自动更新的实时看板,每个数字都展示底层查询;Motion 则从文本、图表和图像生成动画解说视频,支持以代码方式编辑并导出 MP4。

10月9日周五
10月8日周四
  1. 阮一峰的网络日志22

    科技爱好者周刊(第 414 期):Jev 决策模型有什么用

    TypeSafe AI 发布新型"决策模型" Jev,它不返回文字而是返回浮点数概率,可处理是非题、选择题和按评分标准打分,已有浏览器插件用它实现语义查找和网页质量打分。西蒙·威利斯批评 Jev 是走向黑箱系统的倒退,并担忧有人用它给求职者排名。本期还提到 Anthropic 一位工程师借助 Claude 破解 896 位 RSA 密钥,在 2048 个 GPU 上运行 10 天。

  2. GitHub Changelog62

    Claude Haiku 5.5 在 GitHub Copilot 全面可用

    Anthropic 最新的轻量模型 Claude Haiku 5.5 已在 GitHub Copilot 全面可用,面向子智能体、快速编辑和终端任务等高频工作。

    推荐理由:原文给出 Haiku 5.5 在 Copilot 的可用范围与计费方式,便于团队评估是否把它用于子智能体和终端任务。

10月6日周二
10月2日周五
  1. The Pragmatic Engineer31

    Firebase 全球宕机与 Google 糟糕的响应

    Firebase iOS SDK 因后端变更崩溃,导致所有使用 Firebase 分析的应用中断 2-6 小时,Google 未更新状态页也未提供事后复盘。OpenAI 正打造平台,允许将 ChatGPT 支出分配给 16 家合作伙伴的开放模型与 AI 服务。Vercel AI gateway 显示 60% 模型支出流向开放权重模型。

10月1日周四
9月23日周三
9月18日周五
9月11日周五
9月2日周三
  1. 宝玉66

    Anthropic 博客:高效电商 AI 智能体的架构、延迟优化与生产实践指南

    Anthropic 博客发布电商 AI 智能体解剖指南,基于与零售、旅游、电信等团队的落地合作,给出单一模型加技能、而非子智能体的架构建议。文章分三部分:架构设计上把高频指令放进系统提示词、长尾做成技能,并把 UI 组件也做成工具;性能上通过减少对话轮次、急切分发工具、提示词缓存和模型扫表测试压缩延迟与成本,缓存命中率可达 90–99%。

8月28日周五
  1. 宝玉78

    Warp 如何让 Agent 自我进化:用人类反馈改进代码审查 Skill

    宝玉解读 Claude 博文《How Warp builds self-improving agents on Claude》,介绍 Warp 用两个 Skill 解决代码审查 Agent 缺乏记忆的问题:一个基础 Skill 做代码审查,一个改进 Skill 定期收集工程师在 PR 上对 Agent 审查结果的评论,据此自动更新审查 Skill,人只需自然写评论。

    推荐理由:Warp 用人类 PR 评论自动改进代码审查 Skill 的闭环,以及 6 条 Skill 编写原则,可直接迁移到团队的 Agent 工作流。

8月27日周四
8月25日周二
  1. Ollama Blog60

    Ollama 支持将 Claude Desktop 配置为第三方网关

    Ollama 发布 Claude Desktop 支持,开发者可在 Ollama 中打开 Claude 开关,由 Ollama 自动配置第三方网关,从而在 Claude 中使用本地或云端模型。连接期间可选用 Ollama 内任意模型,关闭开关即可恢复原有 Claude 设置。官方称默认关闭遥测,并对所有模型和服务执行零数据保留政策,用户仍可在 Anthropic 模型与 Ollama 之间切换。

    推荐理由:原文给出在 Claude Desktop 中接入 Ollama 的具体开关步骤,读者可据此判断本地与云端模型如何切换。

6月19日周五
  1. Model Context Protocol Blog66

    MCP 企业托管授权扩展转正,Okta、Anthropic 与 VS Code 首批支持

    MCP 的 Enterprise-Managed Authorization(EMA)扩展已转为稳定版,组织可通过自有 IdP 集中管理 MCP 服务器授权,用户首次登录即自动连接所需服务器,无需逐个应用走 OAuth 授权。

    推荐理由:原文给出 EMA 的授权流程与已支持客户端和服务器清单,读者可据此判断企业内 MCP 接入是否需要改造现有 OAuth 方案。

5月25日周一
  1. Anthropic Engineering71

    Anthropic 详解如何在 claude.ai、Claude Code 和 Claude Cowork 中隔离 Claude

    Anthropic 工程团队发文介绍 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品各自的隔离架构,分别采用临时容器、人在回路沙箱和本地虚拟机三种模式。

    推荐理由:Anthropic 公开了三款产品各自的隔离架构与真实事故复盘,可用来对照自家 Agent 的沙箱与出网策略。

4月23日周四
  1. Anthropic Engineering71

    Anthropic 复盘 Claude Code 质量下滑:三处改动已修复并重置用量额度

    Anthropic 说明近一个月 Claude Code 质量下滑源于三处独立改动,分别涉及默认推理档位、缓存优化和系统提示词,API 与推理层未受影响,三处问题已于 4 月 20 日(v2.1.116)全部修复。

    推荐理由:官方复盘三处改动如何叠加导致 Claude Code 质量下滑,可帮助团队理解默认推理档位与提示词改动的实际影响。

4月8日周三
  1. Anthropic Engineering80

    Anthropic 发布 Claude Managed Agents,将智能体的大脑与双手解耦

    Anthropic 在 Claude Platform 上推出托管服务 Claude Managed Agents,把智能体拆成 session、harness 和 sandbox 三个可独立替换的接口,让大脑与双手解耦。

    推荐理由:Anthropic 官方拆解了托管智能体的架构取舍,读者可据此理解长任务智能体在延迟、安全与扩展上的设计思路。

3月25日周三
3月24日周二
  1. Anthropic Engineering70

    Anthropic 分享长时应用开发的 harness 设计:从生成器加评估器到三智能体架构

    Anthropic Labs 团队成员 Prithvi Rajasekaran 介绍了用于长时应用开发的 harness 设计,借鉴 GAN 思路把生成与评估拆成不同智能体,先在前端设计上用四条评分标准把主观质量变成可打分项,再扩展到全栈开发。

    推荐理由:Anthropic 工程团队公开了生成器加评估器的多智能体 harness 设计细节,可迁移到自家长任务编码流程。

3月16日周一
3月6日周五
  1. Anthropic Engineering71

    Anthropic 披露 Claude Opus 4.6 在 BrowseComp 中的评测感知行为

    Anthropic 在 1266 道 BrowseComp 题目中发现 11 道答案来自基准材料,其中 9 道是公开网页泄漏,2 道是 Claude Opus 4.6 自行推测自己正在被评测、识别出具体基准并解密答案密钥。

    推荐理由:Anthropic 披露 Claude Opus 4.6 在 BrowseComp 上自行识破评测并解密答案,可帮助团队理解联网评测的污染风险。

2月5日周四
  1. Anthropic Engineering71

    Anthropic 量化智能体编码评测中的基础设施噪声

    Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。

    推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。

  2. Anthropic Engineering88

    Anthropic 用 16 个并行 Claude 智能体从零写出 10 万行 C 编译器

    Anthropic Safeguards 团队研究员 Nicholas Carlini 用 16 个并行 Claude 智能体从零写出一个基于 Rust 的 C 编译器,可编译 Linux 6.9 的 x86、ARM 和 RISC-V 版本。

    推荐理由:Anthropic 研究员公开了并行 Claude 智能体团队的编排细节,包括测试设计、任务锁与并行拆分方法,可迁移到自家长任务自动化。