跳到正文
  1. Hugging Face Blog66

    作者用 ML Intern 在几天内自建六个模型,总花费约 103 美元

    作者在 HuggingChat 中开启 ML-intern,用提示词驱动智能体完成数据构建、训练、评测与发布,几天内做出六个模型,总计算成本约 103 美元。其中把 Qwen-Image 2.1 的 9B 提示词改写器蒸馏成 0.8B 版本,可在 CPU 上运行,输出有效率 99.7%,token 用量约为教师模型的四分之一。作者公开了七个提示词,并建议在提示中要求基线分数、冒烟测试和预算上限。

    推荐理由:作者用 ML Intern 从零训练六个小模型的完整提示词与成本清单,可迁移到自己的微调与蒸馏流程。

  1. GitHub Blog · AI & ML71

    GitHub Security Lab 发布 Fuzzing Taskflow 智能体

    GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并改进 harness,最后对每个崩溃做分诊并生成漏洞报告。

    推荐理由:GitHub 把模糊测试的 harness 编写、覆盖率追踪和崩溃分诊交给 LLM 智能体,可参考其任务流与工具分层设计。

  1. JetBrains AI Blog66

    JetBrains 分享语义代码搜索 RAG 流水线:解析、分块与向量化

    JetBrains 撰文分享其为 Air Context 构建语义代码搜索 RAG 流水线的第一阶段经验,覆盖解析、分块与向量化。其结构感知分块支持 Kotlin、Java、Python、JavaScript、TypeScript、C#、PHP、Go 和 Rust 九种语言,其他语言回退到按行切分。

    推荐理由:JetBrains 公开了语义代码搜索 RAG 流水线的解析、分块与向量化细节,含二进制量化的取舍经验。

  1. Mistral AI66

    Mistral 用 AI 智能体迁移 4 万行 Fortran 遗留代码

    Mistral 帮助一家欧洲能源运营商把 4 万行 Fortran 77 迁移到 C++,对象是一个无测试套件、无集中文档的物理储层模拟器。团队先搭建数值一致性校验框架,再用 Vibe CLI 启动上百个智能体解析调用树并补文档,最终采用人工把关的 coder、tester、reviewer 结构化工作流逐模块迁移。

    推荐理由:Mistral 用智能体迁移 4 万行 Fortran 的完整流程,可迁移到自家遗留代码改造。

  1. JetBrains AI Blog62

    JetBrains 推出 Central CLI,统一管控第三方 AI 工具开销

    JetBrains 发布 JetBrains Central CLI,把第三方终端 Agent 的请求统一走自家 AI 路由层,从而对 Claude Code、Codex 等工具施加 AI credits 形式的 token 预算。

    推荐理由:JetBrains 公开了内部 AI 成本治理的完整路径,读者可参考其用 CLI 统一路由第三方 Agent 并设置 token 预算的做法。

  1. Anthropic Engineering71

    Anthropic 详解如何在 claude.ai、Claude Code 和 Claude Cowork 中隔离 Claude

    Anthropic 工程团队发文介绍 claude.ai、Claude Code 和 Claude Cowork 三款智能体产品各自的隔离架构,分别采用临时容器、人在回路沙箱和本地虚拟机三种模式。

    推荐理由:Anthropic 公开了三款产品各自的隔离架构与真实事故复盘,可用来对照自家 Agent 的沙箱与出网策略。

  1. Anthropic Engineering80

    Anthropic 发布 Claude Managed Agents,将智能体的大脑与双手解耦

    Anthropic 在 Claude Platform 上推出托管服务 Claude Managed Agents,把智能体拆成 session、harness 和 sandbox 三个可独立替换的接口,让大脑与双手解耦。

    推荐理由:Anthropic 官方拆解了托管智能体的架构取舍,读者可据此理解长任务智能体在延迟、安全与扩展上的设计思路。

  1. Anthropic Engineering74

    Anthropic 如何构建 Claude Code auto mode:跳过权限审批的更安全方式

    Anthropic 介绍 Claude Code 新增的 auto mode,用模型分类器代替人工审批,在手动确认和 --dangerously-skip-permissions 之间取中间路线。

    推荐理由:Anthropic 公开了 auto mode 的两层分类器设计与实测数据,可据此判断能否用它替代逐条人工审批。

  1. Anthropic Engineering70

    Anthropic 分享长时应用开发的 harness 设计:从生成器加评估器到三智能体架构

    Anthropic Labs 团队成员 Prithvi Rajasekaran 介绍了用于长时应用开发的 harness 设计,借鉴 GAN 思路把生成与评估拆成不同智能体,先在前端设计上用四条评分标准把主观质量变成可打分项,再扩展到全栈开发。

    推荐理由:Anthropic 工程团队公开了生成器加评估器的多智能体 harness 设计细节,可迁移到自家长任务编码流程。

  1. Anthropic Engineering88

    Anthropic 用 16 个并行 Claude 智能体从零写出 10 万行 C 编译器

    Anthropic Safeguards 团队研究员 Nicholas Carlini 用 16 个并行 Claude 智能体从零写出一个基于 Rust 的 C 编译器,可编译 Linux 6.9 的 x86、ARM 和 RISC-V 版本。

    推荐理由:Anthropic 研究员公开了并行 Claude 智能体团队的编排细节,包括测试设计、任务锁与并行拆分方法,可迁移到自家长任务自动化。

已经到底了