跳到正文
10月7日周三
10月4日周日
  1. Hugging Face Blog71

    微软 ThinkingBox 发布:按数据库终态而非工具调用给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,并让每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复下的稳定性与成本数据。

10月2日周五
  1. Hugging Face Blog36

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,生成并验证新的可执行训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项属性。随着模型改进,课程会自动转向其仍难以完成的能力缺口。

9月30日周三