跳到正文
10月8日周四
  1. Hugging Face Blog66

    作者用 ML Intern 在几天内自建六个模型,总花费约 103 美元

    作者在 HuggingChat 中开启 ML-intern,用提示词驱动智能体完成数据构建、训练、评测与发布,几天内做出六个模型,总计算成本约 103 美元。其中把 Qwen-Image 2.1 的 9B 提示词改写器蒸馏成 0.8B 版本,可在 CPU 上运行,输出有效率 99.7%,token 用量约为教师模型的四分之一。作者公开了七个提示词,并建议在提示中要求基线分数、冒烟测试和预算上限。

    推荐理由:作者用 ML Intern 从零训练六个小模型的完整提示词与成本清单,可迁移到自己的微调与蒸馏流程。

10月7日周三
  1. Hugging Face Blog23

    TII 推出 Falcon-ASR:1.6B 参数阿拉伯语语音识别模型,主打阿联酋方言

    阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上,其平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。

10月4日周日
  1. Hugging Face Blog71

    微软 ThinkingBox 发布:按数据库终态而非工具调用给 AI 智能体打分

    微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,并让每个任务重复 20 次。

    推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用数据库终态而非工具调用判断成败,并给出 20 次重复下的稳定性与成本数据。

10月2日周五
  1. Hugging Face Blog36

    AutoSynthData:为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,生成并验证新的可执行训练任务,用于企业智能体的后训练。每个任务由系统规范、用户提示词和验证器组成,需满足可行性、真实性和难度三项属性。随着模型改进,课程会自动转向其仍难以完成的能力缺口。

9月30日周三