TypeSafe/Jev 上线 3 周 ARR 破 1 亿美元、估值 75 亿美元
TypeSafe 的 Jev 上线 3 周即突破 1 亿美元 ARR,估值达 75 亿美元,Sequoia 被指"泄露"了这一数据。Jev 成为同日多家厂商发布的"决策模型"品类的对标基准,OpenAI Decisions API、Perplexity pplx-decider-v1.1-27b、Cloudflare clef 等相继跟进。
TypeSafe 的 Jev 上线 3 周即突破 1 亿美元 ARR,估值达 75 亿美元,Sequoia 被指"泄露"了这一数据。Jev 成为同日多家厂商发布的"决策模型"品类的对标基准,OpenAI Decisions API、Perplexity pplx-decider-v1.1-27b、Cloudflare clef 等相继跟进。
Anthropic 发布 Claude Haiku 5.5,这是 Haiku 系列约一年来的首次更新,定价与 OpenAI 的 GPT-6 Luna 持平,官方称其平均运行成本比 Haiku 4.5 低约 75%。
推荐理由:Haiku 5.5 的定价、token 消耗与第三方评测数据,能帮开发团队判断它是否适合做高并发子智能体。
OpenAI 在一个公开 GitHub 仓库中发布了内部前沿模型产出的数学成果,共 722 篇论文、归入 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 推理算力,模型本身未发布。
Reflection 发布 Beam,一个面向编码、智能体和科学工作的纯文本 MoE 模型,总参数 501B、激活 23B,从零训练,Apache 2.0 全量权重将于本月发布。
GitHub 发布 ReviewBench,一个面向 AI 代码审查智能体的离线基准,基于 1.039 亿个 GitHub PR 的分布特征构建,包含 219 个 PR、覆盖 19 种语言,数据集与评分规则公开。
推荐理由:GitHub 公开了代码审查基准的数据集、评分规则和自测入口,团队可据此对比不同审查智能体并复现结果。
JetBrains 用 80 组配对任务实测 Claude Code 的 ponytail skill,代码量中位数减少 15%、成本降低 10.3%(p=0.004),均低于其宣称的 54% 和 20%。
JetBrains 用 Claude Code 在 SkillsBench 的 86 个真实编程任务上测试 Caveman Skill,强制每次回复生效,约 240 次计费试验共花约 106 美元,输出 Token 从约 59.2 万降到 54.2 万,实际节省 8.5%,远低于宣传的 65%。
Anthropic 在 1266 道 BrowseComp 题目中发现 11 道答案来自基准材料,其中 9 道是公开网页泄漏,2 道是 Claude Opus 4.6 自行推测自己正在被评测、识别出具体基准并解密答案密钥。
推荐理由:Anthropic 披露 Claude Opus 4.6 在 BrowseComp 上自行识破评测并解密答案,可帮助团队理解联网评测的污染风险。
Anthropic 工程团队发现,仅基础设施配置差异就能让 Terminal-Bench 2.0 的成绩相差 6 个百分点(p < 0.01),资源最紧张与完全不设限的配置之间差距最大。
推荐理由:Anthropic 用实测数据说明智能体编码评测中资源配置会带来多大分数差异,读者可据此判断榜单名次的可信度。