科技爱好者周刊(第 414 期):Jev 决策模型有什么用
TypeSafe AI 发布新型"决策模型" Jev,它不返回文字而是返回浮点数概率,可处理是非题、选择题和按评分标准打分,已有浏览器插件用它实现语义查找和网页质量打分。西蒙·威利斯批评 Jev 是走向黑箱系统的倒退,并担忧有人用它给求职者排名。本期还提到 Anthropic 一位工程师借助 Claude 破解 896 位 RSA 密钥,在 2048 个 GPU 上运行 10 天。
TypeSafe AI 发布新型"决策模型" Jev,它不返回文字而是返回浮点数概率,可处理是非题、选择题和按评分标准打分,已有浏览器插件用它实现语义查找和网页质量打分。西蒙·威利斯批评 Jev 是走向黑箱系统的倒退,并担忧有人用它给求职者排名。本期还提到 Anthropic 一位工程师借助 Claude 破解 896 位 RSA 密钥,在 2048 个 GPU 上运行 10 天。
Google 介绍 Gemini 3.8 Flash 在软件工程、智能体任务和复杂多步推理上较 3.7 Flash 有明显提升,性能常接近成本更高的前沿模型,原因是模型在复杂任务上会执行更多推理步骤并迭代调用工具。
推荐理由:官方给出 3.8 Flash 在软件工程与多步推理上的提升方向,并附四个开发者实例,可作选型参考。
Ollama 0.31 在 Apple Silicon 上为 Gemma 4 默认开启多 token 预测(MTP),在 Aider polyglot 基准上生成速度平均提升近 90%,且不改变模型输出。
推荐理由:原文给出 MTP 在 Ollama 0.31 上的默认开启方式与实测加速幅度,可据此判断本地跑 Gemma 4 编码智能体的收益。