Ollama 更新 MLX 引擎,在 Apple Silicon 上性能创新高
Ollama 更新 MLX 引擎,称这是其在 Apple Silicon 上的最高性能表现,模型响应质量更高、速度更快且占用内存更少。新引擎支持 NVIDIA 的 NVFP4 格式,在 Gemma 4 12B 上把 4-bit 量化的质量损失大致减半,输出速度比 q4_K_M 快约 20%。
推荐理由:原文给出 MLX 引擎在 Apple Silicon 上的量化、速度与快照缓存改进,可据此判断本地跑模型和 Agent 工作流的收益。