跳到正文
10月7日周三
  1. Google DeepMind62

    Google DeepMind 发布 EmbeddingGemma 2 端侧多模态嵌入模型

    Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可把文本、图像、音频和视频映射到统一嵌入空间。

    推荐理由:原文给出 740M 参数、量化后内存占用和 8K 上下文等具体指标,便于开发者判断端侧多模态检索能否落地。

10月2日周五
  1. Google · Gemini26

    Gemini Live 上线 Guided Vision:为无障碍打造的实时视觉解读

    Google 在兼容 Android 设备上为 Gemini Live 推出 Guided Vision,面向盲人、低视力人群提供语音优先的实时视觉解读。该功能与 Aira 合作、用数万小时数据训练,超 1000 名 Aira Trusted Tester 参与压力测试与安全护栏评估,支持读小字、找物品、描述物体和探索环境,并覆盖多语言。

9月29日周二
  1. Google · Gemini60

    Google 展示开发者用 Gemini 3.8 Flash 做的四个项目

    Google 介绍 Gemini 3.8 Flash 在软件工程、智能体任务和复杂多步推理上较 3.7 Flash 有明显提升,性能常接近成本更高的前沿模型,原因是模型在复杂任务上会执行更多推理步骤并迭代调用工具。

    推荐理由:官方给出 3.8 Flash 在软件工程与多步推理上的提升方向,并附四个开发者实例,可作选型参考。

9月25日周五
  1. Google DeepMind32

    Google 发布 Gemini 3.8 Live with Live Avatar,为对话 AI 带来实时视觉形象

    Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让 AI 能听、能看、能说并具备动态视觉形象。该功能支持异步工具调用、97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 上线,自定义头像需企业白名单申请。

9月24日周四
8月10日周一