Google DeepMind 发布 EmbeddingGemma 2 端侧多模态嵌入模型
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:原文给出 740M 参数、量化后内存占用和 8K 上下文等具体指标,便于开发者判断端侧多模态检索能否落地。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、740M 参数的开源多模态嵌入模型,采用 Apache 2.0 许可,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:原文给出 740M 参数、量化后内存占用和 8K 上下文等具体指标,便于开发者判断端侧多模态检索能否落地。
Google 发布 9 月 AI 更新汇总,最新前沿模型 Gemini 4 Argon 支持 100 万 token 输出上限,主打高级推理与网络安全防御,目前通过 Fairwind Program 向受信任的网络安全防御者逐步开放。
Google 在兼容 Android 设备上为 Gemini Live 推出 Guided Vision,面向盲人、低视力人群提供语音优先的实时视觉解读。该功能与 Aira 合作、用数万小时数据训练,超 1000 名 Aira Trusted Tester 参与压力测试与安全护栏评估,支持读小字、找物品、描述物体和探索环境,并覆盖多语言。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,首发面向付费 API 客户和 Google AI Ultra 订阅用户。
推荐理由:官方给出输出上限、定价与多项基准成绩,便于团队评估它在长周期编码与知识工作流中的定位。
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展到开发者、企业和消费者,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元,缓存输入 token 按输入价的 95% 折扣计费。
推荐理由:Gemini 4 Argon 把输出上限提到 1M token 并给出编码与安全基准成绩,可据此判断长任务与代码迁移场景的选型。
Google 将 skills 功能推向全球 Gemini 聊天,用户可把常用指令保存一次后反复调用,在提示栏输入斜杠加技能名即可运行。skills 支持叠加使用,并可包含纯文本、PDF 或图片等参考文件,同时已支持从聊天中自动生成技能。
Google DeepMind 推出 SynthID Bio,将水印技术引入合成生物学,可在生物代码中嵌入不可感知签名,并在合成出的实体蛋白质上验证,同时保持其生物功能。
Google 介绍 Gemini 3.8 Flash 在软件工程、智能体任务和复杂多步推理上较 3.7 Flash 有明显提升,性能常接近成本更高的前沿模型,原因是模型在复杂任务上会执行更多推理步骤并迭代调用工具。
推荐理由:官方给出 3.8 Flash 在软件工程与多步推理上的提升方向,并附四个开发者实例,可作选型参考。
布鲁克林 Edy's Grocer 店主 Edy Massih 用 Gemini 把家族黎巴嫩菜谱直接换算成大份量宴席批次,避免手工计算香料和酥皮比例出错。Gemini 还能把活动菜单转成分区购物清单、汇总共用食材并提前排出备餐时间表,同时为无麸质、无坚果等饮食限制给出保留原有风味的替换方案。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让 AI 能听、能看、能说并具备动态视觉形象。该功能支持异步工具调用、97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 上线,自定义头像需企业白名单申请。
Google 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让企业智能体在对话中能听、能看、能说,并具备精准唇形同步与自然表情。
Google 为 Private AI Compute 平台引入持久化服务端记忆层,让云端 AI 能跨设备保留上下文,同时维持端侧级别的隐私标准。该架构将数据封存在加密存储中,解密密钥仅保存在用户个人设备上,模型访问时通过端到端加密通道接入云端安全隔离区(secure enclave),在隔离内存中临时解密、写入新上下文后立即重新加密。
Gemini 开始推送新一批 Connected Apps,用户可在 Gemini 内直接管理项目、设计创意素材和规划健身,无需切换标签页。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者主打角色设计与逐行表演指导,后者面向高吞吐、低成本场景。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者主打规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。
Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组全部 90 亿个单核苷酸变异效应预测的平台,数据集达 1 PB,比 AlphaFold Database 大 30 多倍。