TII 推出 Falcon-ASR:1.6B 参数阿拉伯语语音识别模型,主打阿联酋方言
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上,其平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。
阿布扎比技术创新研究院(TII)发布 Falcon-ASR,一个 1.6B 参数的语音识别模型,重点支持阿联酋方言,同时覆盖英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上,其平均 WER 为 20.92%,优于所用榜单快照中最佳公开结果 23.17%;内部阿联酋方言评测中 WER 22.73%、CER 10.19%,比 Qwen3-Omni 低 4.07 个百分点。
Google 发布 9 月 AI 更新汇总,最新前沿模型 Gemini 4 Argon 支持 100 万 token 输出上限,主打高级推理与网络安全防御,目前通过 Fairwind Program 向受信任的网络安全防御者逐步开放。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,把评测耗时从数周投票缩短到数小时。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让 AI 能听、能看、能说并具备动态视觉形象。该功能支持异步工具调用、97 种语言的原生语音到语音同步,输出均带 SynthID 水印,现已在 Gemini Enterprise 上线,自定义头像需企业白名单申请。
Google 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让企业智能体在对话中能听、能看、能说,并具备精准唇形同步与自然表情。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者主打角色设计与逐行表演指导,后者面向高吞吐、低成本场景。
Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者主打规模化与成本效率,后者面向高复杂度任务并支持边推理边说话。