Google DeepMind 发布 Gemini 3.7 Flash
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文给出 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,读者可据此判断编码与智能体任务的成本变化。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:原文给出 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,读者可据此判断编码与智能体任务的成本变化。
Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次把手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。
推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,读者可据此判断手语翻译进入消费级产品的可行边界。
Google Research 提出知识画像(knowledge profiling)框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并发布含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。
推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识调用而非知识缺失。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频配置,可感知非语言临床线索、引导虚拟体格检查并实时进行诊断推理。
推荐理由:原文给出AMIE视频版在随机OSCE研究中的表现与三智能体架构设计,读者可了解实时视听临床问诊的技术路径与验证方式。
Google DeepMind 在 Nature 发表论文,其 WeatherNext AI 模型在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天以上的预警提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报的领先精度和开源入口,读者可了解单一模型如何替代全球与局地两套建模。
Google DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的具身推理模型,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。
推荐理由:原文给出视频理解、任务编排与多机器人协作的能力变化和开放入口,读者可据此判断机器人在真实环境中的执行方式。
Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面改进:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知提升,人声更具表现力和情感且发音改善,同时可更便捷地控制输出 tempo 和时长。
推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和节奏控制上的具体改进方向,可据此判断音乐生成的可控性提升。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:视觉-语言-动作模型 Gemini Robotics 2 可控制从脚到指尖的完整人形机器人和双臂机器人,具身推理模型 Gemini Robotics ER 2 负责任务规划与多机协作,端侧模型 Gemini Robotics On-Device 2 可在本地运行。
推荐理由:原文给出三款模型的职责分工与端侧适配数据,读者可据此判断机器人全身控制与多机协作的落地路径。
Google Research 发布 SymptomAI 研究,让 13917 名参与者随机与五个基于 Gemini Flash 2.0 的对话式智能体进行症状访谈,并生成鉴别诊断(DDx)。
推荐理由:Google 用 13917 人随机研究比较 SymptomAI 与真实医生的鉴别诊断,并给出可穿戴生物信号佐证。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向网络安全的 3.5 Flash Cyber。
推荐理由:原文给出三款新模型的定价、token 效率与基准对比,读者可据此判断智能体工作流的成本变化。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。
推荐理由:原文给出轻量网络安全模型在多个基准和 Google 内部代码库的实测结果,读者可据此判断专用小模型在漏洞挖掘上的性价比。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自500万同意参与者、超过一万亿分钟的多模态传感器信号,覆盖100多个国家和20多种 Fitbit 与 Pixel Watch 设备。
推荐理由:原文给出万亿分钟级可穿戴数据预训练与35项健康任务评测,读者可了解通用生理表征的规模化路径。
Google Research 在 Nature Cities 发表研究,在 10 座美国城市用修改后的 Google Maps 算法,将遇到预设拥堵路段的行程引导至耗时相近的替代路线,进行为期六个月的全市 switchback 实验。
推荐理由:Google Research 在 10 座美国城市做了大规模真实路网实验,读者可了解协同路由对全城车速与排放的实际影响。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音管线,用 Nvidia Parakeet 做语音识别、Gemma 4 31B 在 Cerebras 上做推理、阿里 Qwen3TTS 做语音合成,各层模块化且可替换。
推荐理由:原文给出了一条可替换的实时语音到语音开源管线,读者可据此了解各层组件如何组合并复用到自己的产品中。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型。
推荐理由:原文给出两款新模型的延迟、价格与可用入口,读者可据此判断图像与视频生成链路的成本取舍。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出零样本表格预测的架构设计与合成数据训练思路,读者可据此判断它能否替代传统树模型流程。
Google Research 发布一种新架构,将多 Token 预测(MTP)头接到已冻结的 Gemini Nano v3 模型上,已在 Pixel 9 和 10 系列上线。
推荐理由:原文给出冻结主干加 MTP 头的端侧加速方案,读者可了解其零拷贝 KV 缓存设计与 Pixel 上的实测提速。
Google DeepMind 将 computer use 作为内置工具集成进 Gemini 3.5 Flash,此前该能力仅以独立的 Gemini 2.5 computer use 模型形式提供。
推荐理由:原文说明 computer use 从独立模型并入 Gemini 3.5 Flash 主模型,并给出企业级安全护栏,读者可据此判断智能体跨平台自动化的落地路径。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的高级 AI 的框架,采用纵深防御思路,在模型对齐之外增加系统级安全层。
推荐理由:Google DeepMind 公开内部 AI Control Roadmap,说明如何在模型对齐不完美时用系统级监控兜底。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍。
推荐理由:原文给出 26B MoE 文本扩散模型的开放权重与硬件门槛,读者可据此判断本地低并发推理的取舍。