跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 41–60 条 · 共 90 条
8月14日周五
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。

    推荐理由:原文给出 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,读者可据此判断编码与智能体任务的成本变化。

8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次把手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。

    推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,读者可据此判断手语翻译进入消费级产品的可行边界。

  2. Google Research61

    Google Research 提出知识画像框架:召回而非编码是前沿 LLM 事实性的瓶颈

    Google Research 提出知识画像(knowledge profiling)框架,把事实状态分为编码失败、召回失败、直接召回、思考后召回和无编码推理五类,并发布含 2,150 条 Wikipedia 事实、每条配 10 个问题的 WikiProfile 基准。

    推荐理由:Google Research 用知识画像区分编码与召回失败,指出前沿模型的事实错误更多来自知识调用而非知识缺失。

8月6日周四
  1. Google DeepMind76

    Google DeepMind 的 WeatherNext 气旋预报模型实现突破并开源

    Google DeepMind 在 Nature 发表论文,其 WeatherNext AI 模型在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天以上的预警提前量,三天预报精度相当于此前模型的两天水平。

    推荐理由:原文给出气旋路径与强度预报的领先精度和开源入口,读者可了解单一模型如何替代全球与局地两套建模。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的具身推理模型,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:原文给出视频理解、任务编排与多机器人协作的能力变化和开放入口,读者可据此判断机器人在真实环境中的执行方式。

  2. Google DeepMind62

    Google DeepMind 在 Flow Music 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面改进:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知提升,人声更具表现力和情感且发音改善,同时可更便捷地控制输出 tempo 和时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和节奏控制上的具体改进方向,可据此判断音乐生成的可控性提升。

7月28日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,包含三款模型:视觉-语言-动作模型 Gemini Robotics 2 可控制从脚到指尖的完整人形机器人和双臂机器人,具身推理模型 Gemini Robotics ER 2 负责任务规划与多机协作,端侧模型 Gemini Robotics On-Device 2 可在本地运行。

    推荐理由:原文给出三款模型的职责分工与端侧适配数据,读者可据此判断机器人全身控制与多机协作的落地路径。

7月23日周四
7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:原文给出轻量网络安全模型在多个基准和 Google 内部代码库的实测结果,读者可据此判断专用小模型在漏洞挖掘上的性价比。

7月9日周四
  1. Google Research62

    Google Research 发布 SensorFM:面向可穿戴健康数据的通用基础模型

    Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自500万同意参与者、超过一万亿分钟的多模态传感器信号,覆盖100多个国家和20多种 Fitbit 与 Pixel Watch 设备。

    推荐理由:原文给出万亿分钟级可穿戴数据预训练与35项健康任务评测,读者可了解通用生理表征的规模化路径。

7月8日周三
  1. Google Research62

    Google Research 在 10 座美国城市实验协同路由缓解拥堵

    Google Research 在 Nature Cities 发表研究,在 10 座美国城市用修改后的 Google Maps 算法,将遇到预设拥堵路段的行程引导至耗时相近的替代路线,进行为期六个月的全市 switchback 实验。

    推荐理由:Google Research 在 10 座美国城市做了大规模真实路网实验,读者可了解协同路由对全城车速与排放的实际影响。

7月1日周三
  1. Hugging Face Blog60

    Hugging Face 与 Cerebras 用 Gemma 4 搭建实时语音 AI 管线

    Hugging Face 与 Cerebras 联合演示了一套实时语音到语音管线,用 Nvidia Parakeet 做语音识别、Gemma 4 31B 在 Cerebras 上做推理、阿里 Qwen3TTS 做语音合成,各层模块化且可替换。

    推荐理由:原文给出了一条可替换的实时语音到语音开源管线,读者可据此了解各层组件如何组合并复用到自己的产品中。

6月30日周二
  1. Google Research71

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出零样本表格预测的架构设计与合成数据训练思路,读者可据此判断它能否替代传统树模型流程。

6月27日周六
6月25日周四
6月16日周二
6月11日周四