跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

115条精选相关主题产品更新论文研究开源生态

最新精选

第 41–60 条 · 共 115 条
8月27日周四
  1. Google DeepMind66

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Live API 的 gemini-3.5-transcribe-live 做亚秒级双向流式转写,或通过 Interactions API 的 gemini-3.5-transcribe 处理录音并支持说话人归属与词级时间戳。

    推荐理由:原文给出流式与非流式两种 API 形态及 WER 数据,读者可据此判断语音转写能否接入现有语音智能体流程。

8月25日周二
8月14日周五
  1. Google DeepMind77

    Google DeepMind 发布 Gemini 3.7 Flash

    Google DeepMind 发布 Gemini 3.7 Flash,定位为面向编码和智能体的最强主力模型,距 Gemini 3.6 Flash 发布仅三周。

    推荐理由:原文给出 3.7 Flash 相对 3.6 Flash 的多项基准提升与半价定价,读者可据此判断编码与智能体任务的成本变化。

8月12日周三
  1. Google DeepMind71

    Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次把手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写。

    推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,读者可据此判断手语翻译进入消费级产品的可行边界。

8月10日周一
8月4日周二
  1. Mistral AI66

    Mistral AI 发布 Shieldstral 多模态安全分类模型

    Mistral AI 发布 Shieldstral,一个 3B 开源权重多模态安全分类模型,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重新训练即可统一文本与图像安全评估。

    推荐理由:3B 开源权重模型以自然语言策略替代固定危害分类,读者可据此判断内容审核的部署方式变化。

7月30日周四
  1. Google DeepMind71

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布 Gemini Robotics ER 2,这是其面向机器人的具身推理模型,可理解视频、编排多步任务并把动作执行交给底层 VLA 模型,还能原生调用 Google Search 等工具。

    推荐理由:原文给出视频理解、任务编排与多机器人协作的能力变化和开放入口,读者可据此判断机器人在真实环境中的执行方式。

  2. Google DeepMind62

    Google DeepMind 在 Flow Music 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面改进:旋律结构更丰富自然,歌词质量与提示词遵循度、结构感知提升,人声更具表现力和情感且发音改善,同时可更便捷地控制输出 tempo 和时长。

    推荐理由:官方给出 Lyria 3.5 在旋律、歌词、人声和节奏控制上的具体改进方向,可据此判断音乐生成的可控性提升。

7月28日周二
  1. Google DeepMind78

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,包含三款模型:视觉-语言-动作模型 Gemini Robotics 2 可控制从脚到指尖的完整人形机器人和双臂机器人,具身推理模型 Gemini Robotics ER 2 负责任务规划与多机协作,端侧模型 Gemini Robotics On-Device 2 可在本地运行。

    推荐理由:原文给出三款模型的职责分工与端侧适配数据,读者可据此判断机器人全身控制与多机协作的落地路径。

7月21日周二
7月17日周五
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一个基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的表现。

    推荐理由:原文给出轻量网络安全模型在多个基准和 Google 内部代码库的实测结果,读者可据此判断专用小模型在漏洞挖掘上的性价比。

7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布 Inkling 系列开源多模态模型

    Thinking Machines 在 Hugging Face 发布 Inkling 系列开源多模态模型,包含约 1T 参数的 Inkling 和 276B 总参数、12B 激活参数的 Inkling-Small,均可原生接收图像、文本和音频输入。

    推荐理由:原文给出 Inkling 的架构细节、部署配置与基准数据,读者可据此判断这一开源多模态模型的定位与落地成本。

7月8日周三
  1. Mistral AI66

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布首个具身导航模型 Robostral Navigate,这是一个 8B 模型,仅用单个普通 RGB 相机、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方案高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

    推荐理由:原文给出单目 RGB 相机在 R2R-CE 上的成绩与训练方法,读者可据此判断具身导航的落地门槛。

7月2日周四
  1. Mistral AI66

    Mistral 发布 Leanstral 1.5 形式化验证模型

    Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,总参数 119B、激活参数 6B,在形式化验证上大幅升级。它在 miniF2F 上达到 100%,解决 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34% 的当前最优结果。

    推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的成绩与开源入口,读者可据此判断其在 Lean 4 证明工程中的可用性。

7月1日周三
6月30日周二
  1. Google Research71

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。

    推荐理由:原文给出零样本表格预测的架构设计与合成数据训练思路,读者可据此判断它能否替代传统树模型流程。

6月23日周二
  1. Mistral AI65

    Mistral 发布 OCR 4,支持边界框与块分类

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块类型分类和逐页逐词置信度分数,支持 170 种语言,可单容器自托管部署。该模型在 OlmOCRBench 上取得 85.20 分,OmniDocBench 为 93.07 分,官方称独立标注者在多数文档上更偏好其输出。

    推荐理由:原文给出 OCR 4 的边界框、块分类与置信度输出,读者可据此判断它如何接入 RAG 与智能体流程。

6月11日周四
6月9日周二