Google DeepMind 的 WeatherNext 气旋预报模型实现突破并开源
Google DeepMind 在 Nature 发表论文,其 WeatherNext AI 模型在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天以上的预警提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报的领先精度和开源入口,读者可了解单一模型如何替代全球与局地两套建模。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
Google DeepMind 在 Nature 发表论文,其 WeatherNext AI 模型在气旋路径、强度和风场结构预报上达到 SOTA,平均多出一天以上的预警提前量,三天预报精度相当于此前模型的两天水平。
推荐理由:原文给出气旋路径与强度预报的领先精度和开源入口,读者可了解单一模型如何替代全球与局地两套建模。
微软研究院提出 Echoverse,为 computer-use 智能体构建 12 个训练世界,包括 10 个完整领域世界和 2 个能力世界,每个世界由环境、任务和基于数据库的验证器三部分组成。
推荐理由:微软研究院公开了 Echoverse 的构建流程与训练数据,读者可据此了解高保真合成环境如何影响 computer-use 智能体的训练效果。
Google Research 发布 SensorFM,一个从无标注可穿戴数据中学习的大型传感器基础模型,预训练语料来自500万同意参与者、超过一万亿分钟的多模态传感器信号,覆盖100多个国家和20多种 Fitbit 与 Pixel Watch 设备。
推荐理由:原文给出万亿分钟级可穿戴数据预训练与35项健康任务评测,读者可了解通用生理表征的规模化路径。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、超参数调优和特征工程,单次前向传播即可对未见过的表格生成预测。
推荐理由:原文给出零样本表格预测的架构设计与合成数据训练思路,读者可据此判断它能否替代传统树模型流程。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可了解其预测窗口提升与本地化接入方式。
Mistral 宣布将 Emmi AI 并入公司,并在其企业解决方案中构建物理 AI 这一基础能力,用于 AI 原生的工业工程。该能力从几何与边界条件直接预测物理场,单次前向推理在单 GPU 上以秒级完成,定位为设计迭代的吞吐量提升,传统求解器仍用于验证和边缘场景。
推荐理由:Mistral 把物理仿真模型纳入企业平台,读者可了解其与传统求解器的分工和适用场景。
Google 公布 Empirical Research Assistance(ERA),一款用 Gemini 编写和优化科学代码的研究工具,相关论文今日发表于 Nature。
推荐理由:原文给出 ERA 在 Nature 发表的跨学科基准表现与八篇应用手稿,读者可据此判断 AI 辅助科学编码的落地范围。
Google DeepMind 发布论文提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算岛屿并异步传输数据,从而隔离局部硬件故障。
推荐理由:原文给出分布式训练新架构的带宽、容错与跨代硬件实测数据,可据此判断大规模预训练基础设施的演进方向。
Google Research 与多家 NHS 机构合作在 Nature Cancer 发表两项研究,评估 AI 乳腺癌检测系统在筛查流程中的表现。
推荐理由:两项 Nature Cancer 研究给出 AI 作为第二读片人的前瞻部署数据,可了解其在真实筛查流程中的表现与局限。
Mistral AI 推出 Forge,一套让企业基于自有专有知识构建前沿级 AI 模型的系统,支持预训练、后训练和强化学习等阶段。Forge 支持 dense 与 MoE 两种架构,并可按需支持多模态输入,模型可在企业自有基础设施内训练与治理。
推荐理由:Mistral 官方给出企业自建前沿模型的分阶段训练路径与已合作机构名单,可据此判断企业定制模型的落地方式。
Mistral AI 宣布以创始成员身份加入 NVIDIA Nemotron Coalition,双方计划共同开发前沿开源 AI 模型,结合 Mistral AI 的模型架构与全栈平台和 NVIDIA 的算力、模型开发工具及合成数据生成管线。
推荐理由:Mistral AI 以创始成员身份加入 NVIDIA Nemotron Coalition,读者可了解开放前沿模型的联合开发路径与分工。
Google 宣布在 Flood Hub 上线城市山洪预报,利用新的 AI 方法可在城市区域提前最多 24 小时预测山洪风险。由于山洪缺乏河流水位站等地面真值数据,Google 用 Groundsource 方法借助 Gemini 分析公开新闻报道,提取出历史山洪事件数据集,用于训练和评估新模型。
推荐理由:Google 把城市山洪预警接入 Flood Hub,读者可了解其用 Gemini 从新闻中提取历史灾情训练模型的做法。
Google 推出 Groundsource,一种用 Gemini 从非结构化新闻中提取灾害数据的方法,并发布首个开放数据集,包含 2000 年至今 150 多个国家的 260 万条城市山洪记录。人工复核显示 60% 的提取事件在地点和时间上准确,82% 足以用于实际分析。基于该数据,Google 已在 Flood Hub 推出提前 24 小时的近全球城市山洪预报。
推荐理由:原文给出了用 Gemini 从新闻抽取灾害数据的方法与验证结果,读者可据此判断 LLM 构建历史基准的可行边界。
Mistral AI 宣布完成 1.7B€ 的 C 轮融资,投后估值 11.7B€,由半导体设备厂商 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 等现有投资方参投。
推荐理由:Mistral AI 完成 1.7B€ C 轮融资,由 ASML 领投,读者可据此了解欧洲大模型公司的资本与产业合作走向。
Qwen 团队提出 Group Sequence Policy Optimization(GSPO)算法,基于序列似然定义重要性比率并做序列级裁剪、奖励和优化。
推荐理由:原文给出 GSPO 与 GRPO 在训练稳定性、效率和 MoE 场景下的对比,读者可据此理解 RL 扩展的算法取舍。
Qwen2.5-Max 是预训练超过 20 万亿 token 的大规模 MoE 模型,并经过 SFT 与 RLHF 后训练,现已在 Qwen Chat 上线并通过阿里云提供 API,模型名为 qwen-max-2025-01-25。
推荐理由:原文给出 Qwen2.5-Max 的预训练规模与多项基准对比,读者可据此判断大规模 MoE 路线的能力位置。
阿里发布 Qwen2.5 系列大语言模型,开源 0.5B、1.5B、3B、7B、14B、32B、72B 共七款,并新增 Qwen-Plus 与 Qwen-Turbo 通过阿里云百炼 API 提供。
推荐理由:原文给出七款开源模型的参数、许可与基准对比,读者可据此判断不同尺寸模型的选型与部署成本。
Qwen 发布新一代开源代码模型 Qwen2.5-Coder,提供 1.5B、7B 两个版本,32B 版本即将推出,同时将 CodeQwen 正式更名为 Qwen-Coder。
推荐理由:原文给出 1.5B 与 7B 开源版本、5.5 万亿 token 训练规模和多项基准对比,可据此判断开源代码模型当前水平。
Qwen2 系列开源发布,包含 Qwen2-0.5B、1.5B、7B、57B-A14B 和 72B 五个尺寸的预训练与指令微调模型,已在 Hugging Face 和 ModelScope 上线。
推荐理由:原文给出 Qwen2 五个尺寸的完整规格、上下文长度与基准对比,可据此判断开源模型选型。
Qwen1.5 系列发布首个 100B+ 模型 Qwen1.5-110B,采用与同系列一致的 Transformer 解码器架构,包含分组查询注意力(GQA),支持 32K token 上下文和多语言。
推荐理由:官方给出 Qwen1.5-110B 与 Llama-3-70B、Mixtral-8x22B 的基准对比,可据此判断百亿级开源模型的规模扩展收益。