Hugging Face 的 transformers vLLM 后端达到原生推理速度
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体条件与启用方式,读者可据此判断自家模型能否免移植获得同等推理速度。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 宣布 vLLM 的 transformers 建模后端在多个 LLM 架构上已达到甚至超过 vLLM 手写原生实现的吞吐。
推荐理由:原文给出 transformers 后端在 vLLM 中追平原生实现的具体条件与启用方式,读者可据此判断自家模型能否免移植获得同等推理速度。
Microsoft 在 Build 2026 上发布 Foundry Managed Compute 与 Hugging Face 模型集合,将开源权重模型纳入 Foundry 模型目录,每周刷新,可一键部署到托管 GPU 上。
推荐理由:原文给出模型目录、运行时与一键部署路径,读者可据此判断开源模型在企业环境中的落地方式。
Hugging Face 与 SkyPilot 联合推出 store: hf,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意模型、数据集、Space 仓库挂载进 SkyPilot 任务,并在 20 多个云、Kubernetes、Slurm 和本地运行。
推荐理由:原文给出跨云挂载 Hub 数据的具体配置和免出网费机制,读者可据此判断多云的存储成本与调度方式。
Hugging Face 发布 LeRobot v0.6.0,围绕机器人学习闭环引入世界模型策略、奖励模型 API 和统一评测 CLI。新版本带来 VLA-JEPA、LingBot-VA、FastWAM 三个会想象未来的策略,以及 GR00T N1.7、MolmoAct2、EO-1、Multitask DiT、EVO1 等新 VLA。
推荐理由:原文给出世界模型策略、奖励模型 API 与统一评测 CLI 的具体变化,读者可据此判断机器人学习闭环的落地方式。
Mistral 发布 Leanstral 1.5,一个 Apache-2.0 许可的模型,总参数 119B、激活参数 6B,在形式化验证上大幅升级。它在 miniF2F 上达到 100%,解决 PutnamBench 672 题中的 587 题,并在 FATE-H 取得 87%、FATE-X 取得 34% 的当前最优结果。
推荐理由:原文给出 Leanstral 1.5 在形式化验证基准上的成绩与开源入口,读者可据此判断其在 Lean 4 证明工程中的可用性。
Hugging Face 与 Cerebras 联合演示了一套实时语音到语音管线,用 Nvidia Parakeet 做语音识别、Gemma 4 31B 在 Cerebras 上做推理、阿里 Qwen3TTS 做语音合成,各层模块化且可替换。
推荐理由:原文给出了一条可替换的实时语音到语音开源管线,读者可据此了解各层组件如何组合并复用到自己的产品中。
Google DeepMind 发布实验性开放模型 DiffusionGemma,采用文本扩散方式并行生成整块文本,在专用 GPU 上推理最高提速 4 倍。
推荐理由:原文给出 26B MoE 文本扩散模型的开放权重与硬件门槛,读者可据此判断本地低并发推理的取舍。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本电脑的智能体多模态模型,介于 E4B 与 26B MoE 之间,可在 16GB 显存或统一内存上本地运行。
推荐理由:Gemma 4 12B 用无编码器架构把视觉和音频直接接入 LLM,读者可据此了解端侧多模态模型的设计取舍。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象与水文机构能用与 Google Flood Hub 相同的架构和相近训练数据训练 AI 洪水预报模型。
推荐理由:Google 把驱动 Flood Hub 的水文模型架构与训练流程开源,读者可了解其预测窗口提升与本地化接入方式。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架,开源并支持云端、本地和边缘部署。框架把数据摄取、检索和评估整合到统一接口中,内置 BM25 稀疏检索、稠密向量检索和混合配置,并提供 recall、precision、MRR、NDCG 等评估指标。
推荐理由:原文给出开源搜索框架的三大模块与可替换接口,读者可据此判断检索管线能否少写胶水代码。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,支持 256k 上下文窗口,可在少至四块 GPU 上自托管。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的落地门槛。
Google DeepMind 推出 Gemini for Science,包含 Google Labs 上三个实验性工具:基于 Co-Scientist 的 Hypothesis Generation。
推荐理由:Google 把 Co-Scientist、AlphaEvolve 等能力打包成科研工具集,读者可了解其覆盖的科研环节与开放方式。
Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,其中 31B 在 Arena AI 文本榜位列开源模型第 3、26B 位列第 6。
推荐理由:原文给出四个尺寸的定位与硬件门槛,读者可据此判断本地部署与微调该选哪一档。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可生成带情感表达的语音。
推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等细节,可据此判断企业语音智能体的成本与部署门槛。
Mistral 发布 Mistral Small 4,首次把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力合并进单一模型,采用 Apache 2.0 许可。
推荐理由:Mistral 把推理、多模态与编码能力合并进单一开源模型,并给出延迟与吞吐对比,可据此判断统一模型的取舍。
Mistral AI 宣布以创始成员身份加入 NVIDIA Nemotron Coalition,双方计划共同开发前沿开源 AI 模型,结合 Mistral AI 的模型架构与全栈平台和 NVIDIA 的算力、模型开发工具及合成数据生成管线。
推荐理由:Mistral AI 以创始成员身份加入 NVIDIA Nemotron Coalition,读者可了解开放前沿模型的联合开发路径与分工。
Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列和开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。
Mistral AI 发布 Voxtral Transcribe 2 系列两款语音转写模型:批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime。
推荐理由:官方给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时语音应用的落地成本。
Mistral 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立评测对比,便于判断开源编码模型与闭源模型的差距。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出 MoE 参数与部署方案,读者可据此判断开源前沿模型的可用边界。