Mistral 发布 Mistral Medium 3.5 与 Vibe 云端远程智能体
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,支持 256k 上下文窗口,可在少至四块 GPU 上自托管。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的落地门槛。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密模型,以修改版 MIT 许可开放权重,成为 Mistral Vibe 和 Le Chat 的默认模型,支持 256k 上下文窗口,可在少至四块 GPU 上自托管。
推荐理由:Mistral 把编码智能体搬到云端并同步开源 128B 模型,读者可据此判断自托管与异步编码的落地门槛。
Google DeepMind 发布 Omni 系列首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,读者可据此判断视频生成工作流的变化。
Google DeepMind 发布 Gemini 3.5 系列首个模型 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1 取得 76.2%、GDPval-AA 1656 Elo、MCP Atlas 83.6%,CharXiv Reasoning 为 84.2%,输出速度是其他前沿模型的 4 倍。
推荐理由:原文给出 3.5 Flash 在编码与智能体基准上的具体成绩和开放渠道,读者可据此判断速度与质量的取舍。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。
推荐理由:官方给出音频标签的细粒度控制方式和多语言覆盖范围,读者可据此判断语音生成在应用中的可控程度。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人推理的模型升级版,增强了空间推理与多视角理解,并新增仪表读数能力。
推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,读者可据此判断机器人高层推理的进展。
Google DeepMind 发布 Gemma 4,称其为迄今最智能的开源模型,面向高级推理与智能体工作流,采用 Apache 2.0 许可。该系列包含 E2B、E4B、26B MoE 和 31B Dense 四个尺寸,其中 31B 在 Arena AI 文本榜位列开源模型第 3、26B 位列第 6。
推荐理由:原文给出四个尺寸的定位与硬件门槛,读者可据此判断本地部署与微调该选哪一档。
Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可生成带情感表达的语音。
推荐理由:官方给出 4B 参数、9 种语言与 70ms 延迟等细节,可据此判断企业语音智能体的成本与部署门槛。
Mistral 发布 Mistral Small 4,首次把 Magistral 的推理、Pixtral 的多模态和 Devstral 的智能体编码能力合并进单一模型,采用 Apache 2.0 许可。
推荐理由:Mistral 把推理、多模态与编码能力合并进单一开源模型,并给出延迟与吞吐对比,可据此判断统一模型的取舍。
Mistral 发布 Leanstral,这是首个面向 Lean 4 的开源代码智能体,采用 6B 激活参数的稀疏架构,权重以 Apache 2.0 许可开放,并接入 Mistral Vibe 与免费 API 端点 labs-leanstral-2603。
推荐理由:Mistral 开源面向 Lean 4 的代码智能体,给出与 Claude 系列和开源模型的成本与得分对比,可据此判断形式化验证路线的性价比。
Mistral AI 发布 Voxtral Transcribe 2 系列两款语音转写模型:批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime。
推荐理由:官方给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时语音应用的落地成本。
Mistral 发布文档识别模型 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上相对 Mistral OCR 2 的整体胜率为 74%,官方称其准确率超过企业级文档处理方案和 AI 原生 OCR 方案。
推荐理由:官方给出 OCR 3 相对上一代在表单、手写和复杂表格上的胜率与每千页定价,便于评估替换成本。
Mistral 发布下一代编码模型系列 Devstral 2,含 123B 的 Devstral 2 和 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。
推荐理由:官方给出两款开源编码模型的参数、许可与 SWE-bench 成绩,并附独立评测对比,便于判断开源编码模型与闭源模型的差距。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出 MoE 参数与部署方案,读者可据此判断开源前沿模型的可用边界。
Qwen 发布 Qwen 系列首个安全护栏模型 Qwen3Guard,基于 Qwen3 基础模型微调,可对提示词和回复做安全检测并给出风险等级与分类。它提供 Qwen3Guard-Gen 和 Qwen3Guard-Stream 两个变体,后者通过 Transformer 末层两个轻量分类头实现逐 token 的实时流式检测,两者均有 0.6B、4B、8B 三种规模。
推荐理由:原文给出两种安全护栏变体的能力差异与开源入口,读者可据此判断流式审核在部署中的取舍。
Qwen 发布 Qwen-Image-Edit,这是基于 20B Qwen-Image 的图像编辑版本,将文本渲染能力扩展到图像编辑任务。该模型同时把输入图像送入 Qwen2.5-VL 做视觉语义控制、送入 VAE Encoder 做视觉外观控制,支持语义编辑与外观编辑,并支持中英双语文字的直接增删改且保留原字体、大小和风格。
推荐理由:原文给出语义与外观两类编辑能力及中英文字编辑细节,读者可据此判断图像编辑模型的能力边界。
Qwen 发布 Qwen-Image,一个 20B MMDiT 图像基础模型,主打复杂文字渲染与精准图像编辑,可在 Qwen Chat 的 Image Generation 入口试用。
推荐理由:原文给出 20B MMDiT 图像基础模型在文字渲染与图像编辑上的能力展示和多个基准结果,读者可据此判断中文文字生成的实际水平。
Qwen 通过 Qwen API 推出翻译模型 Qwen-MT(qwen-mt-turbo),基于 Qwen3 并利用数万亿多语言与翻译 token 训练,结合强化学习提升翻译准确度与流畅度。
推荐理由:原文给出 92 种语言支持、术语干预与低至每百万输出 token 0.5 美元的定价,便于评估翻译场景的落地成本。
Qwen 发布 Qwen3-Coder,首个最强变体 Qwen3-Coder-480B-A35B-Instruct 是 480B 参数 MoE 模型,激活参数 35B,原生支持 256K 上下文,借助 YaRN 可扩展至 1M token。
推荐理由:原文给出模型规格、上下文长度与开源 CLI 工具,读者可据此判断开源编码模型在智能体任务上的位置。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。
推荐理由:Mistral 开源两款语音理解模型,给出与 Whisper、GPT-4o mini、Gemini 2.5 Flash 的基准对比和 API 定价,便于评估替代方案。
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。