Mistral 发布 Mistral 3 系列模型,含 675B 参数 MoE 版 Mistral Large 3
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出 MoE 参数与部署方案,读者可据此判断开源前沿模型的可用边界。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
Mistral 发布 Mistral 3 系列,包括 14B、8B、3B 三个小尺寸稠密模型和迄今最强的 Mistral Large 3,后者为稀疏 MoE 架构,41B 激活参数、675B 总参数,全部以 Apache 2.0 许可开源。
推荐理由:Mistral 3 系列以 Apache 2.0 开源并给出 MoE 参数与部署方案,读者可据此判断开源前沿模型的可用边界。
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和面向企业的 Magistral Medium。
推荐理由:Mistral AI 首款推理模型同时给出开源版与商用版,并公开训练论文,读者可据此判断其推理能力与开放程度。
Qwen 发布 Qwen3 系列,旗舰 MoE 模型 Qwen3-235B-A22B 在编码、数学和通用能力评测中与 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等模型表现相当。
推荐理由:原文给出 Qwen3 全系开源规格、混合思考模式与预训练数据规模,便于读者判断其与同级模型的定位差异。
Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。
推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。
Qwen 团队以 Apache 2.0 许可开源 Qwen2.5-VL-32B-Instruct,在 Qwen2.5-VL 系列基础上用强化学习继续优化。
推荐理由:官方给出 32B 视觉语言模型的基准对比与演示案例,可据此判断同规模开源多模态模型的当前水平。
Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。
推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。
Qwen 团队发布 QwQ-Max-Preview,这是基于 Qwen2.5-Max 构建的推理模型预览版,在数学、编码和通用领域任务上表现突出,并擅长 Agent 相关工作流。官方表示 QwQ-Max 与 Qwen2.5-Max 将以 Apache 2.0 协议开源,后续还会推出 Qwen Chat App,并开源 QwQ-32B 等更小的推理模型供本地部署。
推荐理由:原文给出 QwQ-Max-Preview 的能力定位与后续开源、App 和小模型计划,读者可据此判断 Qwen 推理模型的路线。
Qwen 开源 Qwen2.5-7B-Instruct-1M 和 Qwen2.5-14B-Instruct-1M 两个模型,首次将开源 Qwen 模型的上下文长度提升到 1M token。
推荐理由:原文给出两个开源长上下文模型及配套 vLLM 推理框架,读者可据此评估本地部署 1M token 场景的硬件门槛与提速幅度。
Qwen 发布 QwQ-32B-Preview,这是一款专注深度推理的模型,官方博客用一道加括号使等式成立的数学题展示了它的逐步思考过程。模型在尝试多种括号组合后得出 1 + 2 * (3 + 4 * 5 + 6) * 7 + 8 * 9 = 479 的答案。
推荐理由:原文展示了 QwQ-32B-Preview 在复杂数学题上的完整推理过程,读者可据此判断其链式推理能力与边界。
Qwen2.5-Turbo 发布,上下文长度从 128k 扩展到 1M,约合 100 万英文单词或 150 万汉字。该模型在 1M 长度的 Passkey Retrieval 任务上准确率 100%,RULER 得分 93.1,超过 GPT-4 的 91.6 和 GLM4-9B-1M 的 89.9。
推荐理由:原文给出上下文从 128k 扩展到 1M 的实测数据与推理加速幅度,可据此判断长文本场景的可用边界。
Qwen 团队发布 Qwen2.5 系列开源模型,包含语言模型 Qwen2.5(0.5B 到 72B)、代码模型 Qwen2.5-Coder 和数学模型 Qwen2.5-Math,除 3B 和 72B 外均采用 Apache 2.0 许可。
推荐理由:原文给出 Qwen2.5 全系列尺寸、开源许可与基准对比,读者可据此判断开源模型与闭源模型的差距。
Qwen2.5-Math 系列开源,包含 1.5B/7B/72B 基础模型、对应 Instruct 模型以及数学奖励模型 Qwen2.5-Math-RM-72B。
推荐理由:原文给出 Qwen2.5-Math 系列的开源规模、双语与 TIR 支持及多项基准对比,便于判断开源数学模型当前水平。
阿里发布基于 Qwen2 的数学专用模型系列 Qwen2-Math 及 Qwen2-Math-Instruct-1.5B/7B/72B,官方称最大模型 Qwen2-Math-72B-Instruct 在数学基准上超过 GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 和 Llama-3.1-405B。
推荐理由:原文给出数学专用模型的评测对比与去污染流程,读者可据此判断开源模型在数学推理上的位置。