原文发布 4月29日 04:00
Qwen3 发布:235B-A22B 旗舰 MoE 与 6 款稠密模型开源
Qwen 发布 Qwen3 系列,旗舰 MoE 模型 Qwen3-235B-A22B 在编码、数学和通用能力评测中与 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等模型表现相当。
推荐理由:原文给出 Qwen3 全系开源规格、混合思考模式与预训练数据规模,便于读者判断其与同级模型的定位差异。
模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。
原文发布 4月29日 04:00
Qwen 发布 Qwen3 系列,旗舰 MoE 模型 Qwen3-235B-A22B 在编码、数学和通用能力评测中与 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等模型表现相当。
推荐理由:原文给出 Qwen3 全系开源规格、混合思考模式与预训练数据规模,便于读者判断其与同级模型的定位差异。
原文发布 4月10日 08:00
Kimi 发布开源 MoE 视觉语言模型 Kimi-VL,语言解码器仅激活 2.8B 参数,支持 128K 上下文和原生分辨率视觉编码器 MoonViT。基于长 CoT SFT 与 RL 的 Kimi-VL-Thinking 在 MMMU 得 61.7、MathVista 得 71.3。
推荐理由:原文给出 Kimi-VL 系列在激活参数仅 2.8B 下的多模态与长上下文成绩,可对照同量级 VLM 的能力边界。
原文发布 3月28日 00:00
Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。
推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。
原文发布 3月24日 00:00
Qwen 团队以 Apache 2.0 许可开源 Qwen2.5-VL-32B-Instruct,在 Qwen2.5-VL 系列基础上用强化学习继续优化。
推荐理由:官方给出 32B 视觉语言模型的基准对比与演示案例,可据此判断同规模开源多模态模型的当前水平。
原文发布 3月24日 00:00
DeepSeek 官方将 deepseek-chat 模型升级至 DeepSeek-V3-0324,推理能力显著提升,MMLU-Pro 从 75.9 升至 81.2,GPQA 从 59.1 升至 68.4,AIME 从 39.6 升至 59.4,LiveCodeBench 从 39.2 升至 49.2。
推荐理由:官方给出 DeepSeek-V3-0324 在推理、编码和中文写作上的基准变化,可据此判断升级幅度。
原文发布 3月21日 08:00
腾讯发布 hunyuan-t1-20250321,称其为腾讯首个推理模型,全面构建模型文理科能力,长文本信息捕捉能力强。该模型支持推理解答数学、逻辑推理、科学、代码等不同难度的科学问题。
推荐理由:腾讯首个推理模型的能力定位与长文本信息捕捉特点,可供读者对照当前推理模型格局。
原文发布 3月21日 08:00
腾讯正式发布首个深度推理模型 Hunyuan-T1,该模型基于3月初发布的业界首个超大规模 Hybrid-Transformer-Mamba MoE 大模型 TurboS 快思考基座,扩展了推理能力,并进一步对齐人类偏好。
推荐理由:腾讯首个深度推理模型的发布信息,可了解其基于 TurboS 快思考基座扩展推理能力的技术路线。
原文发布 3月6日 00:00
Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。
推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。
原文发布 2月25日 02:00
Qwen 团队发布 QwQ-Max-Preview,这是基于 Qwen2.5-Max 构建的推理模型预览版,在数学、编码和通用领域任务上表现突出,并擅长 Agent 相关工作流。官方表示 QwQ-Max 与 Qwen2.5-Max 将以 Apache 2.0 协议开源,后续还会推出 Qwen Chat App,并开源 QwQ-32B 等更小的推理模型供本地部署。
推荐理由:原文给出 QwQ-Max-Preview 的能力定位与后续开源、App 和小模型计划,读者可据此判断 Qwen 推理模型的路线。
原文发布 2月18日 08:00
月之暗面(Kimi)发布 MoBA(Mixture of Block Attention),将 MoE 思路引入注意力机制,把完整上下文划分为块,让每个 query token 学习只关注最相关的 KV 块,并采用无参数的 top-k 门控机制。
推荐理由:MoBA 把 MoE 思路引入注意力机制,并已用于 Kimi 长上下文请求,读者可了解长序列计算的一种新路径。
原文发布 1月27日 00:00
Qwen 开源 Qwen2.5-7B-Instruct-1M 和 Qwen2.5-14B-Instruct-1M 两个模型,首次将开源 Qwen 模型的上下文长度提升到 1M token。
推荐理由:原文给出两个开源长上下文模型及配套 vLLM 推理框架,读者可据此评估本地部署 1M token 场景的硬件门槛与提速幅度。
原文发布 1月20日 08:00
Kimi 团队发布 Kimi k1.5,并公开了该模型设计与训练的几个关键要点。相关论文以《Kimi k1.5: Scaling Reinforcement Learning with LLMs》为题发布在 arXiv(编号 2501.12599)。
推荐理由:Kimi 官方给出 k1.5 的设计与训练要点,读者可据此了解其强化学习路线的关键取舍。
原文发布 1月20日 00:00
DeepSeek 官方更新文档显示,deepseek-reasoner 是新模型 DeepSeek-R1,可通过指定 model='deepseek-reasoner' 调用。文档同时给出 DeepSeek-R1 发布说明和 Thinking Mode 指南的参考链接。
推荐理由:官方文档确认 deepseek-reasoner 对应 DeepSeek-R1,读者可据此了解新模型的调用方式与入口。
原文发布 11月28日 00:00
Qwen 发布 QwQ-32B-Preview,这是一款专注深度推理的模型,官方博客用一道加括号使等式成立的数学题展示了它的逐步思考过程。模型在尝试多种括号组合后得出 1 + 2 * (3 + 4 * 5 + 6) * 7 + 8 * 9 = 479 的答案。
推荐理由:原文展示了 QwQ-32B-Preview 在复杂数学题上的完整推理过程,读者可据此判断其链式推理能力与边界。
原文发布 11月15日 00:00
Qwen2.5-Turbo 发布,上下文长度从 128k 扩展到 1M,约合 100 万英文单词或 150 万汉字。该模型在 1M 长度的 Passkey Retrieval 任务上准确率 100%,RULER 得分 93.1,超过 GPT-4 的 91.6 和 GLM4-9B-1M 的 89.9。
推荐理由:原文给出上下文从 128k 扩展到 1M 的实测数据与推理加速幅度,可据此判断长文本场景的可用边界。
原文发布 9月19日 00:00
Qwen 团队发布 Qwen2.5 系列开源模型,包含语言模型 Qwen2.5(0.5B 到 72B)、代码模型 Qwen2.5-Coder 和数学模型 Qwen2.5-Math,除 3B 和 72B 外均采用 Apache 2.0 许可。
推荐理由:原文给出 Qwen2.5 全系列尺寸、开源许可与基准对比,读者可据此判断开源模型与闭源模型的差距。
原文发布 9月19日 00:00
Qwen2.5-Math 系列开源,包含 1.5B/7B/72B 基础模型、对应 Instruct 模型以及数学奖励模型 Qwen2.5-Math-RM-72B。
推荐理由:原文给出 Qwen2.5-Math 系列的开源规模、双语与 TIR 支持及多项基准对比,便于判断开源数学模型当前水平。
原文发布 8月8日 00:00
阿里发布基于 Qwen2 的数学专用模型系列 Qwen2-Math 及 Qwen2-Math-Instruct-1.5B/7B/72B,官方称最大模型 Qwen2-Math-72B-Instruct 在数学基准上超过 GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 和 Llama-3.1-405B。
推荐理由:原文给出数学专用模型的评测对比与去污染流程,读者可据此判断开源模型在数学推理上的位置。
原文发布 6月28日 00:00
DeepSeek 将 deepseek-chat 模型升级至 DeepSeek-V2-0628,推理能力在多项基准上提升:编码 HumanEval Pass@1 从 79.88% 升至 84.76%,数学 MATH ACC@1 从 55.02% 升至 71.02%,推理 BBH 从 78.56% 升至 83.40%。
推荐理由:原文给出 DeepSeek-V2-0628 在编码、数学、推理基准上的具体提升数字,便于读者判断这次升级的幅度。
原文发布 5月17日 00:00
DeepSeek 将 deepseek-chat 模型升级至 DeepSeek-V2-0517,指令遵循能力明显提升,IFEval Benchmark Prompt-Level 准确率从 63.9% 升至 77.6%。
推荐理由:官方给出 IFEval 与 JSON 解析率的具体提升数字,可据此判断指令遵循和结构化输出能力的实际变化。