原文发布 3月21日 08:00
腾讯发布首个深度推理模型 Hunyuan-T1
腾讯正式发布首个深度推理模型 Hunyuan-T1,该模型基于3月初发布的业界首个超大规模 Hybrid-Transformer-Mamba MoE 大模型 TurboS 快思考基座,扩展了推理能力,并进一步对齐人类偏好。
推荐理由:腾讯首个深度推理模型的发布信息,可了解其基于 TurboS 快思考基座扩展推理能力的技术路线。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
原文发布 3月21日 08:00
腾讯正式发布首个深度推理模型 Hunyuan-T1,该模型基于3月初发布的业界首个超大规模 Hybrid-Transformer-Mamba MoE 大模型 TurboS 快思考基座,扩展了推理能力,并进一步对齐人类偏好。
推荐理由:腾讯首个深度推理模型的发布信息,可了解其基于 TurboS 快思考基座扩展推理能力的技术路线。
原文发布 3月17日 20:00
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens,推理速度达 150 tokens/秒,采用 Apache 2.0 许可。
推荐理由:官方给出 Mistral Small 3.1 在文本、多模态与长上下文上的具体提升和部署门槛,便于判断其端侧可用性。
原文发布 3月6日 00:00
Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。
推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。
原文发布 2月25日 02:00
Qwen 团队发布 QwQ-Max-Preview,这是基于 Qwen2.5-Max 构建的推理模型预览版,在数学、编码和通用领域任务上表现突出,并擅长 Agent 相关工作流。官方表示 QwQ-Max 与 Qwen2.5-Max 将以 Apache 2.0 协议开源,后续还会推出 Qwen Chat App,并开源 QwQ-32B 等更小的推理模型供本地部署。
推荐理由:原文给出 QwQ-Max-Preview 的能力定位与后续开源、App 和小模型计划,读者可据此判断 Qwen 推理模型的路线。
原文发布 1月28日 23:00
Qwen2.5-Max 是预训练超过 20 万亿 token 的大规模 MoE 模型,并经过 SFT 与 RLHF 后训练,现已在 Qwen Chat 上线并通过阿里云提供 API,模型名为 qwen-max-2025-01-25。
推荐理由:原文给出 Qwen2.5-Max 的预训练规模与多项基准对比,读者可据此判断大规模 MoE 路线的能力位置。
原文发布 1月27日 00:00
Qwen 开源 Qwen2.5-7B-Instruct-1M 和 Qwen2.5-14B-Instruct-1M 两个模型,首次将开源 Qwen 模型的上下文长度提升到 1M token。
推荐理由:原文给出两个开源长上下文模型及配套 vLLM 推理框架,读者可据此评估本地部署 1M token 场景的硬件门槛与提速幅度。
原文发布 1月26日 19:08
Qwen 发布新一代旗舰视觉语言模型 Qwen2.5-VL,并开源 3B、7B、72B 的 base 与 instruct 版本,可在 Hugging Face 和 ModelScope 获取。
推荐理由:原文给出 Qwen2.5-VL 三个尺寸的开源权重与视觉智能体、长视频理解等能力变化,便于读者判断多模态模型的可选范围。
原文发布 1月20日 08:00
Kimi 团队发布 Kimi k1.5,并公开了该模型设计与训练的几个关键要点。相关论文以《Kimi k1.5: Scaling Reinforcement Learning with LLMs》为题发布在 arXiv(编号 2501.12599)。
推荐理由:Kimi 官方给出 k1.5 的设计与训练要点,读者可据此了解其强化学习路线的关键取舍。
原文发布 1月20日 00:00
DeepSeek 官方更新文档显示,deepseek-reasoner 是新模型 DeepSeek-R1,可通过指定 model='deepseek-reasoner' 调用。文档同时给出 DeepSeek-R1 发布说明和 Thinking Mode 指南的参考链接。
推荐理由:官方文档确认 deepseek-reasoner 对应 DeepSeek-R1,读者可据此了解新模型的调用方式与入口。
原文发布 12月26日 00:00
DeepSeek 官方更新显示,deepseek-chat 模型已升级为 DeepSeek-V3,API 保持不变,仍可通过指定 model='deepseek-chat' 调用 DeepSeek-V3。官方同时给出了介绍 DeepSeek-V3 的详情链接。
推荐理由:官方说明 deepseek-chat 已升级为 DeepSeek-V3,API 调用方式不变,读者可据此判断现有集成是否需要改动。
原文发布 12月14日 08:00
xAI 在 API 公测一个月后新增 grok-2-1212 和 grok-2-vision-1212 两款模型,官方称其在准确率、指令遵循和多语言能力上有所提升。此前公测版本为 grok-beta 和 grok-vision-beta。
推荐理由:xAI 在 API 公测一个月后更新两款模型,读者可据此了解其在准确率、指令遵循和多语言上的迭代方向。
原文发布 11月28日 00:00
Qwen 发布 QwQ-32B-Preview,这是一款专注深度推理的模型,官方博客用一道加括号使等式成立的数学题展示了它的逐步思考过程。模型在尝试多种括号组合后得出 1 + 2 * (3 + 4 * 5 + 6) * 7 + 8 * 9 = 479 的答案。
推荐理由:原文展示了 QwQ-32B-Preview 在复杂数学题上的完整推理过程,读者可据此判断其链式推理能力与边界。
原文发布 11月26日 08:00
腾讯混元推出新一代视觉语言旗舰大模型 hunyuan-turbo-vision,采用全新的混合专家模型(MoE)结构。相比前一代模型,其在图文理解相关的基础识别、内容创作、知识问答、分析推理等能力上全面提升。
推荐理由:原文给出混元新一代视觉语言旗舰模型的架构与能力提升方向,可了解其与前代在图文理解上的差异。
原文发布 11月15日 00:00
Qwen2.5-Turbo 发布,上下文长度从 128k 扩展到 1M,约合 100 万英文单词或 150 万汉字。该模型在 1M 长度的 Passkey Retrieval 任务上准确率 100%,RULER 得分 93.1,超过 GPT-4 的 91.6 和 GLM4-9B-1M 的 89.9。
推荐理由:原文给出上下文从 128k 扩展到 1M 的实测数据与推理加速幅度,可据此判断长文本场景的可用边界。
原文发布 11月12日 00:00
阿里开源 Qwen2.5-Coder 系列,新增 0.5B、3B、14B、32B 四个尺寸,加上此前的 1.5B 和 7B 共覆盖六种规模。旗舰 Qwen2.5-Coder-32B-Instruct 在 EvalPlus、LiveCodeBench、BigCodeBench 等代码生成基准上取得开源模型最佳成绩,Aider 代码修复得分 73.7,与 GPT-4o 表现相当。
推荐理由:官方给出六种尺寸的完整规格与多项基准成绩,读者可据此判断开源代码模型当前的可用边界。
原文发布 11月8日 08:00
腾讯混元推出 hunyuan-large-longcontext,采用混元 MoE 结构,参数规模为 A52B,基于开源的 hunyuan-large 模型进一步增训,重点优化长文任务处理能力。该模型与元宝 C 端文档阅读场景使用的是同款模型,在长文本解析和生成方面效果显著。
推荐理由:原文给出混元长文本模型的参数规模与同款落地场景,读者可据此判断其长文任务定位。
原文发布 9月19日 00:00
Qwen 团队发布 Qwen2.5 系列开源模型,包含语言模型 Qwen2.5(0.5B 到 72B)、代码模型 Qwen2.5-Coder 和数学模型 Qwen2.5-Math,除 3B 和 72B 外均采用 Apache 2.0 许可。
推荐理由:原文给出 Qwen2.5 全系列尺寸、开源许可与基准对比,读者可据此判断开源模型与闭源模型的差距。
原文发布 9月19日 00:00
阿里发布 Qwen2.5 系列大语言模型,开源 0.5B、1.5B、3B、7B、14B、32B、72B 共七款,并新增 Qwen-Plus 与 Qwen-Turbo 通过阿里云百炼 API 提供。
推荐理由:原文给出七款开源模型的参数、许可与基准对比,读者可据此判断不同尺寸模型的选型与部署成本。
原文发布 9月19日 00:00
Qwen 发布新一代开源代码模型 Qwen2.5-Coder,提供 1.5B、7B 两个版本,32B 版本即将推出,同时将 CodeQwen 正式更名为 Qwen-Coder。
推荐理由:原文给出 1.5B 与 7B 开源版本、5.5 万亿 token 训练规模和多项基准对比,可据此判断开源代码模型当前水平。
原文发布 9月19日 00:00
Qwen2.5-Math 系列开源,包含 1.5B/7B/72B 基础模型、对应 Instruct 模型以及数学奖励模型 Qwen2.5-Math-RM-72B。
推荐理由:原文给出 Qwen2.5-Math 系列的开源规模、双语与 TIR 支持及多项基准对比,便于判断开源数学模型当前水平。