Qwen 发布 QwQ-32B-Preview 推理模型
Qwen 发布 QwQ-32B-Preview,这是一款专注深度推理的模型,官方博客用一道加括号使等式成立的数学题展示了它的逐步思考过程。模型在尝试多种括号组合后得出 1 + 2 * (3 + 4 * 5 + 6) * 7 + 8 * 9 = 479 的答案。
推荐理由:原文展示了 QwQ-32B-Preview 在复杂数学题上的完整推理过程,读者可据此判断其链式推理能力与边界。
阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。
Qwen 发布 QwQ-32B-Preview,这是一款专注深度推理的模型,官方博客用一道加括号使等式成立的数学题展示了它的逐步思考过程。模型在尝试多种括号组合后得出 1 + 2 * (3 + 4 * 5 + 6) * 7 + 8 * 9 = 479 的答案。
推荐理由:原文展示了 QwQ-32B-Preview 在复杂数学题上的完整推理过程,读者可据此判断其链式推理能力与边界。
Qwen2.5-Turbo 发布,上下文长度从 128k 扩展到 1M,约合 100 万英文单词或 150 万汉字。该模型在 1M 长度的 Passkey Retrieval 任务上准确率 100%,RULER 得分 93.1,超过 GPT-4 的 91.6 和 GLM4-9B-1M 的 89.9。
推荐理由:原文给出上下文从 128k 扩展到 1M 的实测数据与推理加速幅度,可据此判断长文本场景的可用边界。
阿里开源 Qwen2.5-Coder 系列,新增 0.5B、3B、14B、32B 四个尺寸,加上此前的 1.5B 和 7B 共覆盖六种规模。旗舰 Qwen2.5-Coder-32B-Instruct 在 EvalPlus、LiveCodeBench、BigCodeBench 等代码生成基准上取得开源模型最佳成绩,Aider 代码修复得分 73.7,与 GPT-4o 表现相当。
推荐理由:官方给出六种尺寸的完整规格与多项基准成绩,读者可据此判断开源代码模型当前的可用边界。
Qwen 团队发布 Qwen2.5 系列开源模型,包含语言模型 Qwen2.5(0.5B 到 72B)、代码模型 Qwen2.5-Coder 和数学模型 Qwen2.5-Math,除 3B 和 72B 外均采用 Apache 2.0 许可。
推荐理由:原文给出 Qwen2.5 全系列尺寸、开源许可与基准对比,读者可据此判断开源模型与闭源模型的差距。
阿里发布 Qwen2.5 系列大语言模型,开源 0.5B、1.5B、3B、7B、14B、32B、72B 共七款,并新增 Qwen-Plus 与 Qwen-Turbo 通过阿里云百炼 API 提供。
推荐理由:原文给出七款开源模型的参数、许可与基准对比,读者可据此判断不同尺寸模型的选型与部署成本。
Qwen 发布新一代开源代码模型 Qwen2.5-Coder,提供 1.5B、7B 两个版本,32B 版本即将推出,同时将 CodeQwen 正式更名为 Qwen-Coder。
推荐理由:原文给出 1.5B 与 7B 开源版本、5.5 万亿 token 训练规模和多项基准对比,可据此判断开源代码模型当前水平。
Qwen2.5-Math 系列开源,包含 1.5B/7B/72B 基础模型、对应 Instruct 模型以及数学奖励模型 Qwen2.5-Math-RM-72B。
推荐理由:原文给出 Qwen2.5-Math 系列的开源规模、双语与 TIR 支持及多项基准对比,便于判断开源数学模型当前水平。
Qwen2-VL 发布,这是 Qwen 系列基于 Qwen2 的新版视觉语言模型,开源 Qwen2-VL-2B 和 Qwen2-VL-7B(Apache 2.0),并开放 Qwen2-VL-72B 的 API。
推荐理由:原文给出 Qwen2-VL 的视觉理解基准表现、开源规格与视频、智能体能力,读者可据此判断多模态选型。
Qwen 团队发布 Qwen2-Audio,这是 Qwen-Audio 的下一代音频语言模型,可接受音频和文本输入并生成文本输出。它首次支持无需 ASR 模块的语音对话,并能按文本指令分析语音、声音和音乐,支持中文、英语、粤语、法语等 8 种以上语言和方言。
推荐理由:官方给出 Qwen2-Audio 的语音对话与音频分析能力、开源权重和调用示例,读者可据此判断音频语言模型的实际用法。
阿里发布基于 Qwen2 的数学专用模型系列 Qwen2-Math 及 Qwen2-Math-Instruct-1.5B/7B/72B,官方称最大模型 Qwen2-Math-72B-Instruct 在数学基准上超过 GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 和 Llama-3.1-405B。
推荐理由:原文给出数学专用模型的评测对比与去污染流程,读者可据此判断开源模型在数学推理上的位置。
Qwen2 系列开源发布,包含 Qwen2-0.5B、1.5B、7B、57B-A14B 和 72B 五个尺寸的预训练与指令微调模型,已在 Hugging Face 和 ModelScope 上线。
推荐理由:原文给出 Qwen2 五个尺寸的完整规格、上下文长度与基准对比,可据此判断开源模型选型。
Qwen 团队发布博客,介绍如何用 8k 上下文的 Qwen2 模型构建智能体来处理 1M token 的文档,效果超过 RAG 和原生长上下文模型。该智能体分三级:基于 BM25 关键词检索的 RAG、逐块阅读、以及将前两级封装为工具进行多跳推理的 ReAct 式智能体。
推荐理由:原文给出用 8k 上下文模型处理 1M token 文档的三级智能体方案,可迁移到长文档问答场景。
Qwen 团队发布指令微调模型 Qwen-Max-0428,用于对话服务。该模型在 MT-Bench 上得分 8.96,高于此前最大的 Qwen1.5-110B-Chat 的 8.88;在 Chatbot Arena 上得分为 1186,已进入排行榜前十。
推荐理由:原文给出 Qwen-Max-0428 的 MT-Bench 与 Arena 成绩,读者可据此判断它相对 Qwen1.5-110B-Chat 的提升幅度。
Qwen1.5 系列发布首个 100B+ 模型 Qwen1.5-110B,采用与同系列一致的 Transformer 解码器架构,包含分组查询注意力(GQA),支持 32K token 上下文和多语言。
推荐理由:官方给出 Qwen1.5-110B 与 Llama-3-70B、Mixtral-8x22B 的基准对比,可据此判断百亿级开源模型的规模扩展收益。
Qwen 团队发布 CodeQwen1.5-7B 与 CodeQwen1.5-7B-Chat,基于 Qwen1.5 预训练约 3 万亿代码相关 token,支持 92 种编程语言和 64K token 上下文。
推荐理由:原文给出 CodeQwen1.5-7B 的预训练数据规模、上下文长度与多项基准对比,可据此判断开源代码模型与闭源模型的差距。
Qwen 团队发布 Qwen1.5 系列新成员 Qwen1.5-32B 及其对话版本 Qwen1.5-32B-Chat,架构上引入 GQA 以提升推理效率。基础能力评测中,Qwen1.5-32B 在 MMLU 得 73.4、GSM8K 得 77.4、BBH 得 66.8,多数任务超过 Llama2-34B 和 Mixtral-8x7B,略低于 Qwen1.5-72B。
推荐理由:原文给出 Qwen1.5-32B 与 72B、Llama2-34B、Mixtral-8x7B 的基准对比,读者可据此判断中等规模模型的取舍。
Qwen 团队发布 MoE 模型 Qwen1.5-MoE-A2.7B,仅激活 2.7B 参数,性能对标 Mistral 7B、Qwen1.5-7B 等 7B 模型。
推荐理由:原文给出 MoE 架构细节与训练成本、推理吞吐的对比数据,可据此判断小激活参数模型的效率取舍。
Qwen 团队发布 Qwen1.5 系列,开源 0.5B、1.8B、4B、7B、14B、32B、72B、110B 八种尺寸的 base 与 chat 模型,以及一个 MoE 模型,并提供 Int4、Int8 GPTQ 和 AWQ、GGUF 量化版本。
推荐理由:原文给出六种尺寸的开源模型与量化版本,并列出与 transformers、vLLM 等框架的集成方式,便于开发者评估迁移成本。
Qwen 团队发布 Qwen-VL-Plus 和 Qwen-VL-Max 两个升级版视觉语言模型,在图像推理、细节识别与文字提取上均有提升,支持百万像素以上高清图和任意宽高比输入。
推荐理由:官方给出 Qwen-VL-Plus 与 Max 的基准对比和开放入口,可据此判断多模态模型在中文图文任务上的位置。
Qwen 团队在首次开源 Qwen-7B 四个月后,发布 Qwen 系列语言模型整体介绍,并开源 Qwen-1.8B、Qwen-7B、Qwen-14B 和 Qwen-72B 四个尺寸的模型。
推荐理由:原文给出 Qwen 系列各尺寸模型的开源清单与上下文长度、工具调用等规格,便于读者对照选型。