跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

115条精选相关主题产品更新论文研究开源生态

最新精选

第 81–100 条 · 共 115 条
6月26日周四
  1. Qwen Blog71

    Qwen 发布统一多模态理解与生成模型 Qwen VLo

    Qwen 发布统一多模态理解与生成模型 Qwen VLo,预览版可通过 Qwen Chat 访问,支持直接文生图和上传图片后按指令修改。该模型采用从左到右、从上到下的渐进式生成方式,支持中英文等多语言指令,可完成风格迁移、背景替换、文字编辑以及检测、分割、边缘提取等任务。官方表示多图输入和极端宽高比生成尚未正式上线,模型仍处预览阶段,存在生成不准确、不遵循指令等不足。

    推荐理由:原文给出统一理解与生成模型的预览入口和能力边界,读者可据此判断多模态生成的实际可用程度。

6月10日周二
6月5日周四
  1. Qwen Blog62

    Qwen3 Embedding 系列发布:文本嵌入与重排模型开源

    Qwen3 Embedding 系列发布,包含 0.6B、4B、8B 三种尺寸的文本嵌入与重排模型,基于 Qwen3 基础模型构建,以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源,技术报告与代码已发布在 GitHub。

    推荐理由:原文给出 Qwen3 Embedding 系列的尺寸、评测分数与开源入口,读者可据此判断它在检索与重排任务上的选型空间。

5月28日周三
  1. Mistral AI62

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度的取舍方式,便于评估检索成本。

5月21日周三
  1. Mistral AI76

    Mistral AI 与 All Hands AI 发布 Devstral 智能体编码模型

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

5月7日周三
4月29日周二
3月28日周五
  1. Qwen Blog71

    Qwen 发布视觉推理模型 QVQ-Max 首个版本

    Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。

    推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。

3月27日周四
  1. Qwen Blog75

    Qwen 发布端到端全模态模型 Qwen2.5-Omni

    Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。

    推荐理由:原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。

3月24日周一
3月17日周一
3月6日周四
  1. Qwen Blog80

    Qwen 发布 QwQ-32B 推理模型,320 亿参数对标 DeepSeek-R1

    Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。

    推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。

2月25日周二
  1. Qwen Blog62

    Qwen 发布 QwQ-Max-Preview 推理模型预览版

    Qwen 团队发布 QwQ-Max-Preview,这是基于 Qwen2.5-Max 构建的推理模型预览版,在数学、编码和通用领域任务上表现突出,并擅长 Agent 相关工作流。官方表示 QwQ-Max 与 Qwen2.5-Max 将以 Apache 2.0 协议开源,后续还会推出 Qwen Chat App,并开源 QwQ-32B 等更小的推理模型供本地部署。

    推荐理由:原文给出 QwQ-Max-Preview 的能力定位与后续开源、App 和小模型计划,读者可据此判断 Qwen 推理模型的路线。

1月28日周二
1月27日周一
1月26日周日
11月28日周四
  1. Qwen Blog62

    Qwen 发布 QwQ-32B-Preview 推理模型

    Qwen 发布 QwQ-32B-Preview,这是一款专注深度推理的模型,官方博客用一道加括号使等式成立的数学题展示了它的逐步思考过程。模型在尝试多种括号组合后得出 1 + 2 * (3 + 4 * 5 + 6) * 7 + 8 * 9 = 479 的答案。

    推荐理由:原文展示了 QwQ-32B-Preview 在复杂数学题上的完整推理过程,读者可据此判断其链式推理能力与边界。

11月15日周五
  1. Qwen Blog75

    Qwen2.5-Turbo 将上下文扩展至 1M tokens

    Qwen2.5-Turbo 发布,上下文长度从 128k 扩展到 1M,约合 100 万英文单词或 150 万汉字。该模型在 1M 长度的 Passkey Retrieval 任务上准确率 100%,RULER 得分 93.1,超过 GPT-4 的 91.6 和 GLM4-9B-1M 的 89.9。

    推荐理由:原文给出上下文从 128k 扩展到 1M 的实测数据与推理加速幅度,可据此判断长文本场景的可用边界。

11月12日周二
  1. Qwen Blog82

    Qwen2.5-Coder 系列开源,32B 版本对标 GPT-4o

    阿里开源 Qwen2.5-Coder 系列,新增 0.5B、3B、14B、32B 四个尺寸,加上此前的 1.5B 和 7B 共覆盖六种规模。旗舰 Qwen2.5-Coder-32B-Instruct 在 EvalPlus、LiveCodeBench、BigCodeBench 等代码生成基准上取得开源模型最佳成绩,Aider 代码修复得分 73.7,与 GPT-4o 表现相当。

    推荐理由:官方给出六种尺寸的完整规格与多项基准成绩,读者可据此判断开源代码模型当前的可用边界。

9月19日周四
  1. Qwen Blog88

    Qwen 发布 Qwen2.5 系列基础模型

    Qwen 团队发布 Qwen2.5 系列开源模型,包含语言模型 Qwen2.5(0.5B 到 72B)、代码模型 Qwen2.5-Coder 和数学模型 Qwen2.5-Math,除 3B 和 72B 外均采用 Apache 2.0 许可。

    推荐理由:原文给出 Qwen2.5 全系列尺寸、开源许可与基准对比,读者可据此判断开源模型与闭源模型的差距。