跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

197条精选相关主题产品更新论文研究开源生态

最新精选

第 181–197 条 · 共 197 条
9月5日周四
  1. DeepSeek 官方更新71

    原文发布 9月5日 00:00

    DeepSeek V2 Chat 与 Coder V2 合并升级为 DeepSeek V2.5

    DeepSeek 将 DeepSeek V2 Chat 和 DeepSeek Coder V2 合并升级为新模型 DeepSeek V2.5,API 用户仍可通过 deepseek-coder 或 deepseek-chat 访问以保持向后兼容。

    推荐理由:原文列出 V2.5 合并升级后的多项基准变化,读者可据此判断通用与编码能力的提升幅度。

8月29日周四
8月9日周五
  1. Qwen Blog71

    原文发布 8月9日 16:18

    Qwen2-Audio 发布:支持语音对话与音频分析

    Qwen 团队发布 Qwen2-Audio,这是 Qwen-Audio 的下一代音频语言模型,可接受音频和文本输入并生成文本输出。它首次支持无需 ASR 模块的语音对话,并能按文本指令分析语音、声音和音乐,支持中文、英语、粤语、法语等 8 种以上语言和方言。

    推荐理由:官方给出 Qwen2-Audio 的语音对话与音频分析能力、开源权重和调用示例,读者可据此判断音频语言模型的实际用法。

8月8日周四
  1. Qwen Blog72

    原文发布 8月8日 00:00

    阿里发布 Qwen2-Math 数学专用模型系列

    阿里发布基于 Qwen2 的数学专用模型系列 Qwen2-Math 及 Qwen2-Math-Instruct-1.5B/7B/72B,官方称最大模型 Qwen2-Math-72B-Instruct 在数学基准上超过 GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 和 Llama-3.1-405B。

    推荐理由:原文给出数学专用模型的评测对比与去污染流程,读者可据此判断开源模型在数学推理上的位置。

7月24日周三
6月28日周五
  1. DeepSeek 官方更新69

    原文发布 6月28日 00:00

    DeepSeek 将 deepseek-chat 升级至 DeepSeek-V2-0628

    DeepSeek 将 deepseek-chat 模型升级至 DeepSeek-V2-0628,推理能力在多项基准上提升:编码 HumanEval Pass@1 从 79.88% 升至 84.76%,数学 MATH ACC@1 从 55.02% 升至 71.02%,推理 BBH 从 78.56% 升至 83.40%。

    推荐理由:原文给出 DeepSeek-V2-0628 在编码、数学、推理基准上的具体提升数字,便于读者判断这次升级的幅度。

6月14日周五
  1. DeepSeek 官方更新62

    原文发布 6月14日 00:00

    DeepSeek 将 deepseek-coder 升级至 DeepSeek-Coder-V2-0614

    DeepSeek 将 deepseek-coder 模型升级为 DeepSeek-Coder-V2-0614,显著提升编码能力。官方称其在代码生成、代码理解、代码调试和代码补全上达到 GPT-4-Turbo-0409 的水平,同时具备出色的数学与推理能力,通用能力与 DeepSeek-V2-0517 相当。

    推荐理由:官方给出升级后模型在代码生成、理解、调试与补全上的对标水平,便于读者判断编码能力定位。

6月7日周五
5月17日周五
  1. DeepSeek 官方更新62

    原文发布 5月17日 00:00

    DeepSeek 将 deepseek-chat 升级至 DeepSeek-V2-0517

    DeepSeek 将 deepseek-chat 模型升级至 DeepSeek-V2-0517,指令遵循能力明显提升,IFEval Benchmark Prompt-Level 准确率从 63.9% 升至 77.6%。

    推荐理由:官方给出 IFEval 与 JSON 解析率的具体提升数字,可据此判断指令遵循和结构化输出能力的实际变化。

5月11日周六
  1. Qwen Blog62

    原文发布 5月11日 18:10

    Qwen 发布 Qwen-Max-0428 模型

    Qwen 团队发布指令微调模型 Qwen-Max-0428,用于对话服务。该模型在 MT-Bench 上得分 8.96,高于此前最大的 Qwen1.5-110B-Chat 的 8.88;在 Chatbot Arena 上得分为 1186,已进入排行榜前十。

    推荐理由:原文给出 Qwen-Max-0428 的 MT-Bench 与 Arena 成绩,读者可据此判断它相对 Qwen1.5-110B-Chat 的提升幅度。

4月25日周四
  1. Qwen Blog72

    原文发布 4月25日 13:33

    Qwen1.5-110B 发布:Qwen1.5 系列首个千亿参数级模型

    Qwen1.5 系列发布首个 100B+ 模型 Qwen1.5-110B,采用与同系列一致的 Transformer 解码器架构,包含分组查询注意力(GQA),支持 32K token 上下文和多语言。

    推荐理由:官方给出 Qwen1.5-110B 与 Llama-3-70B、Mixtral-8x22B 的基准对比,可据此判断百亿级开源模型的规模扩展收益。

4月16日周二
  1. Qwen Blog66

    原文发布 4月16日 13:33

    Qwen 发布开源代码模型 CodeQwen1.5-7B

    Qwen 团队发布 CodeQwen1.5-7B 与 CodeQwen1.5-7B-Chat,基于 Qwen1.5 预训练约 3 万亿代码相关 token,支持 92 种编程语言和 64K token 上下文。

    推荐理由:原文给出 CodeQwen1.5-7B 的预训练数据规模、上下文长度与多项基准对比,可据此判断开源代码模型与闭源模型的差距。

4月2日周二
  1. Qwen Blog71

    原文发布 4月2日 13:33

    Qwen1.5-32B 与 Qwen1.5-32B-Chat 发布

    Qwen 团队发布 Qwen1.5 系列新成员 Qwen1.5-32B 及其对话版本 Qwen1.5-32B-Chat,架构上引入 GQA 以提升推理效率。基础能力评测中,Qwen1.5-32B 在 MMLU 得 73.4、GSM8K 得 77.4、BBH 得 66.8,多数任务超过 Llama2-34B 和 Mixtral-8x7B,略低于 Qwen1.5-72B。

    推荐理由:原文给出 Qwen1.5-32B 与 72B、Llama2-34B、Mixtral-8x7B 的基准对比,读者可据此判断中等规模模型的取舍。

3月28日周四
2月4日周日
  1. Qwen Blog78

    原文发布 2月4日 13:33

    Qwen 团队开源 Qwen1.5 系列模型

    Qwen 团队发布 Qwen1.5 系列,开源 0.5B、1.8B、4B、7B、14B、32B、72B、110B 八种尺寸的 base 与 chat 模型,以及一个 MoE 模型,并提供 Int4、Int8 GPTQ 和 AWQ、GGUF 量化版本。

    推荐理由:原文给出六种尺寸的开源模型与量化版本,并列出与 transformers、vLLM 等框架的集成方式,便于开发者评估迁移成本。

1月25日周四
  1. Qwen Blog74

    原文发布 1月25日 13:33

    Qwen 发布 Qwen-VL-Plus 与 Qwen-VL-Max 两个升级版多模态模型

    Qwen 团队发布 Qwen-VL-Plus 和 Qwen-VL-Max 两个升级版视觉语言模型,在图像推理、细节识别与文字提取上均有提升,支持百万像素以上高清图和任意宽高比输入。

    推荐理由:官方给出 Qwen-VL-Plus 与 Max 的基准对比和开放入口,可据此判断多模态模型在中文图文任务上的位置。

1月23日周二
  1. Qwen Blog62

    原文发布 1月23日 22:13

    Qwen 发布开源语言模型系列介绍

    Qwen 团队在首次开源 Qwen-7B 四个月后,发布 Qwen 系列语言模型整体介绍,并开源 Qwen-1.8B、Qwen-7B、Qwen-14B 和 Qwen-72B 四个尺寸的模型。

    推荐理由:原文给出 Qwen 系列各尺寸模型的开源清单与上下文长度、工具调用等规格,便于读者对照选型。