跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

197条精选相关主题产品更新论文研究开源生态

最新精选

第 141–160 条 · 共 197 条
6月20日周五
  1. Kimi 官方 Blog76

    原文发布 6月20日 08:00

    Kimi 发布自主研究智能体 Kimi-Researcher

    Kimi 发布自主智能体 Kimi-Researcher,基于内部版 Kimi k 系列模型,完全通过端到端智能体强化学习训练,在 Humanity's Last Exam 上取得 Pass@1 26.9%、Pass@4 40.17% 的成绩,从初始 8.6% 几乎全部由 RL 训练提升而来。

    推荐理由:原文给出端到端智能体 RL 训练的完整路径与 HLE 成绩,读者可据此判断自主搜索智能体的能力边界。

6月17日周二
  1. Kimi 官方 Blog71

    原文发布 6月17日 08:00

    Kimi 发布开源编码模型 Kimi-Dev-72B,SWE-bench Verified 达 60.4%

    Kimi 发布开源编码大模型 Kimi-Dev-72B,在 SWE-bench Verified 上取得 60.4% 的成绩,在开源模型中达到新的 state-of-the-art。该模型通过大规模强化学习优化,在 Docker 中自主修复真实代码仓库,只有整个测试套件通过时才获得奖励。模型已在 Hugging Face 和 GitHub 开放下载与部署。

    推荐理由:原文给出开源编码模型在 SWE-bench Verified 上的成绩与训练方式,读者可据此判断其代码修复能力。

6月10日周二
  1. Mistral AI72

    原文发布 6月10日 20:00

    Mistral AI 发布首款推理模型 Magistral

    Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和面向企业的 Magistral Medium。

    推荐理由:Mistral AI 首款推理模型同时给出开源版与商用版,并公开训练论文,读者可据此判断其推理能力与开放程度。

6月5日周四
  1. Qwen Blog62

    原文发布 6月5日 21:00

    Qwen3 Embedding 系列发布:文本嵌入与重排模型开源

    Qwen3 Embedding 系列发布,包含 0.6B、4B、8B 三种尺寸的文本嵌入与重排模型,基于 Qwen3 基础模型构建,以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源,技术报告与代码已发布在 GitHub。

    推荐理由:原文给出 Qwen3 Embedding 系列的尺寸、评测分数与开源入口,读者可据此判断它在检索与重排任务上的选型空间。

5月28日周三
  1. Mistral AI62

    原文发布 5月28日 20:00

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度的取舍方式,便于评估检索成本。

  2. DeepSeek 官方更新78

    原文发布 5月28日 00:00

    DeepSeek 将 deepseek-reasoner 升级至 DeepSeek-R1-0528

    DeepSeek 官方将 deepseek-reasoner 模型升级至 DeepSeek-R1-0528,多项基准的 Pass@1 明显提升:AIME 2025 从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0,LCB_v6 从 63.5 升至 73.3,Aider 从 57.0 升至 71.6。

    推荐理由:官方给出 R1-0528 在 AIME、GPQA、Aider 等基准上的具体提升幅度,可据此判断推理与代码能力的变化。

5月21日周三
  1. Mistral AI76

    原文发布 5月21日 20:00

    Mistral AI 与 All Hands AI 发布 Devstral 智能体编码模型

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

  2. 腾讯混元官方动态62

    原文发布 5月21日 08:00

    腾讯混元发布 hunyuan-t1-20250521 新版本

    腾讯混元发布 hunyuan-t1-20250521 最新版本,数学、代码、科学和知识问答能力显著增强。该版本还优化了文科数据,提升文创与文本理解能力。

    推荐理由:官方给出混元T1新版本在数学、代码、科学和知识问答上的能力变化,可据此判断升级方向。

5月20日周二
  1. 腾讯混元官方动态60

    原文发布 5月20日 08:00

    腾讯混元发布 hunyuan-turbos-20250515 模型

    腾讯混元发布 hunyuan-turbos-20250515,采用长短思维链自适应融合,全面提升数学、代码、逻辑和科学等理科效果,文科效果维持。效果指标上,数学 ood 测试集提升 7%,逻辑难题提升 5%,代码能力及体验提升 5%,科学提升 8%。

    推荐理由:原文给出混元 turbos 新版本在数学、代码、逻辑和科学上的具体提升幅度,可据此判断理科能力变化。

5月7日周三
4月29日周二
4月26日周六
  1. Kimi 官方 Blog69

    原文发布 4月26日 08:00

    Kimi 发布开源音频基础模型 Kimi-Audio-7B

    Kimi 发布开源音频基础模型 Kimi-Audio-7B,在单一框架内统一处理语音识别、音频理解、音频描述、情感识别、声事件分类和端到端语音对话等任务。模型基于 Qwen 2.5 7B 初始化,预训练数据超过 1300 万小时音频与文本,采用连续声学向量加离散语义 token 的混合输入和并行文本与音频 token 生成头。

    推荐理由:原文给出开源音频基础模型的架构、13M 小时预训练规模和多项基准对比,读者可据此判断统一音频处理框架的当前水平。

4月16日周三
  1. 腾讯混元官方动态62

    原文发布 4月16日 08:00

    腾讯发布混元 TurboS 新版本 hunyuan-turbos-20250416

    腾讯混元推出旗舰大模型新版本 hunyuan-turbos-20250416,预训练底座升级,增强指令理解与遵循能力。对齐阶段提升数学、代码、逻辑、科学等理科能力,并改进文创写作、文本理解、翻译准确率和知识问答等文科能力。该版本还增强各领域 Agent 能力,重点加强多轮对话理解。

    推荐理由:官方给出混元 TurboS 新版本在理科能力、文科能力和 Agent 多轮对话上的具体升级方向,便于判断是否值得切换。

4月10日周四
  1. Kimi 官方 Blog72

    原文发布 4月10日 08:00

    Kimi 发布开源 MoE 视觉语言模型 Kimi-VL 及 Thinking 变体

    Kimi 发布开源 MoE 视觉语言模型 Kimi-VL,语言解码器仅激活 2.8B 参数,支持 128K 上下文和原生分辨率视觉编码器 MoonViT。基于长 CoT SFT 与 RL 的 Kimi-VL-Thinking 在 MMMU 得 61.7、MathVista 得 71.3。

    推荐理由:原文给出 Kimi-VL 系列在激活参数仅 2.8B 下的多模态与长上下文成绩,可对照同量级 VLM 的能力边界。

4月3日周四
  1. 腾讯混元官方动态60

    原文发布 4月3日 08:00

    腾讯混元推出 hunyuan-t1-20250403 模型

    腾讯混元推出 hunyuan-t1-20250403,全面提升文本生成能力、文本逻辑严谨性与专业规范性,并强化项目级代码生成能力。该版本还优化了多轮 ToB 场景理解。

    推荐理由:官方给出 hunyuan-t1-20250403 的能力更新方向,读者可据此判断它在代码生成与 ToB 多轮场景上的变化。

3月28日周五
  1. Qwen Blog71

    原文发布 3月28日 00:00

    Qwen 发布视觉推理模型 QVQ-Max 首个版本

    Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。

    推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。

3月27日周四
  1. Qwen Blog75

    原文发布 3月27日 00:00

    Qwen 发布端到端全模态模型 Qwen2.5-Omni

    Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。

    推荐理由:原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。

3月24日周一
  1. DeepSeek 官方更新80

    原文发布 3月24日 00:00

    DeepSeek 将 deepseek-chat 升级至 DeepSeek-V3-0324

    DeepSeek 官方将 deepseek-chat 模型升级至 DeepSeek-V3-0324,推理能力显著提升,MMLU-Pro 从 75.9 升至 81.2,GPQA 从 59.1 升至 68.4,AIME 从 39.6 升至 59.4,LiveCodeBench 从 39.2 升至 49.2。

    推荐理由:官方给出 DeepSeek-V3-0324 在推理、编码和中文写作上的基准变化,可据此判断升级幅度。

3月21日周五
  1. 腾讯混元官方动态62

    原文发布 3月21日 08:00

    腾讯推出首个推理模型 hunyuan-t1-20250321

    腾讯发布 hunyuan-t1-20250321,称其为腾讯首个推理模型,全面构建模型文理科能力,长文本信息捕捉能力强。该模型支持推理解答数学、逻辑推理、科学、代码等不同难度的科学问题。

    推荐理由:腾讯首个推理模型的能力定位与长文本信息捕捉特点,可供读者对照当前推理模型格局。