原文发布 11月11日 08:00
腾讯混元 HY 2.0 Instruct 上线
腾讯混元 HY 2.0 Instruct 上线,模型底座从 TurboS 升级为混元2.0,模型能力全面提升。官方称该版本显著增强了指令遵循、多轮及长文理解、文学创作、知识准确性、代码及推理能力。
推荐理由:原文列出混元2.0底座替换与能力提升方向,读者可据此判断该版本在指令遵循和长文理解上的变化。
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
原文发布 11月11日 08:00
腾讯混元 HY 2.0 Instruct 上线,模型底座从 TurboS 升级为混元2.0,模型能力全面提升。官方称该版本显著增强了指令遵循、多轮及长文理解、文学创作、知识准确性、代码及推理能力。
推荐理由:原文列出混元2.0底座替换与能力提升方向,读者可据此判断该版本在指令遵循和长文理解上的变化。
原文发布 10月27日 08:00
MiniMax 正式开源并发布 MiniMax M2,定位为面向 Agent 与编码的模型,API 定价为每百万输入 token $0.30、每百万输出 token $1.20,约为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍。
推荐理由:原文给出 M2 的定价、推理速度与开源权重,读者可据此判断它在 Agent 与编码场景中的成本位置。
原文发布 9月30日 08:00
智谱发布旗舰编码模型 GLM-4.6,在公开基准和真实编程任务上表现提升,官方称其为中国领先的编码模型。此次更新将上下文窗口扩展至 200K,以更好处理更长的代码和复杂智能体任务。
推荐理由:原文给出 GLM-4.6 在公开基准与真实编程任务上的提升,以及 200K 上下文窗口对长代码和复杂智能体任务的意义。
原文发布 9月5日 08:00
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,激活参数 32B、总参数 1T,上下文窗口从 128k 提升到 256k tokens。
推荐理由:原文给出上下文窗口翻倍与多项编码基准对比,读者可据此判断它在长任务和智能体编码上的位置。
原文发布 7月30日 20:00
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、代码语义检索和智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。
推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。
原文发布 7月28日 08:00
智谱发布原生智能体大语言模型 GLM-4.5 系列,官方称参数效率提升一倍,并具备较强的推理、编码和智能体能力。该系列还支持一键兼容 Claude Code 框架,更多细节见官方文档。
推荐理由:官方给出 GLM-4.5 的参数效率与推理、编码、智能体能力变化,并说明与 Claude Code 框架的兼容方式。
原文发布 7月22日 21:00
Qwen 发布 Qwen3-Coder,首个最强变体 Qwen3-Coder-480B-A35B-Instruct 是 480B 参数 MoE 模型,激活参数 35B,原生支持 256K 上下文,借助 YaRN 可扩展至 1M token。
推荐理由:原文给出模型规格、上下文长度与开源 CLI 工具,读者可据此判断开源编码模型在智能体任务上的位置。
原文发布 7月11日 08:00
腾讯混元发布 hunyuan-t1-20250711,官方称其大幅提升高难度数学、逻辑和代码能力,并优化模型输出稳定性、提升长文能力。
推荐理由:官方给出混元 T1 新版本在数学、逻辑、代码和长文能力上的具体提升方向,可据此判断推理型模型的能力变化。
原文发布 7月11日 00:00
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
原文发布 6月17日 08:00
Kimi 发布开源编码大模型 Kimi-Dev-72B,在 SWE-bench Verified 上取得 60.4% 的成绩,在开源模型中达到新的 state-of-the-art。该模型通过大规模强化学习优化,在 Docker 中自主修复真实代码仓库,只有整个测试套件通过时才获得奖励。模型已在 Hugging Face 和 GitHub 开放下载与部署。
推荐理由:原文给出开源编码模型在 SWE-bench Verified 上的成绩与训练方式,读者可据此判断其代码修复能力。
原文发布 6月4日 20:00
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项与企业管控工具,基于开源项目 Continue 构建。
推荐理由:Mistral 把模型、IDE 插件与企业管控打包成单一供应商方案,读者可据此判断企业级编码助手的落地路径。
原文发布 5月28日 20:00
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度的取舍方式,便于评估检索成本。
原文发布 5月21日 20:00
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
原文发布 5月20日 08:00
腾讯混元发布 hunyuan-turbos-20250515,采用长短思维链自适应融合,全面提升数学、代码、逻辑和科学等理科效果,文科效果维持。效果指标上,数学 ood 测试集提升 7%,逻辑难题提升 5%,代码能力及体验提升 5%,科学提升 8%。
推荐理由:原文给出混元 turbos 新版本在数学、代码、逻辑和科学上的具体提升幅度,可据此判断理科能力变化。
原文发布 4月3日 08:00
腾讯混元推出 hunyuan-t1-20250403,全面提升文本生成能力、文本逻辑严谨性与专业规范性,并强化项目级代码生成能力。该版本还优化了多轮 ToB 场景理解。
推荐理由:官方给出 hunyuan-t1-20250403 的能力更新方向,读者可据此判断它在代码生成与 ToB 多轮场景上的变化。
原文发布 3月24日 00:00
DeepSeek 官方将 deepseek-chat 模型升级至 DeepSeek-V3-0324,推理能力显著提升,MMLU-Pro 从 75.9 升至 81.2,GPQA 从 59.1 升至 68.4,AIME 从 39.6 升至 59.4,LiveCodeBench 从 39.2 升至 49.2。
推荐理由:官方给出 DeepSeek-V3-0324 在推理、编码和中文写作上的基准变化,可据此判断升级幅度。
原文发布 11月12日 00:00
阿里开源 Qwen2.5-Coder 系列,新增 0.5B、3B、14B、32B 四个尺寸,加上此前的 1.5B 和 7B 共覆盖六种规模。旗舰 Qwen2.5-Coder-32B-Instruct 在 EvalPlus、LiveCodeBench、BigCodeBench 等代码生成基准上取得开源模型最佳成绩,Aider 代码修复得分 73.7,与 GPT-4o 表现相当。
推荐理由:官方给出六种尺寸的完整规格与多项基准成绩,读者可据此判断开源代码模型当前的可用边界。
原文发布 9月19日 00:00
Qwen 团队发布 Qwen2.5 系列开源模型,包含语言模型 Qwen2.5(0.5B 到 72B)、代码模型 Qwen2.5-Coder 和数学模型 Qwen2.5-Math,除 3B 和 72B 外均采用 Apache 2.0 许可。
推荐理由:原文给出 Qwen2.5 全系列尺寸、开源许可与基准对比,读者可据此判断开源模型与闭源模型的差距。
原文发布 9月19日 00:00
Qwen 发布新一代开源代码模型 Qwen2.5-Coder,提供 1.5B、7B 两个版本,32B 版本即将推出,同时将 CodeQwen 正式更名为 Qwen-Coder。
推荐理由:原文给出 1.5B 与 7B 开源版本、5.5 万亿 token 训练规模和多项基准对比,可据此判断开源代码模型当前水平。
原文发布 9月5日 00:00
DeepSeek 将 DeepSeek V2 Chat 和 DeepSeek Coder V2 合并升级为新模型 DeepSeek V2.5,API 用户仍可通过 deepseek-coder 或 deepseek-chat 访问以保持向后兼容。
推荐理由:原文列出 V2.5 合并升级后的多项基准变化,读者可据此判断通用与编码能力的提升幅度。