原文发布 9月30日 08:00
智谱发布旗舰编码模型 GLM-4.6
智谱发布旗舰编码模型 GLM-4.6,在公开基准和真实编程任务上表现提升,官方称其为中国领先的编码模型。此次更新将上下文窗口扩展至 200K,以更好处理更长的代码和复杂智能体任务。
推荐理由:原文给出 GLM-4.6 在公开基准与真实编程任务上的提升,以及 200K 上下文窗口对长代码和复杂智能体任务的意义。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
原文发布 9月30日 08:00
智谱发布旗舰编码模型 GLM-4.6,在公开基准和真实编程任务上表现提升,官方称其为中国领先的编码模型。此次更新将上下文窗口扩展至 200K,以更好处理更长的代码和复杂智能体任务。
推荐理由:原文给出 GLM-4.6 在公开基准与真实编程任务上的提升,以及 200K 上下文窗口对长代码和复杂智能体任务的意义。
原文发布 9月29日 00:00
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 两个接口升级至 DeepSeek-V3.2-Exp。其中 deepseek-chat 对应 DeepSeek-V3.2-Exp 的非思考模式,deepseek-reasoner 对应其思考模式,更多细节见官方文档。
推荐理由:官方说明两个接口分别对应新版本的非思考与思考模式,读者可据此判断现有调用方式是否需要调整。
原文发布 9月23日 04:00
Qwen 发布 Qwen 系列首个安全护栏模型 Qwen3Guard,基于 Qwen3 基础模型微调,可对提示词和回复做安全检测并给出风险等级与分类。它提供 Qwen3Guard-Gen 和 Qwen3Guard-Stream 两个变体,后者通过 Transformer 末层两个轻量分类头实现逐 token 的实时流式检测,两者均有 0.6B、4B、8B 三种规模。
推荐理由:原文给出两种安全护栏变体的能力差异与开源入口,读者可据此判断流式审核在部署中的取舍。
原文发布 9月22日 00:00
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级到 DeepSeek-V3.1-Terminus,前者对应非思考模式,后者对应思考模式。本次更新在保持原有能力的同时修复了用户反馈的问题,包括减少中英文混用和偶发异常字符,并进一步优化 Code Agent 与 Search Agent 的表现。
推荐理由:官方说明了两个接口对应的模式与本次修复项,读者可据此判断升级是否影响现有调用。
原文发布 9月16日 08:00
腾讯混元发布 hunyuan-t1-vision-20250916,为最新版 t1-vision 视觉深度思考模型。相比上一版,该模型在通用图文问答、视觉定位、OCR、图表、拍题解题、看图创作等任务上全面提升,并显著优化了英文和小语种能力。
推荐理由:原文列出混元 t1-vision 新版在图文问答、视觉定位、OCR 等任务上的提升方向,便于判断多模态能力变化。
原文发布 9月5日 08:00
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,激活参数 32B、总参数 1T,上下文窗口从 128k 提升到 256k tokens。
推荐理由:原文给出上下文窗口翻倍与多项编码基准对比,读者可据此判断它在长任务和智能体编码上的位置。
原文发布 8月21日 00:00
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级至 DeepSeek-V3.1,前者对应非思考模式,后者对应思考模式。
推荐理由:官方给出混合推理架构与智能体能力提升,并附 SWE-bench 等基准数据,便于对比版本差异。
原文发布 8月19日 01:30
Qwen 发布 Qwen-Image-Edit,这是基于 20B Qwen-Image 的图像编辑版本,将文本渲染能力扩展到图像编辑任务。该模型同时把输入图像送入 Qwen2.5-VL 做视觉语义控制、送入 VAE Encoder 做视觉外观控制,支持语义编辑与外观编辑,并支持中英双语文字的直接增删改且保留原字体、大小和风格。
推荐理由:原文给出语义与外观两类编辑能力及中英文字编辑细节,读者可据此判断图像编辑模型的能力边界。
原文发布 8月11日 08:00
智谱发布 GLM-4.5V,这是一个 100B 规模的开源视觉推理模型,支持视频理解、视觉定位、GUI 智能体等多种视觉任务。此次更新还新增了思考模式,更多细节见官方文档。
推荐理由:原文给出模型规模、开源属性和覆盖的视觉任务范围,读者可据此判断它在多模态推理上的定位。
原文发布 8月4日 22:08
Qwen 发布 Qwen-Image,一个 20B MMDiT 图像基础模型,主打复杂文字渲染与精准图像编辑,可在 Qwen Chat 的 Image Generation 入口试用。
推荐理由:原文给出 20B MMDiT 图像基础模型在文字渲染与图像编辑上的能力展示和多个基准结果,读者可据此判断中文文字生成的实际水平。
原文发布 7月28日 08:00
智谱发布原生智能体大语言模型 GLM-4.5 系列,官方称参数效率提升一倍,并具备较强的推理、编码和智能体能力。该系列还支持一键兼容 Claude Code 框架,更多细节见官方文档。
推荐理由:官方给出 GLM-4.5 的参数效率与推理、编码、智能体能力变化,并说明与 Claude Code 框架的兼容方式。
原文发布 7月24日 22:00
Qwen 通过 Qwen API 推出翻译模型 Qwen-MT(qwen-mt-turbo),基于 Qwen3 并利用数万亿多语言与翻译 token 训练,结合强化学习提升翻译准确度与流畅度。
推荐理由:原文给出 92 种语言支持、术语干预与低至每百万输出 token 0.5 美元的定价,便于评估翻译场景的落地成本。
原文发布 7月22日 21:00
Qwen 发布 Qwen3-Coder,首个最强变体 Qwen3-Coder-480B-A35B-Instruct 是 480B 参数 MoE 模型,激活参数 35B,原生支持 256K 上下文,借助 YaRN 可扩展至 1M token。
推荐理由:原文给出模型规格、上下文长度与开源 CLI 工具,读者可据此判断开源编码模型在智能体任务上的位置。
原文发布 7月15日 20:00
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测以及从语音直接触发函数调用等能力。
推荐理由:Mistral 开源两款语音理解模型,给出与 Whisper、GPT-4o mini、Gemini 2.5 Flash 的基准对比和 API 定价,便于评估替代方案。
原文发布 7月11日 08:00
Kimi 发布最新 MoE 模型 Kimi K2,激活参数 32B、总参数 1T,在非思考类模型的前沿知识、数学和编码上达到 SOTA,并针对智能体任务优化。官方开源 Kimi-K2-Base 基础模型和 Kimi-K2-Instruct 后训练模型,后者适合直接用于通用对话和智能体场景。
推荐理由:原文给出 MoE 参数规模、MuonClip 训练方案与开源权重,读者可据此判断其智能体任务定位与自部署门槛。
原文发布 7月11日 08:00
腾讯混元发布 hunyuan-t1-20250711,官方称其大幅提升高难度数学、逻辑和代码能力,并优化模型输出稳定性、提升长文能力。
推荐理由:官方给出混元 T1 新版本在数学、逻辑、代码和长文能力上的具体提升方向,可据此判断推理型模型的能力变化。
原文发布 7月11日 00:00
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
原文发布 7月9日 08:00
xAI 发布 Grok 4,用户现在可以通过 API 或在 grok.com 上使用该模型。
原文发布 6月26日 22:00
Qwen 发布统一多模态理解与生成模型 Qwen VLo,预览版可通过 Qwen Chat 访问,支持直接文生图和上传图片后按指令修改。该模型采用从左到右、从上到下的渐进式生成方式,支持中英文等多语言指令,可完成风格迁移、背景替换、文字编辑以及检测、分割、边缘提取等任务。官方表示多图输入和极端宽高比生成尚未正式上线,模型仍处预览阶段,存在生成不准确、不遵循指令等不足。
推荐理由:原文给出统一理解与生成模型的预览入口和能力边界,读者可据此判断多模态生成的实际可用程度。
原文发布 6月25日 08:00
腾讯混元上线 hunyuan-a13b,这是混元首个混合推理模型,也是 hunyuan-standard-256K 的升级版本,总参数 80B、激活 13B,采用 MoE 结构。模型默认慢思考模式,可通过参数或在 query 前加 /no_think 切换快慢思考,官方称数学、科学、长文理解和 Agent 能力提升显著。
推荐理由:原文给出混元首个混合推理模型的参数规模与快慢思考切换方式,读者可据此判断其适用场景。