最新精选
第 161–180 条 · 共 185 条原文发布 9月22日 00:00
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级到 DeepSeek-V3.1-Terminus,前者对应非思考模式,后者对应思考模式。本次更新在保持原有能力的同时修复了用户反馈的问题,包括减少中英文混用和偶发异常字符,并进一步优化 Code Agent 与 Search Agent 的表现。
推荐理由:官方说明了两个接口对应的模式与本次修复项,读者可据此判断升级是否影响现有调用。
原文发布 9月5日 08:00
月之暗面发布 Kimi K2-Instruct-0905,这是 Kimi K2 的最新版本,采用 MoE 架构,激活参数 32B、总参数 1T,上下文窗口从 128k 提升到 256k tokens。
推荐理由:原文给出上下文窗口翻倍与多项编码基准对比,读者可据此判断它在长任务和智能体编码上的位置。
原文发布 9月2日 12:00
Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与商务等类别,包括 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。
推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。
原文发布 8月21日 00:00
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级至 DeepSeek-V3.1,前者对应非思考模式,后者对应思考模式。
推荐理由:官方给出混合推理架构与智能体能力提升,并附 SWE-bench 等基准数据,便于对比版本差异。
原文发布 7月30日 20:00
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、代码语义检索和智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。
推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。
原文发布 7月28日 08:00
智谱发布原生智能体大语言模型 GLM-4.5 系列,官方称参数效率提升一倍,并具备较强的推理、编码和智能体能力。该系列还支持一键兼容 Claude Code 框架,更多细节见官方文档。
推荐理由:官方给出 GLM-4.5 的参数效率与推理、编码、智能体能力变化,并说明与 Claude Code 框架的兼容方式。
原文发布 7月22日 21:00
Qwen 发布 Qwen3-Coder,首个最强变体 Qwen3-Coder-480B-A35B-Instruct 是 480B 参数 MoE 模型,激活参数 35B,原生支持 256K 上下文,借助 YaRN 可扩展至 1M token。
推荐理由:原文给出模型规格、上下文长度与开源 CLI 工具,读者可据此判断开源编码模型在智能体任务上的位置。
原文发布 7月17日 20:00
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑,读者可据此判断其产品线的整合方向。
原文发布 7月11日 08:00
Kimi 发布最新 MoE 模型 Kimi K2,激活参数 32B、总参数 1T,在非思考类模型的前沿知识、数学和编码上达到 SOTA,并针对智能体任务优化。官方开源 Kimi-K2-Base 基础模型和 Kimi-K2-Instruct 后训练模型,后者适合直接用于通用对话和智能体场景。
推荐理由:原文给出 MoE 参数规模、MuonClip 训练方案与开源权重,读者可据此判断其智能体任务定位与自部署门槛。
原文发布 7月11日 00:00
Mistral AI 与 All Hands AI 合作发布 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数与 API 定价,便于对比现有方案。
原文发布 6月25日 08:00
腾讯混元上线 hunyuan-a13b,这是混元首个混合推理模型,也是 hunyuan-standard-256K 的升级版本,总参数 80B、激活 13B,采用 MoE 结构。模型默认慢思考模式,可通过参数或在 query 前加 /no_think 切换快慢思考,官方称数学、科学、长文理解和 Agent 能力提升显著。
推荐理由:原文给出混元首个混合推理模型的参数规模与快慢思考切换方式,读者可据此判断其适用场景。
原文发布 6月20日 08:00
Kimi 发布自主智能体 Kimi-Researcher,基于内部版 Kimi k 系列模型,完全通过端到端智能体强化学习训练,在 Humanity's Last Exam 上取得 Pass@1 26.9%、Pass@4 40.17% 的成绩,从初始 8.6% 几乎全部由 RL 训练提升而来。
推荐理由:原文给出端到端智能体 RL 训练的完整路径与 HLE 成绩,读者可据此判断自主搜索智能体的能力边界。
原文发布 6月4日 20:00
Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项与企业管控工具,基于开源项目 Continue 构建。
推荐理由:Mistral 把模型、IDE 插件与企业管控打包成单一供应商方案,读者可据此判断企业级编码助手的落地路径。
原文发布 5月27日 20:00
Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。
推荐理由:官方给出 Agents API 的内置连接器、状态化对话与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。
原文发布 5月21日 20:00
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
原文发布 5月7日 20:00
Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。
推荐理由:官方给出 Le Chat Enterprise 的功能清单与部署方式,可据此判断企业级 AI 助手的集成与私有化选项。
原文发布 4月29日 04:00
Qwen 发布 Qwen3 系列,旗舰 MoE 模型 Qwen3-235B-A22B 在编码、数学和通用能力评测中与 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等模型表现相当。
推荐理由:原文给出 Qwen3 全系开源规格、混合思考模式与预训练数据规模,便于读者判断其与同级模型的定位差异。
原文发布 4月16日 08:00
腾讯混元推出旗舰大模型新版本 hunyuan-turbos-20250416,预训练底座升级,增强指令理解与遵循能力。对齐阶段提升数学、代码、逻辑、科学等理科能力,并改进文创写作、文本理解、翻译准确率和知识问答等文科能力。该版本还增强各领域 Agent 能力,重点加强多轮对话理解。
推荐理由:官方给出混元 TurboS 新版本在理科能力、文科能力和 Agent 多轮对话上的具体升级方向,便于判断是否值得切换。
原文发布 3月28日 00:00
Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。
推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。
原文发布 3月6日 00:00
Qwen 发布 QwQ-32B,一个 320 亿参数的推理模型,官方称其性能可与 6710 亿参数(激活 370 亿)的 DeepSeek-R1 相比。该模型以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源权重,并可通过 Qwen Chat 使用。
推荐理由:原文给出 32B 模型对标 671B 的评测结果与两阶段 RL 训练方法,可据此判断小模型推理路线的可行性。