跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

83条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 61–80 条 · 共 83 条
11月11日周二
  1. 腾讯混元官方动态60

    原文发布 11月11日 08:00

    腾讯混元 HY 2.0 Instruct 上线

    腾讯混元 HY 2.0 Instruct 上线,模型底座从 TurboS 升级为混元2.0,模型能力全面提升。官方称该版本显著增强了指令遵循、多轮及长文理解、文学创作、知识准确性、代码及推理能力。

    推荐理由:原文列出混元2.0底座替换与能力提升方向,读者可据此判断该版本在指令遵循和长文理解上的变化。

10月27日周一
  1. MiniMax 官方 Blog82

    原文发布 10月27日 08:00

    MiniMax 开源并发布 MiniMax M2,主打 Agent 与编码

    MiniMax 正式开源并发布 MiniMax M2,定位为面向 Agent 与编码的模型,API 定价为每百万输入 token $0.30、每百万输出 token $1.20,约为 Claude 4.5 Sonnet 的 8%,推理速度接近其两倍。

    推荐理由:原文给出 M2 的定价、推理速度与开源权重,读者可据此判断它在 Agent 与编码场景中的成本位置。

9月30日周二
  1. Z.ai 官方发布65

    原文发布 9月30日 08:00

    智谱发布旗舰编码模型 GLM-4.6

    智谱发布旗舰编码模型 GLM-4.6,在公开基准和真实编程任务上表现提升,官方称其为中国领先的编码模型。此次更新将上下文窗口扩展至 200K,以更好处理更长的代码和复杂智能体任务。

    推荐理由:原文给出 GLM-4.6 在公开基准与真实编程任务上的提升,以及 200K 上下文窗口对长代码和复杂智能体任务的意义。

9月5日周五
7月30日周三
  1. Mistral AI60

    原文发布 7月30日 20:00

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08,并推出覆盖补全、代码语义检索和智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。

    推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。

7月28日周一
  1. Z.ai 官方发布73

    原文发布 7月28日 08:00

    智谱发布 GLM-4.5 系列模型

    智谱发布原生智能体大语言模型 GLM-4.5 系列,官方称参数效率提升一倍,并具备较强的推理、编码和智能体能力。该系列还支持一键兼容 Claude Code 框架,更多细节见官方文档。

    推荐理由:官方给出 GLM-4.5 的参数效率与推理、编码、智能体能力变化,并说明与 Claude Code 框架的兼容方式。

7月22日周二
  1. Qwen Blog82

    原文发布 7月22日 21:00

    Qwen3-Coder 发布:480B MoE 编码模型与 Qwen Code 命令行工具开源

    Qwen 发布 Qwen3-Coder,首个最强变体 Qwen3-Coder-480B-A35B-Instruct 是 480B 参数 MoE 模型,激活参数 35B,原生支持 256K 上下文,借助 YaRN 可扩展至 1M token。

    推荐理由:原文给出模型规格、上下文长度与开源 CLI 工具,读者可据此判断开源编码模型在智能体任务上的位置。

7月11日周五
  1. 腾讯混元官方动态62

    原文发布 7月11日 08:00

    腾讯发布 hunyuan-t1-20250711 模型

    腾讯混元发布 hunyuan-t1-20250711,官方称其大幅提升高难度数学、逻辑和代码能力,并优化模型输出稳定性、提升长文能力。

    推荐理由:官方给出混元 T1 新版本在数学、逻辑、代码和长文能力上的具体提升方向,可据此判断推理型模型的能力变化。

6月17日周二
  1. Kimi 官方 Blog71

    原文发布 6月17日 08:00

    Kimi 发布开源编码模型 Kimi-Dev-72B,SWE-bench Verified 达 60.4%

    Kimi 发布开源编码大模型 Kimi-Dev-72B,在 SWE-bench Verified 上取得 60.4% 的成绩,在开源模型中达到新的 state-of-the-art。该模型通过大规模强化学习优化,在 Docker 中自主修复真实代码仓库,只有整个测试套件通过时才获得奖励。模型已在 Hugging Face 和 GitHub 开放下载与部署。

    推荐理由:原文给出开源编码模型在 SWE-bench Verified 上的成绩与训练方式,读者可据此判断其代码修复能力。

6月4日周三
  1. Mistral AI60

    原文发布 6月4日 20:00

    Mistral 发布企业级 AI 编码助手 Mistral Code

    Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项与企业管控工具,基于开源项目 Continue 构建。

    推荐理由:Mistral 把模型、IDE 插件与企业管控打包成单一供应商方案,读者可据此判断企业级编码助手的落地路径。

5月28日周三
  1. Mistral AI62

    原文发布 5月28日 20:00

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度的取舍方式,便于评估检索成本。

5月21日周三
  1. Mistral AI76

    原文发布 5月21日 20:00

    Mistral AI 与 All Hands AI 发布 Devstral 智能体编码模型

    Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。

    推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。

5月20日周二
  1. 腾讯混元官方动态60

    原文发布 5月20日 08:00

    腾讯混元发布 hunyuan-turbos-20250515 模型

    腾讯混元发布 hunyuan-turbos-20250515,采用长短思维链自适应融合,全面提升数学、代码、逻辑和科学等理科效果,文科效果维持。效果指标上,数学 ood 测试集提升 7%,逻辑难题提升 5%,代码能力及体验提升 5%,科学提升 8%。

    推荐理由:原文给出混元 turbos 新版本在数学、代码、逻辑和科学上的具体提升幅度,可据此判断理科能力变化。

4月3日周四
  1. 腾讯混元官方动态60

    原文发布 4月3日 08:00

    腾讯混元推出 hunyuan-t1-20250403 模型

    腾讯混元推出 hunyuan-t1-20250403,全面提升文本生成能力、文本逻辑严谨性与专业规范性,并强化项目级代码生成能力。该版本还优化了多轮 ToB 场景理解。

    推荐理由:官方给出 hunyuan-t1-20250403 的能力更新方向,读者可据此判断它在代码生成与 ToB 多轮场景上的变化。

3月24日周一
  1. DeepSeek 官方更新80

    原文发布 3月24日 00:00

    DeepSeek 将 deepseek-chat 升级至 DeepSeek-V3-0324

    DeepSeek 官方将 deepseek-chat 模型升级至 DeepSeek-V3-0324,推理能力显著提升,MMLU-Pro 从 75.9 升至 81.2,GPQA 从 59.1 升至 68.4,AIME 从 39.6 升至 59.4,LiveCodeBench 从 39.2 升至 49.2。

    推荐理由:官方给出 DeepSeek-V3-0324 在推理、编码和中文写作上的基准变化,可据此判断升级幅度。

11月12日周二
  1. Qwen Blog82

    原文发布 11月12日 00:00

    Qwen2.5-Coder 系列开源,32B 版本对标 GPT-4o

    阿里开源 Qwen2.5-Coder 系列,新增 0.5B、3B、14B、32B 四个尺寸,加上此前的 1.5B 和 7B 共覆盖六种规模。旗舰 Qwen2.5-Coder-32B-Instruct 在 EvalPlus、LiveCodeBench、BigCodeBench 等代码生成基准上取得开源模型最佳成绩,Aider 代码修复得分 73.7,与 GPT-4o 表现相当。

    推荐理由:官方给出六种尺寸的完整规格与多项基准成绩,读者可据此判断开源代码模型当前的可用边界。

9月19日周四
  1. Qwen Blog88

    原文发布 9月19日 00:00

    Qwen 发布 Qwen2.5 系列基础模型

    Qwen 团队发布 Qwen2.5 系列开源模型,包含语言模型 Qwen2.5(0.5B 到 72B)、代码模型 Qwen2.5-Coder 和数学模型 Qwen2.5-Math,除 3B 和 72B 外均采用 Apache 2.0 许可。

    推荐理由:原文给出 Qwen2.5 全系列尺寸、开源许可与基准对比,读者可据此判断开源模型与闭源模型的差距。

  2. Qwen Blog71

    原文发布 9月19日 00:00

    Qwen2.5-Coder 开源发布,含 1.5B 与 7B 版本

    Qwen 发布新一代开源代码模型 Qwen2.5-Coder,提供 1.5B、7B 两个版本,32B 版本即将推出,同时将 CodeQwen 正式更名为 Qwen-Coder。

    推荐理由:原文给出 1.5B 与 7B 开源版本、5.5 万亿 token 训练规模和多项基准对比,可据此判断开源代码模型当前水平。

9月5日周四
  1. DeepSeek 官方更新71

    原文发布 9月5日 00:00

    DeepSeek V2 Chat 与 Coder V2 合并升级为 DeepSeek V2.5

    DeepSeek 将 DeepSeek V2 Chat 和 DeepSeek Coder V2 合并升级为新模型 DeepSeek V2.5,API 用户仍可通过 deepseek-coder 或 deepseek-chat 访问以保持向后兼容。

    推荐理由:原文列出 V2.5 合并升级后的多项基准变化,读者可据此判断通用与编码能力的提升幅度。