跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精选

第 41–52 条 · 共 52 条
9月2日周二
  1. Mistral AI62

    Mistral 为 Le Chat 上线 MCP 连接器目录与 Memories 记忆功能

    Mistral 在 Le Chat 中发布 20 多个基于 MCP 的安全连接器(beta),覆盖数据、生产力、开发、自动化与商务等类别,包括 Databricks、Snowflake、GitHub、Atlassian、Asana、Outlook、Box、Stripe、Zapier 等,并支持添加自定义 MCP 连接器及连接任意远程 MCP 服务器。

    推荐理由:官方给出连接器目录、自定义 MCP 与记忆功能的开放范围,读者可据此判断企业工作流接入方式。

7月30日周三
  1. Mistral AI60

    Mistral 发布 Codestral 25.08 及企业级编码栈

    Mistral AI 发布 Codestral 25.08,并推出覆盖补全、代码语义检索和智能体工作流的企业级编码栈。Codestral 25.08 相比此前版本接受的补全增加 30%,建议后保留代码增加 10%,失控生成减少 50%。

    推荐理由:Mistral 把补全、代码检索和智能体工作流打包成可私有部署的企业编码栈,读者可据此判断自托管 AI 编码方案的落地边界。

7月24日周四
  1. Qwen Blog62

    Qwen 发布翻译模型 Qwen-MT(qwen-mt-turbo)

    Qwen 通过 Qwen API 推出翻译模型 Qwen-MT(qwen-mt-turbo),基于 Qwen3 并利用数万亿多语言与翻译 token 训练,结合强化学习提升翻译准确度与流畅度。

    推荐理由:原文给出 92 种语言支持、术语干预与低至每百万输出 token 0.5 美元的定价,便于评估翻译场景的落地成本。

6月11日周三
6月4日周三
  1. Mistral AI60

    Mistral 发布企业级 AI 编码助手 Mistral Code

    Mistral 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,提供 IDE 插件、本地部署选项与企业管控工具,基于开源项目 Continue 构建。

    推荐理由:Mistral 把模型、IDE 插件与企业管控打包成单一供应商方案,读者可据此判断企业级编码助手的落地路径。

5月28日周三
  1. Mistral AI62

    Mistral AI 发布代码嵌入模型 Codestral Embed

    Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度的取舍方式,便于评估检索成本。

5月27日周二
  1. Mistral AI67

    Mistral 发布 Agents API,内置连接器与多智能体编排

    Mistral 发布 Agents API,将自家语言模型与代码执行、图像生成、文档库、Web 搜索等内置连接器以及 MCP 工具结合,并提供跨对话的持久记忆与智能体编排能力。

    推荐理由:官方给出 Agents API 的内置连接器、状态化对话与多智能体编排能力,读者可据此判断企业级智能体平台的搭建方式。

5月7日周三
  1. Mistral AI60

    Mistral AI 推出 Le Chat Enterprise,由 Mistral Medium 3 驱动

    Mistral AI 发布 Le Chat Enterprise,一款由全新 Mistral Medium 3 模型驱动的企业级 AI 助手,包含企业搜索、Agent 构建器、自定义数据与工具连接器、文档库、自定义模型和混合部署等功能,全部功能将在未来两周内陆续上线。

    推荐理由:官方给出 Le Chat Enterprise 的功能清单与部署方式,可据此判断企业级 AI 助手的集成与私有化选项。

3月7日周五
  1. Mistral AI77

    Mistral AI 发布文档理解 API Mistral OCR

    Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序交错输出文本与图像,并支持将文档作为提示词生成 JSON 等结构化结果。

    推荐理由:官方给出 Mistral OCR 的定价、基准对比与自托管选项,可据此判断多模态文档解析的选型与成本。

1月27日周一
11月15日周五
  1. Qwen Blog75

    Qwen2.5-Turbo 将上下文扩展至 1M tokens

    Qwen2.5-Turbo 发布,上下文长度从 128k 扩展到 1M,约合 100 万英文单词或 150 万汉字。该模型在 1M 长度的 Passkey Retrieval 任务上准确率 100%,RULER 得分 93.1,超过 GPT-4 的 91.6 和 GLM4-9B-1M 的 89.9。

    推荐理由:原文给出上下文从 128k 扩展到 1M 的实测数据与推理加速幅度,可据此判断长文本场景的可用边界。