最新精选
第 141–160 条 · 共 197 条原文发布 6月20日 08:00
Kimi 发布自主智能体 Kimi-Researcher,基于内部版 Kimi k 系列模型,完全通过端到端智能体强化学习训练,在 Humanity's Last Exam 上取得 Pass@1 26.9%、Pass@4 40.17% 的成绩,从初始 8.6% 几乎全部由 RL 训练提升而来。
推荐理由:原文给出端到端智能体 RL 训练的完整路径与 HLE 成绩,读者可据此判断自主搜索智能体的能力边界。
原文发布 6月17日 08:00
Kimi 发布开源编码大模型 Kimi-Dev-72B,在 SWE-bench Verified 上取得 60.4% 的成绩,在开源模型中达到新的 state-of-the-art。该模型通过大规模强化学习优化,在 Docker 中自主修复真实代码仓库,只有整个测试套件通过时才获得奖励。模型已在 Hugging Face 和 GitHub 开放下载与部署。
推荐理由:原文给出开源编码模型在 SWE-bench Verified 上的成绩与训练方式,读者可据此判断其代码修复能力。
原文发布 6月10日 20:00
Mistral AI 发布首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和面向企业的 Magistral Medium。
推荐理由:Mistral AI 首款推理模型同时给出开源版与商用版,并公开训练论文,读者可据此判断其推理能力与开放程度。
原文发布 6月5日 21:00
Qwen3 Embedding 系列发布,包含 0.6B、4B、8B 三种尺寸的文本嵌入与重排模型,基于 Qwen3 基础模型构建,以 Apache 2.0 协议在 Hugging Face 和 ModelScope 开源,技术报告与代码已发布在 GitHub。
推荐理由:原文给出 Qwen3 Embedding 系列的尺寸、评测分数与开源入口,读者可据此判断它在检索与重排任务上的选型空间。
原文发布 5月28日 20:00
Mistral AI 发布首个面向代码的嵌入模型 Codestral Embed,官方称其在真实代码检索任务上优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
推荐理由:官方给出代码嵌入模型与三家竞品的对比,以及维度与精度的取舍方式,便于评估检索成本。
原文发布 5月28日 00:00
DeepSeek 官方将 deepseek-reasoner 模型升级至 DeepSeek-R1-0528,多项基准的 Pass@1 明显提升:AIME 2025 从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0,LCB_v6 从 63.5 升至 73.3,Aider 从 57.0 升至 71.6。
推荐理由:官方给出 R1-0528 在 AIME、GPQA、Aider 等基准上的具体提升幅度,可据此判断推理与代码能力的变化。
原文发布 5月21日 20:00
Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,超过此前开源 SOTA 逾 6 个百分点,并在同一 OpenHands 测试框架下超过 Deepseek-V3-0324(671B)和 Qwen3 232B-A22B。
推荐理由:Devstral 在 SWE-Bench Verified 上以 46.8% 超过此前开源 SOTA 逾 6 个百分点,并给出单卡 4090 可跑的本地部署路径。
原文发布 5月21日 08:00
腾讯混元发布 hunyuan-t1-20250521 最新版本,数学、代码、科学和知识问答能力显著增强。该版本还优化了文科数据,提升文创与文本理解能力。
推荐理由:官方给出混元T1新版本在数学、代码、科学和知识问答上的能力变化,可据此判断升级方向。
原文发布 5月20日 08:00
腾讯混元发布 hunyuan-turbos-20250515,采用长短思维链自适应融合,全面提升数学、代码、逻辑和科学等理科效果,文科效果维持。效果指标上,数学 ood 测试集提升 7%,逻辑难题提升 5%,代码能力及体验提升 5%,科学提升 8%。
推荐理由:原文给出混元 turbos 新版本在数学、代码、逻辑和科学上的具体提升幅度,可据此判断理科能力变化。
原文发布 5月7日 20:00
Mistral AI 发布 Mistral Medium 3,称其在多项基准上达到 Claude Sonnet 3.7 的 90% 以上,价格为每百万 token 输入 0.4 美元、输出 2 美元。
推荐理由:官方给出 Mistral Medium 3 的定价、对标模型与部署门槛,可据此判断企业自部署的成本与可行性。
原文发布 4月29日 04:00
Qwen 发布 Qwen3 系列,旗舰 MoE 模型 Qwen3-235B-A22B 在编码、数学和通用能力评测中与 DeepSeek-R1、o1、o3-mini、Grok-3、Gemini-2.5-Pro 等模型表现相当。
推荐理由:原文给出 Qwen3 全系开源规格、混合思考模式与预训练数据规模,便于读者判断其与同级模型的定位差异。
原文发布 4月26日 08:00
Kimi 发布开源音频基础模型 Kimi-Audio-7B,在单一框架内统一处理语音识别、音频理解、音频描述、情感识别、声事件分类和端到端语音对话等任务。模型基于 Qwen 2.5 7B 初始化,预训练数据超过 1300 万小时音频与文本,采用连续声学向量加离散语义 token 的混合输入和并行文本与音频 token 生成头。
推荐理由:原文给出开源音频基础模型的架构、13M 小时预训练规模和多项基准对比,读者可据此判断统一音频处理框架的当前水平。
原文发布 4月16日 08:00
腾讯混元推出旗舰大模型新版本 hunyuan-turbos-20250416,预训练底座升级,增强指令理解与遵循能力。对齐阶段提升数学、代码、逻辑、科学等理科能力,并改进文创写作、文本理解、翻译准确率和知识问答等文科能力。该版本还增强各领域 Agent 能力,重点加强多轮对话理解。
推荐理由:官方给出混元 TurboS 新版本在理科能力、文科能力和 Agent 多轮对话上的具体升级方向,便于判断是否值得切换。
原文发布 4月10日 08:00
Kimi 发布开源 MoE 视觉语言模型 Kimi-VL,语言解码器仅激活 2.8B 参数,支持 128K 上下文和原生分辨率视觉编码器 MoonViT。基于长 CoT SFT 与 RL 的 Kimi-VL-Thinking 在 MMMU 得 61.7、MathVista 得 71.3。
推荐理由:原文给出 Kimi-VL 系列在激活参数仅 2.8B 下的多模态与长上下文成绩,可对照同量级 VLM 的能力边界。
原文发布 4月3日 08:00
腾讯混元推出 hunyuan-t1-20250403,全面提升文本生成能力、文本逻辑严谨性与专业规范性,并强化项目级代码生成能力。该版本还优化了多轮 ToB 场景理解。
推荐理由:官方给出 hunyuan-t1-20250403 的能力更新方向,读者可据此判断它在代码生成与 ToB 多轮场景上的变化。
原文发布 3月28日 00:00
Qwen 正式发布视觉推理模型 QVQ-Max 的首个版本,可理解图像和视频内容并进行分析推理,覆盖数学题、代码、创作等场景。官方称通过调整模型思考过程的最大长度,其在 MathVision 多模态数学基准上的准确率持续提升。后续将聚焦更准确的观察、可操作手机或电脑的视觉 Agent 以及工具验证、视觉生成等交互方式。
推荐理由:官方给出 QVQ-Max 的视觉推理能力定位与后续路线,读者可据此判断多模态推理模型的当前边界。
原文发布 3月27日 00:00
Qwen 团队发布端到端全模态模型 Qwen2.5-Omni,可处理文本、图像、音频和视频输入,并以流式方式同时输出文本与自然语音。该模型采用 Thinker-Talker 架构,并提出 TMRoPE 位置嵌入来同步视频与音频时间戳,支持分块输入和即时输出的实时交互。
推荐理由:原文给出 Thinker-Talker 架构与实时语音视频交互能力,读者可据此判断端到端全模态模型的落地方式。
原文发布 3月24日 00:00
Qwen 团队以 Apache 2.0 许可开源 Qwen2.5-VL-32B-Instruct,在 Qwen2.5-VL 系列基础上用强化学习继续优化。
推荐理由:官方给出 32B 视觉语言模型的基准对比与演示案例,可据此判断同规模开源多模态模型的当前水平。
原文发布 3月24日 00:00
DeepSeek 官方将 deepseek-chat 模型升级至 DeepSeek-V3-0324,推理能力显著提升,MMLU-Pro 从 75.9 升至 81.2,GPQA 从 59.1 升至 68.4,AIME 从 39.6 升至 59.4,LiveCodeBench 从 39.2 升至 49.2。
推荐理由:官方给出 DeepSeek-V3-0324 在推理、编码和中文写作上的基准变化,可据此判断升级幅度。
原文发布 3月21日 08:00
腾讯发布 hunyuan-t1-20250321,称其为腾讯首个推理模型,全面构建模型文理科能力,长文本信息捕捉能力强。该模型支持推理解答数学、逻辑推理、科学、代码等不同难度的科学问题。
推荐理由:腾讯首个推理模型的能力定位与长文本信息捕捉特点,可供读者对照当前推理模型格局。