跳到正文

全部动态

今日 7 条
今天9月30日周三
  1. AWS Machine Learning Blog66

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和日常专业工作负载提供更强的推理能力。据 OpenAI 说法,它在 DeepSWE v1.1 上以约五分之一的单任务成本达到 GPT-6 Astra 的水平,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点。

    推荐理由:AWS 官方给出 GPT-6.1 Sol 在 Bedrock 上的可用范围与数据隔离条款,便于评估企业级部署条件。

  2. AWS Machine Learning Blog22

    Amazon Quick 提示词工程基础指南

    Amazon Quick 的提示词工程决定其 AI 功能对自然语言请求的响应质量,适用于自定义智能体、自动化流程和对话式数据分析。文章提出以具体性实现清晰、以业务上下文提升相关性、用示例代替描述等核心原则,并给出 CRISPE 结构化框架,从上下文与约束、角色与职责、意图与输入、步骤与范围等维度组织复杂提示词。

  3. AWS Machine Learning Blog22

    Amazon Quick 各组件提示词工程:模式与陷阱

    AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与范围,并自行拆解子问题、限定数据源;Quick Flows 要写清触发时间、数据源、计算与输出格式,复杂逻辑用编号步骤,并可通过对话迭代修改;Quick Sight 的查询需包含业务问题、指标、维度和可视化偏好。

9月29日周二
  1. Hugging Face Blog62

    NVIDIA 发布表格基础模型 Kumo Tabular,在四个基准排名第一

    NVIDIA 发布开源表格基础模型 Kumo Tabular,面向表格分类与回归,给定带标签的行即可在单次前向传播中预测新行标签,无需训练、调参和特征工程。模型提供 28M 到 215M 三种规模,仅用人工合成表格预训练,通过开源库 structured-data-models 运行,采用 OpenMDW-1.1 许可可商用。

    推荐理由:原文给出模型规模、训练数据来源与四个基准排名,可据此判断表格基础模型相对梯度提升树的工作流差异。

  2. Microsoft Research62

    微软研究院发布 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,由跨序列、结构、功能、细胞状态和成像等多模态数据联合训练的生物学世界模型,以及连接模型、科学工具、文献与实验人员的交互式 harness 组成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验闭环设计,并给出胰腺癌化合物筛选的湿实验验证结果。

  3. Hugging Face Blog29

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源正确",专门捕捉把某来源的事实错误归因到另一来源的跨来源混淆。在医疗智能体 281 条真实 trace 上,专家判定应拦截的 139 条 claim 中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中得分最高。

  4. AWS Machine Learning Blog62

    xAI 的 Grok 4.7 上线 Amazon Bedrock

    xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,支持 Responses、Chat Completions 和 Converse API。

    推荐理由:文章给出 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,读者可据此判断长任务智能体的成本与延迟取舍。

  5. Microsoft Research20

    微软亚洲研究院新加坡分院成立一周年:推进前沿 AI 研究、合作与人才培养

    微软亚洲研究院新加坡分院(MSRA – Singapore)作为微软在东南亚的首个研究实验室,成立一年来围绕下一代 AI 模型与智能体系统、领域专用 AI、AI 原生研究实践、生态与人才培养四大方向展开工作。该实验室与新加坡医疗、金融、教育等领域伙伴合作,推进多模态医疗 AI 与自进化诊断智能体的落地,并获新加坡经济发展局(EDB)支持联合博士培养。

9月28日周一
  1. Mistral AI43

    Mistral 在慕尼黑开设德国中心,推进工业 AI 与 Physics AI

    Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将与 BMW 合作碰撞仿真、与 Siemens Energy 合作工业 AI 应用,并与慕尼黑工业大学(TUM)共建汽车空气动力学数字孪生研究。Mistral 强调其开放权重架构让模型在客户自有基础设施上运行,数据不出组织。

  2. Hugging Face Blog72

    H 公司发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B MoE 两个版本

    H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,均已在 H Models API 上线,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。

    推荐理由:Holo4 同时覆盖 GUI、代码、MCP 与 API 四种接口,并公开全部评测轨迹,便于对照其成本与能力取舍。

9月22日周二
  1. Hugging Face Blog30

    oMLX 作者 Jun Kim 加入 Hugging Face,支持 MLX 社区

    oMLX 作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 社区建设。oMLX 将从副业转为有资金支持的正式项目,仍保持 Apache 2.0 开源协议并由 Jun 继续领导,目标是提升稳定性并加快开发。Hugging Face 计划让 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被不同引擎使用的 MLX 参考实现。

9月21日周一
9月16日周三
  1. Mistral AI56

    Mistral 与 Mozilla 合作,为 Firefox Smart Window 提供模型支持

    Mistral 宣布与 Mozilla 达成合作,Firefox 的 AI 浏览助手 Smart Window(beta)改由 Mistral 模型驱动,先面向法国和北美用户,英国和德国预计今年晚些时候跟进。Smart Window 可帮助理解复杂搜索、找回此前点击离开的重要内容,并基于浏览器标签页整理信息。双方称对话默认不保存在 Mozilla 服务器上,Mistral 等合作方同意零数据保留。

9月10日周四
  1. Mistral AI38

    Mistral 与 Cloudera 达成合作,将主权 AI 引入企业数据平台

    Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境内用专有数据训练定制模型,数据与模型所有权归企业所有。Cloudera 平台承载 30 exabytes 客户自管数据。

9月4日周五
  1. Google Research24

    Google Research 研究跨人群基因组预测的迁移学习策略

    Google Research 用 UK Biobank 约数十万欧洲样本与 Biobank Japan 近 20 万日本样本,在 8 项临床指标上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;遗传相关性高的性状可继续受益于欧洲数据至 25-40k+ 样本,而 HDL、LDL 和血糖等高度人群特异性性状受益有限。

  2. Google Research62

    Google 与 HHMI Janelia 等发布雄性果蝇完整脑连接组图谱

    Google 与 HHMI Janelia、剑桥大学等合作在 Cell 发表论文,发布雄性果蝇脑与中枢神经系统的完整连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的雄性果蝇完整连接组,并说明 AI 重建方法如何降低人工校对成本。

9月3日周四
  1. Google DeepMind66

    Google DeepMind 推出 Fairwind Program,向政府与企业开放 Gemini 3.8 Flash Cyber

    Google 推出 Fairwind Program,面向政府机构、关键基础设施运营商和网络安全合作伙伴限量开放其网络防御能力,首批提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 工具链,用于自主发现、验证并修复漏洞。

    推荐理由:官方披露了受限访问计划的能力组合与准入条件,可据此判断前沿网络防御能力的开放节奏。

8月25日周二
  1. Mistral AI37

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发和 AI 解决方案部署,合作规模达数亿欧元。双方将优先聚焦网络安全与语音领域,并计划开发阿拉伯语表现强劲的前沿模型,Mistral 还将探索使用 HUMAIN 数据中心基础设施满足本地算力需求。双方计划在沙特制定联合市场策略,面向受监管行业推广 AI 解决方案。

8月11日周二
  1. Mistral AI62

    Mistral 推出区域推理端点与优先服务层级,并接入 GLM-5.2 等第三方开源模型

    Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的正常运行时间保障。

    推荐理由:Mistral 把区域推理、优先服务层级与第三方开源模型接入打包成一套主权 AI 方案,可观察欧洲厂商如何用合规与算力承诺做差异化。

7月29日周三
7月26日周日
  1. Berkeley AI Research34

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也显著低于全上下文设置。

7月7日周二
  1. Berkeley AI Research34

    智能免费之后怎么办?面向智能体、由智能体构建、为智能体服务的数据系统

    伯克利 EPIC Data Lab 提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统需应对三大新挑战:为智能体服务、由智能体运行、由智能体构建。其中智能体查询会产生大量重复子计划,在 text-to-SQL 基准上仅 10-20% 子计划不同,80-90% 属重复工作,可通过多查询优化与近似查询处理加以利用。

5月8日周五
4月20日周一
3月13日周五
1月10日周六
  1. Berkeley AI Research32

    伯克利提出信息驱动成像系统设计框架,登 NeurIPS 2025

    伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,仅用带噪测量和噪声模型即可量化系统的信息含量,论文发表于 NeurIPS 2025。该指标在彩色摄影、射电天文、无透镜成像和显微成像四个领域均能预测解码器性能,优化后设计可媲美端到端方法,且内存和算力需求更低、无需任务专用解码器。