跳到正文

#推理

今日 0 条
9月16日周三
  1. Google Research32

    Google Research 提出 Retrieve-for-Train:用 RL 编译扩散检索器绕过推理瓶颈

    Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需生成 CoT 推理 token。该方法基于 Gemma3-4B 和 Qwen3-4B 微调扇出语言模型,以集合级属性奖励评估整组结果,相关论文已被 ICML 2026 收录。

8月17日周一
8月13日周四
  1. Microsoft Research40

    MindTopo:微软研究院推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,模型难以在场景变化中持续追踪结构关系。图像与视频生成工具仅在单帧内保留拓扑关系时有用,跨序列仍不可靠。

7月26日周日
  1. Berkeley AI Research34

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效完成长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要内容隔离为自然语言"信念状态"并加以监督,以替代完整交互历史作为智能体工作上下文。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将相对全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值 token 长度也显著低于全上下文设置。

4月20日周一
3月13日周五