热点事件持续更新
Extropic开源热力学编程栈并后训练Qwen模型
1 篇报道1 个报道来源8 小时前更新
先了解这件事
AI 综述
2026年10月2日,Extropic 公布对 Qwen3.6-35B-A3B 进行强化学习后训练的工作,用约 50 个改编自 Hinton 传统经典连接主义实验(含 Boltzmann machine 与 wake-sleep)的编码任务,以 GRPO 目标训练,由 Nemotron 3 Super 120B 担任 LLM judge 打分,奖励为 0.7×执行分 + 0.3×评分表分,用以复现 Hinton 经典实验、探索热力学递归智能。报道未披露训练规模、耗时或评测结果等更多细节。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 01:00
Extropic 披露以 RL 后训练 Qwen3.6-35B-A3B,复现 Hinton 经典连接主义实验。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- Tavily News DiscoveryExtropic 用 RL 后训练 Qwen3.6-35B-A3B 复现 Hinton 经典实验,探索热力学递归智能
Extropic 对 Qwen3.6-35B-A3B 进行 RL 后训练,用约 50 个改编自 Hinton 传统经典连接主义实验(含 Boltzmann machine 与 wake-sleep)的编码任务,以 GRPO 目标训练、Nemotron 3 Super 120B 作 LLM judge 打分,奖励为 0.7×执行分 + 0.3×评分表分。
本事件热度走势
当前热度 8·可比范围峰值 9(10月2日 06:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。