Tavily News Discovery·· 9 小时前AI 评分38
Extropic 用 RL 后训练 Qwen3.6-35B-A3B 复现 Hinton 经典实验,探索热力学递归智能
First Sparks of Thermodynamic Recursive Intelligence | Extropic
AI 导读
Extropic 对 Qwen3.6-35B-A3B 进行 RL 后训练,用约 50 个改编自 Hinton 传统经典连接主义实验(含 Boltzmann machine 与 wake-sleep)的编码任务,以 GRPO 目标训练、Nemotron 3 Super 120B 作 LLM judge 打分,奖励为 0.7×执行分 + 0.3×评分表分。
来源:Tavily News Discovery · extropic.ai