跳到正文
原文
Google Research·AI 评分38

Google 研究:评估 LLM 行为倾向与人类的对齐程度

Evaluating alignment of behavioral dispositions in LLMs

AI 导读

Google Research 提出一套框架,用心理学问卷改编的情境判断测试(SJT)评估 LLM 行为倾向与人类共识的对齐程度,覆盖共情、情绪调节等特质。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在无共识时无法覆盖人类意见的分布范围。在人类一致同意的场景中,小模型(<120B)与前沿闭源模型对齐度接近完美,但共识低于 90% 时对齐度停滞在 80% 出头。

来源:Google Research · research.google