ToMAS:从多智能体LLM失败中构建心智理论基准的试点
原标题:ToMAS: A Pilot Failure-Grounded Theory-of-Mind Benchmark from Multi-Agent LLM Failures
AI 摘要
该论文提出 ToMAS,一个从多智能体 LLM 失败案例中构建心智理论(ToM)基准的试点流程。作者将 MAST-Data 中标注为 FC2(智能体间错位)的执行轨迹,按四条可转换性标准筛选,从 242 条合格训练轨迹中生成 39 个 Clean 条目,标注者间原始一致率为 94.4%。随后用 Qwen2.5-1.5B 做小规模 GRPO 可行性实验,但事后检查发现 LoRA 更新在所用学习率下数值上可忽略,所有条件解码结果与未训练检查点相同,因此该实验无法证明训练效果,仅报告了可执行流程及两个局限:训练与评估条目间的来源差距,以及基于词汇重叠的评分。
正文节选
ToMAS: A Pilot Failure-Grounded Theory-of-Mind Benchmark from Multi-Agent LLM Failures Abstract LLM-based multi-agent systems can fail even when communication succeeds because agents do not correctly track their peers’ roles, knowledge, or intentions. We investigate whether such inter-agent misalignment cases, labelled FC2 in MAST-Data, can be converted into functional partner-state reasoning items. ToMAS applies four explicit convertibility criteria to diagnosed execution traces. A full convers