大型语言模型创造力自动评估的局限性研究
原标题:The Limits of Automatic Evaluation of Creativity in Large Language Models
AI 摘要
博洛尼亚大学和伦敦大学学院的研究人员调查了大型语言模型(LLM)生成文本的创造力自动评估方法的可靠性。他们收集了人类对WritingPrompts数据集中人类和AI生成短故事的11个创造力维度的评估,并与自动客观指标和LLM-as-a-Judge评估进行比较。实验发现自动评估与人类判断存在显著不一致,LLM法官系统性地偏好AI生成的故事,而广泛使用的自动指标与人类判断几乎零相关,凸显了当前创造力自动评估方法的根本局限。
正文节选
[Page 1] The Limits of Automatic Evaluation of Creativity in Large Language Models Alessandro Tutone1, Giorgio Franceschelli1, Mirco Musolesi2,1* 1Department of Computer Science and Engineering, University of Bologna, Bologna, Italy. 2Department of Computer Science, University College London,2026 London, United Kingdom. Aug *Correspon