返回全部动态

大型语言模型创造力自动评估的局限性研究

原标题:The Limits of Automatic Evaluation of Creativity in Large Language Models

arXiv cs.CL一手来源研究质量 82

AI 摘要

博洛尼亚大学和伦敦大学学院的研究人员调查了大型语言模型(LLM)生成文本的创造力自动评估方法的可靠性。他们收集了人类对WritingPrompts数据集中人类和AI生成短故事的11个创造力维度的评估,并与自动客观指标和LLM-as-a-Judge评估进行比较。实验发现自动评估与人类判断存在显著不一致,LLM法官系统性地偏好AI生成的故事,而广泛使用的自动指标与人类判断几乎零相关,凸显了当前创造力自动评估方法的根本局限。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

[Page 1] The Limits of Automatic Evaluation of Creativity in Large Language Models Alessandro Tutone1, Giorgio Franceschelli1, Mirco Musolesi2,1* 1Department of Computer Science and Engineering, University of Bologna, Bologna, Italy. 2Department of Computer Science, University College London,2026 London, United Kingdom. Aug *Correspon


发布时间:2026-08-26 12:00
抓取时间:2026-08-28 10:32
来源机构:arXiv
阅读原文arxiv.org