FinProBench:基于专业交付物的角色接地评分标准评估金融 AI 智能体
原标题:FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables
AI 摘要
arXiv 发布了一项名为 FinProBench 的金融 AI 智能体评估基准,并提出了角色接地评分标准构建(RGRC)流程,从专业人员的交付物中提取评分标准。实验表明,RGRC 在专业角色任务上显著优于仅用提示词的方法(99.1% vs 78.0%),而在常规角色上两者接近。该基准包含 1,723 个交付物,覆盖 57 个职业,初步评估集包含 20 个任务,人类交付物平均得分最高(73.7),且角色级评分标准复用可将构建成本降低 6.7 倍。
正文节选
Computer Science > Artificial Intelligence Title:FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables View PDF HTML (experimental) Abstract:Evaluating financial AI agents requires criteria aligned with real professional work. Existing rubric methods typically derive criteria from task prompts or model outputs, overlooking tacit standards visible only in practitioner deliverables. We introduce FinProBench, a benchmark for profes