返回全部动态

FinProBench:基于专业交付物的角色接地评分标准评估金融 AI 智能体

原标题:FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables

arXiv cs.AI一手来源研究质量 81

AI 摘要

arXiv 发布了一项名为 FinProBench 的金融 AI 智能体评估基准,并提出了角色接地评分标准构建(RGRC)流程,从专业人员的交付物中提取评分标准。实验表明,RGRC 在专业角色任务上显著优于仅用提示词的方法(99.1% vs 78.0%),而在常规角色上两者接近。该基准包含 1,723 个交付物,覆盖 57 个职业,初步评估集包含 20 个任务,人类交付物平均得分最高(73.7),且角色级评分标准复用可将构建成本降低 6.7 倍。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Computer Science > Artificial Intelligence Title:FinProBench: Evaluating Financial AI Agents with Role-Grounded Rubrics Derived from Professional Deliverables View PDF HTML (experimental) Abstract:Evaluating financial AI agents requires criteria aligned with real professional work. Existing rubric methods typically derive criteria from task prompts or model outputs, overlooking tacit standards visible only in practitioner deliverables. We introduce FinProBench, a benchmark for profes


发布时间:2026-08-06 12:00
抓取时间:2026-08-06 21:15
来源机构:arXiv
阅读原文arxiv.org