Benchmark Radar:AI 评测基准的活数据库与搜索引擎
原标题:Paper page - Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation
AI 摘要
研究者发布 Benchmark Radar,一个面向 AI 评测基准的可搜索活数据库与发现引擎,聚合来源、分数历史与证据以支持基准选择与比较。系统每日从 37 个来源(13 个直连、24 个一方研究/工程源)发现基准论文、仓库、数据集与发布,目录含 1,283 条来源记录、790 条记录上的 12,916 个数值观测。作者审计了完整目录,并分析基准饱和、采用趋势与分数比较的局限,同时发布网页仪表盘、排行榜、Pareto 前沿视图、CLI 与可复现分析。
正文节选
Benchmark Radar: A Living Database and Search Engine for AI Benchmarks and Evaluation Abstract Benchmark Radar is a searchable living database and discovery engine for AI evaluation benchmarks that aggregates sources, score histories, and evidence to support benchmark selection and comparison. Benchmark researchers and developers of large language models (LLMs) and other AI systems need to find relevant evaluations, locate their benchmark datasets and code, and understand the settings behind rep