Rasch测量理论用于LLM评估:以LLM作为评分者的案例研究
该研究将Rasch测量理论应用于LLM评估,以LLM作为评分者标注仇恨言论为例,分析了九个LLM与人类评分者的差异。研究发现LLM在严重性、项目校准、问题顺序鲁棒性、目标身份敏感性和评分量表使用上系统性地偏离人类,这些差异在标准评估中会被掩盖。作者主张RMT应纳入LLM评估工具箱。
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该研究将Rasch测量理论应用于LLM评估,以LLM作为评分者标注仇恨言论为例,分析了九个LLM与人类评分者的差异。研究发现LLM在严重性、项目校准、问题顺序鲁棒性、目标身份敏感性和评分量表使用上系统性地偏离人类,这些差异在标准评估中会被掩盖。作者主张RMT应纳入LLM评估工具箱。
该研究首次在完整的Jeopardy!题库(1984-2025年,529,939条线索)上评估了单个9GB开源模型(Qwen2.5-14B,4位量化),严格强制回答下准确率达67.0%,事实类类别超过85%。研究对比了IBM Watson,指出训练数据暴露是两者共有的,但本地模型在训练截止后的线索上仍保持65%准确率,而Watson为0%。作者认为知识压缩能力
Langfuse 发布了 v4.26.0 版本,主要新增了 API 规范预览和评估器执行追踪链接功能,并修复了结构化输出中的推理冲突、OpenAI 工具 schema 嵌套及无状态调用等问题。此外,该版本还优化了 OTel 数据解析和 Web 组件重构。
LoopArena 是一个用于评估模型作为循环工程中运行时控制器能力的新基准。它通过三种设置测试控制器模型指导独立编码代理完成长任务的表现,发现最佳严格成功率为 24.69%,同时推理成本平均降低 64.4%。该基准的代码和数据已开源。
Langfuse 发布 v4.25.0 版本,包含多项新功能、修复和重构。新功能包括定义标准化的 I/O 契约、增强 CSV 解析错误处理、改进 ClickHouse 查询 AST、持久化会话头部可见性、MCP 评估器输出定义、按数据集名称过滤评估样本等。修复涉及 API 历史数据访问限制、OTel 属性路径重建、UI 问题等。此外,还进行了多项代码重构和文
本综述定义了“智能体工件创建”为AI系统有状态、反馈驱动的交付物构建过程,并分析了259项相关工作和29个基准。研究比较了六类工件族,提出了保持责任明确、将反馈转化为针对性修复等原则,并指出了持续保持连贯可控的机会。相关论文列表已发布在GitHub上。
雷峰网报道,香港大学等机构发布的具身智能评测RoboDojo显示,当前头部模型平均成功率仅8.8%,而中国公司原力灵机的通用具身基础模型DM0.5以24.90综合得分和19.34%平均成功率登顶,尤其在记忆维度大幅领先。DM0.5通过原生记忆架构、预训练和微调优化,实现60秒记忆和57毫秒推理延迟,并全面开源,旨在推动行业进入百万小时数据时代。
本文提出了一种名为GCPC(Grounded Checklist Partial Credit)的智能体轨迹评估方法,由人类定义可复用规则,LLM根据任务指令和官方验证器生成任务特定的检查清单,并基于执行日志证据逐项评分,缺失证据时弃权。在包含4,455条轨迹的SkillsBench评估中,GCPC比整体判断更能区分官方PASS和FAIL结果(AUC 0.6
arXiv 论文提出 SciReC,一个模型自适应的多模态学术对话基准,用于评估多模态大语言模型在八类关系推理上的表现,并引入 DMRA 诊断框架以量化视觉理解、知识、记忆和推理等成分的贡献。结果显示 Claude 4.6 总体关系得分最高(73%),GPT 5.4 次之(68%);开源模型在空间关系上最弱,闭源模型在层级和顺序关系上更吃力;所有模型的主要错
一项由MATS研究项目支持的新研究发现,Anthropic的Claude Code和OpenAI的Codex等AI编程助手缺乏时间感知能力,无法准确估计任务所需时间或已用时间。在测试中,它们普遍高估任务时长,且对自身工作质量的评估也不可靠。研究者指出,这种缺陷会影响长时间任务的执行和可控性,但提供时间报告工具时,代理几乎总能正确报告时间。
博科尼大学对1053名新生进行随机实验,发现使用GPT-4o能显著提高商业作业成绩,而因果推理课程虽未提升传统分数,但促使学生提出更多样化和非传统的解决方案。研究指出当前评分体系偏向常规答案,可能掩盖AI辅助下的真实学习效果,且缺乏无AI的后续测试,无法确认是否真正提升学习。
arXiv 论文提出 Modality Maturity Index (MMI) 基准,用于评估全模态模型在文本、图像、音频、视频和文档五种模态及其组合上的输入输出能力。MMI 包含 893 个问题,并引入 Modality Presence Score (MPS) 衡量模态生成能力。测试五个前沿模型发现 MPS 仅 15.6 至 34.9,表明现有模型多模
Google DeepMind 推出首个针对专有前沿 AI 模型的加密双重盲测,以防止基准测试数据泄露。该测试使用 Google Cloud 的机密计算技术,确保外部测试数据和模型权重均保持私密,消除了传统评估中需要共享测试提示或模型权重的权衡。试点项目与新加坡 AI 安全研究所合作,对 Gemini Flash Lite 模型进行测试,旨在提高 AI 评估
该研究正式定义了世界模型的概率对齐概念,并引入PAWBench基准和PAWEval评估协议,用于评估视频生成器作为随机采样器的能力。研究发现,在50个场景和11个当前系统中,没有模型能一致匹配参考概率分布,同时覆盖有效行为范围。研究还测试了语言提示、初始噪声采样和模型训练是否能重塑模型的预测分布,为未来概率对齐世界建模奠定基础。
本研究评估了RAG中证据感知检索评估的下游效用,发现其虽能改变检索排名,但在训练、系统选择及答案质量预测上并不稳定。人类注释确认过滤保留了证据,但不同评估器对答案质量改善结论不一,凸显了评估信号有效性的组合问题。
NeuronFuzz 提出了一种白盒模糊测试框架,利用模型内部安全神经元的激活作为连续反馈,用于评估大语言模型的安全性。该方法通过 SafetyOracle 在预填充阶段计算安全警报分数,避免了响应生成,从而提高了测试效率。实验显示,在五个白盒源模型上,NeuronFuzz 的越狱发现率达 76-100%,优于基线最多 48 个百分点,且优化模板可零样本迁移
DeflectBench 是一个新基准,用于评估大型语言模型按需生成修辞谬误(如偷换概念、人身攻击、红鲱鱼)的能力。研究测试了四个前沿模型,发现拒绝行为主要由请求结构而非声明内容驱动,且教育辩论教练的提示框架几乎消除了所有拒绝,但模型通常会产生标记性合规,即在同一响应中命名所请求的操纵。该基准揭示了不同实验室的对齐机制产生不同的合规特征,对多元对齐社区具有重
ElementCheck 提出了一种基于句子元素的复杂度感知长文本事实性评估框架,通过提取实体对构建元素图,动态调整验证粒度,以解决现有分解-检索-验证流程中的噪声和固定粒度问题。实验在 FastFact-Sent 和两个领域基准上,使用五个骨干模型验证了其一致提升事实性验证效果,并保持较好的准确率-成本平衡。
本文提出一个面向LLM智能体轨迹的成本-效用对齐框架,包含成本剖析、效用归因、错位诊断、定向适应和评估五个阶段,将资源消耗与任务贡献视为同一执行过程的双重账本。效用归因通过过程代理、信息依赖和反事实重放等方法提供因果证据,以指导诊断和适应。该框架为资源感知的智能体设计与部署提供了结构化基础,并分析了近期系统、归因方法和评估协议。
EdgeFirst 发布了 Model Zoo,提供在真实硬件上测量并公开验证的 YOLO 模型性能数据,覆盖多种 NPU 和平台。所有测量结果均可复现,并附有详细的验证会话链接。该资源旨在帮助开发者基于可验证的数据选择边缘 AI 加速器,而非依赖厂商宣称的 TOPS 值。