德国联邦宪法法院句子级解释准则分类基准
该论文为大型语言模型(LLM)的司法推理分析构建了一个句子级基准,用于分类德国联邦宪法法院判决中的解释准则。作者将拉伦茨(Larenz)的解释理论操作化为分类标准,提供了句子级标注的数据集,并对来自三个模型家族的四个LLM进行了基线评估。结果显示,七个二元子任务的平均得分在70.4至79.2之间,语法解释通常最易识别,系统解释通常最难;在测试配置下,GEPA
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文为大型语言模型(LLM)的司法推理分析构建了一个句子级基准,用于分类德国联邦宪法法院判决中的解释准则。作者将拉伦茨(Larenz)的解释理论操作化为分类标准,提供了句子级标注的数据集,并对来自三个模型家族的四个LLM进行了基线评估。结果显示,七个二元子任务的平均得分在70.4至79.2之间,语法解释通常最易识别,系统解释通常最难;在测试配置下,GEPA
该研究在 LongBench-v2 多选题问答上系统测试了学习式上下文规划(learned context planning)能否在强检索、路由、预算化选择和重排序控制下提升长上下文问答表现。使用 Qwen2.5-7B-Instruct 作为答案模型,规划器通过 SFT 在 140 条训练和 28 条开发轨迹上训练。结果显示,在 18k 字符预算下,锚定混合
该研究提出一个面向文化特定亲属称谓的生成基准,用印地语、泰米尔语和韩语测试五个开源权重模型(GPT-OSS-120B、Sarvam-M、Llama-3.3-70B、GLM-5.1、Kimi-K2.6)在生日祝福和婚礼邀请中生成亲属称谓的能力,并与同一关系-语言单元的四选一选择基线对比。结果显示模型选择正确称谓的比例远高于生成比例,例如GPT-OSS-120B
该研究利用 Upworthy Research Archive 的真实标题 A/B 测试数据,检验 LLM 合成人物(synthetic personas)能否预测真实受众点击行为。结果发现,大多数 A/B 测试本身没有统计上可区分的胜者,而基于人物条件的预测反而比无人物零样本基线更差:无人物基线排名更准(top-1 准确率 49.2% vs 34.6%),
该论文针对自回归视频生成中因上下文窗口、存储和计算受限而导致历史信息(如实体身份、动态状态、干预引发的因果变化)过早丢失的问题,将记忆机制系统化为跨自回归步骤持久保存并能影响后续生成的历史信息。作者从形式、功能、操作、学习和评估五个互补视角综述了相关文献,并总结了可组合且资源感知的记忆架构、可信状态更新、自回归学习与标准化评估等开放挑战,为构建可靠的记忆条件
NVIDIA 技术博客介绍 SWE-Serve,一个与 SGLang 团队合作开发的基准,用 53 个来自 SGLang 已合并 PR 的任务评估 AI 编码代理对推理服务软件的修改。在 19 个含实时服务检查的任务中,同一批补丁排除实时检查时通过率为 69.4%,加入完整验证器后降至 45.9%,约三分之一补丁在真实服务器加载模型后失败。该基准还显示跨多个
Anthropic 负责 Claude 微调的工程师 Jackson Kernion 解释,为何模型在数学、代码和推理上越来越强,写作质量却停滞甚至变差。他指出,新模型被优化用于数学和代码,并被训练成面向其他 AI 模型生成技术解释,从而形成人类读者觉得过于密集的“Claudeish”文风。Kernion 表示 Opus 4.6 是最后一个写作表现好的模型,
该论文提出「品味」(taste)概念,指 LLM 智能体在长周期任务中于决策分叉点选择更优方向的能力,并构建了 Taste-Bench 基准。Taste-Bench 从 SWE-bench Pro 和 METR AI R&D 轨迹中自动挖掘出 502 个决策分叉,无需人工标注。评测显示 14 个前沿模型中最优者仅答对 59.7%,且决定证据出现越晚准确率越低
Langfuse 发布 v4.42.0 版本,主要包含 Web 前端重构(将深层导入统一走 index.ts)、UI 修复与设计系统组件迁移,以及 trace 消息内部预览、注释与评论嵌入 trace/session 等新功能。AI 网关方面新增对 Anthropic 连接的支持,评估模块引入实验性的决策模型评估器(TypeSafe Jev)并移除相关功能开
Anthropic 发布 Claude Opus 5.5,作为新 Claude 5.5 家族首个模型,宣称在多数任务上达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%,速度约快 30%,并改善写作与指令遵循。OpenAI 约一小时后发布 GPT-6 Sol 和 Luna,定价比 GPT-5.6 低 50%。Opus 5.5 成为 Clau
Anthropic 发布旗舰模型 Claude Opus 5.5,在 Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0 等编程与知识工作基准上登顶,输出速度比 Opus 5 快 30% 以上。API 输入输出价格下降 20%,缓存读取价从每百万 Token 0.50 美元降至 0.20 美元,Anthr
另有 2 家信源报道
研究评估了医学基础模型 MedGemma(基于 Gemini 的医学通用基础模型)及其针对肺癌检测诊断微调版本,在 NLST 数据集上与 12 位放射科医生进行 Lung-RADS v2022 评估的对比。放射科医生平均 AUC 为 0.90(范围 0.80–0.94),原生基础模型 AUC 仅 0.70,微调后提升至 0.83,处于放射科医生表现的较低区间
该论文首次定义并研究生成视频中的「镜头运动抄袭」问题,指出Sora 2、Veo 3.1等生成模型能以近乎零成本模仿Dolly Zoom、Bullet Time等专业镜头运动,而现有基于视觉内容或光流的取证方法无法捕捉这种运动相似性。作者构建了首个镜头运动数据集与基准CineFlow(含11种运动风格),并提出检测方法CineGuard,将流体力学中的涡度引入
MIT 研究人员发布 TRACTOR 基准,用于评估将 C 代码翻译为 Rust 的自动翻译器。该工作指出 C/C++ 等内存不安全语言是长期系统性漏洞根源,NSA、CISA 等机构已呼吁语言层面的结构性变革,而 Rust 凭借编译期所有权与借用检查、无 GC 开销、可与 C/C++ 互操作等特性成为现代化迁移的首选目标。TRACTOR 旨在为这一翻译任务提
该论文提出 Knowledge-as-Skill 结构设计,让 LLM 智能体能够自主发现、导航和使用知识库,而非依赖传统 RAG 的固定检索-拼接-生成流程。设计包含 SKILL.md 发现层、每目录 index.md 导航层和带 YAML frontmatter 的知识层,遵循 Open Knowledge Format 与 Skill 协议。在 Wix
Moonworks 提出 Moonworks Lunara 文本到图像模型,将「艺术智能」定义为先建立语义、艺术与构图约束、再在约束内实现视觉世界的两阶段计算,并采用新型 Diffusion Mixture Transformer 架构与 CAT 训练算法。团队用 GPT-5.6 Sol 作为评估器,在 1000 条提示、8000 张生成图像上对比包括 FL
该论文针对 QMSum 查询聚焦会议摘要任务,指出该基准缺少统一评分器导致结果难以比较,因此在一个实现下重新评分或生成 15 个系统并发布逐查询预测。核心发现是训练与推理输入对齐很关键:一个 406M Fusion-in-Decoder 专用模型从长输入切换到 2000 词检索片段后损失 6.30 ROUGE-1,但在该片段机制上微调后可恢复,测试得分 36
该研究提出一个精确有理数轨道框架,用3,600道精确有理数题和8,600条提示,测试五种开源权重模型在五种保持数值恒等的改写(小数/分数、科学计数法、百分数、数字词、单位换算)下是否给出相同答案。结果显示,规范准确率高达0.969–0.996,但轨道正确率降至0.848–0.981,轨道不变性为0.851–0.981;大部分严格解析器崩溃源于乘法形式科学计数
该论文提出 RULER 方法,用于从自然语言指令生成 SVG 代码的强化学习。作者发现用多轴评分标准(rubric)提示视觉语言模型评判,比 CLIP、Aesthetic 等标量指标更符合人类判断,且能避免奖励黑客问题。RULER 将每条指令转化为包含语义、视觉、风格六个条目的实例感知评分标准,由评判 VLM 逐项打分并加权作为奖励,通过 GRPO 优化,无
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Sol 和 Luna 价格仅为 GPT-5.6 同级模型的一半,GPT-6 Luna 输入/输出定价低至 $0.10/$0.50 每百万 token;Claude Opus 5.5 相比 Opus 5.0 降价