CSCR:反事实敏感度信用重分配改进长思维链推理
该研究提出了一种名为CSCR(反事实敏感度信用重分配)的方法,用于改进长思维链推理中的强化学习。研究发现,在GRPO等无评论家方法中,特权信息引起的token似然偏移往往集中在可替换的表面形式token上,无法可靠指示正确的优化方向。CSCR通过减少对高敏感度token的信用并重新归一化token级优势,在数学推理基准上持续优于GRPO基线。
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 10:55
该研究提出了一种名为CSCR(反事实敏感度信用重分配)的方法,用于改进长思维链推理中的强化学习。研究发现,在GRPO等无评论家方法中,特权信息引起的token似然偏移往往集中在可替换的表面形式token上,无法可靠指示正确的优化方向。CSCR通过减少对高敏感度token的信用并重新归一化token级优势,在数学推理基准上持续优于GRPO基线。
一项针对九家来自六个不同国家的公司的访谈研究,探讨了自动驾驶系统(ADS)测试的现状与挑战。研究发现当前实践主要依赖基于场景和X-in-the-loop测试方法,并面临场景真实性、覆盖度、仿真保真度和验收标准等挑战。研究提出了一个以证据为中心的闭环测试框架,并展望了未来测试将更加自动化、数据驱动和透明。
本文提出了一种新的RGB-NIR低光成像方法,通过引入3D感知神经建模,在无需干净RGB监督的情况下,隐式融合极噪RGB观测与NIR线索,恢复干净RGB图像。该方法避免了干净RGB数据收集,并能泛化到不同噪声水平,在合成和真实数据上表现优越。代码已开源。
该论文提出心智世界建模(MWM)框架,将心智变量作为世界模型的核心组成部分,而非事后解释。作者在MENTIS基线中实现了该框架,通过显式分解状态解析、目标观察生成、动作分解等阶段,在文本、图像和视频故事数据集上验证了显式建模心智状态对预测人类决策的必要性。实验表明,完整MWM在所有评估模型上表现最佳,而移除心智通道会降低性能,最大的瓶颈在于转换模拟。
Hugging Face 每日论文介绍了一项关于编程助手个性化歧义适应的新研究。研究者提出了 CAPA 基准,通过六种机制刻画个性化编程歧义,并利用受控三阶段生成流程将其注入可执行任务,构建了包含 600 个编程会话的数据集。研究评估了 12 个近期大语言模型在无历史和有同用户历史条件下的表现,并提出了一种轻量级的同用户历史门控方法,以减少澄清次数并提升代码
nqvii 在 Hugging Face 上发布了 swin-tiny-rice-disease 模型,这是基于微软 Swin Transformer 微调的水稻病害图像分类模型,在 rice disease 701515 数据集上达到 87.7% 的准确率和召回率。该模型使用 AdamW 优化器和余弦学习率调度器训练了 35 个 epoch,采用 Apac
Hugging Face 每日论文介绍了一篇关于基于评分标准的强化学习(Rubric-based RL)的研究。论文指出该方法的两个失败模式:未探索标准(UC)和受抑制标准(SC),其中SC在超过57%的训练样本中出现。作者提出Criterion-Distilled Policy Optimization(CriPO)方法,通过策略内自蒸馏和令牌级优势修正同
ExtractBench 是一个用于评估模式引导的企业文档提取任务的基准,包含 370 份企业文档、4869 页内容,覆盖 8 个业务领域和 67 种文档类型。该基准首次同时评估值准确性、记录完整性、溯源性和成本。研究发现商业 VLM 在短文档上表现良好但在长文档上会截断记录,而编码代理虽准确率高但成本更高,LlamaExtract Agentic Plus
该研究探讨了视觉生成中文本条件的缩放特性,发现扩散损失与提示中的结构化语言量相关,而非令牌数量。研究者提出了两种度量方法(GPG和ED),并据此改进了可扩散性和可提示性,通过构建结构化提示和训练提示器。最终系统在多个基准上超越了所有评估的开源模型,并在大多数评估中匹配或超过最强的闭源模型。
Meshy 团队提出 Meshy T2,一种基于流匹配的快速原生网格生成框架。其核心是顶点集网格 VAE,将网格编码为每个顶点的连续潜在标记,并单次解码顶点、边连接和面绕序,无需顶点量化或焊接。生成过程采用由粗到细的两级流匹配模型级联,实现交互式生成速度、面数控制和多部件资产原生支持。实验表明,Meshy T2 在几何保真度上达到最先进水平,端到端图像到网格
Hugging Face 每日论文介绍了一项名为 RLSVR 的新训练范式,通过任务转换将开放式任务转化为可验证的代理环境,从而扩展 RLVR 的应用范围。该研究提出了 SpyRL 多智能体自博弈环境,在文本摘要、创意写作和数学推理等任务上表现出优于现有自改进方法的性能。相关模型和代码已在 GitHub 上发布。
vidraft-darwin 团队在 Google Gemma 和 Hugging Face 举办的 Fast Gemma Challenge 中,通过软件优化在单张 NVIDIA A10G 上实现了 510.58 TPS 的推理速度,且 PPL 为 2.3930,通过了官方验证,成为已验证结果中最快的方案。他们公开了完整配置,包括滑动窗口、质心 top-k
Meta 发布 2026 年二季度财报,净利润暴跌 14%,自由现金流仅剩 7.84 亿美元,同时上调全年 AI 资本开支至 1350 亿-1450 亿美元,引发股价大跌。Meta 在 AI 上半场因 Llama 4 失败和产品融合不佳而落后,现正通过自研模型路由器、限制 Token 使用、筹建云业务等方式寻求 AI 变现。分析认为,AI 行业已从拼投入转向
AISPA 框架提出了一种以用户为中心的系统提示审计方法,用于评估 AI 应用中的系统提示。研究团队对 88 个商业 AI 产品中的 3,249 条系统提示指令进行了审查,发现系统提示设计差异显著,保护性指令虽广泛采用但覆盖范围有限,且约 40% 的产品包含不利于用户的指令。该研究强调了商业 AI 产品中系统提示透明度和标准化的重要性。
Liquid AI发布了新一代混合模型LFM2系列,包括350M、700M、1.2B和2.6B四个参数规模的检查点,专为边缘AI和端侧部署设计。LFM2采用乘法门和短卷积的新架构,训练速度比上一代快3倍,CPU上的解码和预填充速度比Qwen3快2倍,在知识、数学、指令跟随和多语言等基准上优于同尺寸模型。该系列支持8种语言,上下文长度32,768 tokens
Hugging Face 博客文章介绍了 abliteration 技术,可在不重新训练的情况下移除 LLM 内置的拒绝机制,使其能响应所有类型的提示。该方法通过识别模型残差流中的拒绝方向,并通过推理时干预或权重正交化来消除该方向。文章提供了基于 TransformerLens 库的代码实现,并已在 Google Colab 和 GitHub 上发布。
作者在 Hugging Face 博客上分享了一项实验:仅使用奖励信号(REINFORCE 算法)从头训练一个 15M 参数的法国语言模型,使其学会生成特定句子,无需预训练或语言规则。实验发现,逐步奖励(如按位置匹配)能有效引导学习,而全有或全无奖励则完全失败。模型最终达到 99.9% 的语法正确率,但学习到的只是位置到字符的查表,缺乏抽象结构,迁移测试也证
Together AI 发布了 Open Deep Research,一个开源的 LLM 工作流,用于回答需要多跳推理的复杂问题并生成研究报告。该工作流模拟人类研究过程,包括规划、搜索、自我反思和写作,并集成了 Together AI 云平台上的多种模型。其目标是提供灵活、可扩展的架构,供开发者社区使用和扩展,同时发布了数据集和代码。
Together AI 发布了其推理平台的重大更新,提供对性能、成本和质量的完全控制,支持金丝雀发布、蓝绿部署、A/B 测试和自动回滚等功能,并宣布了自定义训练的封闭测试版。该平台旨在帮助团队在生产环境中运行开源权重模型,同时避免从零构建推理栈的复杂性。Together AI 每月处理超过 4000 亿 token,其新平台整合了研究、模型优化和平台工程团队
Mistral AI 发布了 Mathstral,这是一个专为数学和 STEM 领域设计的新模型,基于 Mistral 7B 构建,在 MATH 基准上达到 56.6%,在 MMLU 上达到 63.47%。该模型旨在支持学术研究,与 Project Numina 合作开发,并可通过 HuggingFace 获取。Mathstral 在推理时增加计算量可显著提