返回主题地图

大语言模型

技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月12日周三 · 6 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

冲突还是策略?法国新闻标题中左右翼民粹政党的不对称角色框架

该研究分析了2022至2025年间25家法语媒体发布的28592条新闻标题,使用三模型LLM流水线进行标注,发现法国媒体对极左政党“不屈法国”和极右政党“国民联盟”的报道存在角色不对称:前者更多以冲突框架出现,后者更多以战略选举框架出现。这种差异在多个模型和统计检验中保持稳定,且不受媒体类型影响。研究还提出了一种分层可靠性框架,用于校准政治文本任务中的多数投

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

结构理论中的确定性:通过闭包、可比性和联合可接受性的统一框架

本文提出一个形式化框架,用于从多元结构理论构建规范解释,并区分了三种强度的“规范”概念:闭包稳定、全局完成和AC-6意义下的确定性。该框架将非确定性分为结构多元性(S型)和认知多元性(E型),并分别以Wyckoff和ICT理论为例。研究表明,基于完成算子的规范化需要闭包、可比性和兼容扩展条件,而基于选择器的规范化需要理论内在可比性和全局兼容性。在LLM辅助推

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Netflix 发布基于 LLM 的推荐排序模型 GenRec

Netflix 在 arXiv 发表论文,介绍其基于内部基础 LLM 构建的推荐排序模型 GenRec。GenRec 采用两阶段框架,第一阶段适配开源 LLM 到 Netflix 数据,第二阶段用推荐排序数据后训练,并通过 A/B 测试显示其性能优于现有生产模型。该研究标志着推荐系统从特征工程向上下文工程、从定制架构向共享基础模型的范式转变。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Meta 推出 ConnectionMind:结合社交网络与 LLM 的推荐框架

Meta 提出 ConnectionMind 框架,将社交网络结构与大型语言模型(LLM)结合,用于个性化推荐。该框架构建异构图,将推荐视为图推理问题,采用两阶段学习(监督微调和强化学习)训练推理策略。在 Meta 大规模推荐系统中部署后,在线 A/B 测试显示视频观看时长提升 0.43%。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

利用文化共识理论分析LLM在单一与多元文化环境中的对齐

圣母大学的研究人员利用文化共识理论(CCT)分析了10个国家的12个文化领域中10个大型语言模型(LLMs)与人类文化对齐的情况。研究发现,模型经常无法形成连贯的共识或过度正则化共识,导致文化多样性被算法同质化。该研究提供了诊断工具,以评估模型何时反映真实的人类多样性而非算法同质化。

正文结构化主题已通过公开置信门槛
TechCrunch AI研究

Anthropic 未发布模型在黎曼猜想上取得重大进展

Anthropic 宣布其未发布模型在黎曼猜想上取得重大进展,显著提高了该猜想成立的下界。该模型在无专业数学训练的员工引导下,通过 60 个子代理协作,测试了 650 个想法,花费 3100 万输出 token,最终由两名子代理提出关键数学思想,并经内部数学家验证和 Lean 证明助手形式化。这一成果引发数学界对 AI 在数学发现中作用的争议,部分数学家担忧

8月11日周二 · 6 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

RynnValue:利用时间距离扩展机器人价值基础模型

阿里巴巴达摩院开源了机器人操作价值基础模型RynnValue,利用时间距离作为监督信号,在超过7000小时、约300万条指令条件片段的数据上训练,无需偏好或进度标注。该模型在RBM-EVAL-OOD基准上平均Kendall's tau a达到0.675,超过完全偏好监督的现有最优方法(0.655),并显著优于仅使用进度的方法(0.292)。通过基于势能的奖励

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

DS@GT ARC:大语言模型用于检索增强辩论

DS@GT ARC 团队提交了 Touché 2025 检索增强辩论任务的论文,该任务包括生成辩论中的下一句话和根据格赖斯准则评估辩论回复。他们使用来自三家提供商的六种领先大语言模型,通过检索增强提示流水线进行生成和评估。分析发现,前沿 LLM 作为生成器表现强劲,作为评估器在模型家族内部高度一致,但这种共识并不能可靠地预测官方评估结果,尤其在质量准则上差距

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

基于运行时值反馈优化 LLM 定向测试输入生成

arXiv 上发布了一篇关于基于 LLM 的定向测试输入生成的研究论文,提出了一种名为 ReDig 的运行时反馈引导的优化框架。该框架通过添加控制循环,利用先前测试执行中观察到的运行时值来优化 LLM 生成的测试输入,以提高目标代码行的覆盖率。在 Poppler 和 Libsndfile 的案例研究中,ReDig 能够有效诊断测试脚本失败的原因并利用反馈改进

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

PragyaDoc:低资源环境下的多语言医疗文档智能理解框架

arXiv 发布论文介绍 PragyaDoc,一个面向低资源环境的多语言医疗文档理解框架。该框架通过四层流水线(并行集成 OCR 提取、几何词汇融合、确定性领域结构化、双 LLM 医学推理与定位)解决印度 22 种官方语言导致的医疗文档可访问性障碍。其目标用户包括农村人口、ASHA 工作者和患者家属,旨在提升医疗信息的可理解性。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

WuYuEval:面向固体废物管理的大语言模型多层级基准

WuYuEval是一个针对大语言模型在固体废物管理领域能力评估的多层级基准,包含4590道基础选择题和247道专家级开放式问题。对33个LLM的测试显示,领先模型在基础模块准确率达94.64%,但平均准确率从简单题的84.14%降至难题的42.50%,在计算、实验设计、城市规划和开放式专家任务上表现较弱。推理模式(Thinking)在多数模型对中带来改进,但

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

LayoutDSL:在领域特定语言动作空间中学习室内布局策略

arXiv 上发布了一篇关于室内布局生成的研究论文,提出了 LayoutDSL 框架,利用领域特定语言(DSL)作为动作空间,通过 LLM 学习布局策略。该方法将布局推理转化为可解释的设计决策,并构建了 3D-FrontDSL 数据集,结合强化学习优化策略。实验表明,LayoutDSL 在空间合理性和设计逻辑性上优于现有方法。

8月10日周一 · 5 条
正文结构化主题已通过公开置信门槛
Interconnects AI产品发布

新书发布:RLHF 后训练教科书,涵盖 PPO 与系统设计

Interconnects AI 的作者 Nathan Lambert 发布了新书《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,由 Manning 出版,旨在系统讲解 LLM 后训练(post-training)的关键方法、直觉与历史。书中涵盖 RL

正文结构化主题已通过公开置信门槛
量子位商业

物理AI瓶颈显现,元戎启行成立Superfluid Lab布局基础能力

元戎启行成立国内首个物理AI实验室Superfluid Lab,由前DeepSeek核心成员、首席科学家阮翀带队,聚焦基座模型、VLA模型和世界模型,旨在弥合数据、认知、行动与真实世界之间的断裂层。文章指出物理AI竞争已从产品、模型竞争进入基础能力与组织竞争阶段,Superfluid Lab是元戎提前布局第三阶段的尝试。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

可解释视网膜眼底图像基础模型DualIFM

DualIFM是一个为视网膜眼底图像设计的可解释基础模型,采用BagNet骨干网络,通过小感受野生成忠实于模型决策过程的类别证据图,并在预训练期间加入2D投影层以直接可视化表示空间。该模型在超过80万张彩色眼底照片上训练,性能与参数多16倍的RETFound相当,同时提供可解释的预测。代码和预训练模型已在GitHub上公开。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

LUCID:基于LLM的可解释无监督社区检测方法

arXiv 上发布了一项名为 LUCID 的研究,提出了一种基于大语言模型(LLM)的可解释无监督社区检测方法。该方法受相变动力学启发,设计为四阶段流程,利用 LLM 生成显式规则,无需训练数据和标签。实验表明,LUCID 在真实数据集上达到了最先进性能,优于领先的无监督和半监督基线。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

形式规则与LLM协同:宏翻译的标签团队方法

arXiv 上发布了一篇关于将 C 语言宏翻译为 Rust 的研究论文。研究者提出了首个形式化宏翻译器 MerC,并构建了基准测试 MacroBench。实验发现,LLM 能翻译更多宏但存在错误,而 MerC 与 LLM 结合使用的“标签团队”方法,平均失败率比单独使用 LLM 低 32%,且比 MerC 多翻译 51% 的测试用例。

8月7日周五 · 3 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Hugging Face 发布 Carbon-3B 生成式 DNA 基础模型

Hugging Face 发布了 Carbon-3B,一个 3B 参数的生成式 DNA 基础模型,专注于真核生物,支持 32,768 个 6-mer 令牌(约 197k 碱基对)的上下文,并可扩展至 65,536 令牌。该模型在序列恢复、变异效应预测和基序扰动任务上可与 Evo2-7B 竞争,同时推理速度更快。Carbon 系列还包括 Carbon-8B 和

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

IJCAI-ECAI 2026论文分析:推理规划知识仍是第一主场

雷峰网AI科技评论通过分析IJCAI-ECAI 2026的论文阵容,验证了南京大学俞扬教授关于IJCAI在推理、规划、知识方向最顶级的判断。数据显示,该会议在推理、规划、知识方向的论文占比约20.8%,且杰出论文奖多次花落此领域。文章介绍了多篇相关论文,如NDProp、AESAT、DUPLEX等,展示了符号推理与神经方法融合的趋势。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

从经济代理到代理经济体:经济世界模型的系统蓝图

本文提出经济世界模型(EWM)的实现蓝图,将系统分为六级能力阶梯,从固定规则代理世界到自适应LLM代理世界、自进化代理、演化制度世界及与现实对齐的模拟-现实经济孪生。文献综述显示现有研究集中于低层级代理与模拟环境,而自进化代理、内生制度、持续实证对齐和验证经济机制的系统仍罕见。作者旨在加速下一代经济模拟环境的发展,作为人类决策者和AI代理的训练、规划、评估和