Anthropic 未发布模型在黎曼猜想上取得重大进展
Anthropic 宣布其未发布模型在黎曼猜想上取得重大进展,显著提高了该猜想成立的下界。该模型在无专业数学训练的员工引导下,通过 60 个子代理协作,测试了 650 个想法,花费 3100 万输出 token,最终由两名子代理提出关键数学思想,并经内部数学家验证和 Lean 证明助手形式化。这一成果引发数学界对 AI 在数学发现中作用的争议,部分数学家担忧
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 40 条
Anthropic 宣布其未发布模型在黎曼猜想上取得重大进展,显著提高了该猜想成立的下界。该模型在无专业数学训练的员工引导下,通过 60 个子代理协作,测试了 650 个想法,花费 3100 万输出 token,最终由两名子代理提出关键数学思想,并经内部数学家验证和 Lean 证明助手形式化。这一成果引发数学界对 AI 在数学发现中作用的争议,部分数学家担忧
DS@GT ARC 团队提交了 Touché 2025 检索增强辩论任务的论文,该任务包括生成辩论中的下一句话和根据格赖斯准则评估辩论回复。他们使用来自三家提供商的六种领先大语言模型,通过检索增强提示流水线进行生成和评估。分析发现,前沿 LLM 作为生成器表现强劲,作为评估器在模型家族内部高度一致,但这种共识并不能可靠地预测官方评估结果,尤其在质量准则上差距
arXiv 上发布了一篇关于基于 LLM 的定向测试输入生成的研究论文,提出了一种名为 ReDig 的运行时反馈引导的优化框架。该框架通过添加控制循环,利用先前测试执行中观察到的运行时值来优化 LLM 生成的测试输入,以提高目标代码行的覆盖率。在 Poppler 和 Libsndfile 的案例研究中,ReDig 能够有效诊断测试脚本失败的原因并利用反馈改进
本文提出一个形式化框架,用于从多元结构理论构建规范解释。结构理论由签名、公理和推理策略组成,其可接受解释族包含所有全局一致的结构结论赋值。作者区分了三种规范化层次:闭包稳定化、全局完成和确定性化,并将非确定性分类为认识论多元性(E型)和结构多元性(S型),其中S型强子类由缺乏共同上界刻画。文章给出了两种规范化机制存在的充分条件,并证明在正非反摄规则下,纯推理
arXiv 发布论文介绍 PragyaDoc,一个面向低资源环境的多语言医疗文档理解框架。该框架通过四层流水线(并行集成 OCR 提取、几何词汇融合、确定性领域结构化、双 LLM 医学推理与定位)解决印度 22 种官方语言导致的医疗文档可访问性障碍。其目标用户包括农村人口、ASHA 工作者和患者家属,旨在提升医疗信息的可理解性。
WuYuEval是一个针对大语言模型在固体废物管理领域能力评估的多层级基准,包含4590道基础选择题和247道专家级开放式问题。对33个LLM的测试显示,领先模型在基础模块准确率达94.64%,但平均准确率从简单题的84.14%降至难题的42.50%,在计算、实验设计、城市规划和开放式专家任务上表现较弱。推理模式(Thinking)在多数模型对中带来改进,但
arXiv 上发布了一篇关于室内布局生成的研究论文,提出了 LayoutDSL 框架,利用领域特定语言(DSL)作为动作空间,通过 LLM 学习布局策略。该方法将布局推理转化为可解释的设计决策,并构建了 3D-FrontDSL 数据集,结合强化学习优化策略。实验表明,LayoutDSL 在空间合理性和设计逻辑性上优于现有方法。
Interconnects AI 的作者 Nathan Lambert 发布了新书《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,由 Manning 出版,旨在系统讲解 LLM 后训练(post-training)的关键方法、直觉与历史。书中涵盖 RL
元戎启行成立国内首个物理AI实验室Superfluid Lab,由前DeepSeek核心成员、首席科学家阮翀带队,聚焦基座模型、VLA模型和世界模型,旨在弥合数据、认知、行动与真实世界之间的断裂层。文章指出物理AI竞争已从产品、模型竞争进入基础能力与组织竞争阶段,Superfluid Lab是元戎提前布局第三阶段的尝试。
arXiv 上发布了一项名为 LUCID 的研究,提出了一种基于大语言模型(LLM)的可解释无监督社区检测方法。该方法受相变动力学启发,设计为四阶段流程,利用 LLM 生成显式规则,无需训练数据和标签。实验表明,LUCID 在真实数据集上达到了最先进性能,优于领先的无监督和半监督基线。
arXiv 上发布了一篇关于将 C 语言宏翻译为 Rust 的研究论文。研究者提出了首个形式化宏翻译器 MerC,并构建了基准测试 MacroBench。实验发现,LLM 能翻译更多宏但存在错误,而 MerC 与 LLM 结合使用的“标签团队”方法,平均失败率比单独使用 LLM 低 32%,且比 MerC 多翻译 51% 的测试用例。
Hugging Face 发布了 Carbon-3B,一个 3B 参数的生成式 DNA 基础模型,专注于真核生物,支持 32,768 个 6-mer 令牌(约 197k 碱基对)的上下文,并可扩展至 65,536 令牌。该模型在序列恢复、变异效应预测和基序扰动任务上可与 Evo2-7B 竞争,同时推理速度更快。Carbon 系列还包括 Carbon-8B 和
雷峰网AI科技评论通过分析IJCAI-ECAI 2026的论文阵容,验证了南京大学俞扬教授关于IJCAI在推理、规划、知识方向最顶级的判断。数据显示,该会议在推理、规划、知识方向的论文占比约20.8%,且杰出论文奖多次花落此领域。文章介绍了多篇相关论文,如NDProp、AESAT、DUPLEX等,展示了符号推理与神经方法融合的趋势。
Keep在88全民健身日推出“超级AI会员”,通过自研运动大模型Keepace.ai提供AI语音互动跑、个性化计划、吃练睡分析等服务,覆盖运动前中后全流程,旨在从内容交付转向服务交付。该会员卡试图验证用户是否愿意为AI服务付费,成为Keep在2025年首次年度盈利后的新增长引擎。文章还对比了多邻国和Cursor的AI商业化路径,认为AI从工具变为服务是行业趋
arXiv 上发布了一篇关于黑盒预测器纠错特征发现的研究论文,提出了 CRAFTER 代理。CRAFTER 通过组合搜索和 LLM 生成候选特征,并用验证门控筛选,在六个数据集和六个冻结骨干网络上超越了专用特征工程系统,将最弱骨干的错误率降低最多 27%。该研究为模型纠错提供了新思路。
该研究提出了一种名为DiSR的框架,将3D感知与空间推理分离,利用现成的专家感知模型重建结构化3D证据,并通过LoRA微调LLM仅基于这些几何证据进行推理。DiSR在空间推理基准上取得了有竞争力的性能,同时提供了更好的可解释性、模块化和计算效率,表明显式分离感知与推理是端到端建模的可扩展替代方案。
arXiv 发布 BioMedJImpact 数据集,包含 174 万篇 PubMed Central 文章和 2744 种生物医学期刊,整合文献计量指标、合作特征和基于 LLM 的 AI 参与率。研究发现作者团队规模与引用影响正相关,而 AI 参与率仅在 2019 年子集中与影响因子正相关。该数据集和验证框架为生物医学与 AI 交叉领域的科学计量分析提供了
该研究提出一种基于Koopman算子理论的新框架,用于验证多智能体系统中大型语言模型(LLM)集体推理的收敛性和可解释性。通过将集体视为非线性动力系统,从交互轨迹中估计Koopman传递算子,其谱可提供收敛期限、派系识别和压缩消息基础等机器可检查的证书。实验表明,该框架在注意力共识模型上以高相关性预测收敛时间,并在多数配置中提供有效边界,且计算高效,可在CP
一项针对119名软件从业者的探索性调查显示,大型语言模型(LLM)已深度融入日常开发工作,主要体现为功能性依赖,并出现过度依赖的迹象,如优先使用LLM而非文档或同行咨询,但成瘾相关行为较少。研究建议通过信任校准、专业判断和验证来促进合理依赖。
本研究对比了基于RoBERTa的传统情感分析与基于LLM的多维框架分析在政治新闻评估中的表现。结果显示,RoBERTa将70%的文章归类为中性,导致信息扁平化,而LLM方法能捕捉政治偏见、煽情性、情感诉求和框架等维度。作者认为,对于政治媒体分析,传统情感分析不足,LLM多维框架更适合社会科学和人文学科研究。
本文介绍了黑箱优化词问题(BBOWP)这一新问题设置,要求系统从自然语言描述中推断搜索空间和优化算法。作者建立了BBOWP基准套件(BBOWP-Bench),包含数据集和评估框架,每个实例结合自然语言问题描述、可执行评估环境和人工设计的基线公式。初步评估显示,当前LLM能根据评估预算选择合适算法,但在搜索空间设计上存在困难,尤其是在问题描述信息不足或搜索空间
arXiv 论文提出 SONAR,一个无需参考摘要的代码摘要评估框架,从正确性、抽象性、简洁性和流畅性四个维度评估代码摘要。SONAR 采用基于代码再生成的方法,利用摘要重建代码作为质量信号,避免依赖人工或 LLM 的主观判断。实验表明,正确性和抽象性与 LLM 在下游软件工程任务中的表现显著相关,相关性比最佳基线高 14 倍,而简洁性和流畅性对 LLM 消
谷歌宣布将于2026年9月4日起在Android和Wear OS上关闭Google Assistant,由AI助手Gemini全面接管。此举影响智能手机、平板、手表、耳机及Android Auto车辆,但部分内置Google的汽车暂时保留Assistant。该计划原定2025年实施,现推迟至2026年。谷歌认为这是对Gemini能否胜任日常简单指令的考验,因
今年普利策奖创纪录地有八位获奖者披露使用了人工智能,包括五位获奖者和三位入围者。自2024年起,披露要求成为强制规定。今年参赛者更频繁地使用AI工具和大语言模型,主要用于快速搜索大量文档。例如,《华尔街日报》使用内部LLM总结德克萨斯州洪水的公共文件,《明尼苏达明星论坛报》用ChatGPT翻译日记并请专家核查,美联社用LLM搜索中国监控技术相关文件,《纽约时
微软研究院与Paige(现为Tempus旗下)合作开发了病理学基础模型PRISM2,该模型基于组织图像和真实病理报告中的语言进行训练。在多项基准测试中,PRISM2在前列腺癌、乳腺癌和乳腺淋巴结转移检测等任务上达到或超过了专门的癌症检测系统,且无需为每个任务单独建模。PRISM2的完整模型权重已在Hugging Face上公开发布,供研究使用。
腾讯混元于8月4日发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度语音识别与语义理解,在通用识别、上下文感知、多场景鲁棒性及方言覆盖等维度显著提升。该模型在开源和自建评测集上WER表现领先,已上线腾讯云提供API服务,并集成于腾讯元宝等产品。
CoT-Core 是一种新的无需训练的 LLM 评估核心问题选择框架,通过提示 LLM 生成零样本思维链推理轨迹,并在潜在空间中对问题进行聚类,以逻辑等价性而非表面文本相似性进行选择。在 GSM8K、MMLU、MMLU-Pro 和 GPQA 上的实验表明,CoT-Core 能大幅降低评估成本,同时保持高保真度分数估计,且其有效性受任务复杂度的限制。
arXiv 论文提出 MemoryForge 框架,用于为 LLM 智能体合成类人的终身记忆。该框架通过记忆条件化替代传统提示方法,包含上下文生成器、生活组织器和多分辨率模拟器三个组件。实验表明,MemoryForge 生成的记忆库能使冻结的 LLM 在角色扮演和用户模拟任务中表现出更类人的行为。
AutoFOAM 是一个基于大型语言模型的自进化智能体,可根据自然语言指令自动创建、评估、运行和优化 OpenFOAM 计算流体力学模拟。该模型基于 Qwen-coder 2.5-14B 微调,采用七阶段进化循环和三种防退化机制,旨在降低 CFD 使用门槛并加速原型设计。
RubricReviewer是一个全新的同行评审框架,通过将评分标准生成作为显式中间步骤,并融合无训练代理(Scout)与人类对齐训练模型(Aligner),解决了现有LLM评审员的两大结构性局限。实验表明,该框架生成的评审比现有系统更全面、更具区分度,且对对抗性提示注入攻击的鲁棒性最强。消融研究证实了每个组件的必要性。
DLLM-TTS 是一种将文本到语音合成(TTS)建模为基于 X-Codec2 神经音频编解码器令牌的条件块离散扩散的框架。该模型将序列分解为块,在块内应用掩码扩散,同时顺序处理块,以学习局部声学一致性和全局文本-语音对齐。在推理时,块内并行令牌预测实现了 0.15 的实时因子(RTF),一个在 20K 小时数据上训练的 0.6B 参数模型在 Seed-TT
本文介绍了对文化遗产网络应用 Triangolazioni 的扩展,该扩展利用大型语言模型(LLMs)在松散耦合、与 LLM 无关的架构中,为策展内容补充上下文相关的外部信息。系统支持上下文相关的信息搜索和呈现,且不依赖于特定的 LLM。
GARDRec是一个面向大语言模型推荐系统的决策级图接地框架,通过构建语义结构物品表示、个性化图上下文和显式决策特征,增强LLM在下一项推荐中的排序能力。在三个公开基准上的实验表明,GARDRec在多个LLM骨干网络上普遍优于代表性基线。消融和诊断分析验证了图投影、邻域检索、显式决策特征、排序损失和生成校准的贡献。
该研究针对中小企业在使用大语言模型时面临的幻觉和错误信息问题,提出了基于检索增强生成(RAG)的VectorRAG和GraphRAG建模方法。研究在LLaMA、Mistral和Qwen等多个先进LLM上进行了实验评估,结果显示RAG增强的LLM能显著减少幻觉和错误信息,提高响应质量和上下文相关性,从而支持更可靠、可信的决策。
该研究探讨了大型语言模型(LLMs)在预测大规模阅读与写作测试中题目难度水平的表现。研究发现,零样本GPT-4.1(温度设为0)的预测准确率最高,二次加权kappa(QWK)为0.578,但仍低于ConvBERT(QWK=0.625)。所有LLMs在标记难题时表现不佳,GPT-5.4倾向于低估难度,且嵌入分析表明仅凭语义信息不足以预测难度。研究建议在利用LL
该论文将LLM响应分类任务形式化为两个随机线性动力系统之间的二元假设检验,证明忽略令牌动力学的分类器存在准确率下限,而基于动力系统的分类误分类概率随序列长度指数衰减。研究还通过近似交织条件刻画了跨嵌入模型的泛化能力,解释了该方法的经验性能。
DragonCrawl 是一个基于大语言模型的移动端端到端测试框架,从嵌入相似度匹配演进到生成式意图推理,利用 GPT-4o 的多模态能力在 CI/CD 中持续验证用户流程。该系统在 iOS 和 Android 上分别达到 91.6% 和 92.2% 的通过率,将测试接入时间从 96-120 小时缩短至 4 小时以内,并节省了约 27 人年的维护工作量。论文
arXiv 上发布了一篇论文,提出了一种用于发现重大数学猜想的三阶段 LLM 框架,包括区域搜索、反思验证和 Lean 4 形式化验证。实验表明,20 个候选猜想全部通过形式化检查,且无重复。该框架旨在系统化生成和验证具有高数学潜力的猜想,减少对专家直觉的依赖。
arXiv 论文提出 Think2Go,一种用于下一个兴趣点(POI)推荐的生成式框架,结合了监督微调和基于强化学习的推理,以增强对语义ID的理解并探索时空模式。通过两种优势加权机制(基于核密度估计的提示不确定性校准和奖励归一化缩放)实现联合优化,形成隐式课程学习策略,提升训练稳定性和探索能力。该框架旨在解决现有方法在数据稀疏和复杂移动模式下的局限性。
该研究提出了一种利用大型语言模型、结合仓库级上下文和推理编排的上下文感知流水线,用于为增强现实(AR)应用自动生成和优化蜕变关系(MRs)。研究在142个移动AR系统仓库上评估,生成了14,916个候选MRs,其中层级上下文覆盖最广(7,004个MRs),并通过代理式审议过程在79.0%的案例中协调冲突,最终88.2%的结果选择了上下文感知关系。人工orac