返回主题地图

大语言模型

技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月21日周五 · 8 条
正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

黑盒大语言模型置信度估计的改进方法

该研究提出一种利用标注数据集改进黑盒大语言模型置信度估计的方法,通过构建简单分类器,将现有不确定性分数和相似查询的正确性作为特征,以预测响应正确性。该方法计算开销小,能持续优于现有零样本不确定性量化方法,并提供校准的置信度估计。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

衡量规范决定内容:形式化语义块模型与执行判断基准

EPAM Systems 的研究者提出了一种正式的语义块模型和基于执行判断的基准,用于评估规范质量,独立于模型能力。该模型将规范表示为语义块、依赖关系、规则等结构,并定义了四个机器可检查的良构条件。在 Oracle 到 PostgreSQL 迁移规范上的实验表明,完整规范将干净加载输出从 72.0% 提升至 97.3%,但跨实现者一致性仅从 83.1% 变为

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

SNAIL:从文献中自动识别生物信息学软件名称的混合框架

堪萨斯大学等机构的研究者提出了SNAIL,一个混合命名实体识别框架,用于从生物医学文献中自动识别生物信息学软件和数据库名称。SNAIL结合词汇与语义建模,利用SciBERT等Transformer模型和token掩码策略,并通过引用提示和LLM辅助蒸馏构建训练语料。在多个基准和真实文献上,SNAIL显著优于bioNerDS2及ChatGPT、Gemini等通

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

大语言模型在心理健康领域的应用、创新与伦理挑战系统综述

本文是一篇关于大语言模型在心理健康领域应用的系统综述,涵盖了社交媒体分析、临床对话代理、治疗支持工具、提示工程、多模态学习及伦理考量等方面。综述整合了跨学科研究,利用社交媒体帖子、电子病历和多模态数据实现抑郁症早期检测、自杀风险评估和个性化治疗支持,同时强调了提示工程和可解释性的重要性。文章还讨论了多模态融合技术的进展以及伦理、社会技术和监管方面的挑战,倡导

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

炒作与现实:LLM作为Simulink-Stateflow模型搜索式自动修复中的变异算子

该研究将大语言模型(LLM)作为变异算子集成到基于搜索的自动程序修复(APR)中,用于Simulink-Stateflow模型。在19个真实故障模型上的受控评估中,LLM-based方法仅修复4-6个模型,而原始FlowRepair修复18个,表明LLM集成显著降低了修复性能。分析显示LLM在精确符号编辑上存在困难,缺乏行为反馈,并产生噪声搜索空间。研究强调

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

CoRRe:基于协作信号的后 LLM 商品细化的免训练推荐框架

CoRRe 是一种无需训练的 LLM 推荐框架,采用后 LLM 范式,通过商品共购图和流行度细化 LLM 生成的商品嵌入,以提升细粒度商品检索。实验表明,CoRRe 在真实数据集上优于现有无需训练的方法,并达到或超过基于训练的方法。该框架无需模型训练或任务特定微调,代码和数据集已公开。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10537 发布:Windows CI 改用 LLVM OpenMP

llama.cpp 发布 b10537 版本,主要改进是在 Windows CI 中使用 LLVM 的 OpenMP 替代微软的非再分发调试版本,并打包了相应的许可证。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog研究

ChatGPT 搜索大规模采用 site: 运算符

Simon Willison 报道称,ChatGPT 搜索现在大规模使用 site: 运算符。Promptwatch 的追踪数据显示,包含该运算符的查询比例从 0.3-0.5% 跃升至 16-17%,与 GPT-5.6 的发布相关。OpenAI 在 8 月 6 日宣布更新 GPT-5.6 Sol 以提高事实可靠性。此外,Promptwatch 还报告 Cha

8月20日周四 · 2 条
正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源研究

美团搜索3.0:LLM语义表征在排序模型的探索与应用

美团搜索团队在服务零售排序场景中系统探索了LLM语义表征的应用,通过三期迭代构建了Query-POI-Deal三元语义表征体系,将语义相似度作为特征注入精排模型,显著提升了搜索订单量和长尾场景体验。一期验证可行性,二期系统性升级,三期实现跨场景迁移复用,累计完成3个Launch Review并全量上线。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

编译器引导的自适应证明搜索与跨模型协同

罗切斯特大学的研究者提出了一种编译器引导的自适应证明搜索框架,用于Lean 4项目级定理证明。该框架通过双模型生成和停滞触发的重采样来探索多样化的起始证明,并利用编译器反馈进行当前最优精化。在miniCTX-v2的七个真实项目上,该方法在pass@预算内将平均通过率提高了12.8个百分点,同时将LLM调用减少了21.9%。

8月19日周三 · 4 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

清华王鑫团队独揽IJCAI 2026两大Tutorial,聚焦OOD泛化

清华大学王鑫教授团队在IJCAI 2026上罕见地同时入选两个Tutorial,主题分别为图分布偏移和OOD泛化生成式AI,旨在解决生成式模型在真实世界分布外场景下的泛化问题。该团队提出结合图大语言模型、动态适应和因果不变性的三维解法,并强调后训练策略以提升鲁棒性。这标志着生成式AI技术竞争从IID拟合转向OOD泛化,彰显清华在该领域的国际影响力。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

跨模型记忆迁移:目标侧读取器适配的关键作用

该研究探讨了跨模型冻结记忆迁移的有效性,发现仅冻结记忆内容不足以实现迁移,目标侧读取器的适配至关重要。实验表明,通过训练轻量级读取器,冻结记忆可显著提升不同目标模型的性能,相对困惑度降低最高达15.7%。研究提出Engram式哈希记忆可作为可重用的外部知识工件,但需目标模型具备兼容的读取接口。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

基于契约的AI代理测试生成:规范驱动方法的实证评估

该研究提出了一种名为Spec-Driven Test Generation的测试生成方法,通过让AI代理在生成测试前先提取并记录代码的前置条件、后置条件和未定义行为,形成半形式化规范作为引导。在Google的90个历史生产bug上的评估显示,该方法相比传统基线在bug检测率上提升了9.8个百分点,分支覆盖率提升了2.5个百分点。LLM-as-a-Judge评

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

GxP-Agent:基于过程DAG拓扑的可靠临床试验编程LLM代理系统

GxP-Agent 是一个多智能体系统,将临床试验编程的监管流程编码为有向无环图(DAG),分解为15个领域特定节点,由具备pharmaverse技能上下文的工人代理执行,并包含验证门和条件重试。在CDISC-Bench基准测试中,GxP-Agent使用Claude Sonnet 4.6实现了100%的结构匹配,而所有单代理和扁平多代理方法均为0%,表明编码

8月18日周二 · 4 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源模型发布

Jais 2:阿拉伯语中心的开源大语言模型家族

MBZUAI、Cerebras 和 Inception 联合发布了 Jais 2,一个以阿拉伯语为中心的开源大语言模型家族,包括 70B 和 8B 参数版本。该模型在阿拉伯语和文化相关基准测试中表现优异,并支持高效推理,70B 版本在 Cerebras 硬件上可实现每秒 2000 token 的生成速度。模型已在 HuggingFace 上以商业许可发布,并

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

Claude AI生成的Python测试质量不弱于人类测试

一项研究评估了Claude AI生成的Python测试与人类编写的测试质量,发现Claude Sonnet/Opus 4.6及更新模型生成的测试在多个评估协议下不弱于人类编写的测试。该研究使用真实工具Extractor的测试套件,并采用四种独立评估方法,包括历史回退测试、AST变异测试、覆盖引导变异测试和定性评分。结果表明AI生成的测试质量与人类相当,但研究

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

DESA:混合检索中的通道非对称查询扩展方法

该研究提出 DESA(Dense Expansion and Sparse Anchoring)方法,用于混合检索中的非对称查询扩展。LLM 生成参考段落,通过正交残差扩展增强稠密检索,通过分数乘积锚定限制稀疏检索的词汇支持。在七个 BEIR 数据集上,DESA 相比未扩展查询将 nDCG@10 和 Recall@20 分别提升 3.82% 和 2.38%,

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

亚马逊购买稀有书籍用于AI训练,引发争议

据404 Media报道,亚马逊正在购买大量稀有书籍,通过切断书脊并扫描的方式用于AI模型训练。一个追踪设备显示,一本稀有书籍最终被送往拉斯维加斯的亚马逊设施VGT3。亚马逊回应称,购买书籍是为了改善客户使用的产品和服务。由于互联网文本已被大量使用,稀有书籍成为新的训练数据来源,且2022年前出版的书籍不含AI生成内容,可避免模型崩溃风险。

另有 2 家信源报道

8月17日周一 · 2 条
正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源研究

美团详解Agent评测:从观测到持续迭代的实践方法论

美团技术团队发表了一篇关于Agent评测的科普文章,系统介绍了评测的定义、体系建立方法以及长程Agent框架带来的评测变化。文章基于图灵Agent评测团队两年的实践经验,提出了“观测+评测=持续迭代”的研发公式,并分享了人人对齐、人机对齐等核心方法论。文章还讨论了长程Agent时代评测范式的变化,以及Skill评测等新趋势。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

AI聊天机器人检索医学研究的能力评估:模型、用户角色和样本量的影响

一项研究评估了Claude Sonnet 5、Gemini 3.1 Pro和ChatGPT GPT-5.5在医学问题中检索临床研究的能力,发现平均仅能检索到Cochrane综述中39.2%的纳入研究,且存在对大规模试验的偏见。模型和用户角色显著影响检索性能,其中ChatGPT表现最佳,研究者角色检索效果优于临床医生和患者角色。