返回主题地图

大语言模型

技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月4日周二 · 6 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

DLLM-TTS:用于语音合成的块离散扩散语言模型

DLLM-TTS 是一种将文本到语音合成(TTS)建模为基于 X-Codec2 神经音频编解码器令牌的条件块离散扩散的框架。该模型将序列分解为块,在块内应用掩码扩散,同时顺序处理块,以学习局部声学一致性和全局文本-语音对齐。在推理时,块内并行令牌预测实现了 0.15 的实时因子(RTF),一个在 20K 小时数据上训练的 0.6B 参数模型在 Seed-TT

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

基于LLM的上下文感知文化遗产导览系统

本文介绍了对文化遗产网络应用 Triangolazioni 的扩展,该扩展利用大型语言模型(LLMs)在松散耦合、与 LLM 无关的架构中,为策展内容补充上下文相关的外部信息。系统支持上下文相关的信息搜索和呈现,且不依赖于特定的 LLM。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

GARDRec:面向大语言模型推荐的决策级图接地框架

GARDRec是一个面向大语言模型推荐系统的决策级图接地框架,通过构建语义结构物品表示、个性化图上下文和显式决策特征,增强LLM在下一项推荐中的排序能力。在三个公开基准上的实验表明,GARDRec在多个LLM骨干网络上普遍优于代表性基线。消融和诊断分析验证了图投影、邻域检索、显式决策特征、排序损失和生成校准的贡献。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

基于RAG的上下文知识增强:减少中小企业LLM错误信息

该研究针对中小企业在使用大语言模型时面临的幻觉和错误信息问题,提出了基于检索增强生成(RAG)的VectorRAG和GraphRAG建模方法。研究在LLaMA、Mistral和Qwen等多个先进LLM上进行了实验评估,结果显示RAG增强的LLM能显著减少幻觉和错误信息,提高响应质量和上下文相关性,从而支持更可靠、可信的决策。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 推出 LoLCATs:高效线性化 LLM 新方法

Together AI 推出 LoLCATs 方法,通过注意力迁移将现有 Transformer LLM 快速转换为次二次复杂度模型,无需从头预训练。该方法在 Llama 3.1 全系列(8B/70B/405B)上首次实现线性化,仅用参数高效微调(<0.2%参数)和 4000 万训练 token,显著降低计算成本,同时提升零样本准确率,并匹配原始 Trans

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 发布 QTIP:新型权重量化方法实现质量与速度兼得

Together AI 发布了 QTIP,一种新的仅权重量化方法,结合 Trellis 编码量化与不连贯处理,在模型质量和推理速度上达到最先进水平。QTIP 在 QuIP# 基础上改进,速度比未量化模型快 3 倍以上,并已发布预量化模型(如 Llama 3.1 405B Instruct)和代码库。该论文将作为 Spotlight 出现在 NeurIPS 2

8月3日周一 · 13 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

通过自蒸馏增强基于评分标准的强化学习

Hugging Face 每日论文介绍了一篇关于基于评分标准的强化学习(Rubric-based RL)的研究。论文指出该方法的两个失败模式:未探索标准(UC)和受抑制标准(SC),其中SC在超过57%的训练样本中出现。作者提出Criterion-Distilled Policy Optimization(CriPO)方法,通过策略内自蒸馏和令牌级优势修正同

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

LLMs能否真正理解题目难度?对自动生成题目的启示

该研究探讨了大型语言模型(LLMs)在预测大规模阅读与写作测试中题目难度水平的表现。研究发现,零样本GPT-4.1(温度设为0)的预测准确率最高,二次加权kappa(QWK)为0.578,但仍低于ConvBERT(QWK=0.625)。所有LLMs在标记难题时表现不佳,GPT-5.4倾向于低估难度,且嵌入分析表明仅凭语义信息不足以预测难度。研究建议在利用LL

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

LLM令牌生成的动力系统可区分性保证

该论文将LLM响应分类任务形式化为两个随机线性动力系统之间的二元假设检验,证明忽略令牌动力学的分类器存在准确率下限,而基于动力系统的分类误分类概率随序列长度指数衰减。研究还通过近似交织条件刻画了跨嵌入模型的泛化能力,解释了该方法的经验性能。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

DragonCrawl:基于意图的生成式移动端到端测试框架

DragonCrawl 是一个基于大语言模型的移动端端到端测试框架,从嵌入相似度匹配演进到生成式意图推理,利用 GPT-4o 的多模态能力在 CI/CD 中持续验证用户流程。该系统在 iOS 和 Android 上分别达到 91.6% 和 92.2% 的通过率,将测试接入时间从 96-120 小时缩短至 4 小时以内,并节省了约 27 人年的维护工作量。论文

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

LLM框架用于发现重大数学猜想:AI探索下一个黎曼猜想

arXiv 上发布了一篇论文,提出了一种用于发现重大数学猜想的三阶段 LLM 框架,包括区域搜索、反思验证和 Lean 4 形式化验证。实验表明,20 个候选猜想全部通过形式化检查,且无重复。该框架旨在系统化生成和验证具有高数学潜力的猜想,减少对专家直觉的依赖。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Think2Go:基于LLM推理的生成式下一个POI推荐框架

arXiv 论文提出 Think2Go,一种用于下一个兴趣点(POI)推荐的生成式框架,结合了监督微调和基于强化学习的推理,以增强对语义ID的理解并探索时空模式。通过两种优势加权机制(基于核密度估计的提示不确定性校准和奖励归一化缩放)实现联合优化,形成隐式课程学习策略,提升训练稳定性和探索能力。该框架旨在解决现有方法在数据稀疏和复杂移动模式下的局限性。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

利用大语言模型为AR应用生成仓库感知的蜕变关系

该研究提出了一种利用大型语言模型、结合仓库级上下文和推理编排的上下文感知流水线,用于为增强现实(AR)应用自动生成和优化蜕变关系(MRs)。研究在142个移动AR系统仓库上评估,生成了14,916个候选MRs,其中层级上下文覆盖最广(7,004个MRs),并通过代理式审议过程在79.0%的案例中协调冲突,最终88.2%的结果选择了上下文感知关系。人工orac

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

TAPR:利用任务感知提示重写器提升大语言模型性能

arXiv 上发布了一篇题为 TAPR 的论文,提出了一种任务感知的提示重写器,利用强化学习(GRPO)和 LLM 作为评判者来优化用户提示,以提升下游大语言模型的性能。实验表明,在问答、摘要和算术推理等任务上,该方法能生成更清晰、更具指导性的提示,并在 Natural Questions 和 GSM8K 基准上取得更高准确率。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Snapchat 推出基于 LLM 的生成式检索系统 SnapLGR

Snapchat 团队在 arXiv 上发布了 SnapLGR,一个基于 LLM 的生成式检索系统,用于短视频推荐。该系统通过语义标识符、继续预训练和 TensorRT-LLM 优化,在 A/B 测试中相比 TIGER 基线提升了观看时长等指标。研究表明,生产级生成式检索需要联合设计表示学习、词汇表接地和高效训练服务。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

AI能否评估AI科学家?基于自动多模型评审的自主研究生成系统基准研究

本研究提出了一种使用前沿大语言模型进行自动同行评审的基准测试协议,用于评估AI科学家系统生成的论文质量。研究对Sakana AI v1/v2、CycleResearcher和Data-to-Paper四个框架生成的60篇论文与FARS公司的15篇基准论文进行了比较,发现FARS论文在原创性、严谨性、清晰度和重要性四个维度上显著优于其他系统。Gemini和Cl

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

隐喻诱导的算法引导:LLM代码生成中的跨领域程序迁移

该研究探讨了大型语言模型在代码生成中受隐喻指令影响的现象,发现隐喻可能引发跨领域程序性迁移,导致模型生成低效算法。研究者开发了MASC框架来诱发和检测这种“隐喻算法引导”效应,并通过行为评估和表征分析验证了其机制。结果表明,隐喻技能通过转移源领域的程序模式而非表面语言影响模型输出。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

仅用奖励训练语言模型:达到99.9%语法正确率但缺乏泛化

作者在 Hugging Face 博客上分享了一项实验:仅使用奖励信号(REINFORCE 算法)从头训练一个 15M 参数的法国语言模型,使其学会生成特定句子,无需预训练或语言规则。实验发现,逐步奖励(如按位置匹配)能有效引导学习,而全有或全无奖励则完全失败。模型最终达到 99.9% 的语法正确率,但学习到的只是位置到字符的查表,缺乏抽象结构,迁移测试也证

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

ParallelKernelBench:前沿 LLM 尚无法编写快速多 GPU 内核

Together AI 发布了 ParallelKernelBench(PKB),一个用于评估多 GPU 内核生成的基准测试框架,包含 87 个来自真实代码库的问题,要求模型将 PyTorch + NCCL 实现替换为直接通过 NVLink 通信的 CUDA 内核。测试前沿模型如 GPT-5.5、Gemini 3 Pro 和 Opus 4.7 后发现,正确率

8月2日周日 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

J-Space:又一个LLM读心术?

Hugging Face 博客发布文章,介绍一篇关于用雅可比透镜(J-lens)解读大语言模型内部表征的研究。研究通过干预 Claude 的西班牙语表征,发现模型存在两条独立的信息处理路径,分别支持自动语言处理和显式推理,类似神经科学的全局工作空间。文章强调该结果比标题更严肃,但并未证明模型具有主观意识。