返回主题地图

检索增强

技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 10 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Dropbox 将 Riviera 演进为支持 AI 工作负载的通用内容处理平台

Dropbox 将内部文件预览服务 Riviera 演进为通用内容处理平台,支持 300 多种文件格式和 100 多种转换能力,每秒执行数十万次转换,并支撑 Search、Replay、Sign、Dash 等产品。该平台通过可组合的转换流水线、异步执行和缓存机制,让 AI 工作负载复用既有内容处理基础设施。Dropbox 还通过公开 API 暴露文档转 Ma

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

你的下一个 DSL 作者是语言模型:用类型化领域接地消除语法幻觉

文章提出「类型化领域接地」(Typed Domain Grounding, TDG)方法,认为大模型在领域特定语言(DSL)上的幻觉本质是训练数据频率问题而非知识问题。TDG 将领域嵌入训练数据丰富的主语言中作为类型化内部 DSL,使领域错误表现为编译器类型错误而非静默失败。在 Claude Sonnet 5 的五十任务基准中,该方法比两种宽松的外部 DSL

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

智能体式RAG中部分答案质量与效用的预测

该论文提出一种轨迹内探测框架,用于研究智能体式RAG(Agentic RAG)多跳问答中中间答案状态的变化。作者在每次检索-推理迭代后强制模型生成中间答案,定义“部分答案质量”和“部分效用”两个指标,并发现多数轨迹中仅一次迭代显著提升答案质量,后续迭代收益甚微。基于此,作者构建了部分答案质量预测与部分效用预测任务,实验显示质量预测更可预测(Pearson相关

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向AI原生MBSE的模型治理接口:读取侧充分性与写入侧可采纳性

该论文提出「认知充分性」(epistemic adequacy)作为AI原生MBSE的数据架构模式,分为读取侧充分性与写入侧可采纳性两部分。作者以公开的Apollo 11 SysML v2重建模型为案例,指出结构完整的模型仍缺少推导链、认知状态标注、来源追踪和可解析证据,导致AI读取者不弃权而是从训练数据填补空白。论文提出治理查询架构框架(GQAF),包含八

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

PCap:Facebook Marketplace 个性化检索阶段多样性封顶

Meta 在 Facebook Marketplace 提出 PCap 个性化检索阶段多样性封顶框架,通过基于香农熵的用户多样性偏好建模、用户分桶和个性化类目上限,在多源候选召回阶段引入多样性约束。为调优高维参数,作者采用自动化在线优化方法 Parameter Tuning Sequence。大规模线上 A/B 实验显示 PCap 显著提升用户浏览体验相关的

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

DenseFace:基于密度感知概率匹配的人脸识别偏见缓解

该论文提出 DenseFace,一种基于 von Mises-Fisher 分布密度感知的概率匹配方法,用于在无需重新训练的前提下减少预训练人脸识别模型中的种族偏见。方法通过建模人脸嵌入的局部密度并调整相似度分数,在多种网络架构、训练数据集和损失函数上均能持续降低偏见,同时保持识别准确率。作者还采用 NIST 评估协议,以固定阈值下的误匹配率作为主要偏见指标

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

后训练量化在文本嵌入模型上的失效边界:四类嵌入器家族的实测图谱

该研究系统测试了仅权重量化(PTQ)在检索嵌入模型上的表现,覆盖四个架构家族的五个检查点,在多种位宽和分组大小下评估三个检索语料库。结果显示,INT4/g16 下模块级量化影响极小(最多约1个NDCG点),INT3 下模块敏感度排序因模型家族而异且成本不可加,INT2 下检索质量保留率从1.3%到65.9%不等,存在强烈的模型家族依赖的“低比特悬崖”。权重重

正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究

Google 提出 Retrieve-for-Train:用离线 RL 加速复杂 AI 搜索

Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将奖励对齐的查询扇出行为编译为监督信号,再蒸馏进轻量扩散检索器,从而在推理时单次生成连贯、专家级的搜索结果集合。该方法在 Gemma3-4B 和 Qwen3-4B 上使用 Soft-GRPO 训练,并在时尚文本到图像与音乐文本到音乐

正文结构化主题已通过公开置信门槛
Google ADK JavaScript Releases一手来源开源

Google ADK JavaScript 发布 v2.1.0:新增沙箱执行与 RAG 记忆

Google 发布 ADK JavaScript 的 v2.1.0 版本,新增 Docker 沙箱代码执行器 ContainerCodeExecutor、Vertex AI RAG 记忆后端 VertexAiRagMemoryService、Chrome Prompt API 端侧模型 BaseLlm,以及自愈式错误恢复插件 ReflectAndRetryT

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon Bedrock 提示缓存降低 90% 输入成本

AWS 博客介绍 Amazon Bedrock 的提示缓存功能,通过在请求中加入 cachePoint 标记缓存系统提示、文档和工具定义等重复上下文,缓存命中时输入 token 成本最多降低 90%,TTFT 也会缩短。文章给出缓存写入比标准输入贵 25%、缓存读取便宜 90% 的定价,并展示消息内容、系统提示、工具定义、混合 TTL、租户隔离及 LangC

9月15日周二 · 3 条
正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

面向RAG系统的预检索查询聚类自适应Top-k文档检索

该论文提出一种面向RAG系统的预检索查询聚类框架,用于自适应选择top-k文档检索深度。方法离线通过NDCG-k曲线估计每个查询的饱和点k ,再在嵌入空间聚类查询并为每个簇推荐检索深度;运行时将查询分配到簇并常数时间选择top-k。相比依赖检索后文档聚类的CAR方法,该方案是预检索且以查询为中心,在异构语料中更稳健。作者称在全流量查询测试中效果提升超36%,

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

混合专家语言模型可成为强大高效的检索器

该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

云原生 Graph-RAG 错误归因解耦:数据完整性诊断框架

该论文提出一个三层解耦诊断框架,用于将云原生 Graph-RAG 系统的错误正交归因于推理损失、知识图谱缺陷和 Cypher 生成错误。作者在青藏高原东南部时空生态知识图谱上注入八类缺陷进行评测,发现数据完整性而非算法推理是主要性能瓶颈,结构缺陷使系统准确率从 0.93 降至 0.39。研究还观察到参数化知识掩蔽效应(PKME),即 LLM 用内部记忆补偿断

9月14日周一 · 6 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Ninth Wave 基于 Amazon Bedrock 构建 AI 开放金融入驻助手

Ninth Wave 在 Amazon Bedrock AgentCore 上构建了 AI 驱动的开放金融入驻助手 Compass,用于自动完成银行 API 验证、字段映射和就绪度评分。该系统采用多智能体架构,通过意图路由、按任务选择模型和租户隔离的上下文 grounding,在满足 SOC 2、PCI DSS 等金融合规要求的同时提升入驻效率。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

AWS 生成式 AI 定制化光谱:从提示工程到自定义模型

AWS 发布博客,提出生成式 AI 定制化光谱的 8 步决策框架,帮助团队在提示工程、RAG、微调、继续预训练和从零训练之间做出选择。框架分为 USE、ENHANCE、TRAIN 三类,并映射到 Amazon Bedrock 等 AWS 服务。核心原则是从最简单的方法开始,仅在准确率、延迟或领域需求不满足时才升级。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GigaChat 发布 3B 双向嵌入模型 Giga-Embeddings-instruct-3B-0826

Hugging Face 上发布了 GigaChat 系列的新文本嵌入模型 Giga-Embeddings-instruct-3B-0826,基于 Qwen3 架构(36 层、hidden 2048、约 3B 参数),将自注意力改为双向 encoder 风格,并用 InfoNCE 对比损失训练。模型采用 mean pooling + L2 归一化,支持俄语和

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

MemRetriever:从长期记忆中学习搜索、反思与检索

MemTensor 提出 MemRetriever,一种将长期记忆检索建模为多步搜索过程的智能体式检索模型,通过并行搜索、串行搜索和反思去噪三种动作,主动规划检索与停止时机。研究使用 ReAct 风格轨迹做监督预热,并用 GRPO 强化学习优化证据覆盖、降噪和答案充分性。在 LOCOMO、LongMemEval、HotpotQA、MuSiQue 和 2Wik

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

压缩的代价:事实幻觉的率失真极限

该论文提出一个信息论框架,将闭卷问答中的事实幻觉分解为两个可分离的来源:未观测事实的覆盖缺失,以及已观测事实因有限记忆被迫压缩存储而导致的失真。作者用覆盖-压缩模型证明了一个率失真下界,并通过理论模拟和在现代语言模型上的受控事实注入实验验证了预测特征。该工作为选择性记忆、强制压缩、检索和长上下文组织等行为提供了统一的信息论解释。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

R2VC:检索、验证与置信度校准的模块化事实核查

研究者提出 R2VC,一种模块化的事实核查架构,将检索、推理、验证与置信度校准分离,结合稀疏+稠密混合检索、经 SFT 与 DPO 对齐的生成器、外部 NLI 交叉编码器筛选候选以及轻量级序列级校准器。在 FEVER 上,8B 骨干模型使用 R2VC 后准确率比基线提升 13.74%。消融实验显示验证器候选筛选与置信度校准贡献最大,移除候选筛选准确率降至 7

9月13日周日 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

CMSManhattan 发布 JiRack Ultra 7B CPU 三值模型

CMSManhattan 在 Hugging Face 发布 JiRack Ultra 7B(CPU)模型,基于 DeepSeek R1-7B 架构并加入 BitNet 风格的三值(1.58bit)支持,提供 GGUF 量化版本,面向 CPU 推理优化。模型附带更新的 JiRack Precision Tokenizer,新增 Routing、Media、V