密集检索模型性别敏感性的机制分析
该研究对密集检索模型中的性别敏感性进行了机制性分析,发现性别信号源于输入嵌入,并通过少数晚期注意力头传播,这些注意力头同时携带性别和术语匹配信号。基于此,研究者测试了嵌入级和注意力级干预,发现嵌入级干预非特异性地中和分数差异,而注意力级干预产生方向性偏移。研究为针对性去偏提供了机制基础,并强调了在共享模型组件中分离性别与相关性信号的挑战。
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该研究对密集检索模型中的性别敏感性进行了机制性分析,发现性别信号源于输入嵌入,并通过少数晚期注意力头传播,这些注意力头同时携带性别和术语匹配信号。基于此,研究者测试了嵌入级和注意力级干预,发现嵌入级干预非特异性地中和分数差异,而注意力级干预产生方向性偏移。研究为针对性去偏提供了机制基础,并强调了在共享模型组件中分离性别与相关性信号的挑战。
该研究比较了三种将冻结的Qwen2.5-32B-Instruct模型与污水处理模拟器(CCSS-IX)结合的方法:实时模拟器工具调用、结构化参数注入和DRR检索器。在198个因果问题上,三种方法分别达到99.5%、79%和75.8%的准确率,均优于基线RAG的48%。DRR检索器仅110M参数,训练时间约17秒,且能跨工厂迁移,在反事实基准上表现最佳。该机制
一项针对检索增强生成(RAG)架构的三重稳健性分析发现,GraphRAG 的过度引用问题在架构上普遍存在,但其对忠实度的影响取决于语料库。在 DO-178C 类型化边需求上,GraphRAG 的忠实度随跳数增加而下降,而在 Wikipedia 链上则上升。研究还发现,单一 LLM 评判器的忠实度评估对检索状态敏感,而基于稠密嵌入的路由器在跳数分类上达到 0.
本文提出UniME-R1框架,用于统一多模态检索。该框架通过嵌入器-顾问架构,基于初始检索结果生成检索中心思维链(RC-CoT),以解决LVLM检索器忽略细粒度判别线索的问题。实验表明,UniME-R1在MMEB-V2等多个基准上优于强基线。
Jina AI 发布 jina-reranker-v3.5 重排序模型,参数仅 0.6B,性能超越 1.5B 的 mxbai-rerank-large-v2 和 4B 的 Qwen3-Reranker-4B,在 BEIR 上达到 63.20,半结构化检索提升 9.6 nDCG@10。该模型采用混合注意力(3L2G)和自蒸馏技术,在保持质量的同时显著提升推理速
Cloudflare 宣布对其 AI Search 产品进行多项开发者体验改进,包括自动索引数据、支持无 sitemap 的网站、提供公共搜索端点、自定义域名和私有访问控制,并预览了新的定价模型。这些功能旨在让开发者更容易为 AI 代理构建搜索解决方案,并已在 Cloudflare 自家的 Dev Stack MCP 中应用,为编码代理提供最新的文档检索。
该研究提出一个框架,为LLM代理提供两种自主搜索大型解空间的机制:基于留出数据评分的排行榜作为奖励信号驱动单代理持续改进,以及多代理并行自主探索。在电商产品目录匹配任务上,单代理达到47.8-57.4%的合格覆盖率,五代理达到62.8-69.4%,优于33.3%的基线。该框架贡献在于持续改进奖励循环和全自主并行探索机制。
arXiv 发表了一篇关于生物医学实体链接的论文,提出名为 PILOT 的三阶段框架,包括邻域感知检索、双重重排序和分数融合。该框架利用知识库本体结构,在五个基准数据集上达到平均最优性能,同时保持推理效率。
该论文提出了一种面向嵌入式C软件的函数复用检测方法,通过领域感知的检索增强生成(RAG)流水线,结合注释、调用图和README等上下文信息,使用八种嵌入模型提取特征,并设计四种硬件兼容性验证器过滤候选函数。在六个公共嵌入式项目上的评估显示,SonarQube作为复用过滤器存在93.6%的误报率,而该方法验证器准确率达97.5%,有效弥补了静态分析在硬件兼容性
arXiv 上发布了一篇关于技能检索的研究论文,提出了一种名为 Capability Pages 的集群对比技能表示方法,通过包含正触发器、负边界和判别性主体来提升大型语言模型代理的技能检索性能。在 SRA-Bench 基准测试中,该方法使五种检索器的 Recall@10 平均提升 2.94 点,端到端任务成功率平均提升 3.62 点,并在中文 SSL-Sk
LendingTree 在 Amazon Bedrock 上构建了一个多智能体抵押贷款助手,使用 LangGraph、MCP 和 Amazon Bedrock 基础模型,包含监督者和两个专业工作者(教育和匹配)。该助手通过 Amazon Bedrock Guardrails 和 LLM 安全分类器确保合规性和数据保护,旨在教育借款人并提供个性化贷款选项。该解
AWS 在纽约峰会上宣布 Amazon Bedrock 上的 Web Search 功能正式可用,该功能通过内置的服务器端工具,将模型响应基于最新的网络知识进行 grounding,无需第三方供应商或外部 API。它采用多源 grounding 方法,结合亚马逊运营的网络索引和知识图谱,提供上下文高效的检索和单参数启用,并支持企业级合规(零数据出口)。开发者
Wnuan 提出了一种三阶段后训练流程,用于企业专有知识问答,包括从文档构建任务导向监督、带通用数据回放的监督微调,以及针对残余错误的强化学习。在 WnuanBench 基准上,32B 模型的可接受答案率从 52.76% 提升至 91.51%,但通用基准平均分下降 5.17 分,主要影响指令跟随能力。研究还发现残余错误采样优于全池和随机采样,并指出 RAG
AWS 发布了一篇技术博客,介绍如何使用 Amazon Bedrock AgentCore Browser 构建自动化网页洞察提取解决方案。该方案通过事件驱动架构,利用 AgentCore 的托管浏览器服务渲染 JavaScript 密集型页面,结合 Amazon Bedrock 进行 AI 分析、OpenSearch Serverless 进行语义搜索,并
Hugging Face 每日论文介绍了 UEmbed,一种仅解码器的多模态嵌入模型,能在一次因果前向传播中同时生成稀疏词级和稠密表示。UEmbed 通过添加可学习特殊标记并将词汇表划分为不相交子集来实现稀疏预测,发布了 2B、4B 和 9B 三种规模,其中 9B 模型在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏)的分数,优于现有公开数据训
arXiv 上发布了一篇关于分层 BM25 的论文,提出了一种在十亿文档规模下进行词汇搜索的新方法。该方法通过粗粒度索引选择文档组,将内存占用固定为约 4.4 GB,查询延迟降至约 300 毫秒,同时保证返回分数与扁平索引一致。
arXiv 上发布了一项名为 CeQe 的研究,提出交叉编码器查询扩展(CE-QE)方法,通过从语义检索结果中提取关键术语来增强 BM25 词汇检索,解决词汇鸿沟问题。在 BEIR 基准上,该方法显著提升了词汇召回率,其融合变体 SESF 在 Recall@100 和 nDCG@10 上分别优于现有方法,且无需修改 BM25 索引。
本文提出了一种名为PHA-Net的原型分层对齐网络,用于文本-视频检索任务。该方法通过引入模态共享原型作为桥梁,并设计原型支持的令牌合并模块和原型对比损失,以高效优化跨模态对齐。在MSR-VTT、ActivityNet、VATEX和Charades四个基准上,PHA-Net在召回率总和上分别提升了8.8%、19.2%、0.7%和4.9%,验证了其有效性。
该研究针对中小企业在使用大语言模型时面临的幻觉和错误信息问题,提出了基于检索增强生成(RAG)的VectorRAG和GraphRAG建模方法。研究在LLaMA、Mistral和Qwen等多个先进LLM上进行了实验评估,结果显示RAG增强的LLM能显著减少幻觉和错误信息,提高响应质量和上下文相关性,从而支持更可靠、可信的决策。
Hugging Face 博客介绍了 Bekko Embedding,两个多语言检索模型 bekko-embedding-v1-a8m 和 a25m,分别仅有 7.67M 和 24.93M 活跃参数,在 MMTEB Multilingual v2 的 18 个检索任务上平均分达 56.2 和 57.5,超越多语言 e5 和 BGE-M3。模型通过剪枝 mmB