RAGFlow v0.27.1 发布:新增连接器与搜索提供商,修复多项问题
RAGFlow 发布 v0.27.1 版本,新增 Azure DevOps 数据源连接器、You.com 和 Serply 网络搜索提供商,以及 Synthorai 模型提供商,并补充了 DeepSeek 模型。该版本改进了检索 API,暴露 rerank candidates count 等参数,并将元数据过滤下推到索引层以加速检索。同时修复了多项 bug
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
RAGFlow 发布 v0.27.1 版本,新增 Azure DevOps 数据源连接器、You.com 和 Serply 网络搜索提供商,以及 Synthorai 模型提供商,并补充了 DeepSeek 模型。该版本改进了检索 API,暴露 rerank candidates count 等参数,并将元数据过滤下推到索引层以加速检索。同时修复了多项 bug
本文介绍了 proFILL 方法,用于将大学学术咨询聊天机器人 hoBIT 从基于规则的对话系统升级为支持用户画像的检索增强生成(RAG)系统。proFILL 通过离线构建画像条件化索引,并在在线查询时按需获取用户画像属性,从而为不同院系、入学年份和专业的学生提供准确的答案。实验和用户偏好研究表明,proFILL 优于多种 RAG 基线,并能在开源模型中保持
本研究评估了RAG中证据感知检索评估的下游效用,发现其虽能改变检索排名,但在训练、系统选择及答案质量预测上并不稳定。人类注释确认过滤保留了证据,但不同评估器对答案质量改善结论不一,凸显了评估信号有效性的组合问题。
腾讯微信视觉团队发布了WeMM-Embedding,一个支持文本、图像、视频和交错输入的多模态嵌入模型系列,包含2B、4B和9B三种规模。该模型在MMEB-v2基准上,2B版本已超越此前领先的8B开源基线,9B版本以80.6分创下新纪录。模型已在微信视频号、公众号、朋友圈和电商等场景大规模部署,并在14个在线A/B测试中表现一致提升。模型权重和代码已在Git
AWS 发布了 Amazon Quick Desktop 与 Amazon FSx for NetApp ONTAP 的集成方案,支持治理式 AI 辅助周报生成。该方案通过 S3 访问点控制文件访问,利用知识库和技能实现自动化报告,并将报告准备时间从数小时缩短至数分钟。文章提供了详细的技术架构和部署前提条件。
该研究首次证明了在检索排序任务中,单向量嵌入与多向量嵌入之间存在指数级表达能力差距。作者构造了显式的查询-文档相关性矩阵族,其中多向量嵌入只需多项式大小即可正确排序,而单向量嵌入需要指数大小。基于理论构造,他们提出了ANDOR基准,实验显示单向量模型在零样本和微调后均表现不佳,而多向量模型持续领先,验证了理论预测。
KSE-Web 研究针对低资源语言高棉语的语义搜索,构建了包含 3K 篇清洗文档和 300 条人工审核查询的数据集,并评估了字符 n-gram BM25、多语言稠密检索、混合检索及基于 Qwen2.5 的 LLM 查询扩展。实验结果显示 BM25 性能最佳(Recall@10 0.943,nDCG@10 0.876),混合检索表现相当,而稠密检索单独使用效果
该论文研究了引用在人类和LLM偏好判断中的作用,基于SciArena和ResearchQA两个科学问答数据集,使用混合效应模型分析。主要发现包括:人类偏好引用更多样但总数更少的回答;LLM对引用的偏好与人类不同,且不同LLM之间也存在差异。研究结果对偏好数据收集和奖励建模具有启示意义。
AWS 发布了一个基于云的知识管理系统,利用 Amazon Bedrock、S3、OpenSearch Serverless 等 AWS 服务,通过智能头像和语音交互来捕获和传递机构知识。该系统支持自然语言查询,内置缓存以降低成本,并可通过 CloudFormation 快速部署。其目标是解决知识流失问题,适用于制造、医疗等行业。
Jina AI 发布了 jina-embeddings-v5-omni-nano,一个约 1.04B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型支持检索、分类、聚类和文本匹配任务,可通过 Hugging Face 或 Elastic Inference Service 使用。它定义了开放权重全模态嵌入模型
本文介绍了 BridgeGuard,一个完全离线(air-gapped)的基于智能体检索增强生成(RAG)的系统,用于自动化 FHWA 桥梁检查合规性验证。该系统在边缘硬件上本地运行,结合向量搜索和 SQL 查询,通过多步骤 ReAct 循环实现,在 Delaware 和 Texas 的桥梁数据上分别达到 99.77% 和 100% 的分类准确率,并实现 1
该研究提出了一个用于评估深度搜索中澄清能力的基准,基于百度搜索的真实查询构建了518个实例,并采用闭卷协议和静态金标准来防止意图泄漏。实验表明,澄清能提升搜索效用,其中ERNIE-4.5-Turbo-128K在开源模型中表现最佳,甚至超过GPT-5.2等闭源模型。研究还发现,在严格闭卷条件下,系统常提出无法回答的区域性问题,导致交互效率低下。
该研究首次系统刻画了电子健康记录(EHR)处理中的临床长上下文丢失中间效应(CLitM),发现大语言模型对位于长上下文中间位置的临床信息检索准确率显著下降,峰值与谷值准确率差距达21.9个百分点。作者提出了一种轻量级的查询条件临床抑制(QCCS)上下文选择门控方法,并在多臂实验中证明其端到端指令遵循性能优于BM25、密集检索和交叉编码器等基线。研究表明,查询
本文提出了一种面向LLM重排序的用户上下文感知物品画像框架,通过结构化元数据和评论生成客观特征与主观特质,并利用轻量级画像器为每个用户-物品对选择最相关信息,以解决大规模异构元数据带来的上下文窗口限制、特征重要性随物品和用户变化等挑战。实验表明该方法能持续提升LLM重排序效果,代码已开源。
普林斯顿大学和加州大学圣迭戈分校的研究人员通过超过8000次测试,研究了技能(skills)如何提升AI智能体的性能。研究发现,技能主要通过提供程序性指导(procedural grounding)帮助智能体,而非补充事实知识,这一机制在约66%的案例中有效。然而,当技能库从5个扩展到100个条目时,检索命中率从29.6%降至3.3%,表明技能检索是主要瓶颈
AWS 机器学习博客介绍了一种在 Amazon Bedrock 上通过查询感知压缩降低 RAG 成本的方法。该方法在检索后、最终回答前,使用较小的模型(如 Claude Haiku)过滤检索到的文本块,仅保留与查询相关的部分,再交由主模型(如 Claude Sonnet)生成答案,从而减少输入 token 数量,节省成本并降低幻觉风险。文章还讨论了架构、成本
Hugging Face 发布了 NeuML/colbert-bert-tiny 模型,这是一个基于 ColBERT 架构的微型多向量检索模型,由 BERT Tiny 微调而来,专为 GitHub Actions 等有限计算环境设计。该模型支持通过 Sentence Transformers v6.0.0 的 MultiVectorEncoder 直接加载,
HARP 是一个用于基于查询的 CVE 优先级排序的框架,它利用图增强的多视图评分和偏好自适应融合,无需显式偏好描述即可适应隐式偏好场景。实验表明,HARP 在多个基准和大型语言模型上优于现有方法。
CrossQ 是一种针对晚期交互检索模型(如 ColBERT)的跨令牌条件量化方法,通过在索引时计算轻量级文档上下文来指导码本选择,从而在压缩文档向量索引的同时保持排序质量。实验表明,在 2 B/token 下,CrossQ 在 BEIR 子集上将 MRR@10 提升了 0.010,在 4 B/token 下将 nDCG@10 提升了 0.009,并实现了
该研究提出了一种可变比特分配框架,通过将嵌入向量划分为连续桶并采用贪心策略非均匀分配存储,以在固定内存预算下提升量化质量。实验表明,在具有Matryoshka属性的嵌入上,非均匀分配在相同压缩率下比均匀分配在PQ和SQ上分别提升最多8%和18%的召回率。该工作为大规模检索系统的结构感知压缩与索引提供了新方向。