视觉世界搜索:持久视觉记忆、分层索引与源证据
本文提出了一种面向持续视觉数据流的搜索基础设施模型,包括分析器定义的场景、持久理解工件、视觉记忆和分层索引。作者开发了VideoDB数据格式(VDB)并在生产中实现,通过类型化搜索界面支持规划检索、状态调查、直接访问和基于证据的综合。在四个公共数据集上的9800多个查询对比中,通用组件流水线在Recall@1/@3/@10上优于商业视频原生引擎,表明视觉世界
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 40 条
本文提出了一种面向持续视觉数据流的搜索基础设施模型,包括分析器定义的场景、持久理解工件、视觉记忆和分层索引。作者开发了VideoDB数据格式(VDB)并在生产中实现,通过类型化搜索界面支持规划检索、状态调查、直接访问和基于证据的综合。在四个公共数据集上的9800多个查询对比中,通用组件流水线在Recall@1/@3/@10上优于商业视频原生引擎,表明视觉世界
该研究提出了一种有状态的多智能体LLM验证流水线,用于汽车基于模型的系统工程中的跨视图接口对齐。该框架采用顺序生成矩阵和基于车辆信号规范的检索增强生成,并通过独立的AI验证器代理进行对抗性审计,以消除幻觉。在高级驾驶辅助系统场景中,该方法实现了97%的实体可追溯性和85%的F1分数,而标准RAG的实体可追溯性为0%。
DS@GT ARC 团队提交了 Touché 2025 检索增强辩论任务的论文,该任务包括生成辩论中的下一句话和根据格赖斯准则评估辩论回复。他们使用来自三家提供商的六种领先大语言模型,通过检索增强提示流水线进行生成和评估。分析发现,前沿 LLM 作为生成器表现强劲,作为评估器在模型家族内部高度一致,但这种共识并不能可靠地预测官方评估结果,尤其在质量准则上差距
arXiv 论文提出 Search-G1,一种基于表征的内在奖励框架,用于训练搜索增强语言代理。该框架通过两个干预校准的读数(提示状态读数和答案承诺读数)衡量代理答案的操作性接地,以区分必要检索与冗余搜索,并在强化学习过程中周期性地重新拟合读数,使奖励与策略共同演化。实验表明,Search-G1 在多个基于搜索的问答基准上改善了接地与搜索成本的权衡,在保持竞
DocAtlas 是一个将长文档理解视为可变状态交互过程的系统,通过外部环境管理文档信息的搜索、读取、存储和展示。该系统结合了自改进检索、选择性证据访问和主动工作记忆,在固定上下文预算下运行。使用 GPT-5.4 时,DocAtlas 在 MMLongBench-Doc 上达到 71.4% 的准确率,超过人类专家参考水平;用 Qwen3.5-4B VLM 进
该研究提出了一种面向印度最高法院判决书的修辞角色感知检索增强生成(RAG)框架,通过基于修辞的文本分块、融合检索和交叉编码器重排序提升检索相关性,并利用查询分类与重写及聊天历史增强多轮对话理解。评估采用DeepEval框架,在上下文召回率和答案相关性等指标上表现优异,证明了领域特定增强对构建可靠且可解释的法律AI系统的重要性。
Jina AI 发布了 jina-reranker-v3,一个基于 Qwen3-0.6B 的 0.6B 参数多语言文档重排序模型,采用新颖的 last but not late interaction 架构,在 131K token 上下文中可同时处理多达 64 个文档。该模型在 BEIR 基准上达到 61.94 nDCG@10 的 SOTA 性能,比生成式
该研究对密集检索模型中的性别敏感性进行了机制性分析,发现性别信号源于输入嵌入,并通过少数晚期注意力头传播,这些注意力头同时携带性别和术语匹配信号。基于此,研究者测试了嵌入级和注意力级干预,发现嵌入级干预非特异性地中和分数差异,而注意力级干预产生方向性偏移。研究为针对性去偏提供了机制基础,并强调了在共享模型组件中分离性别与相关性信号的挑战。
该研究比较了三种将冻结的Qwen2.5-32B-Instruct模型与污水处理模拟器(CCSS-IX)结合的方法:实时模拟器工具调用、结构化参数注入和DRR检索器。在198个因果问题上,三种方法分别达到99.5%、79%和75.8%的准确率,均优于基线RAG的48%。DRR检索器仅110M参数,训练时间约17秒,且能跨工厂迁移,在反事实基准上表现最佳。该机制
一项针对检索增强生成(RAG)架构的三重稳健性分析发现,GraphRAG 的过度引用问题在架构上普遍存在,但其对忠实度的影响取决于语料库。在 DO-178C 类型化边需求上,GraphRAG 的忠实度随跳数增加而下降,而在 Wikipedia 链上则上升。研究还发现,单一 LLM 评判器的忠实度评估对检索状态敏感,而基于稠密嵌入的路由器在跳数分类上达到 0.
Cloudflare 宣布对其 AI Search 产品进行多项开发者体验改进,包括自动索引数据、支持无 sitemap 的网站、提供公共搜索端点、自定义域名和私有访问控制,并预览了新的定价模型。这些功能旨在让开发者更容易为 AI 代理构建搜索解决方案,并已在 Cloudflare 自家的 Dev Stack MCP 中应用,为编码代理提供最新的文档检索。
该研究提出一个框架,为LLM代理提供两种自主搜索大型解空间的机制:基于留出数据评分的排行榜作为奖励信号驱动单代理持续改进,以及多代理并行自主探索。在电商产品目录匹配任务上,单代理达到47.8-57.4%的合格覆盖率,五代理达到62.8-69.4%,优于33.3%的基线。该框架贡献在于持续改进奖励循环和全自主并行探索机制。
arXiv 发表了一篇关于生物医学实体链接的论文,提出名为 PILOT 的三阶段框架,包括邻域感知检索、双重重排序和分数融合。该框架利用知识库本体结构,在五个基准数据集上达到平均最优性能,同时保持推理效率。
该论文提出了一种面向嵌入式C软件的函数复用检测方法,通过领域感知的检索增强生成(RAG)流水线,结合注释、调用图和README等上下文信息,使用八种嵌入模型提取特征,并设计四种硬件兼容性验证器过滤候选函数。在六个公共嵌入式项目上的评估显示,SonarQube作为复用过滤器存在93.6%的误报率,而该方法验证器准确率达97.5%,有效弥补了静态分析在硬件兼容性
arXiv 上发布了一篇关于技能检索的研究论文,提出了一种名为 Capability Pages 的集群对比技能表示方法,通过包含正触发器、负边界和判别性主体来提升大型语言模型代理的技能检索性能。在 SRA-Bench 基准测试中,该方法使五种检索器的 Recall@10 平均提升 2.94 点,端到端任务成功率平均提升 3.62 点,并在中文 SSL-Sk
LendingTree 在 Amazon Bedrock 上构建了一个多智能体抵押贷款助手,使用 LangGraph、MCP 和 Amazon Bedrock 基础模型,包含监督者和两个专业工作者(教育和匹配)。该助手通过 Amazon Bedrock Guardrails 和 LLM 安全分类器确保合规性和数据保护,旨在教育借款人并提供个性化贷款选项。该解
AWS 在纽约峰会上宣布 Amazon Bedrock 上的 Web Search 功能正式可用,该功能通过内置的服务器端工具,将模型响应基于最新的网络知识进行 grounding,无需第三方供应商或外部 API。它采用多源 grounding 方法,结合亚马逊运营的网络索引和知识图谱,提供上下文高效的检索和单参数启用,并支持企业级合规(零数据出口)。开发者
AWS 发布了一篇技术博客,介绍如何使用 Amazon Bedrock AgentCore Browser 构建自动化网页洞察提取解决方案。该方案通过事件驱动架构,利用 AgentCore 的托管浏览器服务渲染 JavaScript 密集型页面,结合 Amazon Bedrock 进行 AI 分析、OpenSearch Serverless 进行语义搜索,并
arXiv 上发布了一篇关于分层 BM25 的论文,提出了一种在十亿文档规模下进行词汇搜索的新方法。该方法通过粗粒度索引选择文档组,将内存占用固定为约 4.4 GB,查询延迟降至约 300 毫秒,同时保证返回分数与扁平索引一致。
arXiv 上发布了一项名为 CeQe 的研究,提出交叉编码器查询扩展(CE-QE)方法,通过从语义检索结果中提取关键术语来增强 BM25 词汇检索,解决词汇鸿沟问题。在 BEIR 基准上,该方法显著提升了词汇召回率,其融合变体 SESF 在 Recall@100 和 nDCG@10 上分别优于现有方法,且无需修改 BM25 索引。
本文提出了一种名为PHA-Net的原型分层对齐网络,用于文本-视频检索任务。该方法通过引入模态共享原型作为桥梁,并设计原型支持的令牌合并模块和原型对比损失,以高效优化跨模态对齐。在MSR-VTT、ActivityNet、VATEX和Charades四个基准上,PHA-Net在召回率总和上分别提升了8.8%、19.2%、0.7%和4.9%,验证了其有效性。
AgentMemBench 是一个用于评估对话式 AI 代理长期记忆管理策略的统一基准,在相同条件下测试了五种策略(ICW、EKV、GEM、CBS、WAM),并使用三个公共数据集和 491 个标注问题进行了评估。结果显示,外部键值存储(EKV)在所有质量指标上表现最佳,尤其在长距离回忆方面显著优于其他策略,但代价是更高的内存占用。研究还评估了 MemGPT/
该研究针对中小企业在使用大语言模型时面临的幻觉和错误信息问题,提出了基于检索增强生成(RAG)的VectorRAG和GraphRAG建模方法。研究在LLaMA、Mistral和Qwen等多个先进LLM上进行了实验评估,结果显示RAG增强的LLM能显著减少幻觉和错误信息,提高响应质量和上下文相关性,从而支持更可靠、可信的决策。
arXiv 上发表了一篇关于通用多模态嵌入(UME)的论文,提出 ReLoop-UME 模型。该模型通过循环复用参数共享的检索形成块,并引入可学习的检索寄存器,在不增加 token 工作区的情况下沿模型深度扩展计算。实验表明,ReLoop-UME 在 MMEB-V2 和 MRMR 基准上持续提升检索性能,且运行速度比 UME-R1 快 44.9 倍,比 PL
Dify 发布 v1.16.1 版本,主要包含错误修复和安全增强。新功能包括工作流工具节点的多选输入、节点定位器、块选择器改进、从侧边栏导出 Agent DSL,以及知识追踪的观测性增强。安全方面,Agent 沙箱现在通过 Squid 正向代理运行,并加强了 API 与 agent 后端之间的令牌认证,同时修复了多个漏洞。性能上,新增的轻量级最近应用端点将首
Mem0 发布了 Python SDK v2.0.14,新增 Oracle AI Vector Search 向量存储提供商,支持连接池、HNSW/IVF 索引、JSON 元数据过滤和六种距离度量。同时修复了 OpenSearch 通配符过滤、错误处理以及 Milvus 更新操作中的多个问题。
Google 发布了 Gen AI JavaScript SDK 的 v2.12.0 版本,新增了 AntigravityAgentConfig、历史配置、触发器资源、CodeMenderAgentConfig 等功能,并支持为 gaos 保留自定义请求头。此外,该版本为 gemini-embedding-2 模型的嵌入响应填充了按模态划分的提示词 toke
Haystack 发布 v2.31.0,为 3.0 做准备,将多个组件迁移至独立集成包并标记弃用,包括 SentenceTransformers、Hugging Face API 等。新增 ConditionalRouter 的 output_passthrough 选项,支持路由复杂类型。DocumentNDCGEvaluator 默认按内容匹配文档,并新
RAGFlow 发布 v0.26.4 版本,新增了支持 16 种语言的语言感知 Snowball 词干提取器,并修复了多个 bug,包括解析 LM-Studio 模型名时崩溃、MCP 服务器崩溃、Docling 解析器丢失数学公式等问题。该版本还统一了三个服务为一个二进制文件,并引入了知识编译工作流。
微软研究院发布了 Memora,一种面向长期任务 AI 代理的可扩展记忆系统,通过解耦存储内容与检索方式,平衡抽象与具体性,显著提升代理效率。Memora 在 LoCoMo 和 LongMemEval 基准上达到最先进性能,相比全上下文推理减少高达 98% 的 token 使用。该论文发表于 ICML 2026,代码已在 GitHub 开源。
RAGFlow 发布 v0.26.2 版本,新增 WhatsApp、钉钉、企业微信聊天渠道集成,并改进文件解析功能。该版本修复了多个 bug,包括 MCP 服务器挂起、docx 解析错误、Gemini 模型区域端点问题等,同时扩展了韩语和法语翻译。
LlamaIndex 发布了 v0.14.23 版本,主要更新包括核心模块的多模态合成功能、多模态查询引擎、工具调用模拟 LLM,以及多项 bug 修复和性能优化。此外,多个嵌入适配器(如 Cohere、Google GenAI)和回调模块也进行了依赖更新和兼容性调整。
RAGFlow 发布 v0.26.1 版本,新增功能包括允许用户修改现有模型配置的模型类型,支持将 RAGFlow 助手部署为 Discord 和飞书等外部消息平台上的聊天机器人,并在 Langfuse 中按会话对多轮聊天追踪进行分组以方便调试。此外,该版本修复了多个 bug,包括令牌计费不准确、嵌入截断限制、错误处理重构,以及为 /chat/complet
RAGFlow 发布 v0.26.0 版本,新增多项功能:为多个模型提供商自动填充模型列表,支持配置同一提供商的多个 API 密钥;新增 Outlook、OneDrive、Microsoft Teams 等数据源连接器;为 GraphRAG 索引流程中的社区提取和实体解析实现检查点与恢复功能。此外,该版本还改进了推理模型的响应速度,修复了多个 bug,并新增
RAGFlow 发布 v0.25.5 版本,新增本地与 SSH 数据源支持,并优化数据集搜索路径,延迟降低 50-100%。该版本还改进了元数据过滤、TTS 缓存、服务器启动速度等性能,并修复了多项安全与功能问题。
Dify 发布 v1.14.2 补丁版本,重点进行安全加固、工作流可靠性提升、知识库稳定性修复以及部署和运行时调优。该版本加强了租户隔离和工具凭证安全,修复了工作流执行、RAG 管道和知识库的多个问题,并升级了插件守护进程和依赖。这些改进增强了 Dify 平台的安全性和稳定性,为后续的 Agent 功能奠定基础。
澳大利亚养老护理提供商Regis开发了基于微软Copilot Studio和Foundry的AI助手RegiCare Assist,用于自动总结护理记录并分类临床问题,以减少护理管理者的文书工作。该工具已在72家养老院中约150名员工中使用,使管理者能更快掌握居民状况,腾出更多时间直接护理。Regis强调AI仅作辅助,不替代临床判断,并计划未来与现有护理管理
Dify 发布 v1.14.1 补丁版本,重点进行安全加固、工作流与知识库稳定性提升、部署清理及 UI 平台迁移。安全方面包括自托管 SECRET_KEY 强化、内部指标端点保护、修复 IDOR 问题及依赖升级(如 LiteLLM 修复 CVE-2026-42208)。工作流和知识库修复了多项稳定性问题,并优化了 RAG 去重逻辑。该版本旨在提升自托管部署的
Open WebUI 发布 v0.9.5 版本,重点修复了多项安全漏洞,包括基于重定向的 SSRF 防护、iframe 内容安全策略、URL 解析器 SSRF 绕过、图片 URL 重定向 SSRF 等。同时新增了频道流式响应和工具支持、Markdown 渲染控制、终端代理响应头等功能,并修复了多个权限绕过问题,如技能和日历的公开共享权限、反馈用户归属伪造、工
DSPy 发布了 3.2.1 版本,主要移除了对 litellm 的上限限制,并修复了异步流式调用和 Embedder 缓存问题。同时更新了文档和 CI 流程,包括部署文档调整和 TestPyPI 发布验证强化。该版本还更新了多个依赖,并新增了两位贡献者的首次贡献。