Jina AI 发布多模态嵌入模型 v5-omni-small
Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Jina AI 发布了 jina-embeddings-v5-omni-small,一个约 1.74B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,生成 1024 维共享向量空间嵌入,并与文本版 v5 模型对齐,无需重新索引即可跨模态检索。该模型支持检索、分类、聚类和文本匹配等任务,最大序列长度 32768,提供 Matryoshka 维度裁剪,并
Jina AI 发布了 jina-embeddings-v5-omni-small-retrieval,这是一个多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型约 1.56B 参数,嵌入维度 1024,支持最长 32768 序列,并可通过 Elastic Inference Service 或本地安装使用。该模型在图
DistilVDR 是一个紧凑的 524M 视觉文档检索器,通过双学生蒸馏从 8B 教师模型中提炼而来,使用余弦对齐损失,无需相关性标签。它在 ViDoRe 基准上达到教师模型 86.9% 的 NDCG@5 性能,同时索引体积缩小 15.6 倍,索引速度提升一个数量级。研究团队发布了训练代码和模型权重。
LLM Agents Factory 是一个基于检索的框架,利用超过 20K 个预定义代理配置文件,按需构建领域特定且基于 Wikipedia 的代理。该框架支持语义搜索检索和蒸馏两种模式,在 MMLU、BIG-bench 等基准测试中,其检索式代理构建在准确率上超越非代理基线,并以更低推理成本匹配 AutoGen 的生成质量。该研究将代理构建视为信息检索问
Mem0 发布了 Python SDK v2.0.18,主要包含多项错误修复。核心修复包括对 user id、agent id 和 run id 中的特殊字符进行百分号转义,以确保会话作用域键的唯一性。向量存储方面,修复了 PGVector 过滤值类型检查、Oracle AI Vector Search 配置验证以及连接泄漏问题。这些修复提升了 SDK 的稳
Hugging Face 每日论文发布了一篇关于大型分类检索的研究,提出检索就绪差距问题,即输入为间接证据时目标概念难以被检索。为此,作者提出因子化假设搜索(FHS)方法,在金融分类标注和 CodiEsp 临床编码任务上取得了最佳性能。
本文提出了一种面向持续视觉数据流的搜索基础设施模型,包括分析器定义的场景、持久理解工件、视觉记忆和分层索引。作者开发了VideoDB数据格式(VDB)并在生产中实现,通过类型化搜索界面支持规划检索、状态调查、直接访问和基于证据的综合。在四个公共数据集上的9800多个查询对比中,通用组件流水线在Recall@1/@3/@10上优于商业视频原生引擎,表明视觉世界
该研究提出了一种有状态的多智能体LLM验证流水线,用于汽车基于模型的系统工程中的跨视图接口对齐。该框架采用顺序生成矩阵和基于车辆信号规范的检索增强生成,并通过独立的AI验证器代理进行对抗性审计,以消除幻觉。在高级驾驶辅助系统场景中,该方法实现了97%的实体可追溯性和85%的F1分数,而标准RAG的实体可追溯性为0%。
DS@GT ARC 团队提交了 Touché 2025 检索增强辩论任务的论文,该任务包括生成辩论中的下一句话和根据格赖斯准则评估辩论回复。他们使用来自三家提供商的六种领先大语言模型,通过检索增强提示流水线进行生成和评估。分析发现,前沿 LLM 作为生成器表现强劲,作为评估器在模型家族内部高度一致,但这种共识并不能可靠地预测官方评估结果,尤其在质量准则上差距
arXiv 论文提出 Search-G1,一种基于表征的内在奖励框架,用于训练搜索增强语言代理。该框架通过两个干预校准的读数(提示状态读数和答案承诺读数)衡量代理答案的操作性接地,以区分必要检索与冗余搜索,并在强化学习过程中周期性地重新拟合读数,使奖励与策略共同演化。实验表明,Search-G1 在多个基于搜索的问答基准上改善了接地与搜索成本的权衡,在保持竞
DocAtlas 是一个将长文档理解视为可变状态交互过程的系统,通过外部环境管理文档信息的搜索、读取、存储和展示。该系统结合了自改进检索、选择性证据访问和主动工作记忆,在固定上下文预算下运行。使用 GPT-5.4 时,DocAtlas 在 MMLongBench-Doc 上达到 71.4% 的准确率,超过人类专家参考水平;用 Qwen3.5-4B VLM 进
该研究识别了硬提示压缩中的一种结构性失败模式——指称悬空,即独立选择可能拆分依赖证据对,保留答案但删除解释所需的实体。在0.30压缩比下,Beaver在三个多跳问答数据集上的悬空率为34-54%,所有六种测试压缩器在HotpotQA上均表现出高达60%的悬空率。重新插入缺失的支持段落可将准确率提高29-34个百分点,而自动恢复探针在压缩比仅增加0.01的情况
FATE是一种帧级音视频时间嵌入方法,旨在同时捕捉语义和时间对齐。与现有嵌入模型和同步模型不同,FATE保留帧级序列并在物理时间线上对齐,通过联合目标训练。在三个任务上,FATE在时间和语义检索上大幅超越最强基线,在零样本事件定位上匹配全监督方法,并作为生成评估指标与人类判断相关性最佳。源代码已公开。
该研究提出了一种面向印度最高法院判决书的修辞角色感知检索增强生成(RAG)框架,通过基于修辞的文本分块、融合检索和交叉编码器重排序提升检索相关性,并利用查询分类与重写及聊天历史增强多轮对话理解。评估采用DeepEval框架,在上下文召回率和答案相关性等指标上表现优异,证明了领域特定增强对构建可靠且可解释的法律AI系统的重要性。
Jina AI 发布了 jina-reranker-v3,一个基于 Qwen3-0.6B 的 0.6B 参数多语言文档重排序模型,采用新颖的 last but not late interaction 架构,在 131K token 上下文中可同时处理多达 64 个文档。该模型在 BEIR 基准上达到 61.94 nDCG@10 的 SOTA 性能,比生成式
Hugging Face 博客发布了一篇技术文章,介绍了一个名为 dinghy-law 的 0.6B 参数法律嵌入模型,在 MTEB(Law) 基准上排名第二,超越了更大的模型。文章详细描述了在时间和计算资源有限的情况下,通过 LoRA 微调、基于梯度对齐的硬负样本挖掘、数据读取和权重空间合并等技术,实现了高性能。该模型基于 Qwen3-Embedding-
Hugging Face 博客发布了一篇关于 GLInt 的实地报告,GLInt 是一种用于晚期交互检索的几何匹配硬负样本挖掘方法。作者从多向量检索器挖掘的硬负样本是否优于密集检索器的问题出发,构建了 GLInt 模型,在 BEIR-15 任务上达到 57.43 的平均 nDCG@10,超越了 LateOn 的 57.22,成为 300M 参数以下最强的检索
Hugging Face 博客发布了一篇关于静态检索模型 Lattice 的文章。作者 ErikKaum 训练了 lattice-retrieval 模型,在 660M 精选查询/文档对上训练,BEIR 基准上 NDCG@10 达到 0.4749,优于参考模型。该模型仅 8MB,可在 8 核 M2 MacBook Air 上 7 分 26 秒嵌入整个英文维基
研究人员提出任务条件流匹配(TCFM)框架,用于多语言文本嵌入模型的适配。该框架针对不同任务采用不同的优化策略,仅在翻译任务上应用流匹配,同时结合教师引导的表示保留和三阶段课程学习。在Indic Massive Text Embedding Benchmark上,TCFM取得了新的最先进结果,提升了多语言任务的嵌入质量。论文接受后,代码库和数据集将公开。
NVIDIA 的研究团队针对现代希腊语对 Nemotron 检索栈进行了端到端适配,包括语料挖掘、合成监督、检索模型训练、重排序器适配和阅读器微调,并发布了名为 HERA 的基准。研究发现 BM25 基线在专业希腊语语料上优于多个现成的多语言稠密检索模型,而微调后的 Nemotron 1B 嵌入器将 nDCG@10 从 0.362 提升至 0.835。此外,