Answer.AI 发布小型 ColBERT 检索模型,以 33M 参数超越更大模型
Answer.AI 发布了 answerai-colbert-small-v1,这是一个仅有 3300 万参数的 ColBERT 多向量检索模型,采用 JaColBERTv2.5 训练方法,在 BEIR 基准上超越了同等规模模型及 e5-large-v2 等更大模型。该模型兼容 Sentence Transformers、RAGatouille 和 Stan
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Answer.AI 发布了 answerai-colbert-small-v1,这是一个仅有 3300 万参数的 ColBERT 多向量检索模型,采用 JaColBERTv2.5 训练方法,在 BEIR 基准上超越了同等规模模型及 e5-large-v2 等更大模型。该模型兼容 Sentence Transformers、RAGatouille 和 Stan
阿里云官方AI博客介绍了智能客服从传统NLP机器人到RAG增强,再到AI原生智能体的演进过程,并重点阐述了如何构建“评估-诊断-优化”三位一体的运营Agent平台,利用大模型自动评测客服对话效果,实现BadCase发现准确率85%以上,根因归类和优化建议生成准确率80%以上,显著降低人工运营成本。
阿里巴巴国际站发布AI内容生成方案,用于跨境电商中民族特色品类的识别与匹配。该方案基于大模型构建民族特征知识库,实现民族品类与国际站叶子类目的智能匹配,并通过人工评测优化数据质量。商品挂载错误率从8.4%降至1.8%,显著提升运营效率。
一项案例研究显示,六人学生团队在一个学期内使用AI辅助构建了基于RAG的对话式入职助手,并采用三层成本模型测量开发成本。初始报告的成本比为19.4,但后续发现两个测量错误(订阅制下每token成本推断错误和反事实劳动力定价错误),修正后为9.9。研究强调AI辅助开发成本测量容易出错且难以察觉,呼吁更严谨的测量方法。
该研究通过受控实验探究检索器返回文档的冗余性与多样性对RAG生成器答案正确性的影响。实验使用FictionalQA数据集,发现重复文档和LLM改写版本并不能显著提升答案正确性,而提供多样化的文档(如不同体裁)能带来17%-47%的提升。研究指出,提升效果主要源于文档体裁的多样性,而非更多相关答案的可用性,建议检索方法应关注生成器对多样性的偏好。
一项研究评估了Claude Sonnet 5、Gemini 3.1 Pro和ChatGPT GPT-5.5在医学问题中检索临床研究的能力,发现平均仅能检索到Cochrane综述中39.2%的纳入研究,且存在对大规模试验的偏见。模型和用户角色显著影响检索性能,其中ChatGPT表现最佳,研究者角色检索效果优于临床医生和患者角色。
Amazon DynamoDB 推出了原生向量搜索功能,允许开发者直接在 DynamoDB 中存储嵌入向量并执行近似最近邻查询,无需单独的向量数据库。该功能支持过滤相似性搜索和可配置的向量索引,适用于语义搜索、代理记忆、RAG 等场景。AWS 表示该功能可扩展至数万亿向量,并保持毫秒级延迟,但成本可能高于 S3。
txtai 引入了 LEMUR(Learned Multi-Vector Retrieval)和可配置的均值中心化,以改进晚期交互检索。LEMUR 学习多向量表示的固定维度编码,使晚期交互模型能使用标准向量索引;均值中心化解决了 token 向量各向异性问题。在 BEIR 数据集上,LEMUR 在相同向量维度下相比 MUVERA 显著提升 NDCG@10,但
Simon Willison 在其博客中介绍了一种利用 LLM 进行内容标签化的新方法。该方法不直接让模型从现有标签列表中选择,而是先让模型自由生成可能的标签,再通过向量嵌入与现有标签库匹配,找到最接近的具体标签。Doug Turnbull 提出了这一解决方案,并建议在提示中提供标签形状示例以提升效果。
本文比较了跨语言信息检索(CLIR)方法在斯里兰卡政府信息检索中的应用,使用僧伽罗语和泰米尔语查询英文资料。研究发现,跨语言嵌入模型(尤其是BGE-M3)在Recall@15上达到96.2%(僧伽罗语-英语)和95.6%(泰米尔语-英语),优于基于查询翻译的方法(Google Translate为92.4%和93.0%),且无需翻译开销。结果表明,多语言嵌入
arXiv 论文提出 TTT-Embed 框架,在冻结嵌入模型的输出空间中学习轻量级残差向量,以蒸馏重排序器或 LLM 的排名奖励,无需访问模型权重或修改索引。实验覆盖 5 个嵌入模型和 15 个 MTEB 检索任务,TTT-Embed 将测试时检索性能提升最高 +8.36 nDCG@10,并能泛化到未见查询和任务,同时通过保持基础权重冻结来缓解灾难性遗忘。
该研究对七种主流向量数据库系统(FAISS、Qdrant、Milvus、Weaviate、Chroma、pgvector、LanceDB)进行了全面实证评估,覆盖六个数据集、超过400万向量,测量了检索质量、查询性能和资源消耗等15项指标。结果显示FAISS吞吐量最高但缺乏数据库功能,Weaviate召回率最佳,Qdrant延迟最低,LanceDB索引构建更
该论文提出一个两层级代理系统,将维护的时间点知识库与报告写作分离,以解决长文研究报告中数值漂移、来源缺失和信任扁平化问题。系统在包含6130个来源的公共语料上评估,消除了6845个跨章节数字矛盾,并实现零前瞻违规。
AWS 博客介绍了使用 Amazon Bedrock AgentCore 加速并购尽职调查的多智能体系统。该系统通过编排多个 AI 代理,自动完成数据收集、分析和合规检查,将原本需要数周的工作缩短至数小时。文章提供了两种实现路径:使用 Amazon Quick 集成方案或基于 AgentCore 的自定义架构,并强调了治理、可追溯性和知识积累的重要性。
科大讯飞于8月12日线上发布会推出覆盖智能管理、流程IT、供应链交易、营销销售、研发制造、决策分析、出海智能化七大核心场景的全场景智能体矩阵,标志着其企业服务从单点AI工具向全场景智能体体系升级。科大讯飞提出企业AI竞争已从能力构建转向价值创造,强调智能体需嵌入业务流并形成闭环。此次发布包括讯飞智聘、星火陪练、智慧工牌、SparkOS、星火知识库·Agent
本研究探讨了大型语言模型(LLM)在巴西通用数据保护法(LGPD)背景下简化需求工程(RE)的潜力。研究开发并评估了一种基于检索增强生成(RAG)的系统,利用LGPD文本和ANPD指南,通过少样本提示和思维链技术自动生成用户故事和验收测试场景。评估结果显示高性能,证实了LLM能从软件初始阶段确保法规合规,弥补了现有研究多聚焦GDPR且偏重事后验证的空白。
本文提出了一种用于生成式文档检索的令牌级信用分配优化框架,通过为每个解码步骤估计逐步奖励,解决序列级奖励导致的信用分配模糊问题。实验表明,该方法在检索基准上优于序列级奖励基线,验证了细粒度监督的有效性。
CoinRAG 是一种针对长上下文检索增强生成(RAG)的优化方法,通过复用细粒度的语义片段缓存而非完整块,在低预填充延迟约束下提升效率与准确性。在 LongBench 多跳问答任务上,CoinRAG 平均相对提升 F1 分数 5.3%,并实现了新的帕累托前沿。
AI2 的 OlmoEarth Studio 平台推出自定义嵌入向量导出功能,用户可计算并下载地球观测数据的紧凑数值表示。这些嵌入向量支持相似性搜索、分割和无监督探索等下游任务,并可通过 Studio UI 或 API 定制区域、时间、编码器变体等参数。官方展示了基于 60 个标注像素的线性分类器在越南红树林区域达到 0.84 的加权 F1 分数,证明了嵌入
OneAdvanced 是一家英国企业软件提供商,在 AWS 上部署了超过 50 个 AI 代理,使用 Llama 4 Maverick 和 Llama Guard 4 模型,通过自托管方式满足英国数据主权要求。该解决方案基于 Amazon SageMaker AI、vLLM、RAG 管道和 Strands Agents SDK,支持医疗、法律等受监管行业。