OVOS 多语言意图分类模型发布并弃用
Hugging Face 上发布了 Jarbas/ovos-model2vec-intents-distiluse-base-multilingual-cased-v2 模型,这是一个基于 Model2Vec 的多语言意图分类模型,支持多种语言。该模型已被弃用,建议用户使用 OpenVoiceOS 的新版本模型。模型由 Minish Lab 开发,可用于静态
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 上发布了 Jarbas/ovos-model2vec-intents-distiluse-base-multilingual-cased-v2 模型,这是一个基于 Model2Vec 的多语言意图分类模型,支持多种语言。该模型已被弃用,建议用户使用 OpenVoiceOS 的新版本模型。模型由 Minish Lab 开发,可用于静态
FastGPT 发布 v4.16.2 版本,移除了文件解析相关的 Worker 并发配置,并自动根据 CPU 并行度设置硬上限。新增韩语支持、账号注销、DOC/PPT/XLS 等多种文档格式解析,以及基于 Milvus BM25 的全文检索功能。商业版需执行资源权限数据清理与迁移,Milvus 用户需升级至 2.5.16 及以上。
Agno 发布 v3.0.5 版本,包含多项破坏性变更和新功能。主要变更包括:嵌入失败不再被掩盖,而是显式报告;新增部分内容状态(partial);支持可选的嵌入重试机制;新增 GandrTools 文本转语音工具包和 llmman 模型提供商。这些改进旨在提高知识库摄入的可靠性和错误透明度。
ASTRA 是一个用于工单解决和分析的智能体系统,通过中央编排器协调三个专业信息收集智能体(工单相似性、日志分析和领域知识),并利用法官-编排器循环生成有证据支持的故障排查报告。该系统在 987 个真实电信故障工单上评估,平均质量得分 4.13/5.0,其中 59.9% 的报告正确识别了组件级或更细的故障区域,且硬件故障的诊断难度显著高于软件和配置故障。
印度理工学院甘地讷格尔分校等机构的研究人员发布了GurukulAI,一个面向印度教育体系的AI驱动交互式学习平台。该平台基于从NCERT教科书中提取的18,720个双语问答对,微调LLaMA 3.1 8B模型,并采用检索增强生成(RAG)框架,支持英语和印地语,提供答疑、练习和考试风格问题等功能。该研究旨在弥合全球大语言模型能力与印度地区教育需求之间的差距,
本研究提出一种混合架构,将向量搜索与GraphRAG、Leiden社区检测及交叉编码器重排序相结合,用于气候科学问答。相比传统RAG,该混合方法在上下文相关性和召回率上分别提升160%和177%,表明统一局部与全局检索优于文本片段孤立处理。实验基于Instituto Tecnológico Vale的科学文献数据集,使用7个LLM进行评估。
AgenticRag-R1 是一个基于强化学习的框架,通过内存栈和细粒度动作空间深度融合推理、检索和记忆,并采用分层动作感知奖励和信息感知轨迹拒绝策略,以解决现有 RAG 系统在多步推理中自适应检索和上下文修订的不足。实验表明,该方法在多个多跳、开放域和智能体推理基准上优于强基线,并展现出更稳健、可解释且记忆感知的推理行为。代码已在 GitHub 上匿名公开
该研究提出了一种基于数据库增强的检索增强生成(RAG)方法,用于自动修复REST API误用。研究构建了11种不同的RAG数据库配置,并在从SwitchBot和Fitbit收集的真实误用案例上进行了评估。结果显示,基线方法的修复率为54.3%,而使用四个数据库的RAG方法最高达到88.6%,表明按版本和内容类型组织规范可有效提升修复性能。
MERIT 框架旨在缓解生成式极端多标签分类(XMC)中的暴露偏差,用于用户兴趣倾向建模。通过置换不变的多目标损失和混合金标签与挖掘的难负样本,该方法在包含 25 万以上兴趣类别的电商数据集上,将全局召回率提升至少 11.9%,平均 Hit@k 提升 6.1%,并在生产 A/B 测试中实现用户转化率提升 0.26%。该研究由 arXiv 发布,属于学术研究。
该研究提出一种基于检索增强生成(RAG)的谬误检测与分类方法,利用论证关系(支持与攻击)动态引导外部知识检索,以提升政治辩论中谬误识别的准确性。在ElecDeb60to20基准上,通过42种检索配置和14个模型评估,谬误检测的macro-F1最高达0.864,分类达0.725,显著优于非检索基线。该方法构建了15GB的领域知识库,并强调论证结构作为动态检索引
AWS 发布了一篇博客,介绍如何使用 Amazon Bedrock Managed Knowledge Base 和 AWS CloudFormation 构建可观测的企业级代理检索解决方案。该方案通过 AgentCore 和 AgenticRetrieveStream API 实现多知识库路由与迭代检索,并内置了基于 OpenTelemetry 的观测性和
AWS 发布了基于 Amazon Bedrock 托管知识库构建多租户智能体聊天应用的架构方案。该方案利用 Bedrock 的托管知识库处理文档摄取、向量索引和检索,并通过 Cognito 身份验证和元数据标签实现租户数据隔离。应用通过 API Gateway、Lambda、SQS 和 DynamoDB 实现异步摄取和状态跟踪,支持用户上传文档并立即进行基于
NVIDIA 发布了 GLM-5.2 的 NVFP4 量化版本,该模型基于 ZAI 的 GLM-5.2,采用 MoE 架构和稀疏注意力,支持长上下文。量化使用 NVIDIA Model Optimizer,支持 SGLang 和 vLLM 推理,专为 Blackwell 硬件优化。模型以 MIT 许可证发布,适用于商业和非商业用途。
PACE 是一个用于网页内容提取的智能体框架,通过 LLM 分析页面结构并学习发布者特定的提取配置,在推理时使用固定确定性提取器模板,无需额外 LLM 调用。实验表明,PACE 在文章正文、元数据和多模态提取上优于可扩展的非人工基线,接近人工构建的发布者特定解析器质量。该框架旨在自动化发布者特定提取,为 LLM 数据管道提供可扩展的页面表示。
arXiv 论文提出 TiGER(Time-Integrated Graph for Efficient Retrieval),一种用于动态向量数据集的时间感知近似最近邻搜索方法。TiGER 通过构建和维护统一图索引,利用版本化连通性,支持任意时间范围的直接查询,无需后过滤或合并。实验表明,在保持准确率的同时,查询吞吐量(QPS)相比基线最高提升 5 倍,适
本研究针对个人记忆RAG,以单一用户的LINE聊天记录为对象,将358,896条消息分割为22,329个时间连贯的块,并构建了raw text、summary和embedding text三种搜索表示。通过对比BM25、稠密向量检索及线性混合检索,发现embedding text bm25在单一检索器中表现最佳,而embedding text bm25与em
arXiv 论文提出 CareGraph,一个可审计的混合 AI 框架,用于基于证据的个性化纵向健康智能。该框架将实验室、电子病历、可穿戴设备等多源健康数据转化为趋势、缺失上下文和可追溯的解释,并通过确定性规则与 LLM 结合,在合成数据上验证了高准确率和安全性。研究表明 CareGraph 比单一 GPT-5.6 基线更快、更简洁,且更符合纵向目标,为患者
Agno 发布 v3.0.3,为知识库引入按页网站摄入和按文件文件夹摄入,每页/每文件独立行,支持摘要驱动刷新、失败隔离和级联删除。新增 SitemapReader 和 PageFetcher 以改进 URL 抓取,PDF 条目可引用,并提供 KnowledgeManagementTools 和 AgentOS 知识路由。修复了多页 URL 删除时向量残留、
Cloudflare 推出了 AI Search 服务,为 AI 代理和开发者提供内置的搜索和检索功能,支持代理集成、多模态搜索,并与其他 Cloudflare 工具无缝集成。该服务自动处理爬取、解析、嵌入、向量数据库和搜索 API 等端到端搜索流程,并支持无 sitemap 的自动发现模式。AI Search 可通过单个命令创建搜索实例,并可通过 Work
香港科技大学团队提出PACE框架,用于长视频问答中的证据获取。PACE采用两阶段方法:先基于问题因子索引片段描述,再结合候选答案进行对比验证。在MMR-V基准上,PACE达到42.6%准确率,优于Deep Video Discovery等基线,并在多个长视频基准上表现一致。