Dropbox 将 Riviera 演进为支持 AI 工作负载的通用内容处理平台
Dropbox 将内部文件预览服务 Riviera 演进为通用内容处理平台,支持 300 多种文件格式和 100 多种转换能力,每秒执行数十万次转换,并支撑 Search、Replay、Sign、Dash 等产品。该平台通过可组合的转换流水线、异步执行和缓存机制,让 AI 工作负载复用既有内容处理基础设施。Dropbox 还通过公开 API 暴露文档转 Ma
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Dropbox 将内部文件预览服务 Riviera 演进为通用内容处理平台,支持 300 多种文件格式和 100 多种转换能力,每秒执行数十万次转换,并支撑 Search、Replay、Sign、Dash 等产品。该平台通过可组合的转换流水线、异步执行和缓存机制,让 AI 工作负载复用既有内容处理基础设施。Dropbox 还通过公开 API 暴露文档转 Ma
文章提出「类型化领域接地」(Typed Domain Grounding, TDG)方法,认为大模型在领域特定语言(DSL)上的幻觉本质是训练数据频率问题而非知识问题。TDG 将领域嵌入训练数据丰富的主语言中作为类型化内部 DSL,使领域错误表现为编译器类型错误而非静默失败。在 Claude Sonnet 5 的五十任务基准中,该方法比两种宽松的外部 DSL
该论文提出一种轨迹内探测框架,用于研究智能体式RAG(Agentic RAG)多跳问答中中间答案状态的变化。作者在每次检索-推理迭代后强制模型生成中间答案,定义“部分答案质量”和“部分效用”两个指标,并发现多数轨迹中仅一次迭代显著提升答案质量,后续迭代收益甚微。基于此,作者构建了部分答案质量预测与部分效用预测任务,实验显示质量预测更可预测(Pearson相关
该论文提出「认知充分性」(epistemic adequacy)作为AI原生MBSE的数据架构模式,分为读取侧充分性与写入侧可采纳性两部分。作者以公开的Apollo 11 SysML v2重建模型为案例,指出结构完整的模型仍缺少推导链、认知状态标注、来源追踪和可解析证据,导致AI读取者不弃权而是从训练数据填补空白。论文提出治理查询架构框架(GQAF),包含八
Meta 在 Facebook Marketplace 提出 PCap 个性化检索阶段多样性封顶框架,通过基于香农熵的用户多样性偏好建模、用户分桶和个性化类目上限,在多源候选召回阶段引入多样性约束。为调优高维参数,作者采用自动化在线优化方法 Parameter Tuning Sequence。大规模线上 A/B 实验显示 PCap 显著提升用户浏览体验相关的
该论文提出 DenseFace,一种基于 von Mises-Fisher 分布密度感知的概率匹配方法,用于在无需重新训练的前提下减少预训练人脸识别模型中的种族偏见。方法通过建模人脸嵌入的局部密度并调整相似度分数,在多种网络架构、训练数据集和损失函数上均能持续降低偏见,同时保持识别准确率。作者还采用 NIST 评估协议,以固定阈值下的误匹配率作为主要偏见指标
该研究系统测试了仅权重量化(PTQ)在检索嵌入模型上的表现,覆盖四个架构家族的五个检查点,在多种位宽和分组大小下评估三个检索语料库。结果显示,INT4/g16 下模块级量化影响极小(最多约1个NDCG点),INT3 下模块敏感度排序因模型家族而异且成本不可加,INT2 下检索质量保留率从1.3%到65.9%不等,存在强烈的模型家族依赖的“低比特悬崖”。权重重
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将奖励对齐的查询扇出行为编译为监督信号,再蒸馏进轻量扩散检索器,从而在推理时单次生成连贯、专家级的搜索结果集合。该方法在 Gemma3-4B 和 Qwen3-4B 上使用 Soft-GRPO 训练,并在时尚文本到图像与音乐文本到音乐
Google 发布 ADK JavaScript 的 v2.1.0 版本,新增 Docker 沙箱代码执行器 ContainerCodeExecutor、Vertex AI RAG 记忆后端 VertexAiRagMemoryService、Chrome Prompt API 端侧模型 BaseLlm,以及自愈式错误恢复插件 ReflectAndRetryT
AWS 博客介绍 Amazon Bedrock 的提示缓存功能,通过在请求中加入 cachePoint 标记缓存系统提示、文档和工具定义等重复上下文,缓存命中时输入 token 成本最多降低 90%,TTFT 也会缩短。文章给出缓存写入比标准输入贵 25%、缓存读取便宜 90% 的定价,并展示消息内容、系统提示、工具定义、混合 TTL、租户隔离及 LangC
该论文提出一种面向RAG系统的预检索查询聚类框架,用于自适应选择top-k文档检索深度。方法离线通过NDCG-k曲线估计每个查询的饱和点k ,再在嵌入空间聚类查询并为每个簇推荐检索深度;运行时将查询分配到簇并常数时间选择top-k。相比依赖检索后文档聚类的CAR方法,该方案是预检索且以查询为中心,在异构语料中更稳健。作者称在全流量查询测试中效果提升超36%,
该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最
该论文提出一个三层解耦诊断框架,用于将云原生 Graph-RAG 系统的错误正交归因于推理损失、知识图谱缺陷和 Cypher 生成错误。作者在青藏高原东南部时空生态知识图谱上注入八类缺陷进行评测,发现数据完整性而非算法推理是主要性能瓶颈,结构缺陷使系统准确率从 0.93 降至 0.39。研究还观察到参数化知识掩蔽效应(PKME),即 LLM 用内部记忆补偿断
Ninth Wave 在 Amazon Bedrock AgentCore 上构建了 AI 驱动的开放金融入驻助手 Compass,用于自动完成银行 API 验证、字段映射和就绪度评分。该系统采用多智能体架构,通过意图路由、按任务选择模型和租户隔离的上下文 grounding,在满足 SOC 2、PCI DSS 等金融合规要求的同时提升入驻效率。
AWS 发布博客,提出生成式 AI 定制化光谱的 8 步决策框架,帮助团队在提示工程、RAG、微调、继续预训练和从零训练之间做出选择。框架分为 USE、ENHANCE、TRAIN 三类,并映射到 Amazon Bedrock 等 AWS 服务。核心原则是从最简单的方法开始,仅在准确率、延迟或领域需求不满足时才升级。
Hugging Face 上发布了 GigaChat 系列的新文本嵌入模型 Giga-Embeddings-instruct-3B-0826,基于 Qwen3 架构(36 层、hidden 2048、约 3B 参数),将自注意力改为双向 encoder 风格,并用 InfoNCE 对比损失训练。模型采用 mean pooling + L2 归一化,支持俄语和
MemTensor 提出 MemRetriever,一种将长期记忆检索建模为多步搜索过程的智能体式检索模型,通过并行搜索、串行搜索和反思去噪三种动作,主动规划检索与停止时机。研究使用 ReAct 风格轨迹做监督预热,并用 GRPO 强化学习优化证据覆盖、降噪和答案充分性。在 LOCOMO、LongMemEval、HotpotQA、MuSiQue 和 2Wik
该论文提出一个信息论框架,将闭卷问答中的事实幻觉分解为两个可分离的来源:未观测事实的覆盖缺失,以及已观测事实因有限记忆被迫压缩存储而导致的失真。作者用覆盖-压缩模型证明了一个率失真下界,并通过理论模拟和在现代语言模型上的受控事实注入实验验证了预测特征。该工作为选择性记忆、强制压缩、检索和长上下文组织等行为提供了统一的信息论解释。
研究者提出 R2VC,一种模块化的事实核查架构,将检索、推理、验证与置信度校准分离,结合稀疏+稠密混合检索、经 SFT 与 DPO 对齐的生成器、外部 NLI 交叉编码器筛选候选以及轻量级序列级校准器。在 FEVER 上,8B 骨干模型使用 R2VC 后准确率比基线提升 13.74%。消融实验显示验证器候选筛选与置信度校准贡献最大,移除候选筛选准确率降至 7
CMSManhattan 在 Hugging Face 发布 JiRack Ultra 7B(CPU)模型,基于 DeepSeek R1-7B 架构并加入 BitNet 风格的三值(1.58bit)支持,提供 GGUF 量化版本,面向 CPU 推理优化。模型附带更新的 JiRack Precision Tokenizer,新增 Routing、Media、V