Together AI 长上下文微调:突破 LLM 有效长度限制
Together AI 发布技术博客,探讨大语言模型长上下文能力的现状与挑战。文章指出,尽管模型宣称支持百万级 token,但实际有效上下文长度远低于标称值,性能随长度增加而下降。为解决此问题,Together AI 平台现已支持最长 32k token 的微调,并展示了通过微调 Llama 3.1 8B 模型在重复任务上性能大幅提升的案例,强调长上下文微调
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Together AI 发布技术博客,探讨大语言模型长上下文能力的现状与挑战。文章指出,尽管模型宣称支持百万级 token,但实际有效上下文长度远低于标称值,性能随长度增加而下降。为解决此问题,Together AI 平台现已支持最长 32k token 的微调,并展示了通过微调 Llama 3.1 8B 模型在重复任务上性能大幅提升的案例,强调长上下文微调
EMBL AI Librarian 是一个为 AI 智能体设计的生命科学知识层,它通过单个 LLM 协调检索过程,将自然语言查询转化为对 Europe PMC 的补充子查询,并阅读选中的论文以定位相关证据。在 ScholarQABench 上,Librarian 将 Citation F1 提高了超过 16 分,并在 LitQA2 基准上使 GPT-5.4
arXiv 上发表了一篇关于通用多模态嵌入(UME)的论文,提出 ReLoop-UME 模型。该模型通过循环复用参数共享的检索形成块,并引入可学习的检索寄存器,在不增加 token 工作区的情况下沿模型深度扩展计算。实验表明,ReLoop-UME 在 MMEB-V2 和 MRMR 基准上持续提升检索性能,且运行速度比 UME-R1 快 44.9 倍,比 PL
Hugging Face 博客发布了一篇教程,作者 ngxson 从零开始用 Python 和 ollama 实现一个简单的 RAG(检索增强生成)系统。文章解释了 RAG 的两个核心组件(检索模型和语言模型),并演示了如何通过嵌入模型、向量数据库和聊天机器人构建系统,使用 cat-facts 数据集作为示例。该教程旨在帮助读者理解 RAG 的基本原理和实现
Hugging Face 博客发布了 LettucePrevent,一种在 RAG 生成循环中集成 token 级检测器以实时抑制事实幻觉的方法。其数字检测器在多个模型上将数字幻觉相对减少超过 60%,但事实检测器仅在 Llama-2 7B 上显著降低幻觉(-26.6%),且运行时开销高达 7 倍。该方法通过自定义 LogitsProcessor 和 Hug
Together AI 发布了 Open Deep Research,一个开源的 LLM 工作流,用于回答需要多跳推理的复杂问题并生成研究报告。该工作流模拟人类研究过程,包括规划、搜索、自我反思和写作,并集成了 Together AI 云平台上的多种模型。其目标是提供灵活、可扩展的架构,供开发者社区使用和扩展,同时发布了数据集和代码。
Cohere 发布了开源模型 Command A+,这是一个混合专家(MoE)模型,总参数 218B,激活参数 25B,支持 128K 上下文和 48 种语言,采用 Apache 2.0 许可证。该模型在推理、智能体任务、多模态和检索等企业工作负载上性能优于前代 Command A 系列,并可在低至两张 H100 或单张 B200 的硬件上高效运行。Comm
BAAI Community 发布了一个生产级企业 RAG 系统,支持混合搜索(BM25 + 向量)、基于 LangGraph 的多智能体编排,并集成了 CRAG、HyDE、RAG Fusion 和对话记忆。系统基于 FastAPI、pgvector、Elasticsearch 和 Redis 构建。
Mistral AI 发布了 Mistral OCR 4,这是一款文档解析模型,支持边界框、块分类和置信度评分,覆盖 170 种语言,并可在单容器中自托管部署。该模型在人类评估和 OlmOCRBench 基准上表现优异,价格低至每千页 2 美元(批量 API),适用于企业搜索、RAG 和代理工作流。
LightOn AI 发布了两个开源的 307M 参数多语言检索模型 mDenseOn 和 mLateOn,基于 28 亿对翻译训练语料,覆盖 8 种语言和代码。mLateOn 在 BEIR、MIRACL 和 MLDR 基准上表现最佳,尤其在未见语言上泛化能力显著优于 mDenseOn。所有模型、数据集和训练代码均已开源。
Dify 发布 v1.16.1 版本,主要包含错误修复和安全增强。新功能包括工作流工具节点的多选输入、节点定位器、块选择器改进、从侧边栏导出 Agent DSL,以及知识追踪的观测性增强。安全方面,Agent 沙箱现在通过 Squid 正向代理运行,并加强了 API 与 agent 后端之间的令牌认证,同时修复了多个漏洞。性能上,新增的轻量级最近应用端点将首
Mem0 发布了 Python SDK v2.0.14,新增 Oracle AI Vector Search 向量存储提供商,支持连接池、HNSW/IVF 索引、JSON 元数据过滤和六种距离度量。同时修复了 OpenSearch 通配符过滤、错误处理以及 Milvus 更新操作中的多个问题。
Google 发布了 Gen AI JavaScript SDK 的 v2.12.0 版本,新增了 AntigravityAgentConfig、历史配置、触发器资源、CodeMenderAgentConfig 等功能,并支持为 gaos 保留自定义请求头。此外,该版本为 gemini-embedding-2 模型的嵌入响应填充了按模态划分的提示词 toke
RAGFlow 发布 v0.26.4 版本,新增了支持 16 种语言的语言感知 Snowball 词干提取器,并修复了多个 bug,包括解析 LM-Studio 模型名时崩溃、MCP 服务器崩溃、Docling 解析器丢失数学公式等问题。该版本还统一了三个服务为一个二进制文件,并引入了知识编译工作流。
微软研究院发布了 Memora,一种面向长期任务 AI 代理的可扩展记忆系统,通过解耦存储内容与检索方式,平衡抽象与具体性,显著提升代理效率。Memora 在 LoCoMo 和 LongMemEval 基准上达到最先进性能,相比全上下文推理减少高达 98% 的 token 使用。该论文发表于 ICML 2026,代码已在 GitHub 开源。
RAGFlow 发布 v0.26.2 版本,新增 WhatsApp、钉钉、企业微信聊天渠道集成,并改进文件解析功能。该版本修复了多个 bug,包括 MCP 服务器挂起、docx 解析错误、Gemini 模型区域端点问题等,同时扩展了韩语和法语翻译。
LlamaIndex 发布了 v0.14.23 版本,主要更新包括核心模块的多模态合成功能、多模态查询引擎、工具调用模拟 LLM,以及多项 bug 修复和性能优化。此外,多个嵌入适配器(如 Cohere、Google GenAI)和回调模块也进行了依赖更新和兼容性调整。
RAGFlow 发布 v0.26.1 版本,新增功能包括允许用户修改现有模型配置的模型类型,支持将 RAGFlow 助手部署为 Discord 和飞书等外部消息平台上的聊天机器人,并在 Langfuse 中按会话对多轮聊天追踪进行分组以方便调试。此外,该版本修复了多个 bug,包括令牌计费不准确、嵌入截断限制、错误处理重构,以及为 /chat/complet
RAGFlow 发布 v0.26.0 版本,新增多项功能:为多个模型提供商自动填充模型列表,支持配置同一提供商的多个 API 密钥;新增 Outlook、OneDrive、Microsoft Teams 等数据源连接器;为 GraphRAG 索引流程中的社区提取和实体解析实现检查点与恢复功能。此外,该版本还改进了推理模型的响应速度,修复了多个 bug,并新增
RAGFlow 发布 v0.25.5 版本,新增本地与 SSH 数据源支持,并优化数据集搜索路径,延迟降低 50-100%。该版本还改进了元数据过滤、TTS 缓存、服务器启动速度等性能,并修复了多项安全与功能问题。