混合专家语言模型可成为强大高效的检索器
该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最
公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最
加拿大阿尔伯塔大学强化学习团队提出持续强化学习框架 FAME,通过快速学习模块与元学习模块的双系统设计,分别模拟海马体与大脑皮层协同机制,解决智能体学习新任务时遗忘旧知识的灾难性遗忘问题。论文定义了环境间距离与灾难性遗忘的数学度量,并在 MinAtar、Atari 和 Meta-World 上验证,在平均性能、前向迁移和遗忘三项指标上全面优于 Reset、微
Perplexity 将其本地智能体 Perplexity Computer 的便携版本 Portable Computer 扩展到 Windows 平台,支持配备 24GB 及以上显存的 NVIDIA GeForce RTX 和 RTX PRO 显卡。该版本由 NVIDIA GPU 加速,使用本地模型(如 Qwen 3.8 27B)在设备端分析数据、整合文
智谱宣布完成约50亿美元(约合人民币335.4亿元)融资,包括约20亿美元股份配售及约30亿美元零息可转债,资金约60%用于下一代GLM基础模型与完全自训练体系研发,重点探索递归式自我改进(RSI)循环。公司披露2026年上半年营收9.54亿元、同比增长近400%,MaaS及API收入8.25亿元,ARR达16亿美元。此举反映国产大模型头部厂商融资与上市竞赛
Vercel AI SDK 发布 @ai-sdk/xai@4.0.58 补丁版本,修复了不支持批量请求类型被错误接受的问题,并新增批量图像生成请求支持。同时修复了 DeepSeek 在空工具调用增量下推理流丢失的问题,并更新了 @ai-sdk/provider 与 @ai-sdk/provider-utils 依赖。
Interconnects AI 作者 Nathan Lambert 发布并持续更新一份关于开源 AI 与开放模型的阅读清单,汇总近几年的代表性文章。清单按基础概念、中美竞争、技术细节等主题组织,涵盖开放模型的定义、发布动机、商业战略、安全风险、数据缩减以及中国模型(如 Kimi K3、GLM-5.2)对生态的影响。文中还提到西方公司采用中国模型引发监管关注
llama.cpp 发布 b10909 版本,主要重构 Metal 后端的算子融合机制,将所有可融合模式统一到单张融合表(ggml-metal-fuse.cpp),供图优化器和算子编码器共用。修复了融合模式中输出索引使用相对索引导致 norm/MUL 融合被静默禁用、token 生成性能回退约 5% 的问题。新增 gated delta net 与 KV c
LinkedIn 公布了其 AI 职位搜索背后的训练基础设施,采用多教师蒸馏流水线,将 8B 相关性教师模型和 1.7B 互动教师模型的知识压缩进 0.6B 参数的排序模型。系统基于开源 SGLang 构建自定义框架,在训练循环中直接服务教师模型,并通过在线/离线蒸馏拆分、LiGer、多节点训练、FSDP2 和 H200 集群等优化实现约 8 倍训练加速。该
AWS 为 Amazon SageMaker HyperPod 上的推理推出模型缓存功能,通过预加载模型权重和容器镜像到集群节点的本地 NVMe 存储,将推理 Pod 的冷启动时间从数十分钟缩短到数秒。该功能针对 DeepSeek-R1 等 600GB 以上大模型,解决自动扩缩容时因重复下载镜像和权重导致的响应延迟问题。缓存采用优先调度而非强制调度,未命中缓
智东西报道了一款名为Omen Alpha的匿名模型,该模型在OpenCode调用量榜单中排名第七,以超高性价比和快速开发能力著称。实测显示,Omen Alpha具备视觉能力,能快速完成前端开发、游戏开发和3D建模,但在逻辑推理方面表现不佳,如洗车难题和公务员考试题正确率仅80%。目前该模型仅在OpenCode Go订阅套餐中可用,价格极低。
极佳视界联合清华大学、中科院自动化所等机构,在ECCV 2025上发表了13篇论文,其中7篇聚焦空间智能与物理AI,提出VLA-R1、OmniNWM、ReconPhys等模型,分别解决具身决策推理、驾驶世界模型闭环评估、3D资产物理属性重建等瓶颈,旨在推动物理AI从实验室走向工业落地。
法国AI公司Mistral完成30亿欧元D轮融资,投后估值超210亿欧元,由三星电子领投,ASML、英伟达等参投,创欧洲科技公司单轮融资纪录。资金将用于模型研发、算力扩展和商业增长,目前业务覆盖20国,服务超125家企业。Mistral近期发布Mistral Medium 3.5和Agentic Search等产品,但曾陷入使用DeepSeek模型蒸馏的争议
另有 1 家信源报道
华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动公司发布了首个Agent-Native模型NeoHorse,包含4B和9B两个版本。该模型利用其Routing Harness系统积累的多模型执行轨迹数据进行后训练,在Agent相关评测中4B模型表现达到或略超9B基础模型。公司旨在通过将执行经验转化为模型能力,构建从模型路由到训练改进的闭环,并探
Latent Space 发布了一个前沿 AEO(AI 引擎优化)追踪器,基于 7 个前沿模型在 161 个类别中的推荐结果,分析各产品在 AI 推荐中的主导地位。报告发现模型存在偏好偏差(如 Claude 推荐自家产品),但也观察到跨模型推荐案例。此外,Anthropic 的新模型 Astra 比 Sol 更自信且搜索来源更少,影响了 AEO 策略的有效性
Similarweb数据显示,ChatGPT在AI聊天机器人网站流量中的份额从三个月前的52.7%回升至55.5%,而谷歌Gemini的份额则从27.8%下滑至25.6%。同比来看,ChatGPT的份额从73.3%大幅下降,Gemini份额翻倍,Anthropic的Claude从1.9%增长至9.3%。这些数据仅涵盖网站流量,未计入移动应用和桌面端使用。
GOSIM Shenzhen 2026 开源技术大会将于 10 月 16-17 日在深圳举办,由 DHH 领衔,汇聚英伟达、微软、HuggingFace 等 150+ 全球讲师。大会设置 6 大技术主题论坛、7 场 Workshop、4 场 Hackathon 及 Spotlight 项目路演,聚焦 Agent、开源模型、机器人、边缘智能等下一代开源 AI
国内首份《中国办公Agent用户行为不完全报告》于9月7日在北京发布,基于LobsterAI的真实用户数据。报告显示北京用户量全国居首,海外用户占比超12%,前20%用户消耗87.4%算力,单次任务规模5个月增长3.1倍,非办公时间token消耗近60%,DeepSeek V4 Flash最受欢迎。该报告揭示了办公Agent正从对话走向深度工作,成为通用AI
国内AI人才经历三波大迁徙:从百度等大厂流向AI六小虎和字节等,再到百川智能、零一万物等战略收缩后人才流向腾讯等。深层原因包括股价、战略导向和组织架构。当前趋势是人才流动加速,AI Infra和数据人才受追捧,预训练需求下滑。
美国初创公司 Abliteration.ai 推出商业服务,通过“abliteration”技术移除开源权重模型(如智谱 GLM-5.3)的安全拒绝机制,并以 API 形式出售访问权限,用于网络安全测试和红队演练。该服务降低了使用门槛,但也引发了对滥用的担忧。公司声称不存储提示和响应日志,且不要求身份验证,进一步增加了监管难度。
SGLang 发布 v0.5.19 版本,包含 786 个 PR,来自 214 位贡献者。新增支持 Qwen3.8、Ling-3.0、Granite 4.2 等多个模型,并引入 beam search、DeepEP v2、LayerNorm 序列并行等多项性能优化。这些改进提升了推理吞吐量、降低了延迟,并扩展了硬件兼容性。