米哈游千亿AI野心:从AI帕姆到自进化Agent
米哈游在云栖大会上由《崩坏》系列AI NPC与Gameplay负责人郑银河分享了其AI游戏布局:AI帕姆接入对话能力后一周对话超6000万次,采用策略增强RAG、情绪标签与三层记忆实现「活人感」;内部EchoX平台托管代码Agent与MCP工具用于研发提效,并探索AI Gameplay与自进化Agent。米哈游联合创始人大伟哥称未来三年AI投入最多达1000
技术方向 · 用外部知识约束模型输出的检索增强生成,含向量嵌入与重排序 · 共 258 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
米哈游在云栖大会上由《崩坏》系列AI NPC与Gameplay负责人郑银河分享了其AI游戏布局:AI帕姆接入对话能力后一周对话超6000万次,采用策略增强RAG、情绪标签与三层记忆实现「活人感」;内部EchoX平台托管代码Agent与MCP工具用于研发提效,并探索AI Gameplay与自进化Agent。米哈游联合创始人大伟哥称未来三年AI投入最多达1000
Hugging Face 用户 handwoven8588 发布了 CodeRankEmbed-flash-attn,这是对 nomic-ai/CodeRankEmbed 的 bf16 量化版本,权重未重新训练。该仓库在自定义 modeling 文件中内置三层注意力调度(torch varlen、flash attn、eager),用 O(N) 非填充路径替
Google ADK Python 发布 v2.10.0,引入实验性的技能生命周期管理(含 EPHEMERAL 生命周期、活跃技能上限与 unload skill 工具),新增 MongoDB 向量与混合搜索工具集,并为 Agent 评估加入时长、token 消耗和模型调用次数等效率指标。同时增强对 OpenAI 推理模型的参数自动适配与推理 token 上
Mastra 发布 1.71.0 版本,为可观测性存储引入能力协商机制,服务器通过新接口暴露存储支持的可观测性 API,客户端可据此发现兼容端点而无需升级存储。同时新增 trace 聚合规划 API、工具参数完成即执行的流式优化、Discord 集成与沙箱凭证物化,以及 MongoDB 向量自动嵌入功能。此外包含一处破坏性变更,移除了 playground-
Spring AI 发布 2.1.0-M1 版本,新增对 OpenAI Responses API 的支持,并为预计算嵌入添加 VectorStore.upsert 方法,同时在 AbstractMessage 中引入 MessagePart。该版本还将 Spring Boot 依赖升级至 4.2,并提供了从 2.0.1 升级的说明。
该论文研究通过轨迹微调提升小语言模型(SLM)作为检索增强问答中「下一步动作控制器」的能力。作者从教师模型 Qwen 3-Next 80B-A3B Instruct 的搜索轨迹中构建七类动作预测任务,并用 LoRA 监督微调多个 SLM 与 xSLM。在 1,646 个留出动作样本上,Granite 4.1 3B 的 macro-F1 达 0.6536,远高
该论文提出 X-Rec,一种基于流匹配(flow matching)的生成式检索方法,直接在连续物品嵌入空间建模推荐分布,以规避 U2I 表达力不足和 SID-AR 量化误差、低吞吐的问题。X-Rec 引入锚点条件、黎曼流匹配和延迟交互扩散 Transformer 三项设计。在流式基准上,X-Rec 显著优于 U2I 基线,检索质量与 SID-AR 相当,推
该论文提出 Seek,一个无需训练的迭代式知识检索框架,通过在测试时多轮交互语料库来克服单次检索的局限。每轮由 LLM 生成伪段落扩展查询、检索器获取新候选、专用评估器给出分级相关性判断并指导后续轮次。在 TREC Deep Learning 上 Seek 匹配训练过的重排序器并提升 Recall@100;在 BRIGHT 上 Qwen2.5-7B 相对 B
该论文提出REAT(反思性经验增强辅导)框架,通过多智能体Observer-Critic-Mentor(OCM)蒸馏流程,将历史辅导对话提炼为结构化、与问题无关的教学经验,并在实时辅导中通过状态感知检索模块注入这些经验,以根据学生认知状态提供自适应支架。实验表明,该框架显著优于仅提示和SFT基线,尤其在复杂、低分辅导场景中提升明显,且蒸馏经验在不同模型架构和
llama.cpp 发布 b11163 版本,核心变更是新增 llama batch ext API(PR #24669),支持在同一个 batch 中同时处理 token、embedding 和 state,并引入 llama embd、llama batch ext add embd、llama batch ext set embd state 等接口,
该论文提出 Ovis-Embedding,一个基于 Qwen-Omni 预训练理解模型构建的全模态嵌入模型家族,通过共享多模态骨干网络将文本、图像、视频和音频编码到统一表示空间。研究采用低秩对比预训练、同源采样、focal loss 和嵌入蒸馏等训练优化策略,并在推理时用低秩特征分解实现紧凑嵌入。在 MMEB-v3、MMEB-v2、MVEB、MAEB 和 R
论文提出 SkillApt,一个检索后激活控制器,用于判断已检索到的 Skill 是否应在当前执行状态下真正加载。它通过匹配的 WITH/WITHOUT 执行构建每个 Skill 的反事实证据,并聚合相似历史状态的结果做出 LOAD/ABSTAIN 决策。在 SRA-Bench 上,SkillApt-E 保持与 BM25 Top-1 相同的准确率(0.838
研究团队发布了 ItColBERT,一个 135M 参数的意大利语专用后期交互检索器,基于 PyLate 并遵循 ColBERT-Zero 训练配方,在单张 RTX 3090 上约 14.5 GPU 小时完成训练。在四个意大利语检索基准上,它优于除 mLateOn 外的所有通用后期交互基线,且参数更少。主要发现是方法学上的:在 MLDR-it 上,对未改动检
该论文在真实生产流媒体推荐数据集上系统比较了四种语义用户画像策略,按表示类型(聚合式物品嵌入 vs. LLM生成的自然语言摘要)和时间处理(全历史 vs. 短期/长期注意力融合)进行2×2交叉实验。结果显示,LLM画像的优势具有用户分群条件性:对习惯型用户聚合方法更优,对探索型用户LLM方法能带来准确率提升。此外,LLM画像虽使单条推荐列表略更多样,却导致系
该研究在 LongBench-v2 多选题问答上系统测试了学习式上下文规划(learned context planning)能否在强检索、路由、预算化选择和重排序控制下提升长上下文问答表现。使用 Qwen2.5-7B-Instruct 作为答案模型,规划器通过 SFT 在 140 条训练和 28 条开发轨迹上训练。结果显示,在 18k 字符预算下,锚定混合
Vercel AI SDK 发布 ai@7.0.113 补丁版本,修复了流式工具输入回调、工具审批恢复、视频模型回退保留等多个问题,并修复 Google embedMany 在超过 100 个值时的批处理对齐问题。此外新增 Gemini 3.8 TTS 支持,包含结构化语音元数据、每轮说话人与风格控制,以及 WAV、PCM、mu-law、A-law 等音频格
Agno 发布 v3.0.11 版本,新增知识检索流水线、MMR 重排序器、Recency 重排序器、页面源迁移工具、Y-API 作为 OpenAI 兼容模型提供商,以及运行输出中的取消阶段字段。同时改进 MCP 工具模式与推理检测,修复工具钩子、MCP 服务器路由、AG-UI 协议支持、WebSocket 工作流等多项问题,并弃用向量数据库级别的 rera
Hugging Face 发布 funes,一个为编码智能体提供本地记忆的工具,基于 Lance 数据集构建。它把 Claude Code、Codex、pi 和 Hermes 的历史会话轨迹索引到一个本地 Lance 数据集中,并提供 recall 和 get 工具让智能体在需要旧上下文时检索原始片段。索引过程完全本地、确定性,不经过 LLM 摘要,并支持凭
该论文研究个性化搜索中LLM交叉编码器重排序时行为信号(如点击率)的融合问题。作者发现,将查询切片统计(QSS)直接注入提示虽在特征可用时提升13.3%排序质量,但会导致模型过度依赖该特征,在稀疏或缺失场景下性能下降。为此提出双样本特征丢弃训练策略,在保留排序增益的同时将QSS移除场景性能相对提升4.0%,在线测试中搜索成功率提升约2%。
该论文研究语言智能体在上下文窗口受限时,如何从执行历史中检索完整证据。作者提出将智能体记忆检索形式化为「预算内证据补全」问题,并构建 Execution Provenance Graph Memory(EPGM),用零初始化残差 R-GCN 在工具参数与输出的溯源单元上精炼稠密检索分数。在 ISETrace 的 2,000 条查询上,溯源单元相比固定 512