超越提示:生产级 AI 的上下文工程实践
Redis 开发者体验团队的 Ricardo Ferreira 在演讲中介绍了其基于 Redis 构建的开源项目 Agent Memory Server(AMS),并开发了名为 My Jarvis 的 Alexa 技能,通过 LangChain4j 和 OpenAI 模型为 Alexa 提供智能回答。他分享了在开发过程中遇到的上下文中毒、干扰、混淆、腐烂和冲
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Redis 开发者体验团队的 Ricardo Ferreira 在演讲中介绍了其基于 Redis 构建的开源项目 Agent Memory Server(AMS),并开发了名为 My Jarvis 的 Alexa 技能,通过 LangChain4j 和 OpenAI 模型为 Alexa 提供智能回答。他分享了在开发过程中遇到的上下文中毒、干扰、混淆、腐烂和冲
arXiv 论文提出 EpisodeSim,一种混合 LLM 智能体架构,通过经典 AI 脚手架(如世界主控器)维护场景、脚本、义务和结束条件,以增强 LLM 社交智能体的情节连贯性。实验表明,仅靠 LLM 的局部流畅性不足以模拟完整社交场景,而经典 AI 风格的控制层能显著提升模拟质量。该研究强调将经典 AI 的结构化表示与 LLM 的生成能力结合,为社交
该研究提出概率依赖图(PDG)表示法,将贝叶斯网络结构学习(BNSL)与大型语言模型(LLM)的因果知识进行概率融合。在26个基准网络上,将三种BNSL算法与三种LLM结合,50/50融合在22个网络上优于单一来源,平均F1显著提升。分析显示BNSL提供高召回率的边骨架,而LLM提供高准确率的边方向,两者互补。
印度理工学院甘地讷格尔分校等机构的研究人员发布了GurukulAI,一个面向印度教育体系的AI驱动交互式学习平台。该平台基于从NCERT教科书中提取的18,720个双语问答对,微调LLaMA 3.1 8B模型,并采用检索增强生成(RAG)框架,支持英语和印地语,提供答疑、练习和考试风格问题等功能。该研究旨在弥合全球大语言模型能力与印度地区教育需求之间的差距,
该研究评估了大型语言模型(LLM)在UML类图建模中的表现,发现与专家设计的类图相比,LLM生成的类图存在关键类识别不完整、关系混淆或遗漏、继承关系不足、未使用类和循环依赖等问题。研究提出了记忆强化、外部知识注入和检测引导的自动修复三种策略,实验显示这些策略能有效改善模型输出,关键类识别修复率达85%,耦合关系修复率46%,继承关系修复率69%,未使用类和循
Google Research 发布了 TimesFM-3,这是一个 3.3 亿参数的多变量时间序列基础模型,支持零样本预测,并在 Gift-Eval、FEV-Bench 和 Time 等基准测试中取得领先性能。该模型采用解码器 Transformer 架构和连续补丁掩码策略,可在单次前向传播中生成整个预测区间,并支持外部协变量。相比前代模型,TimesFM
微软研究院发布GigaPath-Flash和GigaTIME-Flash,通过知识蒸馏将十亿参数模型压缩为紧凑的ViT-S编码器,分别实现约50倍计算量降低和6倍速度提升,同时保持或提升病理分析性能。这两个模型以Apache 2.0协议开源,旨在支持大规模人群级病理研究,但仅限研究用途,未经临床验证。
James Hall 在演讲中分享了在浏览器中直接运行 AI 工作负载的经验,包括本地与云端运行的对比、隐私与数据控制问题,以及实际项目中的教训。他强调了本地运行 AI 的优势,如减少数据外泄风险,并提供了技术实现的高层概述和常见陷阱。
本文提出一个基于设计科学研究(DSR)的多准则决策模型,用于在软件工程项目中合规地选择大语言模型(LLM)。该模型将欧盟AI法案、NIST AI风险管理框架、GDPR、LGPD和ISO/IEC 42001等法规要求转化为可操作的技术决策标准,并通过三层结构(法规要求、组织治理能力、生产力与可持续性结果)实现。试点评估使用20个基于CWE和OWASP Top
西班牙加泰罗尼亚理工大学等机构的研究人员针对需求工程中的二元需求分类任务,生成了9000个受控语言变体提示,并使用五个开源LLM在625条标注需求上评估,发现提示的句法和形态句法特征能显著预测LLM性能。该研究为提示工程提供了低成本的事前评估方法,并指出词汇多样性并非提示质量的有效维度。
LitCurate 是一个开源框架,利用大语言模型在可审计的分阶段工作流中从文献构建科学数据库,集成了文献发现、相关性筛选、全文处理和结构化信息提取,并保留中间结果和来源。研究团队应用该框架构建了下地幔矿物状态方程数据库,包含来自 205 篇论文的 1334 条记录,并通过可搜索的网页应用提供访问。该框架通过将科学文献与可追溯的机器可读数据连接起来,为将积累
本文提出了一种考虑竞争对手的生成引擎优化(GEO)方法,将GEO形式化为策略选择问题,并采用两阶段流程:先用贝叶斯优化组合结构(BOCS)搜索策略空间,再用偏好对和推理轨迹微调语言模型。该方法在geo-bench和合成竞争数据集上优于现有基线,并展现出跨域泛化能力。
arXiv 论文提出 ReSource,首个多阶段 LLM 反编译框架,旨在从经过优化和混淆的二进制中恢复源码。该框架将二进制到源码的差异分为词汇、句法和语义三层,并分别处理,以应对控制流平坦化等问题。在超过 8 万对函数上,ReSource 实现了 83% 的 Top-5 检索准确率和 0.66 的平均相似度,优于现有基线。
DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级为 DeepSeek-V3.1-Terminus,分别对应非思考模式和思考模式。此次更新改进了语言一致性,缓解中英文混杂和异常字符,并优化了 Code Agent 与 Search Agent 的表现。
博科尼大学对1053名新生进行随机实验,发现使用GPT-4o能显著提高商业作业成绩,而因果推理课程虽未提升传统分数,但促使学生提出更多样化和非传统的解决方案。研究指出当前评分体系偏向常规答案,可能掩盖AI辅助下的真实学习效果,且缺乏无AI的后续测试,无法确认是否真正提升学习。
腾讯今日发布开源权重文本输入模型Hy4 Preview,总参数量770B,激活参数49B,上下文窗口1M token,Hugging Face上体积1.56TB,相比7月的Hy3大幅提升。模型支持两种推理强度:默认'high'和'no think'(禁用推理)。作者通过SVG生成测试展示了其推理轨迹,并指出推理文本使用截断英文以节省token。
arXiv 论文提出 Procedura,一个基于大语言模型的智能体 3D 建模框架,通过将形状表示为带类型约束的程序化装配(CSG),实现高精度、可编辑且具有部件分解的 3D 生成。在 P3D-Bench 和 MechBench-36 上,Procedura 超越了原生 3D 生成器和先前的 3D 代码智能体,无需 3D 训练即可从文本提示生成精细的多部件
蚂蚁健康与威科集团达成战略合作,威科旗下28本顶尖医学期刊上线阿福医生版,为医生提供循证临床洞见。双方计划基于UpToDate打造本土化临床决策支持工具,并探索AI辅助临床决策等深度合作。
本文提出了一种通过采样来引导和扩展自回归大语言模型(LLM)的灵活且理论基础的框架,涵盖两种算法:基于序贯蒙特卡洛(SMC)和副本交换(RE)的方法,用于从幂化、乘积或倾斜的基础分布中采样。实验表明,这些方法在数学推理任务上无需外部监督或奖励模型即可提升生成质量,且扩展性优于Best-of-N和标准MCMC基线。该框架为LLM的概率推断提供了系统化的采样方案
马萨诸塞大学阿默斯特分校等机构的研究人员评估了独立LLM与预定义智能体流水线在解释ICU死亡率预测方面的可行性。基于eICU演示数据集(2353例ICU住院,死亡率8.1%),XGBoost模型AUROC为0.855。在38例解释子集上,独立LLM产生1例显式结果泄漏,而四步智能体流水线无泄漏;智能体流水线在指南依据、价值特异性和合理性方面得分更高,但SHA