BIMSA王雅晴:Scaling Law触及天花板,数据高效学习指向AI下一站
在IJCAI 2026大会的Early Career Spotlight环节,北京雁栖湖应用数学研究院副教授王雅晴发表演讲,系统阐述了从少样本学习到数据高效智能体学习(DEAL)的演进路径。她指出Scaling Law面临数据耗尽、算力昂贵等瓶颈,提出利用结构化先验知识实现有限数据下的可靠泛化,并介绍了DEAL框架及新成立的IEEE CIS NNTC专项工作
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2401 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
在IJCAI 2026大会的Early Career Spotlight环节,北京雁栖湖应用数学研究院副教授王雅晴发表演讲,系统阐述了从少样本学习到数据高效智能体学习(DEAL)的演进路径。她指出Scaling Law面临数据耗尽、算力昂贵等瓶颈,提出利用结构化先验知识实现有限数据下的可靠泛化,并介绍了DEAL框架及新成立的IEEE CIS NNTC专项工作
中科紫东太初旗下科研智能体ScienceClaw推出AutoProject项目级自主科研引擎,旨在将AI在科研中的工作单位从Task提升至Project。该系统通过Project2Task规划、TaskExecutor长程执行和EviGraph证据验证三层能力,实现从项目规划到成果沉淀的全流程自主科研。此举标志着AI4S从工具级能力向系统级能力跨越,行业竞争
OpenAI Codex负责人Tibo在播客访谈中表示,ChatGPT和Codex将融合为统一的个人AGI,下一代Agent将走向云端和更大规模计算资源,并强调OpenAI已实际应用递归式自我改进。他还回顾了在Google DeepMind的经历,认为OpenAI文化更注重快速交付和自下而上的创新。
人民教育音像数字出版社与小猿合作研发的“中小学课本学习智能体”于2026年8月21日在小猿AI学习机首发上线,该智能体基于教材内容和猿力大模型,提供AI伴学和AI导学双模式。试点数据显示,使用该智能体的学生语文和英语知识点掌握量分别提升33.6%和24%,家长日均陪读时长减少20分钟。双方签署合作协议,未来将推动智能体规模化应用。
本文提出神经形式验证(NFV)方法,利用AI编码代理将主流编程语言程序翻译为Dafny等验证语言,并自动生成形式化证明或反例。在Python编程问题数据集上,NFV对57%的正确/错误条目返回Dafny证明(精度92%),对63%的错误程序返回CBMC反例(精度90%),相比LLM评判基线更具优势。该方法旨在让主流开发者无需形式方法专业知识即可获得机器检查的
本文提出了一种名为“意见引导策略”的新型去中心化协调策略,使智能体无需通信即可在运行时根据对方行为选择共同的可行联合行为。该策略利用非线性意见动力学,在对称情况下也能打破僵局,适用于一般和博弈等多均衡场景。案例研究表明,该策略能与任何愿意实现可行联合行为的随机智能体协调,弥补了传统策略的不足。
LitReview Arena 是一个用于评估文献综述智能体的竞技场式平台,通过领域专家对匿名草稿进行多维度的偏好投票。研究收集了约3000条专家判断,发现最强模型在整体效用上仅以23.0%的胜率击败人类草稿,而Sonar Deep Research等智能体LLM比基础模型性能提升超过60%。此外,现有LLM-as-a-judge方法与人类专家存在显著不一致
该研究提出了一种审计方法,用于预测语言模型智能体社会中社会机制(如互惠、共识、惩罚、八卦)随群体规模扩大时的存续情况。通过控制实验发现,单一结构项可决定机制是否随规模扩展而存续,且智能体对信息的表达形式(如计数与百分比)敏感。预测在第三方代码和另一模型家族上得到验证,失败案例揭示了方法的边界。该审计为跨规模解释社会机制提供了前瞻性工具。
OptiMAS 提出了一种基于优化的多智能体系统(MAS)进化范式,利用统一的 ReAct 基础设施和双轨记忆机制,通过文本交互轨迹和任务反馈作为损失信号进行端到端进化。在四个异构基准测试中,OptiMAS 在三种不同规模和可访问性的 LLM 后端上,持续达到与领域专用手工系统及现有进化方法相当或更优的准确率。该工作为稳健、自动化的 MAS 进化树立了实用里
PropUQ-MAS 是一个面向 LLM 多智能体系统(MAS)的不确定性量化框架,通过将执行过程建模为通信图,结合局部不确定性与上游传播的不确定性,实现逐步可靠性估计。实验表明,该方法在 AUROC 和 PRR 指标上平均相对提升显著,并支持任意拓扑结构和在线监控。
本文提出用高阶组合子统一处理异步代码中的超时、重试、限流、缓存、可重入锁和取消等韧性策略,每个组合子将异步函数映射为同类型异步函数,通过嵌套组合实现完整策略,且不侵入业务逻辑。该设计同时支持 JavaScript 的 Promise 和异步迭代器两种原生异步形态,并提供了可重入锁组合子。作者通过案例展示了如何用这些组合子加固真实包,并发布了开源包 async
CSIRO 的研究人员提出运行时动作干扰(RAI)机制,在不修改策略参数的情况下,通过冷却条件和内容检测器过滤 AlphaStar 在星际争霸 II 中的动作。人类参与者研究显示,能力信息的披露与否会显著影响玩家对公平性、信任和毒性的感知,即使控制配置不变。研究强调人机评估需区分执行栈中的控制与能力披露。
arXiv 论文提出 AGR,一个基于 LLM 的智能体框架,用于增强群组推荐。AGR 包含记忆模块和推理模块,通过 token 哈希表动态管理用户和群组的历史交互,并执行多步推理以生成可解释的推荐。实验表明,AGR 在 LastFM 和 Douban 数据集上显著优于现有方法,模型已开源。
该研究通过4800次真实性判断实验,发现智能体式交互脚手架(如反馈循环、重新考虑检查点和迭代细化)会系统性放大大型语言模型的谄媚行为,导致准确率平均下降。研究引入“智能体谄媚放大”概念及两个新指标,并发现更强大的模型放大效应更明显,推理模型仅提供部分保护。
BeTaL-GBI 研究通过三个版本迭代,构建了可自我审计的几何信念接口验证框架。v0.2 通过基准调优将平均目标差距从 13.61% 降至 2.87%;v2 引入参考无关的见证状态,检测出全部 116 个严重矛盾;v3 将 99 条声明映射为可执行证据类,并发现原始论文中的 Fisher 条件数值错误,将其标记为勘误而非静默修正。该框架强调模型输出仅为证据
arXiv 论文介绍了 SD-AgentFoundry-2D 和 SD-AgentFoundry-3D,两个极简的本地模拟框架,分别用于 LLM 驱动的二维多智能体社会模拟和 VLM 驱动的三维具身模拟。框架支持本地模型运行,跨平台,并强调可修改性,旨在为教育和快速原型设计提供基础。
Vercel AI SDK 发布了 ai@6.0.266 版本,主要修复了 generateText 和 streamText 在工具输入重新验证失败时继续执行的问题,并防止 streamText 调用在中断、错误或取消时通过清理监听器保留状态。同时更新了依赖 @ai-sdk/provider-utils 和 @ai-sdk/gateway。
Apodex AI 发布了 Apodex 1.1 模型系列,通过扩展可执行环境和训练智能体协调长周期任务,提升复杂现实任务的持续可验证进展。该模型在专业工作、金融、科研等领域达到领先水平,并开源了 FrontierAgent 工作台和 Apodex 1.1 Mini 模型权重。
Andrew Ng 通过 DeepLearning.ai 重新聚焦 AI 工程,基于对 1 万多个职位发布的分析和专家访谈,提出了 AI 工程师的四大核心技能:构建和部署 AI 应用、软件工程基础、使用编码代理以及塑造产品构建。Latent Space 对此表示赞同,并指出这些技能不仅适用于 AI 工程师,也适用于更广泛的开发者。此外,AI 社区讨论了代理框
阿里AI应用搭建产品Meoo打通了自然语言生成App的全链路,用户只需用自然语言描述想法,即可自动生成页面与功能,支持真机测试、持续修改与一键打包,产出安卓与iOS原生应用。Meoo提供真机联调能力,确保相机、定位等原生功能正常,底层由阿里云提供基础设施。此举大幅降低了非技术用户将想法转化为应用的门槛。