CompEvo:竞争诱导进化提升多智能体新闻驱动时序预测
研究者提出 CompEvo,一个面向新闻驱动时间序列预测(NTSF)的多智能体竞争诱导进化框架,旨在解决智能体思维同质化(DoT)和策略更新缺乏理论依据(ITG)两大问题。该方法将多智能体交互建模为不完全信息进化博弈,证明混合策略贝叶斯纳什均衡的存在性,并给出局部收敛、长期遗憾和适应度权重单调性的分析。框架整合策略执行、基于适应度的可微选择和竞争诱导策略进化
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
研究者提出 CompEvo,一个面向新闻驱动时间序列预测(NTSF)的多智能体竞争诱导进化框架,旨在解决智能体思维同质化(DoT)和策略更新缺乏理论依据(ITG)两大问题。该方法将多智能体交互建模为不完全信息进化博弈,证明混合策略贝叶斯纳什均衡的存在性,并给出局部收敛、长期遗憾和适应度权重单调性的分析。框架整合策略执行、基于适应度的可微选择和竞争诱导策略进化
UT Southwestern 等机构的研究者发布 OASIS,一个基于评分量规(rubric)的多模态评估平台,可用大语言模型对视频、音频和文本进行结构化打分。平台提供命令行工具与集成栈,支持托管 API 或通过 Ollama、vLLM 等自托管开源模型,并具备量规版本管理、执行溯源和人工复核状态。该系统自 2023 年秋季起在 UT Southweste
该论文指出LLM智能体基准测试存在双重测量混淆:执行关键决策由固定脚手架而非模型完成,评分器又基于输出形状而非任务正确性打分,两者相互掩盖。作者提出测量理论框架与BenchAudit审计修复协议,将执行决策转移给模型并用种子化真值评分,同时报告最坏情况和尾部风险等可靠性指标。在ComtradeBench上的实验将原本几乎无区分度的排行榜转变为能区分平均性能与
本文综述了生成式AI(GenAI)和大语言模型(LLM)对需求工程(RE)未来的影响。作者认为,随着通用软件工程智能体的普及,实现成本降低,工程重心将从编写代码转向需求表达、验证与评估。文章回顾了AI在RE中的历史、LLM的最新进展(如提示编程和通用SE智能体),并预测RE实践将转向操作化规范与智能体指令。该研究旨在帮助RE研究者调整未来研究重点。
该论文提出了一种结合大语言模型(如GPT-4)与可视化分析的人机协同实体解析流程,用于从科学文献中提取领域特定实体,并以金属有机框架(MOFs)材料领域为例进行验证。通过交互式错误分析和RAG过程解释,该方法将单文档实体解析准确率提升了约30%。研究强调了可视化在提升LLM实体解析可解释性和准确性方面的作用。
该论文通过访谈技术文档撰写者,识别出使用LLM创建软件教程时的三项需求:组装和结构化多个LLM响应、策划模型使用的上下文、验证生成内容。研究者设计了dBlocks工具,包含内容分块、上下文管理和内联代码执行功能,并通过用户研究迭代优化。实验表明,与参与者常用工作流相比,dBlocks显著提高了教程置信度,减少了验证摩擦,并帮助撰写者避免搜索冗长聊天记录。
本研究对五个公开AI技能仓库的873次提交、143个技能文件和254次实质性编辑进行了纵向分析,发现所有编辑均由具名人类账户完成,其中62%带有AI合著者标记,表明技能维护目前是“人类主导、AI辅助”的循环,而非自主流程。研究还发现多数编辑为内容增补和修正,但规则相似性编码因可靠性不足而失败。作者发布了语料库、编码手册和重放协议,以支持自动化技能维护系统的评
滴滴国际业务集团与AWS合作,基于Amazon Bedrock构建了智能客服质检系统,覆盖西班牙语和葡萄牙语的出行、外卖和金融服务。该系统包含意图验证、合规评估和客户之声分析三个核心流程,将意图验证准确率从38%提升至86%,合规评分准确率超过90%,并将人工摘要时间从数小时压缩至数分钟。文章详细介绍了系统架构、设计原则及面临的挑战。
本研究评估了大型语言模型(LLM)在零样本框架下预测天气相关强制停电风险的能力,并与监督式机器学习模型进行了对比。实验使用了德克萨斯州中部某公用事业服务区域六年的停电记录和高分辨率天气数据,将问题构建为三个预测时长的二元严重性分类任务。结果显示,监督模型在宏F1和精确度上优于LLM,但新一代LLM取得了有竞争力的分数,并在可操作推理和地理可扩展性方面展现出互
这篇系统化综述梳理了AI招聘系统从匹配模型到智能招聘代理的演变,分析了从相似性匹配到互惠适配、从单一模型到复合工作流、从离线预测到证据与生产力对齐评估的三重转变。综述指出当前评估存在行为标签混淆、数据外部有效性有限、最终输出掩盖流程失败等问题,并提出分阶段映射评估证据与可辩护结论的框架,强调未来系统应具备证据基础、可审计性和成本风险约束。
该研究通过复现已发表的联合分析实验,评估了合成代理(LLM)在再现多维人类偏好方面的能力。结果显示,合成代理在边际分布和方向一致性上表现尚可,但在联合分布、个体选择对齐和效应量精确度上表现不佳,表明其有效性依赖于具体声明且具有层级性,不能作为人类样本的可靠替代。
arXiv 论文提出 Abstraction Agent,一种零样本流水线,利用大语言模型从自然语言游戏描述中发现连续战略特征,对私有状态打分并聚类,无需游戏专用评估器或博弈树遍历。在 HUNL turn endgames 上相比期望手牌强度基线将利用度降低 62%,并成功迁移到多种扑克变体和麻将。该方法将 LLM 参数中的隐性战略知识转化为显式数值特征,代
LG AI Research 发布了 EXAONE Finance,一个专为金融时间序列预测设计的基础模型。该模型采用无注意力架构,用因果一维卷积和分组池化 MLP 替代自注意力,并通过掩码上下文增强处理缺失数据,在涵盖股票、外汇、商品、加密资产等的大规模金融语料上预训练。在 FinVerse 基准上,EXAONE Finance 在点预测、资产排序和投资组
佐治亚理工学院的研究人员提出了一种基于提示工程的框架,用于个性化通用LLM/RAG驱动的AI助教Jill Watson。该框架结合六种学习者维度和布鲁姆分类法,生成96种学习者画像,在不重新训练模型的情况下实现实时响应个性化。实验和人工评估表明,基于提示的个性化能产生可感知的响应差异,为LLM教育代理的适应性行为提供了初步证据。
微软在针对《纽约时报》等出版商和作者提起的版权诉讼中提交新法律文件,称其 Copilot 聊天机器人极少复制新闻或书籍的实质性内容。微软分析 820 万条聊天记录后发现,仅不到 1% 的记录包含至少 16 个与新闻内容相同的词,且只有极少数响应与书籍内容匹配。微软据此主张,使用受版权保护的材料训练 AI 模型属于合理使用,因为系统具有变革性目的。
本文介绍 Eiffel-tools,一个基于语言服务器协议(LSP)的工具,利用大语言模型辅助 Eiffel 编程语言的静态验证开发。该工具通过结合 LLM 和形式验证器,在多个数据集上修复了 76% 至 95% 的缺陷,展示了 LLM 与验证器协同工作的潜力。
本研究测试了本地运行的 Mistral 7B 大语言模型(通过 Ollama)每五秒读取实时游戏状态并为共享 PPO 策略分配战术标签,以增强多智能体战斗游戏中 NPC 的适应性。实验表明,在对抗平衡型对手时,增强小队胜率从 11% 提升至 24%,但在对抗激进型对手时,模型过度偏好包围策略导致效果不佳。分析显示 83.8% 的标签选择为包围,表明该规模模型
弗吉尼亚理工大学和亚利桑那大学的研究人员首次对现成LLM在需求质量评估中的表现进行了基准测试,基于INCOSE标准评估了OpenAI和Anthropic两大家族共十个模型。结果显示,最佳Anthropic模型仅能检测出47%的专家识别问题,同时产生11%的误报,且对必要性和正确性问题的漏检严重。研究还发现模型代际进步非单调,温度采样影响有限,表明现成LLM尚
捷克理工大学的研究团队提出 Exemplar,一种用于显微镜图像少样本分割的模型,融合冻结的 DINOv3 特征与经典滤波器组,在 11 个生物医学数据集上达到 0.782 的平均分数,优于多种少样本方法。该模型在单张标注掩码下表现优于从头训练的 nnU-Net,但后者在八张掩码时反超。研究强调经典先验与自监督特征在少样本场景下的互补性。
Simon Willison 发布了 llm-gemini 0.34 版本,这是一个用于连接 Gemini 模型的 LLM 插件。该版本更新可能包含对 Gemini 模型的支持改进。文章还提及了 Claude 新系统提示词限制复制歌词、Claude Fable 5.1 生成动画鹈鹕以及 ChatGPT Work 的相关内容。