基于账本控制的零样本自编排提升LLM编码性能研究
该研究比较了多智能体LLM系统与单模型基线在编码任务上的表现,发现引入管理器-工人脚手架的效果因模型而异:对部分模型(如Qwen3.8-27B、GPT-5.6-Luna等)有显著提升,对另一些模型(如Qwen3.6-35B)则无益或负面。管理器机制虽使token消耗增加约三倍,但相比升级更大模型,能以更低成本获得相近精度。研究还分析了增益机制,包括上下文管理
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
该研究比较了多智能体LLM系统与单模型基线在编码任务上的表现,发现引入管理器-工人脚手架的效果因模型而异:对部分模型(如Qwen3.8-27B、GPT-5.6-Luna等)有显著提升,对另一些模型(如Qwen3.6-35B)则无益或负面。管理器机制虽使token消耗增加约三倍,但相比升级更大模型,能以更低成本获得相近精度。研究还分析了增益机制,包括上下文管理
Barret Zoph,Thinking Machines 的联合创始人,在离开 OpenAI 后已加入 Google,担任研究副总裁。Zoph 曾在 OpenAI 工作两年,于 2024 年 10 月离职共同创立 Thinking Machines,今年 1 月返回 OpenAI 但仅五个月后再次离职。Google 发言人确认他将利用强化学习和后训练专业知
宾夕法尼亚大学沃顿商学院的研究人员测试了六种AI购物代理模型,发现即使搜索过程发生微小变化,其产品推荐也会大幅波动。研究使用ACES模拟器,发现单一外部来源、来源顺序、记忆片段等因素都会显著影响推荐结果,甚至导致模型忽略客观更优的产品。研究指出,AI购物代理目前无法保证一致或最优的购买决策,对卖家的AI优化也构成挑战。
英伟达CEO黄仁勋在财报电话会议上再次宣称公司已实现AGI,但随即称这一里程碑‘毫无意义’。他指出AGI定义模糊,强调AI真正重要的是产生实际价值和盈利。业界对AGI定义缺乏共识,各公司如OpenAI、Anthropic等均有不同解读,使得AGI概念难以衡量。
本文提出 SimGuide 方法,将用户上下文结构化为类型化、领域特定的 Sims 块,并用程序化示例进行约束,以解决个性化 AI 代理将用户视为单一实体而导致的冲突问题。作者构建了 SimBench 基准(47 个任务),实验表明程序化约束的 Sims 在 GPT-4o 上比 RAG 方法提升 7.9 个偏好遵循点,并在 Claude Sonnet 4.5
Recuris 提出了一种递归记忆架构,通过工作记忆跟踪任务进度并指导技能选择,利用经验记忆和验证门控的局部更新,提升长时程智能体任务的成功率。在四个基准和十个模型上的测试中,Recuris 在 37 个模型-基准组合中的 35 个上提升了任务成功率,例如在 tau-bench 上为 GPT-5.6 Sol 增加 17.8 分,为 Claude Opus 5
台湾网络安全公司TeamT5警告称,中国国家支持的黑客组织在使用AI工具后,攻击次数增加了一倍以上。这些黑客利用DeepSeek编写漏洞代码、收集IP地址,甚至使用ChatGPT和Anthropic的Claude Code进行攻击。英国AI安全研究所的研究显示,开源模型的网络能力大幅提升,但在完全自主攻击方面仍落后于西方前沿模型。
纽约大学阿布扎比分校与阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings发表论文,构建了首个多语言医疗错误评测基准MedErrBench,覆盖英语、中文和阿拉伯语,测试了GPT-4o、Gemini、Llama、Qwen、DeepSeek等模型。研究发现医疗专用模型在错误检测任务上不如通用模型,且英文原生模型在中文原生数据上表现更好。该基准旨在
皮尤研究中心分析了近50万个英文网页,发现自ChatGPT发布以来,超过三分之一的网页显示出AI生成文本的迹象。商业.com域名中的AI文本比例约为.edu或.gov网站的10倍。该研究使用Open Pangram检测工具,但存在局限性,因为当前工具难以区分完全自动化和部分AI辅助的文本。
汤森路透投资约4000万美元,基于阿里巴巴的Qwen开源模型构建了自有法律AI模型“Thomson”,并利用公司内部数据和领域专家进行训练。测试显示,Thomson在访问公司专属内容时能超越GPT-5.4等竞品,但在推理和编码方面表现较弱。公司计划将Thomson用于文档审查等高频任务,并发布小版本模型供非商业使用,以降低成本并保持独立性。
据FT报道,Anthropic的7月年化收入达650亿美元,预计Q3盈利,拥有6000个年消费10万美元以上的客户。但其最强模型Fable 5因成本高昂,在Ramp AI指数中仅占8.0%的模型支出份额,低于Opus 4.8的28.0%。OpenAI年化收入季度内增长35%,突破400亿美元,得益于GPT 5.6的发布。
伦敦AI实验室Inherent由DeepMind校友创立,其新发布的AI代理Faraday在复现科学论文结果的任务上超越了Anthropic和OpenAI的更大模型。Faraday基于仅有270亿参数的Qwen 3.6模型,通过强化学习训练以培养“研究品味”。Inherent计划年底将团队扩至20-25人,并呼吁结束英国的“花园假期”限制。
LLM 工具因 OpenAI Python 库弃用 httpx 而出现安装问题,0.32.1 版本通过固定 openai<3 临时修复,后续 0.33 版本将改用 httpx2。
Matt Webb 在发布 Galactic Compass 2 后,利用 ChatGPT 作为互动导师学习四元数,而非直接编写代码。他认为即使将思考外包给 AI,学习并未停止,反而推动他学习更多。这一观点强调了 AI 在教育和个人成长中的积极作用。
Spring AI 发布 2.0.1 版本,包含多项新功能和错误修复。新功能包括支持 OpenAI 音频流、可配置工具调用限制、Google GenAI 的 ToolChoice 支持、Google 图像生成支持等。错误修复涉及 Redis 聊天内存、PDF 文档读取、OpenAI 流关闭等问题。该版本还移除了弃用的 Mistral AI 聊天模型,并更新了
微软已将 Azure DevOps 远程 MCP 服务器正式发布,为 AI 助手提供托管端点以访问工作项、拉取请求、仓库和管道,无需安装。然而,Claude Desktop、Claude Code、ChatGPT 和 Cursor 等客户端目前无法连接,原因是微软 Entra 身份验证不支持动态 OAuth 客户端注册或客户端 ID 元数据文档。微软正在与
堪萨斯大学等机构的研究者提出了SNAIL,一个混合命名实体识别框架,用于从生物医学文献中自动识别生物信息学软件和数据库名称。SNAIL结合词汇与语义建模,利用SciBERT等Transformer模型和token掩码策略,并通过引用提示和LLM辅助蒸馏构建训练语料。在多个基准和真实文献上,SNAIL显著优于bioNerDS2及ChatGPT、Gemini等通
广州AI营销公司钛动科技宣布完成新一轮融资,由华泰泛大西洋基金领投,资金将用于钛极专业大模型和Navos多智能体等AI技术研发。公司已成为ChatGPT Ads首批官方技术合作伙伴,并推出GEO解决方案,测试显示客户ROI提升至2.5倍。此前公司已递交港交所上市申请,2025年前9个月营收同比增长74.5%。
皮尤研究中心的一项新研究发现,自ChatGPT发布以来,超过三分之一的网页显示出AI写作的迹象。该研究使用Common Crawl档案和Open Pangram技术分析了近50万个英文网页,发现35%的新网页可能由AI撰写或大量编辑。相比之下,.com域名的AI写作比例约为.edu和.gov域名的10倍。研究还指出,AI检测工具可能存在误判,但数据方向性正确
THE DECODER 的 Frontier Radar 第四期指出,中国 AI 模型如 Kimi K3 和 GLM-5.3 已接近美国顶尖模型水平,西方实验室指责中国通过蒸馏和刷分追赶,但模型领先优势难以维持。西方在抽象测试、可靠性和前沿领域仍有优势,但整体领先已转向系统层面。文章还提到欧洲在 AI 竞赛中落后。