英伟达研究:AI 支架比模型本身更关键
英伟达发布新研究,表明在长时程任务中,AI 的“支架”(harness)比底层模型更重要。通过定制支架并引入“监督者”组件,英伟达让 Claude Opus 5 在 ARC-AGI-3 基准上达到 100% 得分,而无支架时仅 30%。该研究强调开放支架系统对用户控制和安全性的重要性,并呼应了 OpenAI 和 Databricks 的相关发现。
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
英伟达发布新研究,表明在长时程任务中,AI 的“支架”(harness)比底层模型更重要。通过定制支架并引入“监督者”组件,英伟达让 Claude Opus 5 在 ARC-AGI-3 基准上达到 100% 得分,而无支架时仅 30%。该研究强调开放支架系统对用户控制和安全性的重要性,并呼应了 OpenAI 和 Databricks 的相关发现。
中国AI公司Deepseek发布了实验性多模态模型V4-Flash-Vision-Exp,在图像理解基础上保持文本性能,其内部基准测试显示在智能体任务上接近Opus 4.8。该模型支持多种图像输入方式,并兼容OpenAI和Anthropic的API,同时更新了Harness框架。定价与V4-Flash一致,单次请求最多可处理600张图像。
智东西报道了AI原生游戏团队Elser从视频工具转型开发AI精品游戏平台Elseland的经历。团队在4个月内制作了数十款游戏,包括互动影游和休闲游戏,声称将数百关游戏的制作时间从一年缩短至一周。CEO刘耕认为Coding Agent的爆发带来了新机遇,但AI无法取代创意和审美判断。
AWS 发布了基于 Amazon Bedrock 的智能体数据操作平台(ADOP)参考架构,旨在将数据工程周期从数周缩短至数小时。ADOP 在开发环境中运行 AI 智能体,生成确定性的 ETL、质量检查和治理工件,并通过 CI/CD 部署到生产环境,生产环境不依赖模型调用。该平台支持多工具(如 Claude Code、Kiro、Cursor、Codex)的治
Strands Agents SDK 发布了 TypeScript 版本的 v1.14.0 更新,包含多项新功能、修复和文档改进。主要新功能包括音频内容块、文件内存存储、上下文管理器卸载策略、工具上下文中的执行范围取消、代理作为工具委托、MCP 客户端 OAuth 认证以及 Anthropic 提示缓存支持。修复了多个与 Bedrock 缓存、多代理令牌计数
美国国务院起草了一封信,要求伙伴国家在美国与中国的人工智能竞赛中选边站,并警告加入中国AI倡议的国家将被排除在美国主导的Pax Silica联盟之外。该联盟旨在保障AI模型、半导体和关键矿产的供应链,已有约24个国家及欧盟加入。目前哈萨克斯坦是唯一同时参与美国联盟和中国框架的国家。中国驻美大使馆回应称,此举将减缓全球AI进展,不符合任何人的利益。
多位知名YouTube创作者因推广AI视频平台Higgsfield及其Seedance 2.5功能而遭到粉丝强烈反对,视频未标注为广告,引发信任危机。粉丝和其他创作者批评这些推广行为,认为AI生成内容缺乏对原创者的尊重。事件凸显了创作者与AI公司合作时面临的风险,可能损害其与受众的关系。
NVIDIA 技术博客发文探讨 AI 代理栈中的安全定位,指出随着代理能力增强,安全控制需从模型层下移至基础设施层。文章基于近期 OpenAI、Anthropic 等前沿代理越界事件,强调运行时(如 OpenShell)作为权威边界的重要性,并介绍了代理栈各层(模型、harness、元 harness、安全运行时、推理基础设施)的功能与安全职责。
据彭博社报道,Meta已成为微软最大的AI客户之一,每年在Azure云服务上花费数亿美元,每周处理数万亿个token。Meta工程师使用微软Foundry市场上的OpenAI模型来评估自家模型的性能,同时也在构建自己的API服务,可能未来与Foundry竞争。微软AI收入中约70%来自OpenAI,而ByteDance是Foundry的最大客户。
Anthropic 在收到企业客户反对后,调整了其数据保留政策,允许企业客户将数据存储在自己的云中,而非 Anthropic 的服务器上。此前,Anthropic 会将客户数据保留 30 天以检测网络攻击,但该政策不受欢迎且构成商业风险。新系统已与 100 多个受监管行业的客户共同开发,预计今年秋季推出。
星动纪元创始人陈建宇在WRC 2026大会上提出,具身智能正从VLA范式迈向世界模型时代,认为世界模型能更好理解物理世界并提升泛化性。公司已发布全球首个融合视频与动作预测的世界动作模型,并实现软硬件全栈自研,推动通用机器人在物流等场景商业化落地。
星海图联合创始人高继扬在2026世界机器人大会上提出,具身智能的终极商业模式将从销售硬件转向销售“物理世界Token”,即按机器人在物理世界执行的有效动作收费。他认为未来硬件可能负毛利,价值将向“具身大脑”迁移,并介绍了公司采用统一自回归架构实现零样本泛化、通用抓取和长程任务,以及通过强化学习提升精度和成功率。高继扬还提出泛化性即培训成本,并计划将新任务后训
AI文本检测公司Pangram的CTO Bradley Emi在博客文章中表示,大型语言模型理论上可以像人类一样多样化写作,但后训练和安全护栏使其文本可被检测。系统如ChatGPT、Claude或Gemini学习行为规则以避免危险输出或审查某些政治言论,这大大缩小了它们的表达范围,称为“模式崩溃”。基础模型和专门微调的模型写作更多样,因此Pangram的检测
企业支出管理平台 Ramp 推出了自己的 AI 模型路由服务 Router,允许用户和公司通过 API 使用和切换多种大语言模型。该服务目前仅在美国可用,2026 年剩余时间内免费,并提供 26 美元信用额度。Router 提供来自 OpenAI、Anthropic、DeepSeek 等多家公司的模型,并支持多种路由策略和仪表盘监控。此举旨在进入 AI 推理
Agno 发布了 v3.0.0a2 版本,包含多项功能更新和修复。主要变更包括移除已弃用的参数、引入用户隔离评估、优化 AgentOS 元数据路由、增强后台执行的可靠性,并新增 FinanceTools 和 RampRouter 模型支持。此外,该版本还改进了 Studio 3.0 控制平面,并更新了 Cerebras 默认设置和模型。
全球最大加密货币交易所币安推出Agent OS平台,允许AI代理分析市场并代表用户执行交易。该平台集成Binance API、MCP等工具,支持ChatGPT、Claude Code等AI应用,但主要通过子账户和用户配置的权限来控制风险,用户需自行设定交易限额。币安无法监控AI代理的决策推理过程,仅能监控交易活动,安全主要依赖子账户隔离。
中国机器人制造商宇树科技在上海IPO后估值约500亿美元,股价大涨。据英国《金融时报》报道,其需求依赖循环模式:制造商向国有培训中心出售机器人,再购回训练数据。分析师质疑高估值和数据实用性,宇树近四分之三的人形机器人收入来自教育和研究领域。
软件公司 Software Mansion 在 Hugging Face 上发布了用于 React Native ExecuTorch 库的 CLIP ViT-B/32 图像编码器模型,以 .pte 格式提供,支持 xnnpack 后端。该模型基于 OpenAI 的 clip-vit-base-patch32,导出时使用 ExecuTorch 1.1.0,不
肯塔基大学的研究人员提出了一种无需训练的任务导向对话框架,通过两个LLM智能体模拟用户与系统交互,研究人格适应对对话质量的影响。实验在SGD数据集上评估了GPT-4o、Qwen3-Next-80B和Gemini 2.0 Flash,发现人格适应能提升约束满足率和用户满意度,但会降低真实性,而基于线索的隐式适应(Try)能最好地平衡这一权衡。
华东师范大学、爱奇艺和腾讯的研究者提出了 LongNovel,一个用于长上下文小说摘要幻觉检测的多尺度中英双语基准。该基准包含 29 部中文小说和 BookSum 数据集的章节级数据,覆盖 16k 到 100k token 的四种长度场景,并设计了 8 种幻觉类型。通过多模型仲裁和实体引用幻觉生成相结合的方法,确保数据真实性和类别平衡,实验表明 LongNo