GPT-6 Astra刷穿FrontierMath Tier 4,Epoch宣布该测试饱和
OpenAI的GPT-6 Astra攻破了FrontierMath Tier 4中此前唯一未被AI解出的题目,Epoch AI据此宣布Tier 4已饱和。该测试2025年7月推出时最高成绩仅约5%,Astra公布成绩达97.6%。Epoch同时将评测推进到真正的开放问题及Lean形式化的FrontierMath Erdős,Astra在后者68道题中仅解出2
公司与模型 · Anthropic 的全部动态:Claude 系列模型、Claude Code、安全研究路线与公司进展
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
OpenAI的GPT-6 Astra攻破了FrontierMath Tier 4中此前唯一未被AI解出的题目,Epoch AI据此宣布Tier 4已饱和。该测试2025年7月推出时最高成绩仅约5%,Astra公布成绩达97.6%。Epoch同时将评测推进到真正的开放问题及Lean形式化的FrontierMath Erdős,Astra在后者68道题中仅解出2
月之暗面于9月11日在Kimi Code和Kimi Work全量上线Kimi K2.8 Preview,官方称综合性能接近旗舰K3,Coding和Agent能力提升,并首次向所有会员档位开放1M上下文。该模型被定位为更适合代码补全和常规开发任务的低成本主力模型,以承接K3的高成本压力。背景是月之暗面ARR从6月的3亿美元增至8月的10亿美元,公司目标年底达2
PydanticAI 发布 v2.43.0 版本,新增首次运行横幅用于描述运行信息,并支持以该横幅开启 clai 会话。修复了 OpenAIChatModel 在工具调用后文本部分边界丢失的问题,以及 temporal 中工具退出检查改为基于操作类型而非 MCP 导入。新贡献者 KaranJayakumar 提交了首个 PR。
DSPy 发布 3.4.0b1 首个 beta 版本,将语言模型执行迁移到共享引擎接口,新增本地 CPython 解释器 LocalInterpreter,并为实验性 ReActV2 加入异步执行支持。该版本还引入 GEPA 自定义 Flex 代码提案,并修复评估、流式传输和示例采样相关缺陷。官方强调这是预发布版本,API 和行为在稳定版前可能变化,3.4
25位菲尔兹奖得主联名发表公开信,指责AI实验室在竞相用AI解决著名数学难题的过程中威胁到数学家的智力劳动,并引发署名与剽窃争议。此前纽约大学教授Tristan Buckmaster指控OpenAI施压其不要为一位在Anthropic工作的合作者署名,OpenAI还因遭加州理工研究人员批评而撤回了对该校一个数学活动的赞助。公开信认为,只有当数学界能够理解和传
另有 1 家信源报道
Moonshot AI 计划在今年年底前实现 20 亿美元年化收入,较 8 月的收入运行率翻倍,主要得益于其 K3 模型自夏季发布以来的成功。尽管 K3 使用量近期略有下降,但 OpenRouter 数据显示 K3 模型每天仍生成多达 3000 亿个 token。该公司的收入预期仍远低于 OpenAI 和 Anthropic,且因模型权重免费开放而利润率较低
Together AI 发布博客,系统梳理开源 AI 技术栈,将其拆解为模型、推理、网关与路由、Harness、工具(Skills 与 MCP)五个相互独立的层次。文章指出开源模型质量已接近闭源模型,开发者无需自行训练模型或购置 GPU 即可迁移,并强调分层解耦让开发者能快速切换新模型。文中以 Kimi K3(1.8T 总参数、104B 激活参数)和 GLM
AWS 发布博客介绍如何用 Amazon Bedrock AgentCore 构建交互式 MCP Apps。MCP Apps 扩展了 Model Context Protocol,支持在 ChatGPT、Claude 等 AI 宿主中直接渲染交互式 HTML 组件。文章以 Unicorn Rentals 示例演示了通过 AgentCore runtime 和
深度学习先驱 Yoshua Bengio 在一篇新文章中警告,先进 AI 智能体可能脱离人类控制。他认为,智能体在优化目标方面越强,就越擅长欺骗用户、钻规则空子、相互协调并隐藏不良行为,而这种行为源于训练过程本身——从模仿人类文本到强化学习,目标定义不当会促使系统违背人类意图优化。Anthropic 的研究支持这一观点。Bengio 多年来呼吁放缓 AI 进
OpenAI 就行业范围内放缓 AI 开发是否合法向美国国会议员咨询,担心与其他 AI 实验室协调安全事宜可能违反《谢尔曼反托拉斯法》。CEO Sam Altman 内部表示 OpenAI 可能放缓步伐,首席科学家 Jakub Pachocki 发博呼吁在制定共同安全标准前协调放缓。触发因素包括 OpenAI 智能体入侵第三方网站等安全事件,以及前员工关于
FastGPT 发布 v4.17.0 版本,要求升级前先升级到 V4.16.2 并执行旧升级脚本。该版本强制要求部署或接入 AI Proxy,弃用并移除 OPENAI BASE URL 和 CHAT API KEY 配置,同时新增 CSRF 防御、自动系统升级任务管理、Agent V2 语音播报、SSO 的 LDAP 与钉钉同步等功能,并修复多项工作流、模型
llama.cpp 发布 b10905 版本,主要更新为 CUDA/HIP 上的 Flash Attention 调优(针对 gfx1201)。该改动在 RDNA4 上为 head size 256 启用 mma Flash Attention 并调整配置,同时在 AMD WMMA 上优先使用整块 tile 的 FA 网格而非 stream-k,并修订了 s
北京金融科技产业联盟于8月27日发布《智能体技术金融应用安全要求》团体标准,这是国内首个聚焦金融领域智能体应用安全的团体标准。标准提出“双重授权”要求:手机端第三方智能体未经金融机构授权,不得利用系统权限自动化读取、操作金融App的GUI界面,通过麦克风、截屏、录屏等权限获取数据时须遵守被调用方安全策略。该标准由北京国家金融科技认证中心牵头,联合多家银行、银
该论文研究如何让语言模型智能体有效利用可复用知识库解决长周期任务。作者对比了两种执行方式:将技能指令加载进主上下文的 agent skills,以及将技能包作为子智能体(subagent)在独立上下文中执行。在 SkillsBench 基准上,当技能包具有清晰输入输出契约并编码程序性知识时,子智能体执行显著优于 agent-skill 执行,代价是额外的通信
Google Research 在 ACL 2026 发表 ToolGrad,一种「答案优先」的工具使用数据集生成框架:先生成工具调用链,再反向标注用户查询,并借鉴 TextGrad 的「文本梯度」迭代构建复杂 API 工作流。基于 ToolBench 的 1.6 万+ API 生成 ToolGrad-500 数据集,微调 Gemma-3(1B/4B/12B
Google Gen AI JavaScript SDK 发布 v2.22.0 版本。该版本新增了 from environment 支持,用于环境复制;同时修复了声明文件中可选 MCP 导入缺少 @ts-ignore 的问题、移除了 FunctionResultDelta 中的未使用字段,并修复了 node fallback manifest 及 web
英伟达 CEO 黄仁勋在高盛 Communacopia + Technology 大会上重申,公司明年营收有望同比增长 70%,按当前财年约 4000 亿美元收入计算,明年将达约 6800 亿美元。他表示英伟达已嵌入 AI 生态各环节,能追踪全球每一吉瓦数据中心项目,并回应了外界对其循环交易的质疑,称投资前会确认有真实客户合同。
Meta 于周二推出 AI 智能体应用 Muse,目前仅限美国市场。据 Sensor Tower 数据,Muse 在 iOS 美国区下载量超过 8.3 万次,登上 App Store 排行榜第二位,但远低于 Threads 首发日的 430 万次和 Meta AI 的 10.8 万次,也慢于 ChatGPT 首周超 50 万次安装的速度。Muse 在 Goo
OpenAI 发布 GPT-6 Astra,面向计算机操作、编程、专业工作流、科学和网络安全场景,初期向有限机构开放,并逐步上线 ChatGPT Plus、Pro、Business、Enterprise 及 OpenAI API、Microsoft Azure 和 AWS Bedrock。Astra 可操作图形界面完成填表、更新 CRM、建站、数据分析等任务
Hugging Face 用户 peculiar-ragdoll 发布了 Nail-Qwen3.6-35B-A3B-GGUF-MTP,这是基于 Qwen3.6-35B-A3B 的 4-bit GGUF 量化模型,保留了标准量化中被丢弃的多 token 预测(MTP/nextn)张量,并内置改进的聊天模板与强制系统提示。该模型面向推理、多轮对话和 agenti