AI 引发的数学危机:从震惊到存在主义拷问
The Verge 的 AI 记者 Robert Hart 在 Decoder 节目中讨论了 AI 对数学领域造成的冲击,称数学界因 OpenAI 发布的高难度数学问题解决方案而‘震惊’。尽管 AI 在基础算术上仍表现不佳,但在高级抽象数学上已展现出专业水平,引发了对数学家角色和数学研究未来的存在主义危机。Hart 采访了多位顶尖数学家,探讨 AI 能力提升
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
The Verge 的 AI 记者 Robert Hart 在 Decoder 节目中讨论了 AI 对数学领域造成的冲击,称数学界因 OpenAI 发布的高难度数学问题解决方案而‘震惊’。尽管 AI 在基础算术上仍表现不佳,但在高级抽象数学上已展现出专业水平,引发了对数学家角色和数学研究未来的存在主义危机。Hart 采访了多位顶尖数学家,探讨 AI 能力提升
开源AI基础设施公司Prime Intellect发布研究,提出多智能体Harness系统,让更便宜的开源模型承担监控和实现任务,从而降低AI自主科研成本。实验中,18个前沿模型参与nanoGPT优化器速通,开源模型Kimi K3搭配Prime Agent Harness达到2930步,超过GPT-5.6 Sol的3042步,逼近Opus 5的2920步。研
华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex等工具。报告将Agent能力拆分为模型与Harness,千问办公的隐含Harness分居首,且API价格较低,具备成本优势。报告认为企业级Agent竞争核心在于工作流和生态协同,千问办公已初步打通钉钉。
另有 1 家信源报道
LangChain 发布了 langchain-openai 1.6.0 版本,主要新增了标准模型异常类型,并修复了在 create chat result 中遇到意外响应类型时错误提示不清晰的问题。该版本旨在提升 OpenAI 集成的稳定性和错误处理能力。
LlamaIndex 发布 v0.14.24 版本,包含多个核心修复和功能增强。核心库修复了 HotpotQA 评估器文件句柄、CodeSplitter 叶子节点保留、MMR 搜索阈值等问题,并新增了属性图提取器的 raise on error 选项。各集成模块也同步更新,如 Anthropic 和 Bedrock 新增对 Claude Sonnet 5 和
非营利组织Guidelight发布首份评估报告,指出Anthropic、OpenAI、Google、xAI和Meta等AI实验室未能完全对其内部AI系统实施基本控制措施。评估基于公开资料,检查了日志记录、风险审查、紧急关闭等六项实践,其中Anthropic和OpenAI得分最高(C+),Meta最差(F)。报告显示各公司在检测异常行为方面表现较好,但在预防和
Anthropic 首次在营收上超过 OpenAI。OpenAI 第二季度营收为 67 亿美元,环比增长 18%,而 Anthropic 同期营收翻倍至 116 亿美元,并实现小幅营业利润。Anthropic 的年化营收率同比增长七倍至 650 亿美元,其编程工具 Claude Code 的成功对 OpenAI 构成压力。OpenAI 表示在 GPT-5.6
华尔街投行杰富瑞实测八款全球主流AI Agent,结果显示阿里千问办公综合得分第一,超越Claude Cowork和Codex。测试涵盖五项真实办公任务,千问办公在复杂任务、浏览器控制及多模态生成中表现突出,且隐含Harness分居首。报告指出,Agent竞争正转向企业级场景,成本与生态协同成为关键。
另有 1 家信源报道
StateM 是一个通过持久状态、可恢复运行手册和程序化控制来提升长时程智能体执行能力的运行时系统,无需修改模型权重。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 的准确率从 83.1% 提升至 92.1%,并将 GPT-5.6 Sol xhigh 提升至 95.3%,同时将 DeepSeek-V4 Flash
Artificial Analysis 发布了名为“Search Index”的新基准,用于评估搜索 API 提供商在 AI 代理场景中的质量、成本和速度。该基准使用统一模型 GPT-5.6 Luna 和开源框架 Stirrup 测试了 Parallel、Exa、Firecrawl 等七家提供商,并结合三个子基准进行评分。结果显示,更好的搜索质量能降低总成本
国内大厂正从AI办公转向企业核心业务场景,蚂蚁数科推出Agentar生态版,帮助商家将服务AI化并接入智能体体系,实现从工具到业务交付的跨越。海外Palantir和OpenAI也在布局AI商业应用,麦肯锡预测到2030年AI代理将参与3万亿至5万亿美元消费交易。蚂蚁数科Agentar已在金融等领域落地超300个智能体,并获IDC市场报告认可。
据彭博社报道,Anthropic在IPO前夕向投资人披露其最新年化营收达650亿美元,较2025年底的90亿美元增长超7倍,并反超OpenAI的400亿美元。Anthropic的增长主要来自企业客户和Claude Code,且已实现调整后营业利润转正,计划最快10月上市。OpenAI则面临营收差距和IPO节奏压力,正调整管理层以应对竞争。
另有 1 家信源报道
本文提出了一个名为“The Unwritten Benchmark”的新基准,用于评估多模态模型在抽象感知推理中的能力。该基准要求模型仅通过笔划声音和手部运动视频来推断正在书写的单词,而无需可见的墨水痕迹。结果显示,人类参与者的有序字母准确率超过80%,而包括GPT-4o和Gemini 2.5-Pro在内的领先多模态模型准确率低于10%。此外,研究发现多模态
前OpenAI首席产品官Kevin Weil创办新公司,定位为AI模型收集科学数据,估值7.5亿美元,计划募资1.5亿美元。与此同时,Jeff Dean创立Discovery Loop,前OpenAI研究员创立Periodic Labs,AI4S赛道进入基础设施建设阶段,分为数据层、模型层和应用层。文章指出科学数据整合难度高,存在碎片化风险,但长期可能形成壁
OpenBMB 发布了 MiniCPM-o 2.6,这是一个 8B 参数的多模态大模型,支持视觉、语音和实时多模态流式交互,在多个基准上超越 GPT-4o 等闭源模型。该模型基于 SigLip、Whisper、ChatTTS 和 Qwen2.5 构建,支持端侧部署,并已开放 ollama、int4、GGUF 等格式。
LangChain 发布了 langchain-openai 1.5.2a1 版本,包含多项更新:支持从响应头提取网关元数据、修复 o 系列模型的 token 计数、支持 OpenAI 3.0 SDK、新增 ChatGPT OAuth 支持的 ChatOpenAICodex 模型、支持显式提示缓存等。这些改进增强了与 OpenAI 服务的集成,并提升了流式处
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分,与 GPT-5.6 Luna(max)持平,仅比 GLM-5.2(max)和 DeepSeek V4 Pro 0813(max)低一分。该模型参数规模远小于对比模型,被认为是一款令人惊叹的模型。
英伟达宣布向软银和OpenAI关联的数据中心开发商SB Energy投资15亿美元,并承诺提供高达1050亿美元的信贷支持,用于建设俄亥俄州辛辛那提附近的OpenAI Ports-Pike数据中心。该设施初期规模4.25吉瓦,可扩展至8吉瓦,英伟达将成为其唯一计算基础设施供应商。项目还包括一座92亿瓦的天然气发电厂,预计耗资330亿美元,但天然气价格可能因竞
另有 1 家信源报道
Nvidia 正大力投资近乎开源的模型(如 Nemotron),通过发布训练数据和代码,鼓励更多公司构建自己的模型,从而扩大对其芯片的需求。文章指出,开源模型生态的未来取决于能否形成经济回报闭环,否则可能转向效率优先的细分市场。同时,训练复杂度的提升和开源社区对后训练的关注,可能改变传统训练流程的划分。
AI视频市场在Sora初期炒作失败后反弹,形成了包括AI工作室、营销平台和虚拟人产业的新行业。好莱坞的Promise等公司利用AI技术降低电影制作成本,Netflix计划在2026年前在300部作品中使用AI。视频初创公司Higgsfield估值达54亿美元,年化收入增长至7亿美元。同时,Inception Point AI等公司批量生产AI虚拟人,用于播客