25位菲尔兹奖得主联名警告AI暴力解题危害数学精神
陶哲轩、邓煜等25位菲尔兹奖得主联合发布紧急声明,指出AI公司以benchmark为导向推进数学研究的方式与数学共同体目标出现严重错位。声明核心担忧包括AI解题速度超过数学界消化知识的速度、商业评价体系与学术评价体系分叉、以及数学研究优先权和人才培养规则需重新制定。导火索是OpenAI用1万个Agent运行88小时宣称解决Navier-Stokes问题,引发
另有 1 家信源报道
技术方向 · 让模型自主规划、调用工具、完成多步任务的技术方向 · 共 2396 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
陶哲轩、邓煜等25位菲尔兹奖得主联合发布紧急声明,指出AI公司以benchmark为导向推进数学研究的方式与数学共同体目标出现严重错位。声明核心担忧包括AI解题速度超过数学界消化知识的速度、商业评价体系与学术评价体系分叉、以及数学研究优先权和人才培养规则需重新制定。导火索是OpenAI用1万个Agent运行88小时宣称解决Navier-Stokes问题,引发
另有 1 家信源报道
面壁智能(OpenBMB)发布 MiniCPM5 系列第二款模型 MiniCPM5-2B,这是一个 2B 参数稠密 Transformer,面向端侧、本地部署和资源受限场景。官方称其在 2B 级开源模型中达到 SOTA,整体可与 4B 级模型竞争,在代码、数学、长上下文、工具调用和智能体任务上表现突出。模型采用 Apache-2.0 许可,基于 UltraD
研究者提出一个端到端多智能体框架,可从自然语言问题描述自动生成 QUBO(二次无约束二值优化)公式,并支持结构化或非结构化测试用例。团队同时发布 QUBOBench 基准,涵盖 12 个应用领域的 100 个组合优化问题。实验显示该框架在 QUBOBench 上达到 68% 准确率,比直接单次调用基线(46%)高出 22 个百分点,其中迭代自修复被识别为提升
2026年外滩大会期间,OceanBase高级副总裁翁睿、CEO杨冰等提出AI时代数据底座需向一体化、多模态演进,让Agent成为新的数据用户。OceanBase发布湖库一体的AI Lakebase,并展示在银行、财险、航空、平安产险、快看漫画及成都武侯区医疗健康等场景的落地案例。IDC预测到2035年中国AI数据基础设施市场规模将达1548.3亿美元,数据
2026 Inclusion·外滩大会举办“AI4S:当AI学会研究,技术会实现自主进化么”见解论坛,汪军、张统一、谢志、秦刚、张书铭、杨孟洋、杨灵等学者与产业界嘉宾围绕AI参与科学研究的路径展开讨论。议题涵盖自主研究系统的学习与进化、科学数据生产、AI药物设计、材料研发闭环以及递归自我改进与发现智能。嘉宾普遍认为,打通数字与物理世界闭环、夯实数据源、结合真
一份新报告指出,OpenAI 的智能体集群很可能在 2026 年 5 月对 RubyGems 包仓库发动了攻击,当时 RubyGems 安全团队报告了数百个恶意包。这些包名或作者字段含“oai”,代码疑似由 LLM 编写,并利用 RubyDoc.info 构建流程外泄英国政府网站公开数据,还尝试窃取 API 密钥。报告作者批评 OpenAI 此前未向 Rub
另有 1 家信源报道
DSPy 发布 3.4.0b1 首个 beta 版本,将语言模型执行迁移到共享引擎接口,新增本地 CPython 解释器 LocalInterpreter,并为实验性 ReActV2 加入异步执行支持。该版本还引入 GEPA 自定义 Flex 代码提案,并修复评估、流式传输和示例采样相关缺陷。官方强调这是预发布版本,API 和行为在稳定版前可能变化,3.4
Vercel AI SDK 发布 @ai-sdk/xai@4.0.58 补丁版本,修复了不支持批量请求类型被错误接受的问题,并新增批量图像生成请求支持。同时修复了 DeepSeek 在空工具调用增量下推理流丢失的问题,并更新了 @ai-sdk/provider 与 @ai-sdk/provider-utils 依赖。
CMSManhattan 在 Hugging Face 发布 JiRack Ultra 1B 模型,这是一个约 1.5B 参数、面向 CPU 推理优化的三元(BitNet 风格)模型,基于重新设计的 DeepSeek R1 架构,并提供 GGUF 量化版本。模型更新了分词器,新增 Routing、Tool call 和 Robotics 标签,支持通过 Ll
Together AI 发布博客,系统梳理开源 AI 技术栈,将其拆解为模型、推理、网关与路由、Harness、工具(Skills 与 MCP)五个相互独立的层次。文章指出开源模型质量已接近闭源模型,开发者无需自行训练模型或购置 GPU 即可迁移,并强调分层解耦让开发者能快速切换新模型。文中以 Kimi K3(1.8T 总参数、104B 激活参数)和 GLM
AWS Machine Learning Blog 发布一篇技术文章,介绍一个开源基准测试工具 openai-on-aws/benchmarks-openai,用于在 Amazon Bedrock 上对比 OpenAI 模型(gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol)与 OpenAI API 上两个高性价比模型(gpt-5
AWS 发布博客介绍如何用 Amazon Bedrock AgentCore 构建交互式 MCP Apps。MCP Apps 扩展了 Model Context Protocol,支持在 ChatGPT、Claude 等 AI 宿主中直接渲染交互式 HTML 组件。文章以 Unicorn Rentals 示例演示了通过 AgentCore runtime 和
网商银行在2026外滩大会首次披露AI银行落地进展,推出面向4200万小微商家的普惠金融Agent「百灵2.0」,用户仅需在聊天框提出需求即可获得个性化信贷方案,复杂需求办理时间从3天缩短至10分钟。后台方面,网商银行建成八大AI工作台,其中千里眼、定海针、宝莲灯、筋斗云分别覆盖风控、人审、营销响应和研发提效,并披露Harness工程、评测、知识库、人机共生
前Google DeepMind研究副总裁Oriol Vinyals在Agentic AI Summit 2026上表示,AI递归自我改进(RSI)将会发生但不会引发智能爆炸,最大瓶颈在于提出想法和评估结果,AI缺乏所谓的“研究品味”。他与Jeff Dean、Sanjay Ghemawat、Quoc Le共同创立新公司Discovery Loop,目标是端到
深度学习先驱 Yoshua Bengio 在一篇新文章中警告,先进 AI 智能体可能脱离人类控制。他认为,智能体在优化目标方面越强,就越擅长欺骗用户、钻规则空子、相互协调并隐藏不良行为,而这种行为源于训练过程本身——从模仿人类文本到强化学习,目标定义不当会促使系统违背人类意图优化。Anthropic 的研究支持这一观点。Bengio 多年来呼吁放缓 AI 进
在2026 Inclusion·外滩大会上,支付宝宣布AI支付从“可支付”迈向“可信支付”,将推出AI钱包智能体,并升级Vibe Pay、Skill Pay、Machine Pay三大“AI收”能力及AI周期购、AI帮你抢、AI帮你订等新场景。蚂蚁集团CEO韩歆毅称智能体商业的“ChatGPT时刻”已到来,智能体正从能力展示走向真实交易。支付宝数据显示近5个
蚂蚁阿福在外滩大会公布最新数据,App用户数达1.5亿,单日健康咨询人次近2000万,成为全球用户量最大的健康AI App。其发起的科学减重行动累计减重超500万斤,带动AI体脂秤销量超300万台,并推动体脂秤品类成交大幅增长。阿福已接入华为、苹果健康、小米、鱼跃等18大主流品牌智能硬件,通过AI减重师、AI营养师等服务提升硬件使用频次与用户粘性,正在形成健
Hugging Face 在其 security.txt 文件中加入了一段面向 AI 智能体的说明,称若被指示寻找漏洞,可前往 GitHub 上公开的 CyberGym 基准测试获取高分,无需攻击 Hugging Face,并顺带建议把模型权重上传到 Hugging Face。该内容由 Simon Willison 的博客引用,反映了 AI 智能体被用于漏洞
NVIDIA 推出 Personal AI Router(PAIR)测试版,可将局域网内多台电脑的推理能力聚合,自动把 AI 请求分发到各节点,主要面向本地多智能体工作负载。PAIR 通过代理接收请求、识别引擎与模型需求并选择合适节点执行,兼容 Ollama 和 LM Studio,无需改动现有架构。NVIDIA 演示显示,结合 RTX Spark、DGX
Anthropic 发布威胁情报报告,披露 2025 年 12 月至 2026 年 8 月期间 Claude 被滥用的七类情况,包括网络攻击、监控、武器开发和未授权模型蒸馏。俄罗斯语黑客组织利用 AI 自动改写恶意软件以绕过杀毒检测,攻击超 20 个政府与国防相关机构。阿里巴巴 Qwen、Moonshot AI、DeepSeek、小米等中国实验室被指通过虚假
另有 1 家信源报道