Latent Space 发布前沿 AEO 追踪器:分析模型推荐偏好与偏差
Latent Space 发布了一个前沿 AEO(AI 引擎优化)追踪器,基于 7 个前沿模型在 161 个类别中的推荐结果,分析各产品在 AI 推荐中的主导地位。报告发现模型存在偏好偏差(如 Claude 推荐自家产品),但也观察到跨模型推荐案例。此外,Anthropic 的新模型 Astra 比 Sol 更自信且搜索来源更少,影响了 AEO 策略的有效性
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
Latent Space 发布了一个前沿 AEO(AI 引擎优化)追踪器,基于 7 个前沿模型在 161 个类别中的推荐结果,分析各产品在 AI 推荐中的主导地位。报告发现模型存在偏好偏差(如 Claude 推荐自家产品),但也观察到跨模型推荐案例。此外,Anthropic 的新模型 Astra 比 Sol 更自信且搜索来源更少,影响了 AEO 策略的有效性
TechCrunch 发布了一份 AI 术语表,用通俗语言解释 AGI、AI agent、API 端点、思维链、计算、深度学习、扩散模型等常见术语,并提及 OpenAI 新模型 Astra 的“不透明递归”推理技术引发安全担忧。该术语表旨在帮助从业者、投资者和普通读者跟上快速演进的 AI 词汇,并会定期更新。
字节跳动Seed Research发布了EdgeBench,一个超长时程基准,用于衡量智能体在真实环境中的持续学习能力,包含134个任务,每个任务支持至少12小时交互。研究发现,智能体的环境学习性能遵循log-sigmoid曲线,拟合优度R²=0.998,且前沿模型的学习速度约每三个月翻倍。EdgeBench已开源51个任务和完整评估框架,以促进社区研究。
国内AI人才经历三波大迁徙:从百度等大厂流向AI六小虎和字节等,再到百川智能、零一万物等战略收缩后人才流向腾讯等。深层原因包括股价、战略导向和组织架构。当前趋势是人才流动加速,AI Infra和数据人才受追捧,预训练需求下滑。
EvoHarnessBench 是一个新基准,用于评估 LLM 智能体在工具、技能和智能体三个维度上不断演化的外部 harness 下的表现。它包含 17 个多阶段流、802 个任务、520 个工具、42 个技能和 62 个智能体,并区分部署评估和自进化适应评估。研究发现,harness 扩展会导致智能体在已解决任务上性能下降,即 harness 诱导的遗忘
Harbor Adapters 和 Harbor-Index 项目为大规模智能体评估提供了统一基础设施和精选元数据集。他们开发了适配器,将超过80个基准测试移植到Harbor框架,并对8个模型在54个基准上进行了大规模评估。Harbor-Index包含82个高质量任务,旨在保持挑战性的同时降低成本。所有代码、结果和数据集均已开源。
伦敦国王学院等机构的研究团队探讨了是否应将“AI 精神病”列为独立临床诊断,该现象指重度使用聊天机器人期间出现或恶化的精神病症状。研究指出,聊天机器人的谄媚倾向和类人设计会强化用户的妄想,形成“单人的回音室”,并援引案例包括青少年自杀等严重后果。团队建议临床医生常规询问患者聊天机器人使用情况,并呼吁开发者进行发布前测试和上市后监测。
量子位报道称,具身智能领域正兴起In-Context Learning(ICL)创业热潮,Skild AI和Generalist AI分别发布机器人基础模型S1和GEN-1.5,展示机器人通过观看示范视频即可学习新任务,无需微调。国内创业公司可可矩阵(COCO Matrix)致力于将ICL作为具身智能的底层范式,其创始人高宇翔认为,具身智能的Scaling方
Meta 的超级智能实验室发布了首个实时音频感知模型 Muse Voice Transcribe,能够实时转写语音、区分说话人并检测句子边界。该模型将音频分成 80 毫秒的块,并根据难度动态调整延迟,以平衡速度和准确性。其定价为每小时 0.18 美元,低于 OpenAI 和 ElevenLabs 等竞争对手,支持超过 70 种语言,现已通过 Meta AI
Ollama 发布 v0.34.0 版本,允许在 ChatGPT 桌面版中直接使用 Ollama 模型,用户可在 macOS 上通过 Ollama 应用进行设置。该版本还提升了 Apple Silicon 上的结构化输出性能,增加了对 OpenAI 兼容客户端工具搜索和响应压缩的支持,并修复了压缩响应中图像显示的问题。
Artificial Analysis 发布了其智能指数 4.2 版本,以回应此前对 GPT-6 Astra 评分准确性的质疑。更新后,GPT-6 Astra 的得分较前代提升 4 分,但仍落后于 Anthropic 的 Claude Fable 5.1。新指数引入了两个新基准,并增加了私有测试数据的权重,以防止模型作弊。
Simon Willison 在博客中分享了在 macOS 上通过 ChatGPT Codex 使用 Blender 的经验,指出只需安装 Blender 应用并输入简单提示词即可让编码代理生成图像。他通过三个提示词成功渲染了一只鹈鹕骑自行车的场景,并添加了背景和细节。文章还提及了其他相关文章,如 Astra 的鹈鹕对比网格和 OpenAI 的 rogue
GPT-6 Astra发布带火了循环Transformer技术,阿里团队早在11个月前就发表了MeSH和SpiralFormer两篇论文,分别解决循环内部信息管理和计算粒度问题。MeSH通过动态读写路由器管理记忆槽,减少计算冗余;SpiralFormer通过多分辨率序列处理,让每轮循环关注不同尺度的信息。两篇论文分别被ICLR 2026和EMNLP 2026
作者在 Grok Bot 上体验五天后,认为其通过浏览器登录即可连接插件和工具,配置简单如 MacBook,而 OpenClaw 则像 Linux,灵活但复杂。Grok Bot 将 Bot 作为编程的原子单元,支持通过自然语言组合多个 Bot 形成群聊,并可通过角色化区分来组织工作。作者还创建了 Agentic Engineer Bot 来路由任务给不同编码
Doubleword 联合创始人 Meryem Arik 在 QConAI 2030 上预测了 AI 行业未来趋势,涵盖 token 支出、基础设施、代理、监管和职业发展。她指出 token 成本已成为企业问题,并驳斥了 AI 实验室补贴 token 的说法,认为 token 价格将持续下降。她还预测了企业采用 AI 的速度和前沿模型改进的速度。
陶哲轩警告,AI快速解决数学难题可能阻碍数学发展,因为解题过程被黑盒化,掩盖了探索中的宝贵失败。他以纳维-斯托克斯方程为例,指出AI可能直接给出答案,但人类无法理解证明,使问题失去推动后续研究的意义。他还吐槽GPT-6在孪生素数猜想上的突破,认为问题被AI“污染”前,牛津数学家Julia Stadlmann的工作更值得关注。
Anthropic宣布,其AI模型Claude在11天内完成了费马大定理的首个端到端形式化证明,生成了约1300万行Lean代码和超过3万个中间定理。该工作由姚班校友Tianyi Peng主导,使用了多Agent协作系统Prove2Me,最终证明经Lean验证与Mathlib中的陈述一致。这一成果表明AI可大幅加速数学文献的形式化进程。
另有 1 家信源报道
PydanticAI 发布 v2.40.0 版本,新增了后台更新价格、会话中的 barge-in 处理、事件监听器注册、RealtimeSession 的 respond 和 enqueue 方法等功能。同时修复了多个实时音频和流处理相关的 bug,包括 OpenAI Responses 流终止事件的 finish reason 映射、音频块类型检查、工具失
LangChain 发布了 langchain-core 1.6.2 版本,主要更新包括支持 OpenAI 异步工具、修复 Google GenAI 和 Bedrock 标准内容中的变异问题,并升级了依赖库以增强安全性。
llama.cpp 发布 b10813 版本,新增了针对 Adreno GPU 的 OpenCL xmem SDPA 路径,通过环境变量 GGML OPENCL XMEM SDPA 控制,并修复了数值误差优化 GQA/mask attention 的问题。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件