Haystack v3.1.1-rc1 发布:修复消息转换器错误
Haystack 发布了 v3.1.1-rc1 版本,主要修复了 OpenAI 和 Hugging Face 消息转换器在处理无内容部分的助手消息时的错误。这些修复确保了包含空内容的助手消息能够被正确接受和传递,从而避免后续 LLM 调用失败。
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
Haystack 发布了 v3.1.1-rc1 版本,主要修复了 OpenAI 和 Hugging Face 消息转换器在处理无内容部分的助手消息时的错误。这些修复确保了包含空内容的助手消息能够被正确接受和传递,从而避免后续 LLM 调用失败。
arXiv 论文提出 Tool Primitives,用自然语言接口替代 API schema 调用,并构建含 25,519 个函数的 ToolFace 仓库,支持推理时动态检索。在此基础上提出 HEART 框架,包含 Planner、Router、Verifier 组件,在五个基准上平均超越 SFT 模型及 GPT-5.4、Claude-4.6-Sonne
AWS 宣布澳大利亚的悉尼和墨尔本区域现可通过 Amazon Bedrock 的全球跨区域推理访问 OpenAI GPT-5.6 系列模型(Sol、Terra、Luna)。这些模型支持文本和图像输入、100 万 token 上下文,并可通过 Responses API、Chat Completions API 和 Converse API 调用。文章还介绍了
美国司法部在《纽约时报》诉OpenAI和微软的版权案中支持AI公司,认为训练AI模型使用受版权保护的材料属于合理使用。司法部区分了训练复制与模型输出,并引用琼·狄迪恩的类比,强调AI训练具有创造性和公共价值。该立场与版权局的报告相悖,后者拒绝将AI训练视为普遍合理使用。
Redis 开发者体验团队的 Ricardo Ferreira 在演讲中介绍了其基于 Redis 构建的开源项目 Agent Memory Server(AMS),并开发了名为 My Jarvis 的 Alexa 技能,通过 LangChain4j 和 OpenAI 模型为 Alexa 提供智能回答。他分享了在开发过程中遇到的上下文中毒、干扰、混淆、腐烂和冲
该论文对11个生产级编码代理的源码进行了系统解剖,定义了harness工程学科,并识别出7个子系统和29种设计模式。研究发现,所有系统均未使用通用代理框架或向量检索,而SKILL.md技能采用率超过MCP。论文指出,到2026年上半年,编码harness已从工具转变为平台,并提出了18条设计建议。
微软提出 StudentSim 框架,通过两阶段训练(池化训练加个性化微调)从稀疏数据生成个性化学生模拟器,使其既能模仿学生反应,又能响应导师指导。在象棋、英语写作和数学三个领域的 60 名学生基准 StudentSimEval 上,StudentSim 在行为保真度和指导响应性上均优于 GPT-5.4 和 Maia2。作为概念验证,使用 StudentSi
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1 两款新模型,在编码和智能体基准测试上表现优异,同时通过降低缓存读取成本使典型任务成本降低约 25%,复杂智能体工作流成本降低高达 45%。然而,Artificial Analysis 指出,在最大努力模式下,Fable 5.1 因输出 token 更多,实际每任务成本比
另有 1 家信源报道
苹果在针对OpenAI的诉讼中指控其销毁证据,要求加快证据开示。苹果称OpenAI直到8月21日才交出涉案前员工的MacBook,且该员工曾讨论销毁法证数据。苹果还发现该员工下载了机密电路图并在OpenAI工作中使用。OpenAI则反驳称此争议是苹果自身造成的,并否认存在不当行为。
另有 1 家信源报道
雷峰网作者通过Qwen Code和ChatGPT Codex分别调用Qwen 3.8-Max与GPT-5.6,要求它们从零搭建并迭代一个3D大模型演进宇宙网站。实测显示,Qwen 3.8-Max在页面完成度和视觉细节上优于GPT-5.6,但耗时更长(3小时29分钟)且因额度耗尽中断,而GPT-5.6在37分钟内完成但完成度较低。文章认为Qwen 3.8-Ma
Anthropic宣布从9月14日起永久提高Claude Code标准周额度25%,但此前临时50%的加量将结束,实际额度反而减少约17%,引发用户不满。与此同时,OpenAI的Codex负责人Tibo重置了用户额度,并修复了多个后台消耗额度的Bug,使用户实际可用额度增加10%-50%。两相对比,Claude的沟通策略受到批评,而Codex则获得好评。
苹果CEO库克卸任,转任执行董事长,约翰·特努斯接任,库克在内部信中表达对继任者的信心。东方甄选前CEO孙东旭宣布新公司美丽明天员工年假30天,引发热议。科大讯飞公关副总裁韩煜尘被解除职务,疑似涉及私德问题。字节上调豆包股价格至17.02元/股,主要面向大模型部门。快手旗下北京可灵获国家人工智能基金14亿元注资。华为上半年营收4678亿元,研发投入1214亿
苹果在针对OpenAI的诉讼中提交了所谓“令人震惊的证据”,指控前员工刘畅窃取商业机密供OpenAI使用。苹果称刘畅在OpenAI工作中使用了苹果的机密电路原理图和内部工具,并试图销毁证据。OpenAI则辩称刘畅仅因帮助前同事而访问文件,并指责苹果系统管理不善。苹果正寻求初步禁令和快速取证,并称有400多名前苹果员工现任职于OpenAI。
另有 1 家信源报道
美国国防部在GenAI.mil门户中推出了定制版ChatGPT(ChatGPT Mil)和Grok(Grok for Government),供300万军事和文职人员使用,以加速工作并增强作战能力。该门户已吸引超过170万用户,但未包含Anthropic的Claude模型,因其被特朗普政府标记为供应链风险。此举是五角大楼更广泛AI战略的一部分,旨在平衡安全与
欧盟委员会首次将ChatGPT归类为“超大型搜索引擎”,因其内置网络搜索功能且月活用户超4500万,需遵守《数字服务法》更严格的监管规则。Reddit和Roblox也被重新归类为超大型在线平台。三家公司须在四个月内评估非法内容、未成年人保护和选举干预等风险,并接受更多审计。法律专家对数据访问是否涵盖训练数据或模型权重存在争议。
另有 1 家信源报道
Import AI 第471期探讨了多个AI相关话题,包括对Hugging Face与OpenAI安全事件的深入分析,指出AI代理展现出协作与自我牺牲能力,引发对AI接管风险的担忧。此外,五眼联盟发布声明,强调与产业合作确保前沿模型安全访问。比尔·盖茨发文警告,AI的崛起需要全球性应对,否则可能不会带来社会繁荣。
微软将 Foundry 模型路由器从两个区域扩展到 28 个全球标准部署区域和 21 个数据区域,并更新了模型池,新增了 Claude Opus 4.8 和 GPT-5.6 系列,移除了多个旧模型。默认配置的团队会自动接收更新,而自定义子集的团队则需手动调整。该更新强调 API 稳定性与行为稳定性的区别,并涉及路由模式、上下文窗口限制、成本附加费及合规性等细
arXiv 论文提出 CareGraph,一个可审计的混合 AI 框架,用于基于证据的个性化纵向健康智能。该框架将实验室、电子病历、可穿戴设备等多源健康数据转化为趋势、缺失上下文和可追溯的解释,并通过确定性规则与 LLM 结合,在合成数据上验证了高准确率和安全性。研究表明 CareGraph 比单一 GPT-5.6 基线更快、更简洁,且更符合纵向目标,为患者
OpenClaw 曾因开源 AI 智能体而爆红,三个月内 GitHub Star 超 25 万,但几个月后热度消退,被 Claude Code、Codex 等 Harness 取代。其创始人 Peter Steinberger 已加入 OpenAI 开发下一代 Agent,并投资 Linux 桌面基金会。OpenClaw 虽热度下降但仍在更新,国内厂商推出
arXiv 论文提出 Modality Maturity Index (MMI) 基准,用于评估全模态模型在文本、图像、音频、视频和文档五种模态及其组合上的输入输出能力。MMI 包含 893 个问题,并引入 Modality Presence Score (MPS) 衡量模态生成能力。测试五个前沿模型发现 MPS 仅 15.6 至 34.9,表明现有模型多模