VOL. 2026-09-04 · 10 STORIES · DAILY INTELLIGENCE
AI HOT RADAR 日报
2026-09-04 · PUBLISHED · 约 8 分钟
今日AI行业迎来重磅发布,OpenAI正式推出GPT-6 Astra…
今日AI行业迎来重磅发布,OpenAI正式推出GPT-6 Astra系列,并宣布进入AGI时代,该模型在多项基准测试中表现优异,支持自主操作电脑,成为当日最核心事件。与此同时,字节跳动密集发布Seed2.0系列、全双工语音模型Seeduplex及3D生成模型Seed3D 2.0,覆盖多模态、语音交互与3D生成,并获约296亿美元贷款用于AI基础设施。开源社区亦活跃,Qwen3.8-27B与Qwen3.8-Flash-Next分别推出INT8和NVFP4量化版,后者可在单张96GB GPU上运行180B参数模型;inclusionAI的Ling-3.0-flash以124B总参、5.1B激活参数实现高效推理。此外,Agno与LangChain4j等开发工具更新,分别支持无状态MCP服务与响应式异步交互,推动AI应用工程化落地。
今日看点
2 个章节 · 10 条情报- 01模型发布GPT-6正式发布,OpenAI宣布进入AGI时代8
- 02产品发布Agno v3.0.6 发布:支持无状态 MCP 服务与协议协商2
模型发布
MODEL RELEASE8 篇GPT-6正式发布,OpenAI宣布进入AGI时代
OpenAI正式发布GPT-6 Astra和Astra Pro,称其为最智能、最协调的模型,并在发布会上宣布进入AGI时代。该模型在数学、编程、网络安全等基准测试中表现优异,支持Computer Use和Browser Use,能操作软件完成复杂任务。API定价为输入10美元/百万token,输出50美元/百万token。首批企业测试已开始,Astra将向ChatGPT Plus、Pro、Business和Enterprise用户开放。
Qwen3.8-27B 推出 W8A8 INT8 量化版,性能超越官方 FP8
Freaksterz 发布了 Qwen3.8-27B 的 W8A8 INT8 量化版本,采用 SmoothQuant 和激活感知 GPTQ 技术,在保持低 KL 散度的同时实现比 W8A16 更快的预填充速度。该模型兼容 DFlash2 投机解码,并提供了详细的评估数据和部署指南。
inclusionAI 发布 Ling-3.0-flash:124B 总参混合推理模型,激活仅 5.1B
inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数 124B,激活参数仅 5.1B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE。该模型在代码、智能体、通用知识等基准上匹配或超越前代旗舰,并集成 SGLang HiCache 与 Mooncake 分层缓存,将长输入场景的 TTFT 降低 60% 至 80% 以上。模型支持 256K 上下文,默认启用思考模式,适用于生产环境中的复杂智能体工作流。
Primitive AI 发布 Qwen3.8-Flash-Next NVFP4 量化版,单 GPU 可运行
Primitive AI 发布了 Qwen3.8-Flash-Next 的 NVFP4 量化版本,使 180B 参数的模型能在单张 96GB Blackwell GPU 上运行。该量化模型在 9 项基准测试中平均得分 92.2,支持 MTP 投机解码,并提供了详细的部署方案,包括 CPU 卸载和 NVMe 映射选项。
字节跳动发布Seed2.0系列模型,强化多模态与复杂推理能力
字节跳动旗下 Seed 研究团队正式发布 Seed2.0 系列模型,针对大规模生产部署和多模态理解进行了系统优化,提升了视觉感知、复杂指令执行和推理能力,并提供 Pro、Lite、Mini 及代码模型等多种规格。Seed2.0 在多项公开基准上取得领先成绩,其 Pro 和代码模型已在豆包和 TRAE 上线,API 已通过火山引擎开放。
字节发布全双工语音大模型Seeduplex,已在豆包App上线
字节跳动旗下Seed研究团队正式推出Seeduplex,一款原生全双工语音大模型,基于全新的“边听边说”框架,支持同时聆听与说话,显著提升交互自然度与流畅度。相比半双工模型,其误响应率和误打断率降低一半,过早响应率降低40%,并已在豆包App全量上线,实现行业首次大规模部署。该模型在复杂声学环境中的干扰抑制和自适应端点检测方面取得突破,多维度评估显示其在对话流畅度和节奏上优于传统方案。
Seed3D 2.0发布:更高精度与可用性的3D生成模型
字节跳动旗下 Seed Research 团队发布了新一代 3D 生成模型 Seed3D 2.0,通过两阶段 DiT 架构和统一 PBR 模型,显著提升了几何精度和材质真实感,在多项对比评测中达到 SOTA 水平。该模型已通过火山引擎 API 开放使用,技术报告同步发布。
OpenAI发布GPT-6 Astra;小米18 Fold定价过万;字节获296亿美元贷款
OpenAI发布GPT-6 Astra模型,具备百万级上下文和自主操作电脑能力,在多项测试中表现优异。小米确认小米18 Fold起售价过万,搭载自研玄戒O3芯片。字节跳动将获得约296亿美元银团贷款,用于AI基础设施投入。
产品发布
PRODUCT RELEASE2 篇Agno v3.0.6 发布:支持无状态 MCP 服务与协议协商
Agno 发布了 v3.0.6 版本,主要新增了无状态 MCP 服务模式(通过 MCPConfig(stateless=True) 实现),支持多实例部署无需会话亲和性;同时新增 MCPTools(protocol_mode=...) 参数,可协商 MCP 协议版本,并默认保持旧版兼容。此外,AgentOS 增加了 MCP Server Card 端点、.zip 和 .eml 文件上传支持,以及 AuthorizationConfig.excluded_route_paths 配置。修复了 Anthropic 思考块重放、Gemini 图片 MIME 类型、递归分块重复等问题。
LangChain4j 1.20.0 发布:支持非阻塞响应式与 Jackson 3
LangChain4j 发布 1.20.0 和 1.20.0-beta30 版本,引入非阻塞/响应式支持,AI 服务方法可返回 CompletableFuture 或 Flow.Publisher 实现异步交互,并贯穿工具调用、记忆、护栏和检索全链路。同时新增 Jackson 3 可选支持,通过添加 langchain4j-jackson3 依赖即可切换 JSON 处理库。此外修复了多个存储、搜索和异常处理问题。