阶跃发布 Step 5 Preview,跻身 AA 榜单全球开源前三
阶跃星辰于9月20日发布新一代旗舰基座模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作与金融等场景,提升真实世界 Agentic 任务表现。该模型在全球权威榜单 Artificial Analysis Intelligence Index 中跻身全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8,并计划于 10
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
阶跃星辰于9月20日发布新一代旗舰基座模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作与金融等场景,提升真实世界 Agentic 任务表现。该模型在全球权威榜单 Artificial Analysis Intelligence Index 中跻身全球开源前三,单任务成本仅为 Claude Opus 5 的 1/8,并计划于 10
Comfy-Org 在 Hugging Face 上发布了 Qwen3-VL 的重新打包版本,将 Qwen/Qwen3-VL-4B-Instruct 和 Qwen/Qwen3-VL-8B-Instruct 转换为适配 ComfyUI 的单文件模型。该仓库提供 bf16、fp8 scaled、int8 convrot 和 nvfp4 等多种量化格式,用户需将文
DeepBeepMeep 在 Hugging Face 上发布了 Wan2.1 视频生成模型的单文件版本,基于 Wan-AI/Wan2.1-T2V-1.3B,用于配合其开源项目 WanGP 使用。WanGP 支持 Wan、Hunyuan Video、Flux 1 & 2、Qwen、Z-Image 和 LTV 等视频生成模型,主打低显存需求(最低 6GB 即可
llama.cpp 发布 b11057 版本,新增针对 Ling 3.0(Bailing V3)的专用聊天解析器。由于 Ling 3.0 Flash 模板在生成提示中预先打开 think 块,模型不会输出起始 标签,且工具调用可能出现在 之前,导致原有自动解析器将工具调用误判为 reasoning content,客户端收到空 content 且无 tool
Hugging Face 用户 ajgazin 发布了 Swift-Qwen3.8-27B-Uncensored-Dynamic-MTP-GGUF,这是对已去审查(abliterated)的 Swift-Qwen3.8-27B 模型进行 GGUF 量化的版本。该模型采用 Unsloth Dynamic 3.0 量化布局,包含 MTP 头以支持 llama.c
MinerU 发布 4.0.4 版本,主要修复 VLM 引擎在高显存设备上的 GPU 显存利用率逻辑,并降低推理性能、模型加载等日志级别。API server 的 --log-level 参数现在仅作用于服务端日志,WebUI 修复了超长文件名的幂等处理问题。依赖方面要求 mineru-vl-utils 最低版本提升至 2.0.5,以修复 lmdeploy
Cerebras 与 OpenAI 联合发布 Ultrafast Mode 服务层级,首先在 OpenAI API 中上线并由 Cerebras 提供算力支持,目前面向少数客户限量预览。该模式驱动 GPT-5.6 Sol,输出速度最高达每秒 750 tokens,且不牺牲质量。Cerebras 称在 Humanity's Last Exam 基准上,Ultr
Cerebras 在 Hot Chips 2026 大会上深入介绍了 CS-4 加速器的系统架构,包括 Nexus 机架级平台、晶圆级引擎的供电与冷却设计,并预览了 CS-5 和 CS-6 路线图。CS-5 计划于 2027 年推出,目标在开源模型上实现每用户每秒 1 万输出 token,在万亿参数级前沿模型上实现每秒 5000 token 和每兆瓦每秒 3
Cerebras 宣布为 OpenAI 的 GPT-5.6 Sol 提供 Ultrafast 模式,输出速度最高达每秒 750 个 token。该服务运行在 Cerebras WSE-3 晶圆级芯片上,模型架构、权重、精度、上下文配置和推理设置与标准 OpenAI 端点完全一致,未做蒸馏或量化。Cerebras 称在 GDP-Val 任务上完成速度比标准端点
Cerebras 发布第四代 AI 加速系统 CS-4,由三个 Wafer Scale Engine 3 Turbo 处理器构成,采用全新 Nexus 机架级平台架构。官方称其推理速度最高可达 GPU 系统的 30 倍,在超过 10 万亿参数模型上实现每秒 1000+ token,并原生支持分离式推理,可与 AMD Helios、AWS Trainium 等
华为在2026年全联接大会上发布灵衢(UnifiedBus)统一互联总线协议,以及昇腾960芯片、昇腾960超节点、OceanStor M900 AI记忆存储等AI基础设施新品。灵衢将CPU、NPU、DPU、内存、存储等统一互联,使10万卡集群的MFU从约20%提升至35%,单集群可支持100万颗AI处理器。华为同时推进CANN开源与Agent开发生态合作,
llama.cpp 发布 b11055 版本,主要变更为在 hexagon 后端新增对 GEGLU QUICK 的支持(PR #29114)。该版本同时提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11054 版本,主要变更为在 Hexagon 后端启用对 TOP K 算子的支持,包括单行 TOP K 线程化、提升基于 VTCM 的尺寸上限、修复 TOP K mdev 行分区、优化大行选择,并更新了相关文档。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译包。
Hugging Face 开源了 Reef 基础设施,旨在让智能体(harness + 模型)能够从经验中持续自我进化。Reef 以推理为核心,提供标准 OpenAI 格式推理端点,并将推理轨迹、执行结果和用户反馈存储为结构化经验流,支持模型权重与 harness(提示、记忆、技能、工具、编排逻辑)的联合更新。其目标是让开源社区更容易实验持续自我改进,并获得
Interconnects AI 作者撰文阐述其对递归自我改进(RSI)的立场。作者认为,当前 AI 安全担忧更多源于前沿实验室(尤其 OpenAI 和 Anthropic)大规模使用数千并发智能体所带来的文化焦虑,而非真正的 RSI 突破;他提出「有损自我改进」替代情景,指出可自动化研究范围有限、并行智能体收益递减、资源瓶颈与政治因素制约进展。文章还引用了
llama.cpp 发布 b11053 版本,主要改进了 server 的启动日志信息。更新后每个模型在日志中会显示来源标签(preset/models dir/cache),替代原先难以理解的星号标记,并在“Loaded cached model presets”日志中显示 Hugging Face hub 缓存路径,同时新增 hf cache::get
llama.cpp 发布 b11052 版本,主要变更是其 json-schema 功能现在接受正则表达式模式中的转义连字符(PR #29127)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
量子位实测了Qwen 3.8 27B模型,该模型能通过一句Prompt在几分钟内生成完整网页工具,包括数据分析工具和仿12306抢票页面。工程师Alok结合Cerebras硬件实现了1950 token/s的生成速度,可秒级生成Google首页和YouTube界面。但实测发现生成的网页仅为前端外壳,无法接入真实后端、支付和实时数据,且Cerebras加速方案
Google 与 DeepMind 研究人员提出 Dream-RSI 方法,通过回放已完成的搜索记录来测试新的搜索策略,而无需重复昂贵的实时计算,从而让 AI 智能体更高效地解决困难搜索任务。该方法只改变搜索策略、不改动底层模型,在 Gemini 3.1 Pro 和 Gemini 3.7 Flash 上测试八项任务,平均运行时间和尝试次数均下降,并在部分 G
英特尔推出第三代酷睿处理器Wildcat Lake,采用Intel 18A制程和双芯片封装,内置17TOPS算力的NPU,首次将AI功能下放到4000 6000元价位段轻薄本。英特尔同时展示Firefly萤火虫计划参考设计,通过拥抱手机产业链、优化零部件和标准化集成来降低成本。作者在搭载该处理器的机械革命无界14 S上实测了WorkBuddy、像素蛋糕、Ow