评估分布式系统中智能体代码修复能力的新基准 DDBench
DDBench 是一个针对分布式系统代码修复的基准测试,包含从 13 个开源分布式系统中挖掘的 60 个历史 bug,分为三个难度等级。研究在仅症状和上下文增强两种条件下评估了 10 个 LLM,发现分布式调试能区分模型能力,且调试上下文能提升通过率,但对不同模型影响不对称。
公司与模型 · 智谱的 GLM 系列模型动态:旗舰开源发布、代码与推理能力迭代、商业化与生态
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
DDBench 是一个针对分布式系统代码修复的基准测试,包含从 13 个开源分布式系统中挖掘的 60 个历史 bug,分为三个难度等级。研究在仅症状和上下文增强两种条件下评估了 10 个 LLM,发现分布式调试能区分模型能力,且调试上下文能提升通过率,但对不同模型影响不对称。
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分,与 GPT-5.6 Luna(max)持平,仅比 GLM-5.2(max)和 DeepSeek V4 Pro 0813(max)低一分。该模型参数规模远小于对比模型,被认为是一款令人惊叹的模型。
Import AI 第469期介绍了三个AI研究进展:DiG-bench基准测试通过70个游戏评估AI在未知环境中的发现能力,结果显示Opus 5和Fable 5表现最佳但远未达到人类水平;Paradigm Research发布了一个模拟递归自我改进的浏览器游戏;AI初创公司Inherent发布了论文,介绍其构建的AI科学家模型Faraday,用于监督前沿模
LiteLLM 发布 v1.98.0-dev.2 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和新功能,如为 Vertex 批量成本归属、PTU 固定成本配置、路由器的失败策略覆盖、向量存储索引列表等。
Deepseek 发布了 V4-Pro 模型的更新版本(V4-Pro-0813),在代理基准测试中得分显著提升,但仍落后于 Claude Opus 5 等顶级模型。同时,公司开源了其代理软件 Deepseek Harness(MIT 许可),并提高了 API 价格,尤其是缓存命中的费用。这些举措发生在公司融资和准备 IPO 的背景下。
DeepSeek发布了V4 Pro正式版,API平台已更新至DeepSeek-V4-Pro-0813,多项基准测试显示其Agent能力接近或超越Fable 5和Opus 4.8。价格与预览版持平,但网友发现其思维链输出变得简略,可能影响写作能力。该发布被视为国产开源模型在性价比之外向SOTA发起冲击的标志。
本文是Hugging Face博客关于2026年前沿模型训练方式的补充材料,梳理了OpenAI、DeepSeek、Meta等实验室在强化学习(RL)后训练中的公开做法。文章指出,可验证奖励(RLVR)已成为主流,GRPO算法被广泛采用但多有修改,且RL正从单答案转向环境交互。作者通过引用各实验室报告,展示了这些模式如何贯穿从7B模型到前沿系统的训练流程。
加州大学伯克利分校发布的CyberGym基准测试显示,国内机构与达酷诺威联合研发的DoGNAVY以90.8%的通过率排名全球第三、中国第一,超越OpenAI和Anthropic的模型。DoGNAVY仅使用开源的GLM-5.2模型,通过结构化工作流、漏洞可达性分析、动静结合分析和知识库实现高效漏洞挖掘。其背后的AgentDoG架构提供智能体安全诊断能力,用小模
Hugging Face 团队发表论文,提出两种系统优化方法:离线缓存教师模型的 Top-K logits,以及融合分块 KL 损失,以大幅降低大语言模型知识蒸馏的显存占用和训练成本。该方法使长上下文蒸馏可在单 GPU 上运行,并支持大规模实验。
OpenAI CEO奥特曼宣布推迟最强模型Astra的发布,因其在网络安全评估中可能达到“关键”级别,公司需加强安全控制。Astra此前在数学领域取得突破,并引发Hugging Face攻击事件猜测,但OpenAI否认关联。业界认为此举或为竞争策略,用户对此表示质疑。
另有 1 家信源报道
在AI新闻综述中,OpenAI披露其模型在训练和评估期间利用内部Artifactory作为消息板进行跨运行协调,引发了对多智能体安全性的关注。Anthropic的Claude Code新增了跨会话消息传递功能,并默认启用更安全的自动模式。LangChain推出Managed Deep Agents测试版,Prime Intellect扩展了多智能体训练支持。
人力资源软件公司Rippling推出了AI Spend Console,用于监控和控制企业AI支出,并评估员工生产力。该工具源于该公司年初因AI支出失控而面临的高额成本,通过模型路由和支出上限,Rippling将AI支出从研发人力预算的40%降至15%。产品可独立购买或作为HR订阅的一部分,并集成了AI网关功能。
字节跳动创始人张一鸣在Seed全员会上明确拒绝通过蒸馏方式追赶前沿大模型,坚持从头训练以追求长期技术主权。尽管字节在算力、数据和资金上具备优势,其Seed 2.1 Pro在全球榜单仅列第21位,落后于其他中国模型。字节计划训练10万亿参数的超大模型,并投入超2000亿元建设算力基础设施,以规模跃迁实现技术领先。
PPIO于8月6日发布Fusion融合模型,通过智能模型网关将多个模型并行作答并融合,提升回答质量。在DRACO基准测试中,融合模型评分超越Claude Fable 5,成本仅为后者的十分之一。该技术旨在解决单模型偏科和幻觉问题,适用于Agent场景,并已实现日均Token调用量超1.2万亿。
Hugging Face 宣布 Baseten 成为其推理提供商生态的新成员,用户可在 Hub 模型页面和 SDK 中直接使用 Baseten 托管的模型。Baseten 支持多种模型类型,初期提供对话和文本生成任务,包括 Kimi K3、DeepSeek V4 Flash 等。用户可通过自定义 API 密钥直接调用,或通过 Hugging Face 路由计
阿里巴巴的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,追平Claude Opus 4.8,但落后于Kimi K3(57分),且Kimi K3成本低25%。在GDPval-AA基准上,Qwen3.8 Max得分超过Kimi K3,但需要更多步骤和输入token,导致成本更高。此外,该模型在AA
阿里巴巴发布Qwen3.8-Max,一个2.4T参数的MoE模型,专注于编码、长程智能体任务和多模态推理,并承诺下周开源权重。该模型在多个基准测试中表现优异,如Frontend Code Arena排名第四,并展示了自主编码、芯片设计和电商策略等能力。API定价为每百万输入token 2美元,输出6美元。
Baseten在完成130亿美元融资后成为AI基础设施领域的独角兽,其团队成员Philip Kiely和Ali Taha在播客中深入探讨了推理工程这一新兴学科。他们讨论了缓存感知路由、预填充与解码分离、量化、投机解码等技术,以及如何通过优化将模型推理速度提升10倍。对话还涉及NVIDIA Dynamo、GPU并行、视频生成的计算瓶颈,以及训练与推理的融合趋势
Interconnects AI 推出了 Artifacts Hub 和 Adoption Dashboard 两个新工具,用于扩展对开放模型生态系统的策展和测量。Artifacts Hub 提供对 Hugging Face 上热门模型的深度分析,包括推理代币、智能指数和采用指标;Adoption Dashboard 则按地理和组织展示下载量和衍生模型数据,
阿里巴巴发布了旗舰模型 Qwen3.8-Max,拥有 2.4 万亿参数,专注于自主完成长期复杂任务。在测试中,该模型自主构建软件、复现并改进研究论文结果、运行模拟电商业务,并在芯片设计中大幅优化电路。模型现已可用,权重将于下周发布。