NVIDIA 发布 NVLink Fusion 与 NVHBM,提升定制 AI 基础设施性能
NVIDIA 发布了 NVLink Fusion 和 NVHBM 技术,旨在帮助超大规模企业和 AI 原生公司将其定制 XPU 和 CPU 集成到 NVIDIA AI 基础设施中。NVHBM 是定制 HBM 基底芯片技术,相比标准 HBM4e 可提供高达 30% 的带宽提升、25% 的计算芯片面积增加和 15% 的功耗降低。该技术通过减少内存接口面积和优化功
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
NVIDIA 发布了 NVLink Fusion 和 NVHBM 技术,旨在帮助超大规模企业和 AI 原生公司将其定制 XPU 和 CPU 集成到 NVIDIA AI 基础设施中。NVHBM 是定制 HBM 基底芯片技术,相比标准 HBM4e 可提供高达 30% 的带宽提升、25% 的计算芯片面积增加和 15% 的功耗降低。该技术通过减少内存接口面积和优化功
AWS 发布了 Amazon Bedrock AgentCore Evaluations,该服务通过 OpenTelemetry 标准解耦了代理评估与具体框架,支持 LangGraph、LlamaIndex、OpenAI Agents SDK 等多种框架。它自动读取调用代理、推理和工具执行三类 span,并利用 LLM-as-a-judge 进行统一评分,无
Ollama 发布了 v0.33.1 版本,主要更新包括对 MLX 后端 Qwen3.8 Flash Next 的支持,以及 llama.cpp 的更新。此外,mlxrunner 新增了结构化输出支持,并优化了从慢速存储加载模型时的 Metal GPU 超时问题。该版本还修复了 cmake 外部兼容补丁的幂等性问题。
阿里巴巴发布了Qwen3.8-Flash-Next模型权重,作为Qwen4架构的预览,供开发者实验和评估。该模型是一个多模态MoE模型,主模型125B参数,附加51B N-gram嵌入,每token激活6B参数,原生上下文窗口262,144 token,可通过YaRN扩展到1M。NVIDIA提供了Day 0功能支持,包括SGLang、vLLM和TensorR
Mastra 发布 2026 年 8 月 26 日更新,新增 Elasticsearch 和 Valkey 存储后端,以及 E2B Desktop 计算机使用沙箱提供商。沙箱现在支持运行时环境控制和更安全的关闭行为,同时改进了可观测性、评分和流式会话体验。此版本包含多项破坏性变更,如 LSP 默认关闭和部分 API 调整。
Langfuse 发布了 v3.225.5 版本,主要包含四个修复:处理 ClickHouse JSON 中的畸形 Unicode 转义、强制 OTLP 摄取请求体大小限制、要求自动化调度 URL 变更时使用新鲜令牌,以及要求审计日志批量导出下载需要审计日志访问权限。这些修复均为 v3 分支对主分支问题的回移。
vLLM 发布 v0.28.0 版本,包含 584 个提交,重点优化了 Kimi-K3 和 DeepSeek V4 的性能,支持稀疏 MLA、DCP、FlashKDA 等特性,并改进了推测解码和模型运行器。该版本还引入了新的默认配置、破坏性变更,并扩展了模型支持,如 Muse Glimmer、Ling 3.0 Flash 等。
Twilio 在 PB 级数据湖管道中,针对 Apache Hudi 的 Kafka 数据摄入,提出了一种基于时间在队列中等待的延迟度量方法,以替代传统的 offset lag。该方法通过读取 Hudi 提交文件中的 checkpoint,计算最新未消费消息的时间戳与当前时间的差值,从而准确反映数据新鲜度,并支持自定义 SLA 告警。该方案无需修改现有管道,
OpenCompass 发布 v0.5.4 版本,集成了 VLMEvalKit 以支持多模态评估,并新增多轮推理能力及 Multi-IF 基准。该版本扩展了模型 API 生态,支持 LiteLLM 网关和 TurboMind 的 PPL 评估,并新增了金融、长上下文、对齐、信息抽取和代码推理等多个基准测试。此外,修复了多项评估正确性和生成行为问题,并提升了安
LiteLLM 发布了 v1.100.0-dev.1 版本,该版本的所有 Docker 镜像均使用 cosign 进行签名,并提供了通过提交哈希或发布标签验证签名的方法。此版本包含多项修复和功能改进,包括修复 responses 桥接、新增 New Relic 按团队追踪、改进 Azure AI Foundry 的认证支持,以及多项 UI 和 CI 优化。
OpenAI自研推理芯片「小辣椒」在SemiAnalysis的实测中,以700W功耗实现每瓦吞吐最高1.9倍于英伟达Blackwell,推理时延低3.6倍,在多个开源模型上击败英伟达、AMD和谷歌芯片。该芯片由博通合作设计,采用台积电N3P工艺和HBM4内存,计划2027年量产。尽管性能领先,OpenAI仍表示不会弃用英伟达,英伟达股价反而上涨2.19%。此
NVIDIA Dynamo 推出影子引擎恢复预览功能,通过 GPU 内存服务(GMS)在活动引擎旁保持一个完全初始化的空闲引擎,并共享权重,避免冷重启。在 GLM-5.2 双工作节点部署中,故障恢复时间从 283 秒降至 7.3 秒,提速约 39 倍。该功能解决了权重与进程绑定及初始化状态不可转移的问题,支持 vLLM、SGLang 和 TensorRT-L
AWS 发布了 Amazon OpenSearch Service MCP Apps,该功能扩展了 Model Context Protocol,使 AI 代理的工具调用能返回交互式可视化结果(如追踪瀑布图、服务拓扑图),直接在 IDE 聊天窗口中渲染。这解决了可观测性代理验证环节需要切换浏览器、手动核对的问题,让工程师在对话线程内完成验证。MCP Apps
OpenAI在Hot Chips大会上展示了其首款自研推理芯片“Jalapeño”的基准测试结果,声称其在每瓦吞吐量和token延迟上优于Nvidia的Blackwell和Rubin芯片。该芯片由OpenAI与博通合作开发,历时约16个月,其中设计周期仅9个月,并使用了OpenAI自身的模型辅助设计。SemiAnalysis的测试显示,Jalapeño在性能
英伟达宣布面向Vera Rubin平台的Groq 3 LPX交互式推理机架全面投产,这是其收购Groq技术后首款商业化落地的机架级专用推理系统,专为AI Agent场景设计。第三方机构Artificial Analysis测试显示,在10万tokens长上下文下该产品输出速度达3431tokens/s,是当前公开同类方案的近4倍,且无精度损失。该产品与Ver
IBM 发布 Granite Speech 5.0 Turbo CTC 系列,包含两个 470M 参数的英语语音识别模型,在 NVIDIA H200 GPU 上实现超过 12,600 RTFx 的吞吐量,可每秒转录超过 3.5 小时的语音。模型采用编码器-only 设计,相比前代速度提升 20 倍以上,适合边缘设备使用。非商业版本(CC-BY-NC-SA-4
OpenAI在Hot Chips会议上公布了其定制推理芯片Jalapeño的详细信息和首批基准测试结果。在Semianalysis的InferenceX基准测试中,Jalapeño在每用户token数和每千瓦吞吐量上均优于当前最先进的Nvidia Blackwell系统。该芯片由OpenAI与博通合作开发,旨在减少推理过程中的预填充和通信延迟,计划于2026
另有 1 家信源报道
OpenAI 发布新款 AI 芯片 Jalapeño,宣称其推理性能优于 Nvidia 的 GB200/GB300 超级芯片,能效提升 1.5 至 1.9 倍,端到端延迟降低 1.7 至 3.6 倍。该芯片由 OpenAI 与 Broadcom 合作设计,专为 AI 推理优化,计划于今年年底小规模部署,2027 年扩大规模。OpenAI 表示不会完全替代现有
另有 2 家信源报道
英伟达宣布其推理加速器Groq 3 LPX进入全面生产,该芯片针对AI代理的快速token生成进行了优化。在Artificial Analysis的基准测试中,该系统达到每秒3400个token,英伟达称其速度是竞争对手Cerebras的四倍。然而,专家指出该对比对英伟达有利,因为其架构需要至少64个芯片才能达到该结果,而Cerebras仅需一到两个加速器。
Dify 发布 v1.17.0 版本,新增多项功能:Agent 支持 E2B 云沙箱、构建时快照和工作区级技能管理;工作流中可复用 LLM 环境变量;循环和迭代节点支持人工输入;提供统一追踪、Cloudflare Turnstile 验证码、Azure Key Vault KMS、TiDB 混合搜索等。此外,改进了无障碍性、工作流稳定性和内部测试质量。