用并发扫描为 SageMaker AI 生成式端点做容量规划
AWS 博客介绍在 Amazon SageMaker AI 上通过并发扫描(concurrency sweep)为生成式 AI 端点做容量规划的方法。文章以部署 NVIDIA Nemotron-3 Nano 30B(MoE,仅 3B 激活参数)到 ml.g7e.2xlarge 为例,使用原生 vLLM 容器和 CreateAIBenchmarkJob API
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
AWS 博客介绍在 Amazon SageMaker AI 上通过并发扫描(concurrency sweep)为生成式 AI 端点做容量规划的方法。文章以部署 NVIDIA Nemotron-3 Nano 30B(MoE,仅 3B 激活参数)到 ml.g7e.2xlarge 为例,使用原生 vLLM 容器和 CreateAIBenchmarkJob API
llama.cpp 发布 b11104 版本,主要更新为 llama-server 新增绑定多个地址的能力(PR #28690),并处理了地址重叠、多 TCP 地址下拒绝 --port 0 等边界情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vu
Synthyra 在 Hugging Face 上发布了 ESM2-35M 模型,将 facebook/esm2 t12 35M UR50D 检查点与 FastPLMs 运行时打包,用于蛋白质语言建模。该模型支持序列与残基分类、数据集嵌入、PEFT/LoRA 微调以及测试时训练(TTT),并可通过 trust remote code 在 Transforme
llama.cpp 发布 b11103 版本,为 HunyuanOCR 目标模型增加 DFlash 投机解码支持,在 Hunyuan 图构建中注册层输入张量,修复了此前因张量为空导致的断言中止问题。同时修复了针对 HunYuan 目标转换 DFlash 草稿模型时的词表处理错误,包括缺失的 fix special tokens 方法和配置读取错误。测试显示图
旧金山初创公司 The Biological Computing Co.(TBC)宣布与 AWS 合作,推出号称首个「神经元衍生」的文本到视频模型,声称比基础开源模型快 5 倍、推理成本低 80%。其做法并非用生物神经元计算,而是先在 4096 电极芯片上培养皮层神经细胞、测量信号扩散与衰减规律,再将其转化为不到基础模型 0.1% 大小的软件适配器,插入现有
NVIDIA 发布 DLSS 5,引入 3D-Guided Neural Rendering,以游戏引擎渲染帧为基础,在保留场景结构与艺术意图的前提下增强光照与材质细节,并已在 NBA 2K27 中上线。同时更新 NVIDIA ACE,推出 Nemotron Speech 3.5 Streaming 与 Qwen3 TTS 等模型,并升级 NVIGI SDK
llama.cpp 发布 b11101 版本,主要变更是允许对 llama 进行重复的 find package 调用(#29228)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
NVIDIA 在 ROS 2 Lyrical 中贡献了 CUDA buffer 后端,配合上游 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时,可通过零拷贝传输交换 GPU 常驻数据,否则自动回退到 CPU 路径。NVIDIA Isaac ROS 5.0 的所有节点
智能经济30人论坛AGI测评中心发布2026年9月12日至18日《AGI市场观察》,基于OpenRouter词元消耗、厂商官方价格及Arena基准测评追踪国产大模型。报告显示,DeepSeek V4 Flash、V4.1 Flash、腾讯Hy4 preview、智谱AI GLM 5.3 Flash四款轻量级模型周用量均破10万亿tokens,四强合计约占中国
阿里 PAI 团队在 Hugging Face 发布 MiniMax-H3-Fun-Controlnet-Union,这是一个基于 VideoX-Fun 流程训练的 ControlNet-Union 模型,可为 MiniMax-H3 视频生成器提供 Canny、Depth、HED、MLSD、Pose 五种控制条件以及视频修复能力。该模型仅包含约 6.8GB
在2026杭州云栖大会上,阿里云CTO李飞飞系统阐述了Agentic Cloud战略,将Model、Harness、Context作为核心构建场景,并发布企业级Agent构建治理平台AgentCore、Agent Sandbox、新一代高性能存储CPFS等新品。阿里云重构了从AI Native Cloud、Agent Native Cloud到Context
llama.cpp 发布 b11100 版本,主要修复了 chat 模块中 Muse Glimmer 工具调用(tool-call)首次解析错误的问题,并新增测试验证、精简匹配模式。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYC
llama.cpp 发布 b11099 版本,主要变更是在 release 工作流中同时构建 Snapdragon 目标,使 Hexagon NPU 二进制文件首次随正式发布页提供。此前 Snapdragon CI 构建仅用于 QDC 设备测试,NPU 二进制从未进入发布页。该版本同时提供 macOS、Linux、Android、Windows 等多平台预编
香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队提出 COBRA-Skills,将 Agent 技能优化建模为带预算控制的情境多臂老虎机问题,用轻量 MLP 预测收益加 LinearUCB 量化探索来筛选候选技能,再由进化算子按对数调度生成与精炼技能。该方法仅用 50 个优化样本,在 6 个跨领域 Benchmark 上全面超越
全国工商联9月22日发布2026中国民营企业500强榜单及调研分析报告,京东、阿里、恒力、华为、比亚迪、腾讯位列前六,入围门槛255.99亿元。研发投入方面华为、腾讯排名前二,500强研发费用总额1.26万亿元,腾讯2025年研发投入857.5亿元、资本开支792亿元均创新高,并持续加码AI基础设施以支持混元模型升级及WorkBuddy、CodeBuddy推
美团技术团队提出统一推荐基座大模型 MTFM,在外卖多个主要业务场景实现统一精排模型,通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计解决规模可扩展性、场景可延展性与架构高效性挑战。该模型在外卖多业务中实现订单量提升 2.06% 6.68%,推理成本降低 24%,相关工作已被 KDD 2026 收录。
llama.cpp 发布 b11097 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 非 MoE 的 dp4a 二值化内核(PR #29055)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO
vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K
该论文提出 RBS-Attention,一种免训练的稀疏预填充方法,用于缓解长上下文 LLM 推理中密集自注意力预填充的开销。作者指出块质心评分会因「均值稀释」而漏掉块内高度相关的 token,因此设计双分支选择:质心基分支捕捉平均相关性,救援分支利用最大键块半径及其随提示、层、头变化的分布来识别可能被低估的块。在 H100 上,该方法在 Qwen3-30B
该论文提出一种面向任务的多智能体框架,用于处理复杂的可穿戴健康查询。框架通过意图-任务层级将复合查询拆解为不同意图和带显式依赖的类型化任务,由专门智能体分别执行检索、分析和建议任务,并保持各意图状态隔离。在含一个月纵向可穿戴记录的合成数据集上,Query Agent 在检索问题上准确率优于直接调用 LLM 的基线,并将查询阶段平均 token 消耗从较高值降