2026全球AI芯片峰会上海落幕:智能体时代CPU回归与3D存算成焦点
2026全球AI芯片峰会在上海落幕,由智东西发起、智猩猩主办,超过60位嘉宾围绕架构创新、3D堆叠、存算一体、HBF新型存储、智能体推理等议题展开分享。英特尔高宇提出智能体时代CPU重回C位,并预告将展示单机柜承载5万Agent的高密度CPU机柜;后摩智能、奎芯科技、东方算芯、亿铸科技等企业分别披露3D CIM、定制内存、软件定义芯片、通用存算一体等进展。大
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
2026全球AI芯片峰会在上海落幕,由智东西发起、智猩猩主办,超过60位嘉宾围绕架构创新、3D堆叠、存算一体、HBF新型存储、智能体推理等议题展开分享。英特尔高宇提出智能体时代CPU重回C位,并预告将展示单机柜承载5万Agent的高密度CPU机柜;后摩智能、奎芯科技、东方算芯、亿铸科技等企业分别披露3D CIM、定制内存、软件定义芯片、通用存算一体等进展。大
llama.cpp 发布 b11076 版本,主要变更为移除测试中的过时注释(#29140)。该版本同步提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11075 版本,主要改动是简化 ggml-metal 后端中融合算子(fusion pattern)操作列表的声明方式,从 ops all 派生非空融合算子并去掉模式向量中的 all 后缀。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROC
AWS 博客介绍 Positron(Posit 面向数据科学的 IDE)现可在 Amazon SageMaker AI 上运行。数据科学家可在 SageMaker Studio Space 中直接使用 Positron,通过 Space 执行角色访问 Athena、Glue Data Catalog 和 S3,无需管理凭证,并可用 Amazon Bedroc
Hugging Face 上发布了一个名为 DogContext/GLM-5.3-Flash-Uncensored-Q2-ds4 的模型,它是 GLM-5.3-Flash 的去审查(abliterated)版本,经 imatrix 校准量化为约 2-bit GGUF,可在单台 128GB Apple Silicon Mac 上常驻运行。该模型保留原生 MTP
EXL 在 AWS 上推出 Medical IDP 解决方案,结合 Xtrakto.AI 文档处理与基于保险医疗数据微调的 EXL Insurance LLM,将医疗记录审核从每案 100 多分钟的人工流程转为自动化管道。方案使用 SageMaker AI 做训练与推理、Bedrock 调用通用基础模型,并通过 IAM 控制受保护健康信息访问,面向理赔与核保
llama.cpp 发布 b11074 版本,主要修复了 JSON 枚举(enum)处理问题,为枚举值添加了 common json value 处理逻辑,并曾添加 tests/test-json.cpp 测试但按要求移除。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端(CUDA、Vulkan、ROCm、SYC
llama.cpp 发布 b11073 版本,主要变更是 SYCL 后端对 MKL-FA softmax 加载进行合并(coalesce),替代原先每行一个 work-item 的实现方式,并改进了变量命名可读性。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包,覆盖 CUDA、Vulkan、ROCm、SYCL、Ope
NVIDIA 发布技术博客,介绍其 Earth-2 平台中的 AI 数据同化工具,可将专有或第三方观测数据融入天气预报流程。教程涵盖两种技术:用点观测约束扩散模型(适用于区域模型)以及将多源数据集同化为一致状态(适用于全球模型)。文中以 CorrDiff 为例,展示如何利用 Score-Based Data Assimilation 在不重新训练模型的情况下
Langfuse 发布 v4.40.0 版本,新增将 transcript spans 关联到源 trace 的 trace-batching 功能,并修复了删除 API key 记录后缓存未清除的认证问题。此外还包含若干 Web 页面重构、文档修正和 AGENTS.md 使用方式调整等杂项改动,并迎来一位新贡献者。
llama.cpp 发布 b11071 版本,主要变更是将 Ubuntu CUDA 发布构建的 CUDA 版本升级到 13.4(PR #29202)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b11069 版本,主要变更是针对 SM70(Volta)架构调整了 MMVQ 到 MMQ 的切换阈值(crossover),由 Yangyu Chen 提交并经 Johannes Gaessler 审阅。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan
llama.cpp 发布 b11068 版本,主要修复了 macOS 27 SDK 下 Metal 后端的弃用警告(PR #29136)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
该项目基于 OpenRouter 公开 API 构建了一个覆盖 425 个模型的排行榜,展示每百万 token 价格、服务商、精度、可用性、上下文长度、实测响应速度和韩语质量。作者对 330 个模型从敬语、韩国制度知识、格式遵循、术语等七个维度独立评分,发现约三分之一模型韩语评级为 F,且质量、性价比、速度领先者几乎从不重合。此外,作者用付费 API 对 3
该论文提出 Proxifield,一种去中心化的多智能体通信协议,通过智能体演化中的语义邻近度构建稀疏通信图,无需模型训练或集中式规划器,在推理时利用直接寻址、信息需求、计划对齐和信息互补四种路由信号连接智能体。在无人机搜救和 HiddenBench 集体推理两个领域,Proxifield 在最大规模模型(397B)下优于 Star 和 Shared Con
该论文提出 Elastic Threshold Attention(ETA),一种端到端可训练的稀疏注意力架构,用于缓解长上下文解码中的 KV 缓存内存带宽瓶颈。ETA 通过查询表示预测动态的逐头阈值,并在训练中以退火 sigmoid 门控乘性抑制低于阈值的 logits,而非直接删除,从而避免表示坍塌并消除初始 token 上的注意力汇。作者还实现了基于
该论文提出一种混合 GPU-CPU 协同服务系统,用于超大规模个性化搜索。系统通过 GPU 路径在约十亿文档的精选库存上融合检索与交互预排序,CPU 路径在约二十倍大的库存上进行轻量级个性化评分,两条路径可按请求独立运行并去重后共享下游排序。生产环境 A/B 测试显示,相比原有纯 CPU 配置,模型评分相关性和实质互动均有提升,验证了深度-广度分离架构的实用
该研究探讨了参数量低于30亿的小语言模型(SLM)能否通过熵信号判断自身不确定性。作者在7个模型对和5个NLU基准上评估了7种方法,发现91%的数据集-模型组合中token级熵几乎为零,无法作为置信信号;而语义熵(多次采样并按语义聚类)能恢复有效的不确定性信号。利用语义熵将不确定查询路由到更大的专家模型,准确率最高提升50个百分点,且跨家族路由(如SmolL
该论文提出 MAGIC,一种无需训练的事后压缩方法,用于提升视觉文档检索(VDR)效率。针对 ColPali 等多向量检索系统中 patch 级向量带来的存储与 MaxSim 计算开销,MAGIC 通过估计检索需求并构建双边际熵最优传输问题,在压缩时优先保留高使用率 patch 并均衡保留 facet 的使用。在 ViDoRe 基准上,MAGIC 在多种保留
该论文提出 Bio-MF,一种无需预训练、无潜变量的单步 MeanFlow 框架,用于在混合运动想象脑机接口中由 EEG 条件生成 fNIRS 信号。Bio-MF 直接预测干净 fNIRS 信号并转化为 MeanFlow 速度监督,单次网络评估即可完成推理,并整合时空交互 4D 编码、跨模态无分类器引导和噪声级门控 FFT 正则化。在 Dataset 1 上