注意力感知路由:在 MoE 中耦合路由与注意力
该论文提出 Attention-Aware Routing (AAR),在 MoE 语言模型中用滑动窗口的注意力权重为路由器补充上下文信息,同时冻结基础 Transformer 只训练路由参数。在 OLMoE 上,AAR 相比仅路由 SFT 基线提升了 GSM8K 数学推理表现,并揭示路由与注意力构成耦合回路:路由变化经残差流放大注意力汇。研究还发现 AAR
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文提出 Attention-Aware Routing (AAR),在 MoE 语言模型中用滑动窗口的注意力权重为路由器补充上下文信息,同时冻结基础 Transformer 只训练路由参数。在 OLMoE 上,AAR 相比仅路由 SFT 基线提升了 GSM8K 数学推理表现,并揭示路由与注意力构成耦合回路:路由变化经残差流放大注意力汇。研究还发现 AAR
该研究指出,分布式推理中通信增益的聚合描述存在两个局限:一是具有相同特征值和奇异值谱的稳定线性系统可能产生符号相反的增益,仅改变消息方向即可使准确率在65.9%到91.2%之间变化;二是社区共享偏差下,更高的平均个体准确率可能同时损害未受影响社区或降低全局投票准确率。作者提出保留任务投影的局部响应近似方法,在合成任务上以0.45个百分点的均方根误差预测多轮增
该论文提出 PRQuant,一种无需训练、低开销的 W4A4 量化框架,结合通道重排与静态权重侧残差补偿。方法先用 AWQ 风格缩放识别对权重量化误差贡献最大的输入通道,将其置换到连续尾部块并离线构建残差子张量,使推理时残差补偿转化为规则的尾部增强 GEMM,避免在线收集开销。实验显示 PRQuant 在五个下游基准上平均准确率超过默认 MXFP4 及所评估
该论文提出 Guided SID 方法,通过确定性监督索引分配,强制 RQ-VAE 的粗粒度语义 ID 层级编码预定义的、文本可接地且任务相关的类别属性,同时保持码本可学习。在 6.54 亿至 7.41 亿标识符的生产目录上,引导式检索器在各列表长度上均提升 recall@,MRR 从基线提升至更高值,并更常预测预定义属性。对照实验表明增益来自重构后的粗粒度
论文提出一种零推理成本的"前瞻性记忆检索"机制:将用户的承诺以带日期或触发条件的条目存入显式账本,当条目触发时,与之关联的记忆项获得显著性加成,并以乘法方式融入基于嵌入的检索,从而在查询时不运行任何模型。在仿照 TriggerBench 结构构建的合成任务集(48 段盲写对话、175 个任务)上,该机制将困难层的 recall@5 从 0.000 提升至默认
在2026杭州云栖大会上,阿里巴巴集团CEO吴泳铭宣布阿里将坚定投入AI模型、AI芯片和AI云三大基础设施建设,作为长期战略选择。他提出机器思考总量未来将达到人类的1000倍以上,并披露Qwen团队正探索递归式自我改进(RSI),计划训练5-10T参数规模新模型。芯片方面,平头哥发布国产AI芯片真武V900,算力为真武M890的3倍,单集群可扩展至50万卡;
智锐通发布 EMA-7132 Mini-ITX 主板,采用 170×170mm 标准尺寸并板载双 PCIe 插槽,使图像采集卡与 AI 推理显卡可同板并行工作。该主板搭载 Intel Alder/Raptor Lake-H i5/i7/i9 处理器,支持 DDR5 内存,可在设备端完成数据分析,并支持三路独立显示与四路 2.5GbE 网口。产品面向内窥镜手术
在AICC 2026上,IDC发布《2026年中国人工智能计算力发展评估报告》,指出Agent时代算力需求正从脉冲式调用转向持续负载,全球Token消耗量到2030年复合增长率达4822.6%,算力缺口绝对值将达3809亿美元。浪潮信息首席AI战略官刘军将算力问题拆分为Capability(能力型智算)与Capacity(容量型智算)两个方向,并发布超节点A
另有 1 家信源报道
llama.cpp 发布 b11095 版本,主要新增针对高通 Hexagon 平台的 HMX 优化版 GATED DELTA NET(GDN)内核。该 PR 逐步实现了 HMX 支持、流水线化 HMX 与 DMA、HVX 多线程、向量化 expf 及尾部处理优化,并改进了 flash attention 内联 softmax 与 DMA 流水线,使 tok
llama.cpp 发布 b11094 版本,主要变更是将内置的 cpp-httplib 依赖更新至 0.57.1(由 Adrien Gallouët 提交,PR #29239)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、
llama.cpp 发布 b11093 版本,主要修复了 Metal 后端 flash attention 块预处理阶段的 mask 边界问题(PR #29220)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVI
llama.cpp 发布 b11090 版本,主要修复了 CUDA 后端在 sm 70(Volta 架构)上的 tile 编译错误。此前提交 1884824fd 引入的五参数 load ldmatrix 仅定义了 tile ,导致 Volta 的 tile 无法匹配;本次将 tile 形状泛化为 ,使非 swizzle 分支可转发到三参数加载器。该修复由 D
Hugging Face 用户 avar6 发布了基于 zai-org/GLM-5.3-Flash 的实验性 GGUF 量化模型,支持视觉功能,需配合 timkronos 的 llama.cpp 分支使用。量化从 bf16 safetensors 生成,提供 IQ2 XXS 至 Q3 XL 等多种精度方案,并持续更新 mmproj 与混合精度量化。作者表示
TypeSafe AI 发布 Jev,一种被称为「System One 模型」或「决策模型」的新型 LLM:输入文本,输出浮点数形式的分类、是/否判断、评分及置信度,而非文本。Jev 仅按输入 token 计费(每百万 token 0.042 美元),输出免费,速度极快,适合垃圾邮件检测、标签推荐、排序与搜索重排等分类任务。作者指出其黑盒性质带来偏见隐患,并
NVIDIA 发布 TensorRT 多设备推理能力,使单个 TensorRT 网络可借助 NCCL 分布式集合通信跨多 GPU 执行,并从 TensorRT 11.0 起全面支持。Dynamo-Triton 26.07 版本的 TensorRT 后端启用该能力,一个 KIND MODEL 实例可拥有多块 GPU 并统一暴露单个 gRPC 模型端点。文章以
llama.cpp 发布 b11081 版本,主要更新了测试工具 test-llama-archs,使其张量数据标准差(stdev)可配置,并改进了帮助信息、用法示例和未知参数报错。同时调整了 test-recurrent-state-rollback 使用 NMSE 检查 logits 回滚,并禁用了部分无效测试。该版本继续提供覆盖 macOS、Linux
llama.cpp 发布 b11080 版本,主要更新是让 tests/test-backend-ops 的 -o 过滤器支持正则表达式条目,普通算子名仍保持精确匹配(如 -o ADD 不会匹配 ADD EX)。同时修复了不必要的 FA vec slice 日志输出,并重排了帮助文本格式。该版本同步提供 macOS、Linux、Windows、Android
llama.cpp 发布 b11078 版本,新增通过 LLAMA ARG 环境变量配置 temperature、top-p、min-p 及各类惩罚参数的能力,使 llama-server 可完全通过环境文件(如 Debian 上的 systemd)控制。同时使用 llama-gen-docs 重新生成 readme 文件,并提供了覆盖 macOS、Linu
llama.cpp 发布 b11077 版本,修复了 router 模式下的 API 密钥认证问题。此前 unset reserved args() 未清除 LLAMA ARG API KEY FILE,导致通过 --api-key-file 传入的密钥被转发给 router 派生的子实例,使使用 --api-key 的客户端在 chat completio
Langfuse 发布 v4.41.0 版本,新增用 Rust 编码 v4 原生块与事件字节的能力,并支持自动化按标签过滤 prompt 事件。同时修复了告警链接、仪表盘嵌套滚动、追踪图递归栈溢出、IME 输入重复等多项问题,并进行了大量 Web 端重构与依赖升级。