VidParse:在线解析自我中心程序,无需训练
VidParse 是一个无需训练的在线自我中心程序解析框架,利用冻结的 DINOv2 和手-物检测器构建操作锚定特征,通过时间相似性矩阵和棋盘核检测动作边界,并使用图约束波束搜索强制执行程序性任务图。在 GTEA 和 EgoPER 基准上,该方法在复杂多步解析准确率上比强在线基线提升高达 10 倍,且无需梯度更新。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
VidParse 是一个无需训练的在线自我中心程序解析框架,利用冻结的 DINOv2 和手-物检测器构建操作锚定特征,通过时间相似性矩阵和棋盘核检测动作边界,并使用图约束波束搜索强制执行程序性任务图。在 GTEA 和 EgoPER 基准上,该方法在复杂多步解析准确率上比强在线基线提升高达 10 倍,且无需梯度更新。
DAMP是一种针对Gated DeltaNet和Kimi Delta Attention等混合架构语言模型的新型量化方法,首次研究其循环状态的后训练量化。该方法通过结合量化误差能量和衰减持久性识别高风险通道,以混合精度存储,在9.9比特每状态值下保持接近FP32基线的精度,同时减少69.1%的存储并加速解码。
该研究提出将大语言模型解码中的输出投影和top-k token选择重构为最大内积搜索(MIPS)问题,并使用基于HNSW的向量索引替代密集词汇投影,仅检索少量高得分token。在Gemma 3、Llama 3.2和Qwen 3模型上,该方法在CPU推理和批大小为1时,端到端吞吐量最高提升82%,同时保持生成质量。该方案无需重新训练,可无缝集成到现有模型中,适
该论文提出量化触发后门攻击,利用后训练量化作为触发器,使模型在源精度验证时表现良性,但在INT8或4位压缩后激活恶意行为。研究将攻击扩展到多语言编码器-解码器seq2seq模型,并发现攻击持久性取决于量化器几何和模型架构而非标称位宽。结果表明源精度审计不足以认证部署行为,最终部署配置必须纳入行为认证。
本文提出了一种名为FAID的细粒度自适应隐式仇恨言论检测框架,将隐式仇恨言论分为浅层、定向和上下文依赖三类,并针对不同类别采用轻量级提示调优、知识增强和智能体推理等不同策略。实验表明,FAID在四个基准数据集上显著优于现有最先进方法,同时减少了计算冗余。
本文提出了一种名为“概率事件”的计算原语,用于实时处理量子图像传感器(如SPAD)产生的光子流。该方法通过递归贝叶斯推断跟踪强度变化后的时间,生成运动自适应场景通量、高保真活动图和熵感知不确定性三种低延迟信号,避免了传统事件相机的固定阈值触发。在0.05勒克斯的极低光照下,该方法无需重新训练视觉模型即可实现人体姿态估计,处理速度超过每秒50,000帧量子帧,
llama.cpp 发布 b10709 版本,主要修复了 RPC 后端中跨服务器张量序列化的问题,避免序列化来自其他服务器的缓冲区,并新增了双服务器回归测试。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10708 版本,主要修复了 ggml backend buft get alloc size() 的防护问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
llama.cpp 发布 b10707 版本,优化了 kv-cells 的序列扫描逻辑,在保持行为不变的前提下提前终止扫描。该优化显著提升了长上下文下的生成速度,例如在 RTX PRO 6000 上 55k 上下文从 56.3 t/s 提升至 74.3 t/s,132k 上下文从 33.6 t/s 提升至 50.9 t/s。
llama.cpp 发布 b10706 版本,新增 SWIGLU CLAMP 操作,并为其添加了 Vulkan 着色器支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。
Inco AI 发布了 DFlash 2 草稿模型,用于 GLM-5.3-Flash 的投机解码。该模型采用块扩散技术,单次预测整个 token 块,并通过轻量选择器保持解码无损。用户可通过 SGLang 集成使用,模型以 CC BY-NC-ND 4.0 许可发布,仅限研究用途。
llama.cpp 发布 b10705 版本,主要改进了 TENSOR READ LAZY 处理逻辑,在启用 lazy 模式时强制 CPU 上的张量使用 lazy 加载。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
llama.cpp 发布 b10704 版本,优化了 CUDA 下 MoE 模型的 mm ids helper 路径,使 n expert used 为 10 时也能使用快速路径,在 Qwen3.8-Flash-Next 模型上 prompt 处理速度从 2334 t/s 提升至 2600 t/s。该版本同时提供了多平台二进制文件。
llama.cpp 发布 b10703 版本,主要更新为针对 RDNA 3 架构调整了矩阵乘法(MMQ)配置,以优化 AMD GPU 上的推理性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
llama.cpp 发布 b10702 版本,主要针对 HIP 后端优化了 Q2 0 量化格式的点积路径,特别为 gfx1201 架构使用原生 amdgcn perm 指令提升性能。该版本提供了多平台预编译二进制,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 CUDA、Vulkan、ROCm 等。
llama.cpp 发布 b10701 版本,修复了 DFlash2 NVFP4 草稿模型在投机解码中因未传递 Q、K、V 和输出投影的缩放因子而导致接受 token 极少的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种硬件加速后端。
llama.cpp 发布 b10700 版本,将命令行参数 --tensor-read-lazy 重命名为 --lazy-mode,并新增 -lzm 简写。该版本同步更新了 README 文档,并提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10699 版本,新增 ggml backend op alloc size may expand 函数,用于处理 Metal、SYCL、WebGPU 等后端在特定算子上的额外内存需求,并优化了 RPC 后端的内存分配查询逻辑。该版本提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。
高通工程技术高级副总裁侯纪磊在圣迭戈总部与媒体交流,介绍了高通在2bit量化感知训练(QAT)方案上的进展,已与部分中国厂商合作。他还详解了高带宽计算(HBC)技术,相比HBM具有性价比优势,有效内存带宽提升显著。高通正推动端云协同的智能体体验,并与模型厂商深度适配形成参考方案。
Mistral 于 11 月 18 日发布了 Mistral Large 2.1 和 Pixtral Large 模型,后者为多模态模型,支持文档和图像理解。同时,Le Chat 平台新增了带引用的网络搜索、画布功能、图像生成(由 Black Forest Labs 的 Flux Pro 驱动)以及更快的响应速度。