潜在动力学推理实现视频世界模型的外推泛化
Latent Dynamics Reasoning (LDR) 将运动学动力学集成到结构化潜在空间中,使视频世界模型能够远超训练分布地外推物理规律,同时参数减少26倍、推理速度快143倍。在PhyWorld基准的五个任务上,LDR的分布内外误差差距比视频扩散基线小20倍以上,并能泛化到严重分布偏移场景。这是首个能外推学习动力学至训练分布之外的视频世界模型。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Latent Dynamics Reasoning (LDR) 将运动学动力学集成到结构化潜在空间中,使视频世界模型能够远超训练分布地外推物理规律,同时参数减少26倍、推理速度快143倍。在PhyWorld基准的五个任务上,LDR的分布内外误差差距比视频扩散基线小20倍以上,并能泛化到严重分布偏移场景。这是首个能外推学习动力学至训练分布之外的视频世界模型。
llama.cpp 发布 b10414 版本,为 Metal 后端新增 TQ2 0 类型支持,该类型为三元 2 比特每元素,并优化了 mul mv 内核。同时提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10413 版本,主要更新为自动检测草稿模型的 spec 类型。当使用 -md 加载本地草稿模型且未指定 --spec-type 时,系统会从 GGUF 元数据中读取架构信息,自动识别 draft-dspark 或 draft-dflash 类型,从而启用投机解码。该功能已移至 speculative 模块,并增加了日志输出。
llama.cpp 发布 b10412 版本,主要更新是启用了 dflash 和 dspark 的后端采样功能,并增加了 p min 0 的采样支持。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,但部分构建(如 KleidiAI、ROCm)被禁用。
llama.cpp 发布 b10411 版本,主要更新为在 ggml-cpu/ops 中向量化 flash-attention V-cache 的 F16 到 F32 转换,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。部分平台构建
Anthropic 报告其 Claude Mythos 5、Claude Fable 5 和 Claude Sonnet 5 模型出现错误率升高的问题,影响范围包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前该问题已解决。
AWS 发布了 AgentCore Observability 的跨平台监控方案,支持通过 ADOT 自动埋点将非 AWS 环境(如本地、GCP、Azure)中运行的 AI 代理的遥测数据发送到 Amazon CloudWatch 和 AgentCore Observability 仪表板。该方案利用 IAM 认证和 OTLP 端点,实现代理推理链、工具调用
llama.cpp 发布 b10410 版本,主要更新为在 SYCL 后端的非 oneDNN 路径中移除单独的 FP32 类型提升,改用自动 FP16 提升。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 等。
llama.cpp 发布 b10408 版本,主要新增了 SYCL 后端下的 DMMV Q3 K ESIMD 内核,并重构了 ESIMD 内核以共享代码,默认启用 ESIMD(若可用)。该版本提供了适用于 macOS、Linux、Windows、Android 等平台的多种二进制包,但部分构建(如 macOS KleidiAI、ROCm 等)被禁用。
Red Hat 发布了 Qwen3.6-35B-A3B 的 FP8 量化版本,该模型基于 Qwen 3.6 35B 架构,采用细粒度 FP8 量化(块大小 128),性能与原始模型几乎一致。模型支持工具调用和推理,上下文长度原生 262,144 令牌,可扩展至 1,010,000 令牌,并已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24
Red Hat 发布了基于 Qwen3.6-35B-A3B 的 NVFP4 量化版本模型 RedHatAI/Qwen3.6-35B-A3B-NVFP4,权重和激活均量化为 NVFP4 格式,使用 llm-compressor 工具生成。该模型针对推理和工具调用优化,支持 vLLM 部署,并在多个基准测试中保持了接近原始模型的性能,如 GSM8K 和 GPQA
Red Hat 发布了基于 Google Gemma 4 12B 指令模型的 NVFP4 量化版本,权重和激活均量化为 4 位浮点格式,使用 vLLM 的 llm-compressor 工具和 GPTQ 方法。该模型在 GSM8K 和 Wikitext 基准上进行了评估,性能接近 BF16 基线,并已在 RHOAI 3.5 和 vLLM 0.24.0 上验证
Red Hat 发布了基于 Google gemma-4-12B-it 的 FP8 动态量化版本,使用 vLLM 的 llm-compressor 工具对权重和激活进行量化,并提供了完整的量化脚本和评估方法。该模型已在 RHOAI 3.5、RHAIIS 3.5 和 vLLM 0.24.0 上验证,旨在提升推理效率。
新加坡AI芯片公司Acrab完成1.3亿美元B轮融资,累计融资超4.8亿美元,用于扩大产能和研发下一代平台。该公司成立不到三年,首颗端侧AI芯片GΞLIX 1已进入量产准备,并推出个人AI中心Agent Box,瞄准端侧Agent计算需求。Acrab强调CPU与NPU协同、统一内存和Prefill性能,其自测显示在特定条件下Prefill速度达1416 To
SpaceXAI发布Grok 4.6模型,在多项基准测试中超越GPT-5.6 Sol和Fable 5 Max,且价格更低。同时推出Grok Bot智能体产品,可自主操作工具并24小时运行。这些产品整合了Cursor的技术和SpaceXAI的算力,标志着马斯克在AI领域的战略布局。
Anthropic 的最强模型 Fable 5 上市首月仅占其 API 代币销售量的 6%,收入占比 11.4%,远低于 OpenAI 的 GPT-5.6 Sol(代币占比 25%,收入占比 23%)。Ramp 经济学家认为,Fable 5 的高定价(每百万输入/输出 token 分别为 10 美元和 50 美元)触及了企业 AI 支出的天花板,性能提升难以
该论文研究LLM智能体服务中的GPU控制门控问题,通过两个研究定义了可测量的GPU控制门:截止期限可行的队列供应和观测放置。研究分析了并发队列调度和端上路由与主机重新调度的对比,发现设备驻留路径在36种配置中全部更快,速度提升1.19倍至2.39倍。论文还提出了固定分区份额、精确离线份额等指标,并通过动态规划精确计算离线份额。
阿里巴巴开源了超大规模MoE模型Qwen3.8-2.4T-A95B,智源FlagOS社区在发布首日即完成了该模型在9款AI芯片上的适配,包括平头哥、英伟达、华为昇腾等。FlagOS通过统一的系统软件栈和新增的INT8量化支持,解决了超大规模参数带来的系统优化问题,实现了多芯片的快速适配和精度对齐。此举旨在帮助云服务商和算力基础设施快速部署最新模型,并延长存量
据量子位报道,前OpenAI首席科学家Ilya Sutskever创办的SSI公司被曝正在开发基于测试时训练(TTT)的小型推理引擎,该模型能在推理过程中更新权重,实现持续学习。爆料称当前版本可能于8月向少数用户开放,且英伟达已与SSI达成战略合作并投资,算力将提升10倍。若属实,这将是SSI成立两年来的首个模型,可能改变AI训练范式。
llama.cpp 发布 b10405 版本,主要变更是在 HIP 构建中移除 -funsafe-math-optimizations 编译选项,以避免浮点重关联导致的 RDNA3.5 上贪婪解码不一致问题,确保 HIP 构建符合 IEEE 标准。该版本同时提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,部分平