llama.cpp b10400 发布:修复 ARM 构建问题
llama.cpp 发布 b10400 版本,主要修复了 ARM 构建问题及未使用变量警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 等。部分平台构建(如 macOS KleidiAI、Ubuntu ROCm、openEule
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10400 版本,主要修复了 ARM 构建问题及未使用变量警告。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 等。部分平台构建(如 macOS KleidiAI、Ubuntu ROCm、openEule
该研究对多模态大语言模型的视觉工具使用进行了因果审计,发现尽管聚合准确率有所提升,但返回的视觉证据往往对答案没有因果影响,或调用计划不连贯。研究提出了视觉证据增益等干预指标,并在六个模型和五个基准上揭示了两种失败模式,将这种不一致称为视觉工具使用的幻觉。
该研究将预训练语言模型 Qwen2.5-0.5B-Instruct 改造为循环深度架构,通过权重共享的循环块和可训练桥接层实现迭代潜在计算。在两种参数预算(6M 适配器和 180M 全块)下,模型在 ARC 基准上表现不逊于基线,并能外推至监督深度的 1.5 倍。与同规模自回归模型相比,循环模型在深度推理上准确率更高(84% vs 72%),速度更快,且保留
本文研究了一种名为“强到弱脚手架”的测试时能力迁移方法,即由更强的构建模型为较弱的目标模型构建推理时脚手架,在不更新参数的情况下提升其任务表现。在四个心智理论基准测试中,该方法将目标模型的平均性能从0.49提升至0.91,主要归功于将不稳定的模型推理卸载到确定性代码、基准特定路由和严格答案格式执行。研究还发现,构建模型的推理努力与脚手架质量单调相关,且较弱的
mradermacher 发布了 Qwen3-Next-80B-A3B-Thinking-GRPO-Uncensored 模型的 GGUF 量化版本,基于 puwaer 的原始模型,提供多种 i1 和 imatrix 量化格式,文件大小从 16.3GB 到 55.1GB 不等。该模型支持中英日多语言,采用 CC-BY-NC-SA-4.0 许可,旨在为本地部署
CoinRAG 是一种针对长上下文检索增强生成(RAG)的优化方法,通过复用细粒度的语义片段缓存而非完整块,在低预填充延迟约束下提升效率与准确性。在 LongBench 多跳问答任务上,CoinRAG 平均相对提升 F1 分数 5.3%,并实现了新的帕累托前沿。
DeepSeek 发布了 V4 Pro 0813 模型,目前仅通过 API 提供,OpenRouter 已上线。作者推测其开放权重可能发布,因为前代模型均有权重。该模型在不同推理级别下生成的鹈鹕图像差异显著,且基准测试结果通过非官方渠道传播。
Ollama 发布 v0.32.10 版本,主要更改包括:未设置 repeat penalty 的模型默认值从 1.1 改为 1.0(关闭),以匹配其他引擎并加速推测解码;NVFP4 MLX 模型全局缩放使预填充速度提升约 7-8%;修复了 OCI 清单配置和层共享摘要时 blob 验证被跳过的问题。
SpaceXAI 发布了新模型 Grok 4.6,在 Artificial Analysis Intelligence Index 上得分 61,与 OpenAI 的 GPT-5.6 Sol 持平,仅次于 Anthropic 的 Claude Opus 5 和 Claude Fable 5。该模型在代理任务上表现优异,在 GDPval-AA v2 基准上排名
另有 1 家信源报道
阿里巴巴发布了其最大的开源权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max),总参数达 2.4T,每个 token 激活 95B 参数,采用细粒度 MoE 架构和全注意力与线性注意力混合设计,支持百万 token 上下文。NVIDIA 宣布该模型可在 GB300 NVL72 平台上以 FP8 精度实现每 GPU 每秒超 4K tokens
Anthropic 报告了多个模型出现性能降级问题,主要影响 Claude Fable 5,导致请求错误率上升。团队已识别并正在解决该问题,目前事件已解决。受影响的服务包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。
IIT Bombay和Adobe Research的研究人员开发了一种名为“Previous-Token Prediction”(PTP)的方法,能够仅根据LLM的输出文本以近乎完美的准确率重建原始提示词,无需访问模型权重,甚至适用于第三方模型。该方法通过训练一个逆语言模型来预测前一个token,并能在不知道具体模型的情况下提取提示词,这可能导致专有系统提示
NVIDIA 技术博客发布了一篇关于 AI 工厂全栈可观测性选型的指南,针对 AI 基础设施多层架构中故障定位难的问题,提出了一个基于 NVIDIA DGX 部署的决策框架。文章通过分布式训练中 InfiniBand 链路静默故障的案例,说明了全栈可观测性的重要性,并给出了组件到遥测工具的映射表,帮助运维团队选择最小工具集并构建分诊仪表板。
Vercel AI SDK 发布 7.0.63 版本,主要修复了 UI 消息流中推理块的 ID 保留问题,并允许不支持重排序模型的提供商分配给 Provider。同时更新了 @ai-sdk/gateway 依赖至 4.0.50。
Langfuse 发布 v4.10.0 版本,新增多项功能,包括允许用户在应用内代理运行时开始新对话或切换对话、跟踪认证后端活动、添加 Cursor Cloud 环境、集成指标 API 以及提升观测负载上限至 20k。同时修复了多个问题,如公共评论创建时的 authorUserId 验证、SCIM 用户配置中的密码属性忽略、Docker socket 可达性
OneAdvanced 是一家英国企业软件提供商,在 AWS 上部署了超过 50 个 AI 代理,使用 Llama 4 Maverick 和 Llama Guard 4 模型,通过自托管方式满足英国数据主权要求。该解决方案基于 Amazon SageMaker AI、vLLM、RAG 管道和 Strands Agents SDK,支持医疗、法律等受监管行业。
AWS 在 SageMaker HyperPod 上推出分层 KV 缓存架构,结合 Curvine 分布式缓存文件系统,将 KV 缓存从 GPU 扩展到 CPU 和共享 NVMe 池,实现跨副本缓存复用。测试显示,该方案可将跨 Pod 缓存命中率提升至 100%,TTFT 改善最高达 2.7 倍,并允许在更低成本的 G6e 实例上运行原本需要 P5 实例的工
llama.cpp 发布 b10375 版本,主要更新为收紧 Qwen 模型的 bare function 解析逻辑。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
中国科学院自动化研究所紫东太初大模型团队提出核心集剪枝方法GMC,通过互补证据自适应筛选与群体互补信息传输双阶段架构,在免训练、无额外依赖的情况下压缩视觉Token。实验表明,在Qwen2.5-VL-7B上减少80% Token仍保留97.78%能力,在LLaVA-1.5-7B上性能几乎无损,并减少KV Cache占用,提升推理速度。该方法可兼容主流视觉语言
InSight-doc 是一种用于长文档理解的智能视觉感知框架,将视觉分辨率视为可自适应调整的推理时资源。它从低分辨率开始,无需外部检索器即可选择性放大高分辨率区域以获取更精细的证据。通过包含17.9K SFT示例和19.2K硬RL示例的训练,InSight-doc-8B在文档VQA基准上提升了4.3-16.4个准确率点,在长文档上将幻觉减少超过40%,推理