llama.cpp b10269 发布:修复 dflash wo a 加载问题
llama.cpp 发布 b10269 版本,主要修复了 dflash wo a 在加载时的 reshape 问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持多种硬件加速后端。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1726 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10269 版本,主要修复了 dflash wo a 在加载时的 reshape 问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持多种硬件加速后端。
llama.cpp 发布 b10268 版本,主要修复了 macOS 15 及以下版本预编译二进制无法工作的问题,并禁用了 KleidiAI 构建。该版本提供了覆盖 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10267 版本,主要重构了 speculative decoding 的配置初始化逻辑,减少代码重复,现有测试通过。该版本提供了多平台二进制包,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 Vulkan、CUDA、ROCm 等。
Zero-Mem 提出了一种零 token 记忆操作方案,使 LLM 代理在长交互中无需额外 LLM 调用即可管理记忆。它通过实体-上下文图和时间层次结构组织原始交互痕迹,仅最终问答阶段调用 LLM。在长记忆和长上下文问答基准上,Zero-Mem 达到竞争性性能,并将记忆操作时间成本降低 57.6%。
llama.cpp 发布了 b10265 版本,主要同步了 ggml 更新。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的多种二进制文件,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。部分平台(如 macOS KleidiAI 和 openEuler)的构建被禁
Liquid AI 发布了 LFM2.5-2.6B,一个 2.6B 参数的小型语言模型,专为本地和边缘设备上的智能体部署而设计。该模型通过四阶段后训练(包括 SFT、教师专业化、多领域策略蒸馏和智能体强化学习)在工具使用、指令遵循和多步智能体任务上表现出色,可与 4 倍大的模型竞争。LFM2.5-2.6B 支持高效的 CPU 和 GPU 推理,在 Apple
llama.cpp 发布 b10262 版本,主要更新是在 Vulkan 后端实现了 GATED LINEAR ATTN 操作,并更新了相关文档。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种二进制包,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10261 版本,主要更新是验证了 plamo2 字节 token。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
Cloudflare 推出 Cloudflare Agents,整合部署和管理托管代理所需的一切,首先提供可观测性功能。该平台支持代理追踪,兼容 OpenTelemetry 的代理框架(如 Think、Flue 和 AI SDK),并在仪表板中新增 Agents 视图,用于可视化、回放和调试代理会话。此举旨在帮助开发者理解代理行为、成本,并推动自主改进的代理
Cloudflare 宣布推出新工具集,旨在让 AI 代理超越代码生成,承担更多软件开发生命周期(SDLC)的任务,包括 CI/CD 运行、本地开发中的可观测性、代理监控等。Cloudflare 提出用代理开发生命周期(ADLC)取代传统 SDLC,强调软件工厂需要可编程、可扩展、可复现、实时、原子化、权限化和自改进的平台。此举旨在应对 AI 生成代码带来的
AI基础设施公司Runware推出了模块化数据中心Sonic Inference Pod,这是一种可运输的推理计算单元,旨在以更低成本提供高质量推理服务。该产品采用闭式循环冷却系统,无需用水,可在数天内建成,并已在美国、欧洲和亚太地区部署了10个Pod。Runware CEO认为分布式计算靠近用户是长期趋势,并计划通过这种方式满足日益增长的推理需求。
llama.cpp 发布 b10259 版本,主要更新为允许在模型加载过程中重塑张量。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。
Anthropic 报告 Claude Sonnet 5 出现错误,影响 claude.ai、Claude Console、Claude API 和 Claude Code。目前问题已解决,团队正在监控结果。
首届全国青少年人工智能大赛决赛在上海举办,上海仪电作为战略合作单位提供高性能算力集群和仪电智算云平台支撑,保障三大赛道稳定运行。赛事吸引近4万名学生参与初赛,数百名选手进入决赛。上海仪电通过弹性调度、网络安全保障和跨部门专项团队,确保赛事平稳落地,未来将继续深化合作支持青少年AI教育。
本文提出GPTQ-2D算法,用于在二次度量下将实数矩阵舍入为整数,处理左右两侧均有基矩阵的双边自适应舍入问题。该算法以立方时间产生与四时间方法相同的舍入矩阵,通过反对角线顺序并行舍入独立条目。
GradCuit是一种新的测试时潜在推理方法,通过在选定的Transformer层插入可优化的潜在状态,利用因果自注意力机制实现直接且可解释的梯度分配。在五个指令微调骨干模型、三个推理基准和两种答案格式上,GradCuit平均准确率达64.5%,优于链式思维提示6.6个百分点,并展现出更强的鲁棒性。该方法还提供了token级梯度归因,揭示潜在影响集中在推理连
llama.cpp 发布 b10258 版本,主要变更是将 n vocab 从 llama sampler data 移至 penalty sampler,以与 logit bias 和 mirostat 采样器的实现方式保持一致。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,并支持多种硬件加速后端
DeepSeek发布V4 Flash模型,以极低价格(输入$0.14/百万token,输出$0.28)提供接近顶尖模型的性能,引发全球开发者热潮。海外平台如Nous Portal和Cline纷纷提供补贴或免费额度,进一步降低使用门槛。该模型在多项基准测试中得分大幅提升,反超自家V4 Pro,逼近Opus 4.8,有望改变开发者对开源模型的认知,推动AI应用生
Anthropic 正在调查 Claude Sonnet 5 出现的错误率升高问题,该问题影响 claude.ai、Claude Console、Claude API 和 Claude Code 等多个服务。目前尚未提供修复时间表。
llama.cpp 发布 b10256 版本,主要更新是 SYCL 后端对非连续 concat 内核进行了并行化优化,通过调整启动几何形状将性能提升约 9.4%。该版本同时提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。