返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1726 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月5日周三 · 2 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10269 发布:修复 dflash wo a 加载问题

llama.cpp 发布 b10269 版本,主要修复了 dflash wo a 在加载时的 reshape 问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10268 发布:修复 macOS 兼容性并更新预编译二进制

llama.cpp 发布 b10268 版本,主要修复了 macOS 15 及以下版本预编译二进制无法工作的问题,并禁用了 KleidiAI 构建。该版本提供了覆盖 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

8月4日周二 · 18 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10267 发布:重构投机解码配置

llama.cpp 发布 b10267 版本,主要重构了 speculative decoding 的配置初始化逻辑,减少代码重复,现有测试通过。该版本提供了多平台二进制包,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Zero-Mem:面向 LLM 代理的零 Token 记忆操作

Zero-Mem 提出了一种零 token 记忆操作方案,使 LLM 代理在长交互中无需额外 LLM 调用即可管理记忆。它通过实体-上下文图和时间层次结构组织原始交互痕迹,仅最终问答阶段调用 LLM。在长记忆和长上下文问答基准上,Zero-Mem 达到竞争性性能,并将记忆操作时间成本降低 57.6%。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10265 发布:同步 ggml 并更新多平台二进制

llama.cpp 发布了 b10265 版本,主要同步了 ggml 更新。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的多种二进制文件,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。部分平台(如 macOS KleidiAI 和 openEuler)的构建被禁

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Liquid AI 发布 LFM2.5-2.6B:高效本地智能体模型

Liquid AI 发布了 LFM2.5-2.6B,一个 2.6B 参数的小型语言模型,专为本地和边缘设备上的智能体部署而设计。该模型通过四阶段后训练(包括 SFT、教师专业化、多领域策略蒸馏和智能体强化学习)在工具使用、指令遵循和多步智能体任务上表现出色,可与 4 倍大的模型竞争。LFM2.5-2.6B 支持高效的 CPU 和 GPU 推理,在 Apple

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10262 发布:Vulkan 后端新增 GATED LINEAR ATTN 支持

llama.cpp 发布 b10262 版本,主要更新是在 Vulkan 后端实现了 GATED LINEAR ATTN 操作,并更新了相关文档。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种二进制包,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10261 发布:验证 Plamo2 字节 token

llama.cpp 发布 b10261 版本,主要更新是验证了 plamo2 字节 token。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 推出 Agents 平台,提供代理追踪与可观测性

Cloudflare 推出 Cloudflare Agents,整合部署和管理托管代理所需的一切,首先提供可观测性功能。该平台支持代理追踪,兼容 OpenTelemetry 的代理框架(如 Think、Flue 和 AI SDK),并在仪表板中新增 Agents 视图,用于可视化、回放和调试代理会话。此举旨在帮助开发者理解代理行为、成本,并推动自主改进的代理

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源产品发布

Cloudflare 推出代理开发生命周期工具集,推动软件工厂自动化

Cloudflare 宣布推出新工具集,旨在让 AI 代理超越代码生成,承担更多软件开发生命周期(SDLC)的任务,包括 CI/CD 运行、本地开发中的可观测性、代理监控等。Cloudflare 提出用代理开发生命周期(ADLC)取代传统 SDLC,强调软件工厂需要可编程、可扩展、可复现、实时、原子化、权限化和自改进的平台。此举旨在应对 AI 生成代码带来的

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

Runware推出模块化推理Pod,探索数据中心便携化未来

AI基础设施公司Runware推出了模块化数据中心Sonic Inference Pod,这是一种可运输的推理计算单元,旨在以更低成本提供高质量推理服务。该产品采用闭式循环冷却系统,无需用水,可在数天内建成,并已在美国、欧洲和亚太地区部署了10个Pod。Runware CEO认为分布式计算靠近用户是长期趋势,并计划通过这种方式满足日益增长的推理需求。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10259 发布:支持加载时张量重塑

llama.cpp 发布 b10259 版本,主要更新为允许在模型加载过程中重塑张量。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Claude Sonnet 5 错误已解决

Anthropic 报告 Claude Sonnet 5 出现错误,影响 claude.ai、Claude Console、Claude API 和 Claude Code。目前问题已解决,团队正在监控结果。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

仪电智算护航全国青少年AI大赛决赛

首届全国青少年人工智能大赛决赛在上海举办,上海仪电作为战略合作单位提供高性能算力集群和仪电智算云平台支撑,保障三大赛道稳定运行。赛事吸引近4万名学生参与初赛,数百名选手进入决赛。上海仪电通过弹性调度、网络安全保障和跨部门专项团队,确保赛事平稳落地,未来将继续深化合作支持青少年AI教育。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

GPTQ-2D:立方时间双边自适应舍入算法

本文提出GPTQ-2D算法,用于在二次度量下将实数矩阵舍入为整数,处理左右两侧均有基矩阵的双边自适应舍入问题。该算法以立方时间产生与四时间方法相同的舍入矩阵,通过反对角线顺序并行舍入独立条目。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

GradCuit:通过信用分配梯度流实现稳健可解释的测试时潜在推理

GradCuit是一种新的测试时潜在推理方法,通过在选定的Transformer层插入可优化的潜在状态,利用因果自注意力机制实现直接且可解释的梯度分配。在五个指令微调骨干模型、三个推理基准和两种答案格式上,GradCuit平均准确率达64.5%,优于链式思维提示6.6个百分点,并展现出更强的鲁棒性。该方法还提供了token级梯度归因,揭示潜在影响集中在推理连

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10258 发布:重构采样器数据并更新多平台支持

llama.cpp 发布 b10258 版本,主要变更是将 n vocab 从 llama sampler data 移至 penalty sampler,以与 logit bias 和 mirostat 采样器的实现方式保持一致。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,并支持多种硬件加速后端

正文结构化主题已通过公开置信门槛
量子位模型发布

DeepSeek V4 Flash低价风暴席卷硅谷,海外平台争相补贴

DeepSeek发布V4 Flash模型,以极低价格(输入$0.14/百万token,输出$0.28)提供接近顶尖模型的性能,引发全球开发者热潮。海外平台如Nous Portal和Cline纷纷提供补贴或免费额度,进一步降低使用门槛。该模型在多项基准测试中得分大幅提升,反超自家V4 Pro,逼近Opus 4.8,有望改变开发者对开源模型的认知,推动AI应用生

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10256 发布:SYCL 内核优化提升性能

llama.cpp 发布 b10256 版本,主要更新是 SYCL 后端对非连续 concat 内核进行了并行化优化,通过调整启动几何形状将性能提升约 9.4%。该版本同时提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。