返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月4日周二 · 10 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10245 发布:修复 minimax m3 图未使用输入张量

llama.cpp 发布 b10245 版本,主要修复了 minimax m3 图中未使用的输入张量问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10244 发布:MSA 迁移至新 KV 缓存实现

llama.cpp 发布 b10244 版本,主要将 MSA(多头自注意力)逻辑从 llama-kv-cache 迁移到新的 llama-kv-cache-msa 实现中。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Latent Space研究

推理工程大师课:Baseten解析AI推理优化前沿

Baseten在完成130亿美元融资后成为AI基础设施领域的独角兽,其团队成员Philip Kiely和Ali Taha在播客中深入探讨了推理工程这一新兴学科。他们讨论了缓存感知路由、预填充与解码分离、量化、投机解码等技术,以及如何通过优化将模型推理速度提升10倍。对话还涉及NVIDIA Dynamo、GPU并行、视频生成的计算瓶颈,以及训练与推理的融合趋势

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10243 发布:优化索引器缓存分配

llama.cpp 发布 b10243 版本,主要更新为仅在“完整”索引器层中分配索引器缓存,以优化内存使用。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持 CUDA、Vulkan、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 发布 QTIP:新型权重量化方法实现质量与速度兼得

Together AI 发布了 QTIP,一种新的仅权重量化方法,结合 Trellis 编码量化与不连贯处理,在模型质量和推理速度上达到最先进水平。QTIP 在 QuIP# 基础上改进,速度比未量化模型快 3 倍以上,并已发布预量化模型(如 Llama 3.1 405B Instruct)和代码库。该论文将作为 Spotlight 出现在 NeurIPS 2

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Minions:端侧小模型与云端大模型协作降低 LLM 成本

Together AI 的研究团队提出了一种名为 Minions 的方法,通过让小型端侧模型与云端前沿模型协作,将大量 LLM 工作负载转移到消费设备上,仅本地读取长上下文,从而降低云成本且几乎不损失质量。实验表明,Minions 在保持 97.9% 准确率的同时,成本仅为云端方案的 17.5%。该方法通过分解-执行-聚合循环,解决了小模型长上下文和多步指令

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ThinkingCap-Qwen3.6-27B 发布 ROCmFPX 量化版,专为 AMD Strix Halo 优化

lmcoleman 发布了 ThinkingCap-Qwen3.6-27B 的 ROCmFPX 量化版本,使用 MagicQuant 混合进化搜索,针对 AMD Strix Halo 平台优化。该版本仅支持实验性 llama.cpp 分支,不支持标准 llama.cpp,且包含 MTP 自推测解码功能,可提升生成速度。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

F1利用AWS代理AI将数据运营从数周缩短至数分钟

Formula 1与AWS合作构建了Data Accelerator解决方案,利用Amazon Bedrock AgentCore上的代理AI,将MarTech数据平台从手动维护转变为自动化管理。该方案将数据源接入时间从6-8周缩短至约40分钟代码生成加数小时部署,并实现了自动化的GDPR分类、异常检测和端到端可观测性。F1的IT总监和数据运营负责人强调了该

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10242 发布:CUDA 后端新增惩罚采样器

llama.cpp 发布 b10242 版本,主要更新为 CUDA 后端新增 penalties sampler 支持,包括频率和存在惩罚的调整,并添加了相应的测试。该版本还提供了多种平台和硬件的二进制文件,如 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon Bedrock 推出自动策略细化功能

AWS 宣布在 Amazon Bedrock 中推出自动策略细化功能,用于自动化 Automated Reasoning 策略的故障诊断与修复流程。该功能提供两种模式:迭代细化(Iterative Refinement)处理规则问题,以及模糊变量细化(Ambiguous Variable Refinement)处理语言歧义问题。用户需审批所有更改,从而减少手

8月3日周一 · 10 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

React Native ExecuTorch 版 all-MiniLM-L6-v2 模型发布

该仓库托管了适用于 React Native ExecuTorch 库的 all-MiniLM-L6-v2 模型,以 .pte 格式导出并支持 xnnpack。模型使用 ExecuTorch v0.6.0 导出,不保证向前兼容,用户需确保运行时版本匹配。仓库包含模型文件和 tokenizer.json,供开发者在移动端集成。

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Claude Sonnet 5 性能下降,Anthropic 正在调查

Anthropic 正在调查 Claude Sonnet 5 的性能下降问题,该问题影响了 claude.ai、Claude API、Claude Code 和 Claude Cowork 等多个服务。目前公司尚未公布具体原因和修复时间。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10241 发布:修复 CUDA 数据竞争并优化性能

llama.cpp 发布 b10241 版本,主要修复了 CUDA 后端中 block reduce 复用共享内存时的数据竞争问题,并引入了双缓冲优化以提升 softmax 和 norm 操作的性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Anthropic 多模型错误率事件已解决

Anthropic 报告了影响多个 Claude 产品(包括 claude.ai、Claude Console、Claude API、Claude Code 和 Claude Cowork)的错误率问题。该事件经历了调查、实施修复和监控阶段,目前已解决。

正文结构化主题已通过公开置信门槛
Import AI研究

自复制AI病毒原型问世,研究者警告需准备防御

研究人员开发了一种利用开源大语言模型的自复制计算机病毒原型,该病毒能利用被感染机器的GPU资源进行推理,并自主发现漏洞、发起攻击和复制自身。该研究由多伦多大学、剑桥大学等机构完成,展示了AI驱动的自主网络威胁已成为现实。研究者认为未来互联网将充满攻防AI代理,需要人类部署防御性AI代理来对抗。

正文结构化主题已通过公开置信门槛
Cloudflare AI Blog一手来源研究

Cloudflare 优化 Kimi 与 GLM 推理:KV 缓存量化与权重压缩

Cloudflare 在 Workers AI 上通过 KV 缓存量化(FP8)和模型权重压缩(INT4)优化了 Kimi 和 GLM 等大型 MoE 模型的推理效率,使内存占用减半、吞吐量提升,且模型精度几乎无损。这些技术结合预填充/解码分离架构,支持更多并发请求并降低成本,相关优化已通过 SGLang 框架开源。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.3.1 发布:修复定价与仪表盘问题

Langfuse 发布了 v4.3.1 版本,主要包含多项修复和改进。修复了定价模块中 GPT-5.6 的使用别名问题,以及仪表盘中遗留 trace 组件的路由问题。此外,还进行了 CI 构建配置和代码风格规则的优化。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10240 发布:服务器默认端口将改为 9931

llama.cpp 发布 b10240 版本,主要更新为服务器默认端口将从 8080 更改为 9931,并添加了相关通知。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多个平台的预编译二进制文件,支持多种硬件加速后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程

KV 缓存详解:优化 Transformer 推理效率

Hugging Face 博客发布了一篇关于 KV 缓存的教程,解释了该技术如何通过存储注意力层的键值对来避免重复计算,从而加速 Transformer 模型的文本生成。文章提供了 PyTorch 伪代码和 transformers 库的使用示例,并展示了在 T4 GPU 上使用 KV 缓存可获得约 5.21 倍的加速。该技术对于长文本生成尤为重要,能显著提

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

微软Agent Framework正式版发布,推出Agent Harness和托管代理

微软于2026年4月2日将Agent Framework升级至1.0正式版,并在Build 2026大会上发布了Agent Harness、GitHub Copilot SDK和Claude Agent SDK连接器,以及多智能体编排模式,均达到稳定版本。该框架提供统一的运行时,支持本地、容器和托管部署,并内置OpenTelemetry等治理功能。MBZUA