返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月20日周四 · 17 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10516 发布:修复 Vulkan 空指针问题

llama.cpp 发布 b10516 版本,主要修复了 Vulkan 后端中 ggml vk queue command pools cleanup 函数的空指针检查问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、OpenVINO 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10514 新增 Granite SWA 模型支持

llama.cpp 发布 b10514 版本,新增对 GraniteSWAForCausalLM 和 GraniteMoeSWAForCausalLM 模型架构的转换与推理支持,包括滑动窗口注意力模式、逐层 RoPE 判定及 MoE 参数处理。该更新由 IBM 的 Gabe Goodhart 主导,并借助 AI 辅助编码工具完成。此版本增强了 llama.c

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Software Mansion 发布 React Native ExecuTorch 版 CLIP 图像编码器

软件公司 Software Mansion 在 Hugging Face 上发布了用于 React Native ExecuTorch 库的 CLIP ViT-B/32 图像编码器模型,以 .pte 格式提供,支持 xnnpack 后端。该模型基于 OpenAI 的 clip-vit-base-patch32,导出时使用 ExecuTorch 1.1.0,不

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Zetta:用于自进化物理智能的高效闭环具身框架

Zetta是一个闭环具身智能框架,通过在线演化基于代码的运行时批评者和恢复技能,在保持基础策略冻结的同时,以动作频率治理物理执行。在LIBERO-Pro和RoboCasa基准上分别达到90.8%和93.6%的成功率,推理速度提升11.1倍,且技能可零样本迁移,展现出机器人"顿悟时刻"。该研究为可靠物理智能的扩展提供了新路径。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

LLM委托合约:技术与努力选择中的道德风险

该论文将经典委托-代理框架扩展至LLM代理选择技术与努力水平(如token预算)的场景,建模了凹性饱和生产函数,推导了最优线性合约,并基于MATH和MMLUPro基准校准模型,证明简单线性合约能有效激励技术感知的委托。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

推理设置影响大语言模型在医学分配中的行为

该研究通过医学资源分配场景,发现大语言模型在推理时是否包含先前响应会显著影响其行为,且不同模型间概率变化方向可能相反。研究强调部署环境中的上下文工程对模型决策的重要性,并指出单次评估可能掩盖多轮任务中的潜在风险。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

混合PDE参数学习中算子误设的检测与区分:无参考工具

该研究针对混合PDE参数学习中的算子误设问题,提出了一种无需参考模型的检验工具,能从单次拟合中区分算子错误与参数不可辨识。实验表明,误设估计器在域内误差低于噪声,但系数偏差大,且容量无关,多种架构收敛到相同的伪真值。该工具在正确设定下保持沉默,在误设下高概率拒绝,为可部署测试提供了分离两种失败的能力。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10507 发布:新增 mtmd 位图合并功能

llama.cpp 发布了 b10507 版本,主要更新是添加了 mtmd bitmap set mergeable 功能(PR #27348)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。部分平台的构建(如 macOS KleidiAI、U

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10506 发布:Metal 后端优化 q8 0 反量化

llama.cpp 发布 b10506 版本,主要更新是在 Metal 后端使用打包类型对 q8 0 进行反量化,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。部分平台构建(如 KleidiAI、ROCm、openEuler)因兼容性问题被禁用。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10505 发布:新增 dedup-cache-models 预设选项

llama.cpp 发布 b10505 版本,为 server 新增 dedup-cache-models 预设选项(PR #27346),用于模型缓存去重。该版本提供了覆盖 macOS、Linux、Windows、Android 及 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA 展示 AI 编码代理开发 Holoscan 实时分割应用

NVIDIA 技术博客介绍了如何使用 AI 编码代理开发 Holoscan 应用,通过 CLI、技能和代理实现实时内窥镜工具分割应用。开发流程采用工程师指导的迭代方式,代理使用 Codex 和 GPT-5.6 完成代码实现,并复用 MONAI 模型。该方法提高了开发效率,并强调了将复杂目标分解为可验证迭代的重要性。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Silicon Data 融资3000万美元,为AI计算定价并推出期货交易

Silicon Data 是一家帮助华尔街为 AI 计算定价的初创公司,近期完成了 3000 万美元 A 轮融资。该公司旨在成为 GPU 租赁的参考价格和指数,并计划于 10 月 5 日在 CME 推出计算期货交易,尚待监管批准。在 TechCrunch 的 Equity 播客中,研究主管 Steve Hou 讨论了 AI 建设现状,认为数据表明行业并非如悲

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.32.15 发布:新增模型元数据缓存

Ollama 发布了 v0.32.15 版本,主要新增了模型元数据缓存功能,以减少每次请求的开销。该版本还包含新贡献者 gaugarg-nv 的首次贡献。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.15.0 发布:增强沙盒工具与开源代理支持

Langfuse 发布 v4.15.0 版本,主要改进包括:改进沙盒工具渲染、时间线紧凑模式、为开源版提供应用内代理基础、在分析事件中添加用户 ID。同时修复了多个问题,如会话回放内容掩码、工具竞态条件、RBAC 权限等。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Unsloth 发布 Qwen3.8-27B GGUF 量化模型,支持动态量化与智能体优化

Unsloth 发布了基于 Qwen3.8-27B 的 GGUF 量化模型,采用 Dynamic V3.0 技术,宣称在精度和量化性能上优于其他量化方案。Qwen3.8-27B 是 Qwen 系列最新开源模型,具备原生视觉语言理解、灵活思考控制、长上下文(262K 原生,可扩展至 1M)和增强的智能体执行能力。该模型支持在 Unsloth Desktop 中

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究

NVIDIA 发布 Cosmos 3 Edge:设备端机器人控制的世界模型

NVIDIA 发布 Cosmos 3 Edge,一个 4B 参数的 omni-model,可在 Jetson Thor 上实现设备端机器人控制。该模型基于 Cosmos 3 系列预训练,通过后训练生成机器人操作策略,在 Jetson AGX Thor T5000 上推理延迟约 1.53 秒,闭环任务成功率 22.9%。教程提供完整后训练流程,使用 DROID

8月19日周三 · 3 条
正文结构化主题已通过公开置信门槛
THE DECODER商业

中国允许英伟达H200芯片小批量进入以助AI企业追赶美国

中国允许英伟达H200芯片小批量进入大陆,字节跳动和腾讯各获得约1万颗,以帮助国内AI企业追赶美国。H200比英伟达最先进芯片落后至少两代,因美国出口管制无法购买更先进的。中国还支持华为等本土制造商,但国内AI公司在推理能力上仍落后于美国,且需求激增导致部分公司如Moonshot不得不拒绝客户。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Liquid AI 发布 LFM2.5-2.6B GGUF 量化模型,面向端侧部署

Liquid AI 发布了 LFM2.5-2.6B 模型的 GGUF 量化版本,该模型专为端侧部署设计,基于 LFM2 架构并经过扩展预训练和强化学习。模型支持多种语言,可通过 llama.cpp 运行,提供了命令行使用示例。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Liquid AI 发布 LFM2.5-1.2B 端侧模型 GGUF 版

Liquid AI 发布了 LFM2.5-1.2B-Instruct 模型的 GGUF 量化版本,专为端侧设备部署设计。该模型基于 LFM2 架构,经过扩展预训练和强化学习,支持多种语言,并可通过 llama.cpp 运行。