返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月3日周四 · 20 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10780 发布:SYCL API 支持点对点复制

llama.cpp 发布 b10780 版本,主要更新为增强 SYCL API 以支持点对点复制功能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10778 发布:修复模型加载内存峰值问题

llama.cpp 发布 b10778 版本,主要修复了模型加载阶段内存峰值过高的问题(PR #27483)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10777 发布:SYCL Q4 K 优化与多平台支持

llama.cpp 发布 b10777 版本,主要更新为 SYCL 后端对 Q4 K 多列 MMVQ 的优化,通过权重解包和行间激活复用减少冗余计算,并新增相关测试。该版本提供多平台预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、SYCL 等后端。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

SmarCo GC3:RISC-V数据流架构如何破解视频生成存储墙

中科通量推出全球首款基于RISC-V数据流架构的视频智能AIGC芯片SmarCo GC3,旨在解决视频生成中的存储墙问题。该芯片采用数据流架构,通过数据依赖动态触发计算,减少数据搬运,并配置200 TOPS算力、128GB内存和128路硬解码引擎。此举为视频生成提供新算力选择,但实际效果和生态兼容性仍需验证。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源模型发布

llama.cpp 新增 NVIDIA Nemotron-3-Puzzle-75B 模型支持

llama.cpp 发布 b10776 版本,新增对 NVIDIA Nemotron-3-Puzzle-75B-A9B 模型的支持。该模型具有每层不同的专家 FFN 大小和 top-k 路由配置,为此引入了每层 n ff exp 和 n expert used 的数组支持,并扩展了 GGUF 键以接受标量或数组。同时更新了转换脚本以兼容官方 BF16 检查点

正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源研究

美团智播数字人直播技术突破:从高保真形象到万路并发

美团技术团队在2026年中国互联网大会上展示了美团智播数字人直播解决方案,该方案融合大模型、数字人与多模态交互技术,实现高保真形象生成、自然动作驱动、语音手势协调及高效推理部署,使数字人直播月日均GTV同比增长82.12%,开播场次提升11倍。团队自研的SDIP、SREdit、MoTiGA、StreamingTalk及Glance2Gaze等技术分别被ACM

正文结构化主题已通过公开置信门槛
Latent Space产品发布

Muse Spark 1.3 对标前沿模型,斯坦福推智能体工程课程

Meta 发布 Muse Spark 1.3,据称性能接近 OpenAI 和 Anthropic 的前沿模型,并承诺开放权重,训练成本可降低 90% 以上。斯坦福大学推出两门 AI 智能体工程课程,强调从提示工程转向系统化智能体构建。业界讨论 Astra 循环变压器架构的实质,以及智能体评估和技能检索的新方法。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Skim and Skip:高效多模态检索的分层自适应推理框架

清华大学、微软和上海交通大学的研究者提出了 Skim and Skip (SAS) 框架,用于提升多模态检索的效率。该框架通过基于 [EOS] 的 token 级信息选择和自适应深度推理,在 12 个 MMEB 检索任务上保留了约 99% 的密集基线性能,同时实现了最高 1.64 倍的端到端加速和 66.3% 的 FLOPs 减少。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

FORGE:微控制器整数视觉模型的前向测试时自适应

FORGE 提出了一种面向微控制器上整数部署视觉模型的前向测试时自适应方法。该方法通过重新归一化折叠卷积的逐通道输出,恢复了因批归一化折叠而丢失的统计信息,从而在无反向传播的推理运行时实现自适应。实验表明,FORGE 在 CIFAR-10/100 和 Tiny-ImageNet 上恢复了 TENT 的大部分精度提升,并在 ESP32-S3 上实测自适应能耗仅

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

基于语言与代码的概率推理实现归纳与探究

该研究提出一种计算模型,将符号知识编码为结合自然语言与源代码的“心智程序”,并利用LLM引导的贝叶斯学习算法进行序列推断,以模拟人类的归纳学习与主动探究。实验表明,该模型能复现人类行为中的锚定、花园路径等效应,而纯LLM或经典贝叶斯模型则无法同时满足数据效率、不确定性表达和灵活性。研究推测,人类通过混合语言与程序表征的假设空间进行近似贝叶斯更新,LLM作为自

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

面向LLM工具使用的Agent原生可复用工具原语框架HEART

arXiv 论文提出 Tool Primitives,用自然语言接口替代 API schema 调用,并构建含 25,519 个函数的 ToolFace 仓库,支持推理时动态检索。在此基础上提出 HEART 框架,包含 Planner、Router、Verifier 组件,在五个基准上平均超越 SFT 模型及 GPT-5.4、Claude-4.6-Sonne

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DeepSeek-V4-Flash DSpark 草稿模型 GGUF 发布

bleysg 发布了 DeepSeek-V4-Flash 的 DSpark 草稿模型 GGUF 版本,专为 ds4 C+CUDA 推理引擎设计,支持无损投机解码,在 DGX Spark 上平均加速 1.38 倍,峰值 1.71 倍。该文件包含 3 层 transformer、目标融合投影、Markov 头等,采用 Q2 K 路由专家等量化策略,约 6.5 G

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DeepSeek-V4-Flash 定制 GGUF 发布,面向 AMD Strix Halo 优化

Hugging Face 上发布了 DeepSeek-V4-Flash-0731 的定制 GGUF 量化版本,专为 AMD Strix Halo 平台的 Ember 运行时设计,采用 ROCmFPx 自定义张量类型,不兼容主流 llama.cpp 等运行时。该版本经过 abliteration 和重要性矩阵校准,并附带 DSpark 草稿模型,在 AMD R

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10770 发布:为 M3 添加 fa-vec 调优

llama.cpp 发布 b10770 版本,主要更新是为 Apple M3 芯片添加了 fa-vec 调优(PR #28236),以提升 Metal 后端性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10769 发布:修复 Metal 低内存查询问题

llama.cpp 发布 b10769 版本,主要修复了 Metal 后端在低内存条件下的内存查询问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Claude Sonnet 5 错误率升高已解决

Anthropic 报告 Claude Sonnet 5 出现错误率升高的问题,影响范围包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。问题从太平洋时间下午 2:05 持续到 2:19,现已解决。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 在澳大利亚推出 Bedrock 上的 OpenAI GPT-5.6 跨区域推理

AWS 宣布澳大利亚的悉尼和墨尔本区域现可通过 Amazon Bedrock 的全球跨区域推理访问 OpenAI GPT-5.6 系列模型(Sol、Terra、Luna)。这些模型支持文本和图像输入、100 万 token 上下文,并可通过 Responses API、Chat Completions API 和 Converse API 调用。文章还介绍了

正文结构化主题已通过公开置信门槛
TechCrunch AI研究

OpenAI新推理技术引发AI安全专家担忧

据The Information报道,OpenAI的新模型Astra将采用一种名为“循环深度”(又称“不透明循环”)的推理技术,该技术使模型在循环中处理查询,可能使思维链更难监控,引发AI安全专家的担忧。Redwood Research CEO Buck Shlegeris和AI安全倡导者Zvi Mowshowitz等专家公开表示忧虑,认为该技术可能破坏思维

正文结构化主题已通过公开置信门槛
The Verge AI模型发布

谷歌发布Gemini 3.8 Flash:性能更强但成本可能更高

谷歌发布了Gemini 3.8 Flash模型,该模型通过更多推理步骤和迭代工具调用实现更强性能,但可能因token消耗增加而提高使用成本。该模型在软件工程和自主智能体基准测试中表现优异,同时谷歌推出了面向政府和可信伙伴的Fairwind计划,提供Gemini 3.8 Flash Cyber和CodeMender代理。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10764 发布:清理 CUDA 代码并更新多平台二进制

llama.cpp 发布 b10764 版本,主要更新为移除 ggml-cuda 中的未使用变量。该版本提供适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm 等多种后端。