返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月6日周日 · 5 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10822 发布:简化 UI 资源嵌入并支持多平台

llama.cpp 发布 b10822 版本,主要更新为通过 CMake 直接嵌入 UI 资源,移除了构建时的 C++ 辅助程序和外部 gzip 依赖,简化了交叉编译。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10821 发布:为 M2 Max 添加 fa-vec 调优

llama.cpp 发布 b10821 版本,主要更新是为 M2 Max 芯片添加了剩余的 fa-vec 调优(PR #28458)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA Nemotron 3.5 Lightning 30B A3B 发布 GGUF 量化版

Hugging Face 上发布了由 ggml-org 转换的 NVIDIA Nemotron 3.5 Lightning 30B A3B 模型的 GGUF 量化版本,该模型基于 NVIDIA 的 BF16 版本,支持通过 llama.cpp 运行。此转换使得模型可以在本地设备上高效运行,扩大了其可用性。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

IFM 发布 K2-Horizon-7B-Uno 扩散增强模型

IFM 发布了 K2-Horizon-7B-Uno,这是一个基于 K2-Horizon-7B 的扩散增强语言模型,通过 LoRA 适配器添加扩散路径,实现无损加速。该模型在多个基准测试中表现优于参考模型,如 Tau2 Telecom 得分 90.1,且吞吐量更高。模型代码和评估脚本已公开,完整评估套件即将发布。

正文结构化主题已通过公开置信门槛
智东西研究

Claude 11天完成费马大定理形式化证明,清华姚班校友带队

Anthropic宣布其AI模型Claude在11天内完成了费马大定理的首个端到端、可由计算机完整检查的形式化证明,期间生成约1300万行Lean代码和约30300个可验证定理。该项目由清华姚班毕业生、哥伦比亚大学助理教授彭天翼发起,使用数十个Claude Agent并行协作,并借助其团队打造的Prove2Me平台。这一成果将原本预计耗时数年的数学形式化工作

另有 1 家信源报道

9月5日周六 · 15 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

JiRack Ultra 14B:面向 CPU 的高效三元模型发布

CMSManhattan 发布了 JiRack Ultra 14B,一个基于 DeepSeek R1-14B 架构、采用 BitNet 三元权重的 CPU 推理优化模型,支持多语言和扩展 tokenizer,涵盖路由、工具调用和机器人等标签。模型提供多种 GGUF 量化版本和 Docker 部署选项,并计划支持 Ollama 生产环境。该模型旨在降低云基础设

正文结构化主题已通过公开置信门槛
量子位研究

GPT-6带火循环Transformer,阿里两篇顶会论文提前布局

GPT-6 Astra发布带火了循环Transformer技术,阿里团队早在11个月前就发表了MeSH和SpiralFormer两篇论文,分别解决循环内部信息管理和计算粒度问题。MeSH通过动态读写路由器管理记忆槽,减少计算冗余;SpiralFormer通过多分辨率序列处理,让每轮循环关注不同尺度的信息。两篇论文分别被ICLR 2026和EMNLP 2026

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 推出 16GB VRAM 优化 GGUF 量化版

Hugging Face 用户 tooltd 发布了 Qwen3.8-27B 的 GGUF 量化版本,针对 16GB VRAM 优化,采用自定义混合精度量化方法 ZB-ZipBrain,结合重要性矩阵校准和率失真边际成本,自动寻找帕累托最优的比特分配。该模型在 16GB 显卡上约 4 BPW,12GB 显卡上约 3 BPW,并通过基准测试对比了多种量化方法的

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

QConAI 2030 预测演讲:token 成本与 AI 未来趋势

Doubleword 联合创始人 Meryem Arik 在 QConAI 2030 上预测了 AI 行业未来趋势,涵盖 token 支出、基础设施、代理、监管和职业发展。她指出 token 成本已成为企业问题,并驳斥了 AI 实验室补贴 token 的说法,认为 token 价格将持续下降。她还预测了企业采用 AI 的速度和前沿模型改进的速度。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10819 发布:修复 Metal 内存泄漏

llama.cpp 发布 b10819 版本,主要修复了 Metal 后端在提前返回路径中的内存泄漏问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

FLUX.2-klein-4B LiteRT 版:手机端本地文生图与编辑

Hugging Face 社区发布了 FLUX.2-klein-4B 模型的 LiteRT 量化版本,由 Black Forest Labs 的 FLUX.2 klein 4B 转换而来,采用 int8 量化并针对端侧设备优化。该版本可在 Pixel 8a 的 Mali GPU 上完全本地运行文生图和图像编辑任务,生成质量与 fp32 管线相当(PSNR 3

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10818 发布:修复 SYCL 并恢复 Kronecker FWHT 支持

llama.cpp 发布 b10818 版本,主要修复 SYCL 后端的 test-backend-ops CI 问题,并恢复对 Kronecker 乘积 FWHT 的支持(适用于 384、640、768 等尺寸)。该版本为 SYCL 后端隔离了 Kronecker 测试,并修复了未使用变量和尾随空格错误。同时提供了多平台(macOS、Linux、Windo

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

OpenAI 推出 GPT-6 Astra,配额减半

OpenAI 已向 Pro、Enterprise 和 Business Premium 用户推出 GPT-6 Astra 模型,可通过 ChatGPT、API、Azure 和 AWS Bedrock 使用。该模型的消息配额约为 GPT-5.6 Sol 的一半,且不同订阅计划有不同限制。Plus 和 Business 用户将在未来几天获得访问权限。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

huihui-ai 发布 Qwen3.8-27B 无审查 GGUF 模型

huihui-ai 发布了基于 Qwen3.8-27B 的 abliterated 版本 GGUF 模型,通过消融部分层来移除模型的拒绝机制,实现无审查输出。该模型提供了多种量化版本,并支持通过 ollama 和 llama.cpp 使用。模型存在生成敏感或不适当内容的风险,仅建议用于研究或受控环境。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ling-3.0-tiny 模型发布 GGUF 量化版本

NANI-Nithin 发布了 inclusionAI/Ling-3.0-tiny 模型的 GGUF 量化版本,提供多种 K-quant 和 IQ 量化文件,适用于 llama.cpp 运行时。该模型采用 BailingMoeV3 混合架构,需要特定运行时支持。量化版本旨在平衡模型大小、速度和输出质量,方便本地部署。

正文结构化主题已通过公开置信门槛
量子位研究

光象科技与清华发布物理原生世界模型ActEffect

光象科技联合清华大学李升波教授课题组发布了第一代物理原生世界模型Phi-WM 1.0 ActEffect,该模型在训练阶段通过受控世界模型预测动作后果并优化策略,训练完成后即从部署链路中退出,以降低推理时延和算力成本。在LIBERO、LIBERO-PLUS和RoboCasa-GR1基准上分别取得98.8%、80.3%和67.5%的平均成功率,并在真实工业场景

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

推测宏提交:加速工具使用型代理的新机制

南加州大学和英特尔实验室的研究者提出了一种名为 Speculative Macro Commit (SMC) 的运行时机制,用于加速工具使用型 LLM 代理。SMC 采用双模型架构,由权威模型生成官方轨迹,而快速的推测模型在隔离环境中预执行未来动作链,并通过挖掘重复的多动作模式进行宏提交。实验表明,SMC 在保持任务准确性的同时,相比顺序执行和 Specul

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

受治理数据分析:确定性策略执行优于运行时工具规划

arXiv 论文提出一种受治理的数据分析架构,其中语言模型仅负责解释用户问题,而确定性策略选择预编写的分析程序,确保结果附带完整证据。作者通过构造性翻译证明了该受限语言在特定分析类别上的完备性,并对比了运行时工具规划与策略执行两种方式:在440次运行中,策略执行在110次全部达标,而运行时规划在330次中无一满足完整契约。该结果具有配置特定性,不构成对智能体

正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.19 发布:新增模型支持与多项性能优化

SGLang 发布 v0.5.19 版本,包含 786 个 PR,来自 214 位贡献者。新增支持 Qwen3.8、Ling-3.0、Granite 4.2 等多个模型,并引入 beam search、DeepEP v2、LayerNorm 序列并行等多项性能优化。这些改进提升了推理吞吐量、降低了延迟,并扩展了硬件兼容性。

正文结构化主题已通过公开置信门槛
量子位研究

Claude 11天完成费马大定理首个完整形式化证明

Anthropic宣布,其AI模型Claude在11天内完成了费马大定理的首个端到端形式化证明,生成了约1300万行Lean代码和超过3万个中间定理。该工作由姚班校友Tianyi Peng主导,使用了多Agent协作系统Prove2Me,最终证明经Lean验证与Mathlib中的陈述一致。这一成果表明AI可大幅加速数学文献的形式化进程。

另有 1 家信源报道