返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月23日周三 · 20 条
正文结构化主题已通过公开置信门槛
量子位观点

Jev vs Decitron:同为决策AI,为什么不是一回事?

量子位刊文对比两款决策AI:TypeSafe AI(有OpenAI背景)推出的Jev主打快速判断,将AI输出变为Choice、Score、Probability等可直接执行的结果,服务软件与Agent;中科闻歌今年6月发布的通用决策大模型Decitron决策机则结合世界模型、多智能体推演、博弈与求解,面向战略与复杂系统决策。文章认为两者共同推动AI输出从生成

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp 发布 b11119:缩减采样器 probe 体积

llama.cpp 发布 b11119 版本,主要变更是采样器(sampler)中 probe 体积的缩减(PR #29285)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
量子位模型发布1

爱诗科技发布实时世界模型PixVerse R2

爱诗科技发布新一代实时世界模型PixVerse R2,将LLM式的Scaling逻辑引入实时世界模型,通过统一可扩展的因果建模框架把视觉、动作、音频、时序及控制信号纳入同一表示体系,并采用Omni Causal AR与Real-Time Acceleration两层架构分别负责能力上限与实时性。文章称R2在实时性、长程一致性、多模态控制等方面较R1提升,可应

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源1

Comfy-Org 发布 Wan 2.1 ComfyUI 重打包模型

Comfy-Org 在 Hugging Face 上发布了 Wan 2.1 的 ComfyUI 重打包模型文件仓库,将 Wan-AI、alibaba-pai、MAGREF-Video、MeiGen-AI 等多个来源的 Wan 2.1 系列模型(含 T2V、I2V、FLF2V、VACE、Fun 等变体)整理为可直接放入 ComfyUI 目录的 safetens

正文结构化主题已通过公开置信门槛
量子位产品发布1

阿里千问AI平台全面升级模型服务、Agent服务与AI应用

9月22日云栖大会MaaS & Agent技术主论坛上,阿里巴巴集团战略副总裁文征宣布千问AI平台全面升级,在模型服务基础上新增Agent服务与行业AI解决方案,并推出API优速模式、Agent Studio、千问AI座舱解决方案等能力。平台通过FlashBoot、UniScheduler等将模型弹性启动时间从1200秒缩短至70秒,首Token延迟降低38

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

Jev 送 1.2 亿 Token:低价判断如何卡位 Agent 决策层

雷峰网报道,Jev 向申请用户发放 1.2 亿 Token 额度,引发对其商业动机的讨论。文章指出 Jev 主要处理分类、路由、评分和概率判断等小颗粒度任务,Token 消耗极低,赠送额度意在让开发者扩大测试范围,把 Jev 嵌入 Agent 执行链中的高频决策节点。文章认为 Jev 押注 System 1 式快判断层,并通过 Calibration 概率校

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究1

大语言模型的概率结构

这篇 arXiv 论文从概率论视角统一阐述大语言模型,将 LLM 描述为 token 序列空间上的概率测度,通过自回归条件分布指定,训练被形式化为最大似然估计并用随机梯度方法求解,文本生成则视为该随机过程的序贯模拟。论文还分析了 KL 散度不对称性在文本生成中的作用,并将其与幻觉现象以及统计合理性与真实性的区分联系起来。作为同一视角的补充,论文讨论了基于 s

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究1

纯Rust端到端训练语言模型:经验报告

作者独自用纯 Rust 在租用 GPU 上以 164 美元成本端到端预训练了一个约 0.4B 参数、以孟加拉语为主的语言模型,并记录了 Candle 与 Burn 两个 Rust ML 框架作为训练后端时的缺陷分类:Candle 有 5 个缺陷(包括融合核静默不产生梯度),Burn 有 3 个缺陷(包括反向传播吞吐仅约理论值 3%、核融合路径在数十亿参数规模

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布1

Ollama 发布 v0.34.4:修复模型未找到错误并优化结构化输出

Ollama 发布 v0.34.4 版本,修复了服务端间歇性出现的“model not found”错误,并针对思考模型优化了结构化输出的单次处理流程。此外,该版本更新了 llama.cpp 与 MLX 依赖,改进了 MLX 下 Gemma 4 图像分辨率动态选择及 Qwen 3.8 提示处理速度,同时调整了应用端对 ChatGPT/Codex 的检测方式。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp 发布 b11118:新增 hex-dma 直接映射 DMA 缓存

llama.cpp 发布 b11118 版本,核心变更是引入 hex-dma 直接映射 DMA 缓存,用于更好地处理 HVX 上的 flash attention 掩码(FA mask)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

VieNeu-TTS v3 Turbo:48kHz 越南语 TTS 与实时流式 API

作者 Phạm Nguyễn Ngọc Bảo 发布越南语 TTS 模型 VieNeu-TTS v3 Turbo,支持 48kHz 高保真语音、23 种预设音色、即时声音克隆、情感控制和英越双语切换。配套 vieneu Python SDK v3.7.1 提供免 PyTorch 的 CPU/ONNX 路径,并在 CUDA 上通过连续批处理实现单张 RTX 3

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

LeCun ECCV 2026 演讲:预测像素是伪命题,押注 JEPA 世界模型

图灵奖得主 Yann LeCun 在 ECCV 2026 发表 Keynote 演讲,主张仅靠语言和 token 训练无法让 AI 达到人类水平智能,也无法跨越物理世界门槛。他批评当前视频生成路线「预测像素」是伪命题,力推 JEPA 联合嵌入预测架构,在抽象表征空间预测未来并规划动作。LeCun 还透露约一个月前创立了 Advanced Machine In

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp b11117:HIP 后端用 SWAR 优化 IQ2/IQ3

llama.cpp 发布 b11117 版本,主要变更是针对 HIP 后端优化 IQ2/IQ3 量化格式,使用 SWAR(寄存器内并行)技术以位操作实现 vsub4 和 vcmpne4 指令。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布1

Claude Opus 5.5、GPT-6 Sol/Luna 发布与新一轮价格战

Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna。GPT-6 Sol 和 Luna 价格仅为 GPT-5.6 同级模型的一半,GPT-6 Luna 输入/输出定价低至 $0.10/$0.50 每百万 token;Claude Opus 5.5 相比 Opus 5.0 降价

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

slashreboot 发布 Athena-Class Model A 实验模型

slashreboot 在 Hugging Face 发布实验性研究模型 Athena-Class Model A,基于 Gemma 4 31B Instruct 进行 LoRA 微调并合并量化为 Q8 0。该模型主打持久身份、长上下文一致性与无需系统提示的自主智能体行为,在 AIME 2026 上取得 93.33%(Consensus@4)、GPQA Di

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

Qwen3.8-27B MTPLX 优化速度 FP16 版发布

Hugging Face 上发布了 Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed-FP16,这是 Qwen3.8-27B 的 MLX 量化包,面向 M1/M2 Mac 的 FP16 版本,权重与父版本逐字节一致,仅将浮点张量以 fp16 存储。该版本基于 MTPLX 实现原生多 token 预测投机解码,官方称速度可

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

Qwen3.8-27B MTPLX 8位量化优化质量版发布

Hugging Face 用户 Youssofal 发布了 Qwen3.8-27B-MTPLX-Optimized-Quality,这是基于 Qwen/Qwen3.8-27B 的 8 位动态量化 MLX 模型包,面向 Apple Silicon Mac 本地运行。该版本保留原生多 token 预测(MTP)投机解码头,在 M5 Max 上实测约 48 tok

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

Qwen3.8-Flash-Next 的 MTPLX 4-bit 量化版发布

Hugging Face 用户 Youssofal 发布了 Qwen3.8-Flash-Next 的 MTPLX 量化版本 Bare Speed,基于 Qwen 125B-A6B Flash-Next 预览模型,采用统一 4-bit 量化并保留 16-bit 关键组件,通过 MTPLX 在 Apple Silicon 上实现原生多 token 预测投机解码。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp b11115 发布:OpenCL 新增 A8 Q4 K dp4a 二值化内核

llama.cpp 发布 b11115 版本,主要变更为在 OpenCL 后端新增 A8 Q4 K 非 MoE 的 dp4a 二值化 GEMM 内核 kernel gemm noshuffle q4 k q8 1 dp4a ila a8 bin,并重命名了二值化内核选择辅助函数。该版本同时提供覆盖 macOS、iOS、Linux、Android、Window

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp b11114:修复 server 路由驱逐竞态

llama.cpp 发布 b11114 版本,主要修复了 server 端路由驱逐(eviction)与现有队列之间的竞态问题。改动包括:所有模型加载都经过队列,使队列条目在等待者离开前保护模型不被 tick() 驱逐;同时不再将请求放入正在停止的模型,而是让其加入队列由下一个实例处理。该版本还提供了 macOS、Linux、Windows、Android