返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月2日周日 · 20 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10229 发布:修复 OpenCL 引用计数问题

llama.cpp 发布 b10229 版本,主要修复了 OpenCL 后端中 ggml backend opencl init() 未正确递增 ref count 的 bug,该问题会导致程序结束时 profiling 数据无法刷新写入。此版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10228 发布,支持 DeepSeek V4 MTP 与 DSpark

llama.cpp 发布了 b10228 版本,主要更新是支持 DeepSeek V4 的 MTP(多 token 预测)和 DSpark 特性。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并包含 UI 组件。

正文结构化主题已通过公开置信门槛
THE DECODER研究

Meta AI 用第二智能体作为记忆教练,保持长任务不跑偏

Meta AI 研究人员提出了一种双智能体记忆系统,通过一个独立的记忆智能体监控任务进度,并在适当时机向主智能体发送提醒,以解决长任务中的行为状态衰减问题。该系统在 Terminal-Bench 2.0 和 tau2-Bench 基准测试中显著提升了任务完成率,并优于现有记忆系统。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

DAS框架:分布感知投机解码加速RL训练rollout高达50%

Together AI 博客介绍了分布感知投机解码(DAS)框架,用于加速强化学习(RL)后训练中的 rollout 阶段,最高可提速 50% 且不改变模型输出。DAS 通过自适应后缀树草稿模型和长度感知调度策略,解决了长尾生成导致的 GPU 利用率低和同步瓶颈问题。实验表明,在数学推理和代码生成任务上,DAS 分别实现了超过 50% 和约 25% 的 ro

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10227 发布:新增 Qwen3 专用解析器

llama.cpp 发布 b10227 版本,主要新增了 Qwen3 专用解析器,支持带标签的思维工具解析、工具调用省略及 Qwen3-Coder 的注释处理。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等后端。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo

Mistral AI 与 NVIDIA 合作发布了 12B 参数的 Mistral NeMo 模型,支持 128k 上下文窗口,在推理、世界知识和编码方面达到同类最佳水平。该模型采用 Apache 2.0 许可,支持 FP8 推理,并引入新分词器 Tekken,在多语言压缩效率上显著提升。Mistral NeMo 已可通过 HuggingFace、Mistr

正文结构化主题已通过公开置信门槛
xAI News一手来源产品发布

xAI 免费开放 Grok-2 并推出新功能与 API 更新

xAI 宣布将改进后的 Grok-2 模型免费开放给所有 𝕏 平台用户,新模型速度提升三倍,并增强了准确性、指令遵循和多语言能力。同时,xAI 推出了 Grok 按钮、Aurora 图像生成模型等新功能,并更新了企业 API,新增 grok-2-1212 和 grok-2-vision-1212 模型,降低了 API 价格。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10225 发布:优化 MiMo V2 MTP 张量加载

llama.cpp 发布 b10225 版本,主要更新为仅在需要时加载 MiMo V2 MTP 张量,以优化内存使用。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10226 发布:修复 SYCL iGPU 分类

llama.cpp 发布 b10226 版本,主要修复了 SYCL 后端对集成 GPU(iGPU)的分类问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm、OpenVINO 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10224 发布:WebGPU 支持 f16 repeat

llama.cpp 发布 b10224 版本,主要更新为 ggml-webgpu 添加对 f16 repeat 操作的支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

网易有道全线产品接入DeepSeek-V4-Flash正式版

网易有道宣布旗下AI Agent产品矩阵已完成DeepSeek-V4-Flash正式版的全面接入,覆盖LobsterAI、有道词典、有道翻译、Hi Echo等产品。此次升级基于DeepSeek-V4-Flash-0731模型,该模型与预览版结构一致,但通过后训练优化显著提升了Agent能力。升级后,LobsterAI运行更经济,翻译和口语产品功能更精准,Th

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10223 发布:修复 CI 错误并更新多平台构建

llama.cpp 发布 b10223 版本,主要修复了部分 CI 错误。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
xAI News一手来源商业

SpaceXAI 与 Anthropic 达成算力合作,提供 Colossus 1 超级计算机

SpaceXAI 与 Anthropic 签署协议,提供其超级计算机 Colossus 1 的访问权限。Colossus 1 拥有超过 22 万块 NVIDIA GPU,用于 AI 训练和推理。Anthropic 将利用该算力提升 Claude Pro 和 Max 订阅服务,并有意合作开发轨道 AI 计算能力。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源产品发布

Mistral AI 为 Le Chat 推出深度研究与语音等新功能

Mistral AI 为其 AI 助手 Le Chat 推出多项新功能,包括 Deep Research 预览模式、基于 Voxtral 模型的语音模式、由 Magistral 推理模型驱动的多语言推理、Projects 上下文文件夹,以及与 Black Forest Labs 合作的图像编辑功能。这些功能旨在提升用户的深度研究、自然交互和上下文管理体验,用

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源研究

Mistral AI 发布大模型全生命周期环境影响评估,呼吁行业标准化

Mistral AI 发布了其大语言模型的首个全生命周期环境影响评估,与 Carbone 4 和 ADEME 合作完成,并经过同行评审。报告披露了训练 Mistral Large 2 的碳排放、耗水量和资源消耗,以及 Le Chat 每次推理的边际影响。该公司呼吁行业采用标准化环境报告,并提出了减少 AI 环境足迹的杠杆,如提高透明度和优化模型使用。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 推出 Blackwell GPU 集群,训练速度提升90%

Together AI 宣布推出基于 NVIDIA Blackwell 平台的 GPU 集群,并配套优化的 AI 加速软件栈 Together Kernel Collection。该集群在训练 70B 参数模型时速度比 H100 快 90%,达到每节点每秒 15,200 tokens。Together AI 利用 ThunderKittens 框架开发了自定

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 发布自适应投机系统 ATLAS,推理速度大幅提升

Together AI 推出了自适应学习投机系统 ATLAS,这是首个无需手动调优即可自动提升推理性能的投机解码系统。ATLAS 结合静态和自适应投机器,根据实时流量动态调整,在 DeepSeek-V3.1 上达到 500 TPS,在 Kimi-K2 上达到 460 TPS,比标准解码快 2.65 倍。该系统旨在解决静态投机器在多变工作负载下性能下降的问题,

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

FlashAttention-3 发布:利用 Hopper GPU 新特性实现 1.5-2 倍加速

Together AI 发布了 FlashAttention-3,通过利用 Hopper GPU 的异步特性(如 WGMMA、TMA 和 FP8 低精度)来加速注意力计算,相比 FlashAttention-2 在 FP16 下速度提升 1.5-2 倍,达到 740 TFLOPS(H100 理论峰值的 75%),FP8 下接近 1.2 PFLOPS。该技术提

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 成为 MiniMax M3 首选云伙伴,实现高效推理优化

Together AI 宣布成为 MiniMax M3 的首选云合作伙伴,将在其公开发布后托管该开放权重模型。Together AI 的推理和内核团队通过多项优化,如 KV-Block-Major 稀疏注意力内核、MSA 的分页注意力集成等,实现了 81-125% 的吞吐量提升。MiniMax M3 支持 1M 上下文窗口和原生多模态,其稀疏注意力机制显著加

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源商业

Together AI 与 YC 合作推出首个专用 GPU 集群

Together AI 与 Y Combinator 宣布合作,为 YC 投资组合中的 AI 初创公司提供首个专用 GPU 集群,以解决计算资源获取难和成本高的问题。该集群支持短期灵活使用和长期优惠价格,初创公司可通过自助门户直接管理 GPU。目前集群已满负荷运行,双方计划未来扩展集群规模。