返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1732 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

6月19日周四 · 1 条
正文结构化主题已通过公开置信门槛
Text Generation Inference Releases一手来源产品发布

TGI v3.3.4 发布:修复 Neuron 并支持 Gemma3

Text Generation Inference 发布 v3.3.4 版本,修复了 Neuron 模型导出时 batch size 为 1 的问题,并增加了对 Gaudi 上 Gemma3 文本和 VLM 模型的初步支持。该版本还包含其他后端修复。

6月16日周一 · 1 条
正文结构化主题已通过公开置信门槛
DeepSeek Harness Repository Activity一手来源模型发布

DeepSeek-V3 发布:高效 MoE 模型,性能比肩闭源

DeepSeek 发布了 DeepSeek-V3,这是一个拥有 6710 亿总参数、每个 token 激活 370 亿参数的混合专家(MoE)语言模型。该模型采用无辅助损失负载均衡策略和多 token 预测训练目标,在 14.8 万亿 token 上预训练,仅需 278.8 万 H800 GPU 小时,性能超越其他开源模型,并可与领先闭源模型媲美。训练过程稳

6月5日周四 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini 2.5 Pro 新预览版发布,支持自适应思考

Google 发布了 Gemini 2.5 Pro 的新预览版 gemini-2.5-pro-preview-06-05,该版本引入了自适应思考能力。旧版本 gemini-2.5-pro-preview-05-06 将于 2025 年 6 月 26 日重定向到 gemini-2.5-pro。

5月30日周五 · 1 条
正文结构化主题已通过公开置信门槛
Text Generation Inference Releases一手来源产品发布

TGI v3.3.2 发布:新增 Qwen3 支持并修复 Gaudi 问题

Text Generation Inference 发布 v3.3.2 版本,主要改进包括升级 vllm 扩展操作、切换到 hf-nix、新增 Qwen3 支持、fp8 compressed tensors w8a8 支持,并修复了 Llama-4-Scout 和 Llama-4-Maverick 在 Gaudi 上的 OOM 和崩溃问题。

5月22日周四 · 1 条
正文结构化主题已通过公开置信门槛
Text Generation Inference Releases一手来源产品发布

TGI v3.3.1 发布:升级 Torch 2.7 并支持 Llama4 与 DeepSeek R1

Hugging Face 发布了文本生成推理库 TGI 的 v3.3.1 版本,主要更新包括升级到 Torch 2.7 和 CUDA 12.8,并针对 HPU 后端优化了预热逻辑,支持 Llama4 和 DeepSeek R1 模型,同时修复了 GPU UUID 计数和默认注意力路径崩溃等问题。

5月1日周四 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

为什么我们要思考:测试时计算与思维链的进展

Lil'Log 发布文章《Why We Think》,回顾了测试时计算和思维链(CoT)在提升模型性能方面的最新进展。文章从人类双过程理论出发,将慢思考类比为测试时计算,并探讨了通过并行采样和顺序修正等解码策略来优化模型输出的方法。文章还提到了强化学习在提升 CoT 推理能力中的应用,并引用了 o1、o3 和 R1 等模型的技术报告。

4月14日周一 · 1 条
正文结构化主题已通过公开置信门槛
GLM New Releases一手来源模型发布

智谱AI发布5款新模型:GLM-4-Air和GLM-Z1系列

智谱AI于2025年4月14日发布多个新模型,包括两个基座模型GLM-4-Air-250414和GLM-4-Flash-250414,以及三个推理模型GLM-Z1-AirX、GLM-Z1-Air和GLM-Z1-Flash。其中GLM-4-Air性能比肩GPT-4o和DeepSeek-V3-0324,GLM-Z1-AirX速度最快可达200 tokens/秒,

12月19日周四 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

谷歌发布Gemini 2.0 Flash Thinking Mode公开预览版

谷歌于2024年12月19日发布Gemini 2.0 Flash Thinking Mode公开预览版。该模式是一种测试时计算模型,允许用户查看模型的思考过程,并生成具有更强推理能力的响应。

12月11日周三 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

谷歌发布 Gemini 2.0 Flash 实验版,速度翻倍并支持多模态

谷歌发布了 Gemini 2.0 Flash 实验版,该模型速度是 Gemini 1.5 Pro 的两倍,支持双向流式传输、多模态响应生成(文本、图像和语音)以及内置工具使用(如代码执行、搜索和函数调用)。此次发布标志着 Gemini 系列在性能和功能上的重大升级。

7月25日周四 · 1 条
正文结构化主题已通过公开置信门槛
Chip Huyen Blog观点

构建生成式 AI 平台:通用架构与关键组件解析

Chip Huyen 在博客中概述了构建生成式 AI 平台的通用架构,从最简单的查询-模型响应开始,逐步添加上下文增强(如 RAG)、护栏、模型路由、缓存等组件,并强调可观测性和编排的重要性。文章指出上下文构建类似于经典机器学习中的特征工程,RAG 是常见的上下文增强模式,并介绍了基于术语和基于嵌入的检索方法。该架构旨在帮助企业高效部署生成式 AI 应用,提

1月16日周二 · 1 条
正文结构化主题已通过公开置信门槛
Chip Huyen Blog教程

生成配置详解:温度、top-k、top-p 与测试时计算

Chip Huyen 在其博客中深入探讨了 AI 模型的生成配置,包括温度、top-k、top-p 以及测试时计算。文章解释了模型生成文本的概率性采样过程,以及如何通过调整温度等参数来平衡创造性与一致性。此外,文章还讨论了增加推理计算量(如多次采样)对提升模型性能的作用,并提及了结构化输出的方法。

3月7日周一 · 1 条
正文结构化主题已通过公开置信门槛
Jay Alammar观点

Cohere大规模语言模型的实际应用

Jay Alammar加入Cohere团队近一年,该公司训练大规模语言模型(GPT和BERT类)并通过API提供,支持微调。他撰写了多篇文章,介绍如何应用这些模型解决实际问题,包括提示工程、语义搜索、微调等。这些内容旨在帮助开发者和企业更好地使用大规模语言模型。