返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1730 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月2日周日 · 20 条
正文结构化主题已通过公开置信门槛
Together AI Blog一手来源商业

Together AI 完成 8 亿美元 C 轮融资,推动开源 AI 普及

Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Salesforce Ventures 等,并额外获得超过 500 兆瓦计算能力承诺。该公司提供开源 AI 全栈平台,客户包括 Cognition、Cursor 等,其平台通过优化推理栈帮助客户降低 6 至 20 倍成本。CEO 表示将继续推动开源 AI 的普及和高效推理。

正文结构化主题已通过公开置信门槛
Groq Blog一手来源产品发布

Groq 即时支持 OpenAI 开源安全模型 GPT-OSS-Safeguard-20B

Groq 宣布在 GroqCloud 上提供 OpenAI 最新开源安全模型 GPT-OSS-Safeguard-20B 的即时访问,该模型基于 GPT-OSS-20B 微调,专为安全分类任务设计,支持自带策略、可配置推理努力、完整推理轨迹和提示缓存,运行速度超过 1000 tokens/秒,定价与基础模型相同。该模型旨在提供可解释的分类器而非原始分数,便于

正文结构化主题已通过公开置信门槛
Groq Blog一手来源商业

Groq 获 2025 Gartner AI 基础设施酷供应商认可

Groq 被 2025 年 Gartner AI 基础设施酷供应商报告认可,其 LPU 芯片相比 GPU 提供更快、更低成本的推理性能,且性能随规模线性扩展。超过 250 万开发者使用 GroqCloud,该平台支持低延迟推理,适合实时 AI 应用。Gartner 分析师强调其确定性执行模型,确保生产环境性能可预测。

正文结构化主题已通过公开置信门槛
Groq Blog一手来源观点

Groq 呼吁美国采取灵活 AI 出口政策以保持算力优势

Groq 博客发文主张美国应通过灵活的出口政策推动 AI 基础设施出口,强调推理算力是未来竞争的关键。文章引用数据称 AI 相关投资已占美国 GDP 增长的 40%,并呼吁采用多元化的出口框架(如联盟或市场模式)以保持创新优势。

正文结构化主题已通过公开置信门槛
Groq Blog一手来源商业

Groq 扩大 GroqCloud 规模,在英国新建数据中心

Groq 宣布扩大其 GroqCloud 全球基础设施,以应对高性能 AI 推理需求的激增。作为扩张的一部分,Groq 与 Equinix 合作在英国推出了新的数据中心,为欧洲开发者提供低延迟、确定性的推理服务。GroqCloud 开发者数量已超过 350 万,生产流量持续增长。该扩张旨在支持实时 AI 应用,并改善总拥有成本。

正文结构化主题已通过公开置信门槛
Groq Blog一手来源产品发布

GroqCloud上线Orpheus TTS新版本,新增沙特阿拉伯语声音

GroqCloud宣布Canopy Labs的Orpheus TTS模型新版本上线,包括改进的沙特阿拉伯语模型,新增Abdullah和Aisha两个声音,并作为PlayAI-TTS的替代品。该模型提供低延迟、字符计费,支持英语和沙特阿拉伯语,适用于语音代理、客户支持等场景。

正文结构化主题已通过公开置信门槛
Groq Blog一手来源产品发布

Groq 揭秘 LPU 架构:如何无损加速万亿参数模型推理

Groq 在 GroqCloud 上预览了 Moonshot 的 Kimi K2 模型,并解释了其 LPU 架构如何通过 TruePoint 数值格式、SRAM 存储和静态调度等技术,在不损失精度的情况下实现万亿参数模型的快速推理。该架构通过选择性降低精度和优化内存层次,实现了比传统 GPU 更高的推理速度和更低的延迟。

正文结构化主题已通过公开置信门槛
Cohere Blog一手来源模型发布

Cohere 发布开源 ASR 模型 Transcribe,刷新语音识别准确率纪录

Cohere 发布了开源自动语音识别模型 Transcribe,基于 Conformer 架构,支持 14 种语言,在 HuggingFace Open ASR 排行榜上以 5.42% 的平均词错误率排名第一,超越 Whisper Large v3 等模型。该模型注重生产就绪性,提供高效推理和多种部署方式,并计划与 Cohere 的代理编排平台 North

正文结构化主题已通过公开置信门槛
xAI News一手来源模型发布

xAI 发布 Grok 4.5,全面登陆多平台并集成 Office

xAI 于 2026 年 7 月 22 日发布其最智能的模型 Grok 4.5,现已登陆 grok.com、X、iOS 和 Android 平台。该模型在理解用户意图、长对话跟踪和回答可靠性方面有所提升,并能高效推理,更快给出答案。Grok 4.5 还能端到端完成任务,如构建电子表格、生成幻灯片和图表、起草文本以及从长 PDF 中提取要点。此外,Grok 通

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源产品发布

Mistral Studio 为提示词和技能提供集中式记录系统

Mistral AI 宣布其 Studio 平台为提示词和技能提供集中式记录系统,支持版本管理、所有权追踪和审计日志,使企业能够快速迭代并受控部署 AI 行为。该功能将提示词视为生产资产,通过不可变版本、清晰所有权和审计日志确保合规性,并集成可观测性以追踪生产输出到具体版本。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 发布 Voxtral TTS 多语言语音生成模型

Mistral AI 发布了 Voxtral TTS,一个 4B 参数的多语言文本转语音模型,支持 9 种语言,具有低延迟和情感表达。该模型可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元,并支持零样本跨语言语音适应。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

Hugging Face 博客新文章:Kimi K3 等模型发布与技术教程

Hugging Face 博客发布了多篇新文章,涵盖模型发布、技术教程和行业观点。其中重点介绍了 Kimi K3 模型,该模型拥有 2.8T 参数,采用 MXFP4 量化,并开放权重,对社区具有重要意义。其他文章涉及多语言检索模型、设备端视觉语言模型、物理 AI 模拟、FLUX 3 多模态模型、AI 预测模型开源、KV 缓存优化、RAG 幻觉预防等。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

vLLM transformers 后端性能达原生水平,支持一键运行

Hugging Face 宣布升级 vLLM 的 transformers 建模后端,通过 torch.fx 静态分析和 AST 源码重写,动态应用推理层融合,使 transformers 模型在 vLLM 中达到或超过原生实现的吞吐。在 Qwen3 系列(4B、32B、235B MoE)上验证了性能,用户只需添加 --model-impl transfor

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程

PyTorch 性能分析(三):注意力机制剖析

Hugging Face 博客发布 PyTorch 性能分析系列第三部分,聚焦注意力机制的剖析。文章通过对比朴素注意力、原地操作和 SDPA 等实现,展示了如何利用 profiler 识别性能瓶颈,并指出将 masked fill 替换为原地版本可消除多余的内存拷贝内核,从而提升效率。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Thinking Machines 发布开源多模态模型 Inkling 及小型版

Thinking Machines Lab 发布了开源多模态模型 Inkling 及其小型版本 Inkling-Small。Inkling 拥有约 1 万亿参数,支持文本、图像和音频输入,具备 1M 上下文窗口和智能体能力,并已在 Hugging Face 上提供,支持 transformers、SGLang、vLLM 和 llama.cpp 等推理引擎。该

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源观点

模型路由看似简单实则复杂:从分类到系统优化

Hugging Face 博客文章指出,模型路由并非简单的分类问题,而是系统优化问题。作者通过 AppWorld 测试发现,GPT-4.1 的实际成本高于 Claude Sonnet 4.6,原因是缓存读取定价差异。文章强调路由需综合考虑成本、质量、延迟、合规等因素,并介绍了其优化路由器的成本-精度前沿结果。

正文结构化主题已通过公开置信门槛
OpenAI API Changelog一手来源产品发布

OpenAI发布GPT-5.6系列及多项API更新

OpenAI 在2026年7月发布GPT-5.6模型系列,包括Sol、Terra和Luna,并大幅降低Luna和Terra的价格。同时推出API快速模式、官方Terraform提供商、GPT Transcribe和GPT Live Transcribe转录模型,以及组织级硬性支出限制。此外,还发布了GPT-Realtime-2.1及mini版本,改进实时推理

正文结构化主题已通过公开置信门槛
AI at Meta Blog一手来源模型发布

Meta 发布 Muse Image 并预览 Muse Video,具备智能体式图像生成能力

Meta 超级智能实验室发布了 Muse Image 并预览了 Muse Video,这是其首批媒体生成模型。Muse Image 具备智能体能力,能使用搜索和编码工具、自我优化,并支持多参考图像合成,已在 Meta AI 应用、meta.ai 等平台上线。Muse Video 提供高保真视频生成和原生音频支持,即将面向创作者推出。模型在 Arena 基准上

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Kimi K3 模型概览:2.8T 参数与 MXFP4 量化

Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3,这是首个达到 2.8 万亿参数的开源模型,采用 MoE 架构和 MXFP4 量化,支持 100 万 token 上下文及原生视觉。模型在多个基准测试中表现优异,尤其在编码任务上领先。开源权重计划于 7 月 27 日发布,将推动社区研究和部署。

正文结构化主题已通过公开置信门槛
Anthropic Newsroom一手来源模型发布

Anthropic 发布 Claude Opus 5,性能提升且成本减半

Anthropic 发布了 Claude Opus 5,这是 Opus 系列的新一代模型,在编码、知识工作和智能体任务上表现优异,接近 Fable 5 的智能水平但价格减半。该模型在多个基准测试中创下新纪录,如 Frontier-Bench 和 GDPval-AA,并在成本效率上优于前代 Opus 4.8。早期客户反馈显示其在调试、自动化工作流和科学分析中表