Together AI 完成 8 亿美元 C 轮融资,推动开源 AI 普及
Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Salesforce Ventures 等,并额外获得超过 500 兆瓦计算能力承诺。该公司提供开源 AI 全栈平台,客户包括 Cognition、Cursor 等,其平台通过优化推理栈帮助客户降低 6 至 20 倍成本。CEO 表示将继续推动开源 AI 的普及和高效推理。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1730 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Together AI 宣布完成 8 亿美元 C 轮融资,投资方包括 NVIDIA、Salesforce Ventures 等,并额外获得超过 500 兆瓦计算能力承诺。该公司提供开源 AI 全栈平台,客户包括 Cognition、Cursor 等,其平台通过优化推理栈帮助客户降低 6 至 20 倍成本。CEO 表示将继续推动开源 AI 的普及和高效推理。
Groq 宣布在 GroqCloud 上提供 OpenAI 最新开源安全模型 GPT-OSS-Safeguard-20B 的即时访问,该模型基于 GPT-OSS-20B 微调,专为安全分类任务设计,支持自带策略、可配置推理努力、完整推理轨迹和提示缓存,运行速度超过 1000 tokens/秒,定价与基础模型相同。该模型旨在提供可解释的分类器而非原始分数,便于
Groq 被 2025 年 Gartner AI 基础设施酷供应商报告认可,其 LPU 芯片相比 GPU 提供更快、更低成本的推理性能,且性能随规模线性扩展。超过 250 万开发者使用 GroqCloud,该平台支持低延迟推理,适合实时 AI 应用。Gartner 分析师强调其确定性执行模型,确保生产环境性能可预测。
Groq 博客发文主张美国应通过灵活的出口政策推动 AI 基础设施出口,强调推理算力是未来竞争的关键。文章引用数据称 AI 相关投资已占美国 GDP 增长的 40%,并呼吁采用多元化的出口框架(如联盟或市场模式)以保持创新优势。
Groq 宣布扩大其 GroqCloud 全球基础设施,以应对高性能 AI 推理需求的激增。作为扩张的一部分,Groq 与 Equinix 合作在英国推出了新的数据中心,为欧洲开发者提供低延迟、确定性的推理服务。GroqCloud 开发者数量已超过 350 万,生产流量持续增长。该扩张旨在支持实时 AI 应用,并改善总拥有成本。
GroqCloud宣布Canopy Labs的Orpheus TTS模型新版本上线,包括改进的沙特阿拉伯语模型,新增Abdullah和Aisha两个声音,并作为PlayAI-TTS的替代品。该模型提供低延迟、字符计费,支持英语和沙特阿拉伯语,适用于语音代理、客户支持等场景。
Groq 在 GroqCloud 上预览了 Moonshot 的 Kimi K2 模型,并解释了其 LPU 架构如何通过 TruePoint 数值格式、SRAM 存储和静态调度等技术,在不损失精度的情况下实现万亿参数模型的快速推理。该架构通过选择性降低精度和优化内存层次,实现了比传统 GPU 更高的推理速度和更低的延迟。
Cohere 发布了开源自动语音识别模型 Transcribe,基于 Conformer 架构,支持 14 种语言,在 HuggingFace Open ASR 排行榜上以 5.42% 的平均词错误率排名第一,超越 Whisper Large v3 等模型。该模型注重生产就绪性,提供高效推理和多种部署方式,并计划与 Cohere 的代理编排平台 North
xAI 于 2026 年 7 月 22 日发布其最智能的模型 Grok 4.5,现已登陆 grok.com、X、iOS 和 Android 平台。该模型在理解用户意图、长对话跟踪和回答可靠性方面有所提升,并能高效推理,更快给出答案。Grok 4.5 还能端到端完成任务,如构建电子表格、生成幻灯片和图表、起草文本以及从长 PDF 中提取要点。此外,Grok 通
Mistral AI 宣布其 Studio 平台为提示词和技能提供集中式记录系统,支持版本管理、所有权追踪和审计日志,使企业能够快速迭代并受控部署 AI 行为。该功能将提示词视为生产资产,通过不可变版本、清晰所有权和审计日志确保合规性,并集成可观测性以追踪生产输出到具体版本。
Mistral AI 发布了 Voxtral TTS,一个 4B 参数的多语言文本转语音模型,支持 9 种语言,具有低延迟和情感表达。该模型可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元,并支持零样本跨语言语音适应。
Hugging Face 博客发布了多篇新文章,涵盖模型发布、技术教程和行业观点。其中重点介绍了 Kimi K3 模型,该模型拥有 2.8T 参数,采用 MXFP4 量化,并开放权重,对社区具有重要意义。其他文章涉及多语言检索模型、设备端视觉语言模型、物理 AI 模拟、FLUX 3 多模态模型、AI 预测模型开源、KV 缓存优化、RAG 幻觉预防等。
Hugging Face 宣布升级 vLLM 的 transformers 建模后端,通过 torch.fx 静态分析和 AST 源码重写,动态应用推理层融合,使 transformers 模型在 vLLM 中达到或超过原生实现的吞吐。在 Qwen3 系列(4B、32B、235B MoE)上验证了性能,用户只需添加 --model-impl transfor
Hugging Face 博客发布 PyTorch 性能分析系列第三部分,聚焦注意力机制的剖析。文章通过对比朴素注意力、原地操作和 SDPA 等实现,展示了如何利用 profiler 识别性能瓶颈,并指出将 masked fill 替换为原地版本可消除多余的内存拷贝内核,从而提升效率。
Thinking Machines Lab 发布了开源多模态模型 Inkling 及其小型版本 Inkling-Small。Inkling 拥有约 1 万亿参数,支持文本、图像和音频输入,具备 1M 上下文窗口和智能体能力,并已在 Hugging Face 上提供,支持 transformers、SGLang、vLLM 和 llama.cpp 等推理引擎。该
另有 1 家信源报道
Hugging Face 博客文章指出,模型路由并非简单的分类问题,而是系统优化问题。作者通过 AppWorld 测试发现,GPT-4.1 的实际成本高于 Claude Sonnet 4.6,原因是缓存读取定价差异。文章强调路由需综合考虑成本、质量、延迟、合规等因素,并介绍了其优化路由器的成本-精度前沿结果。
OpenAI 在2026年7月发布GPT-5.6模型系列,包括Sol、Terra和Luna,并大幅降低Luna和Terra的价格。同时推出API快速模式、官方Terraform提供商、GPT Transcribe和GPT Live Transcribe转录模型,以及组织级硬性支出限制。此外,还发布了GPT-Realtime-2.1及mini版本,改进实时推理
Meta 超级智能实验室发布了 Muse Image 并预览了 Muse Video,这是其首批媒体生成模型。Muse Image 具备智能体能力,能使用搜索和编码工具、自我优化,并支持多参考图像合成,已在 Meta AI 应用、meta.ai 等平台上线。Muse Video 提供高保真视频生成和原生音频支持,即将面向创作者推出。模型在 Arena 基准上
Moonshot AI 于 2026 年 7 月 16 日发布 Kimi K3,这是首个达到 2.8 万亿参数的开源模型,采用 MoE 架构和 MXFP4 量化,支持 100 万 token 上下文及原生视觉。模型在多个基准测试中表现优异,尤其在编码任务上领先。开源权重计划于 7 月 27 日发布,将推动社区研究和部署。
Anthropic 发布了 Claude Opus 5,这是 Opus 系列的新一代模型,在编码、知识工作和智能体任务上表现优异,接近 Fable 5 的智能水平但价格减半。该模型在多个基准测试中创下新纪录,如 Frontier-Bench 和 GDPval-AA,并在成本效率上优于前代 Opus 4.8。早期客户反馈显示其在调试、自动化工作流和科学分析中表