LiteLLM v1.97.0-dev.1 发布:Docker 镜像签名验证及多项功能更新
LiteLLM 发布了 v1.97.0-dev.1 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。更新内容涵盖多项功能改进和修复,包括支持 Cursor 模型名称后缀、团队回调日志修复、JWT 认证用户邮箱回填、Playground 非流式响应切换、MCP 服务器组件重命名、Rubrik 护栏
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1726 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
LiteLLM 发布了 v1.97.0-dev.1 版本,该版本的所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。更新内容涵盖多项功能改进和修复,包括支持 Cursor 模型名称后缀、团队回调日志修复、JWT 认证用户邮箱回填、Playground 非流式响应切换、MCP 服务器组件重命名、Rubrik 护栏
PydanticAI 发布 v2.24.0 版本,主要包含多项 bug 修复,涉及 Google、Bedrock、OpenRouter、Groq 等提供商,以及 AG-UI 协议兼容性改进。修复了 Google 提供商超时参数、Bedrock 流处理、Kimi 推理模型识别等问题,并新增了对 Groq 复合模型名称的支持。
Latent Space 的 AINews 报道了关于 Megakernels 的讨论,认为其因复杂性和硬件变化而失去优势,但 Cursor 开源了 Megakernel 并宣称提升 41% 吞吐量。同时,Qwen 发布 Qwen3.8-Max,NVIDIA 和 Mistral 推出 Alpamayo 2 Super 和 Shieldstral,Pokee-
llama.cpp 发布 b10276 版本,主要变更是在构建过程中优先使用 npm ci 而非 npm install 以增强安全性。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10275 版本,主要修复了内置工具中 Windows OEM 输出解码为 UTF-8 的问题,确保子进程输出在 JSON 层正确显示,避免字符丢失。该版本提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。
llama.cpp 发布 b10274 版本,主要修复了短输入时重复空音频块的问题。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Anthropic 报告其多个模型出现错误率升高的问题,影响用户登录 Claude.ai 和通过 oAuth 登录 Claude Code,以及部分模型请求报错。目前问题已解决,团队正在密切监控以防再次发生。
SpaceX 的 AI 收入同比增长超过三倍,达到 26 亿美元,主要来自向 Anthropic 和 Google 等公司提供算力的交易。尽管 AI 部门本季度亏损 15 亿美元,但整体亏损收窄至 1.43 亿美元。公司资本支出达 183.7 亿美元,主要用于建设 AI 算力,同时 Starship 的开发推高了太空部门成本。马斯克表示 SpaceX 正在以
llama.cpp 发布 b10273 版本,主要更新是移除了基于历史采样器中的“全上下文窗口”功能,将默认上下文长度从 -1 解析为 1024 而非完整上下文长度,并为历史采样器设置共享默认值 64。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 CUDA、Vulkan、ROCm 等。
AtomicChat 发布了 DeepSeek-V4-Flash-0731 的 GGUF 量化版本,该模型为 284B 参数的 MoE 模型,已进行量化感知训练,专家权重以 MXFP4 存储。文章提供了详细的量化质量对比表,显示在相同大小下其量化版本优于 unsloth 的版本,并警告 GGUF 文件中的聊天模板已过时,需手动替换以避免推理能力下降。
Ollama 发布 v0.32.6 版本,主要改进包括:在 Apple GPU 上通过 MLX 引擎自动使用 MTP 头进行推测解码,提升 Qwen3.5 性能;优化 OpenAI 兼容 API 的流式响应格式,使其更符合官方规范;修复了截断响应的 finish reason 报告问题;为云模型提供 kimi-k3:cloud 标签;修复 TUI 多个问题;
AWS 在纽约峰会上宣布 Amazon Bedrock 上的 Web Search 功能正式可用,该功能通过内置的服务器端工具,将模型响应基于最新的网络知识进行 grounding,无需第三方供应商或外部 API。它采用多源 grounding 方法,结合亚马逊运营的网络索引和知识图谱,提供上下文高效的检索和单参数启用,并支持企业级合规(零数据出口)。开发者
realrebelai 在 Hugging Face 上发布了 MiniMax-H3 模型的 GGUF 量化版本,支持文本到视频生成,并提供了 ComfyUI 的目录结构。该模型基于 Comfy-Org/MiniMax-H3,包含 UNet、文本编码器和 VAE 组件,用户需从 Comfy-Org 获取 VAE 文件。发布者声称已获得 MiniMax 的许可
llama.cpp 发布 b10270 版本,主要新增对 Qwen3-TTS 的支持,包括文本模型、编码器、说话人编码器及代码到语音的转换,并重构了 llama-tts 二进制文件。该版本还提供了多种平台和硬件加速的预编译二进制文件。
LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V6-GGUF,该模型通过其自研的 Genesis 算法对张量进行噪声修复,无需重新训练即可提升模型稳定性和输出质量。模型融合了 Hermes 微调数据,支持多语言和视觉任务,并
bartowski 使用 llama.cpp b10173 对 deepseek-ai 的 DeepSeek-V4-Flash-0731 模型进行了量化,发布了 GGUF 格式的 MXFP4 版本,文件大小为 156.38GB。该模型拥有 284B 参数,目前仅提供 MXFP4 格式,其他量化大小可能后续推出。用户可通过 llama.cpp、LM Studi
Groq 博客发布了一篇关于 AI 推理(inference)的科普文章,解释了推理在机器学习中的定义、工作原理、类型及实际应用。文章强调推理是模型部署后对新数据做出预测或生成文本的关键步骤,并指出 Groq 的 LPU 推理技术能以高速度和低成本支持实时应用,如语音识别和智能体工作流。文章还提及 Meta 的 Llama 3.3 70B 模型在质量上接近
Groq 在 GroqCloud 推出一年之际,宣布其开发者社区已突破 100 万人。过去一年中,该平台经历了快速增长,包括 48 小时内收到约 3000 个 API 访问请求,以及通过 GroqChat 提交的约 100 万条提示。公司将继续提供快速 AI 推理解决方案,并扩展其服务,包括 Dev Tier 自助访问、Flex Pricing 和批处理。
Groq 公司发布了其 LPU(语言处理单元)AI 推理技术的详细介绍,该处理器专为运行大型语言模型等 AI 工作负载而设计,相比 GPU 在架构层面能效提升高达 10 倍。LPU 采用软件优先、可编程流水线架构、确定性计算与网络以及片上内存等核心设计原则,旨在提供更快的推理速度和更高的效率。Groq 的 GroqCloud 平台由 LPU 驱动,展示了其在
GroqCloud 推出了批量处理 API,面向开发者和企业级用户,支持在 24 小时内处理大规模非实时 AI 推理工作负载,如数据分类、翻译、文档摘要和图像转文本。该服务提供 25% 的常规折扣,并在 4 月底前将折扣翻倍至 50%。新增支持 Llama 3.3 70B、DeepSeek-R1-Distill-Llama-70B 和 Llama 3.2 9