Anthropic 多款 Claude 模型错误率升高已解决
Anthropic 报告其多个 Claude 模型(包括 Claude Mythos 5.1、Claude Fable 5.1 和 Claude Opus 5)出现错误率升高的问题,影响范围涉及 claude.ai、Claude API、Claude Code 和 Claude Cowork。团队已定位原因并部署修复,截至 9:16 PT 问题已解决,影响结
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Anthropic 报告其多个 Claude 模型(包括 Claude Mythos 5.1、Claude Fable 5.1 和 Claude Opus 5)出现错误率升高的问题,影响范围涉及 claude.ai、Claude API、Claude Code 和 Claude Cowork。团队已定位原因并部署修复,截至 9:16 PT 问题已解决,影响结
AWS 发布博客,介绍如何在 Amazon ECS 上部署 LiteLLM 网关,将 OpenAI ChatGPT Codex 连接到 Amazon Bedrock,实现集中式企业控制。该方案支持模型认证、路由、预算、速率限制和遥测,并提供了完整的部署步骤和架构说明。文章还讨论了直接访问 Bedrock 与使用网关的适用场景,以及 LiteLLM 作为客户自
在IFA 2026上,NVIDIA联合微软及合作伙伴宣布加速本地AI推理,推出RTX Spark迷你PC,并简化Hermes Agent、OpenClaw和Perplexity Portable Computer等应用的本地模型设置。同时发布了多项模型更新,包括Nemotron 3.5 Lightning、GLM-5.3-Flash、Qwen3.8系列等,并
NVIDIA 发布了 Personal AI Router (PAIR) 的测试版,这是一个虚拟推理路由器,可将本地网络中的多台设备(如 RTX AI PC、DGX Spark 等)组合成动态计算集群,以缓解多智能体工作负载下的 GPU 瓶颈。PAIR 通过代理兼容 Ollama 和 LM Studio 接口,无需修改智能体代码即可将请求路由到可用节点。实测
Nvidia 发布了免费开源软件 PAIR(Personal AI Router),可将家庭中闲置的电脑(如配备 RTX 显卡或 Apple M4 芯片的设备)连接起来,构建个人 AI 数据中心,用于本地 AI 推理和代理工作流。PAIR 通过六位码配对和 mTLS 加密确保安全,支持 Windows、Linux 和 macOS,目前提供测试版。此外,Nvi
software-mansion 在 Hugging Face 上发布了用于 React Native ExecuTorch 库的 LLaMa 3.2 模型仓库,包含 1B 和 3B 版本及其量化版本(.pte 格式),并提供了 QLoRa、SpinQuant 等优化版本。这些模型使用 ExecuTorch v0.6.0 导出,不保证向前兼容,用户需确保运行
Hugging Face 发布了 LFM2.5-Embedding-350M 模型的 React Native ExecuTorch 版本,支持 XNNPACK 和 MLX 两种后端,分别适用于 Android/通用 CPU 和 Apple Silicon GPU。该模型为双向混合架构,输出 1024 维归一化嵌入,使用余弦相似度,并建议在检索时使用 'qu
Hugging Face 上发布了 LFM2.5 模型家族,专为 React Native ExecuTorch 库设计,提供量化后的 .pte 格式文件,可直接在 ExecuTorch 运行时使用。该模型基于 LiquidAI 的 LFM2.5-VL-1.6B,支持图像与文本输入。用户需确保运行时与导出 .pte 文件所用的 ExecuTorch 版本兼容
Hugging Face 用户 quimmedes 发布了 Qwen3.8-Flash-Next 的 MTP(多 token 预测)草稿模型 GGUF 格式,支持推测解码,需配合其 fork 的 cafe-llama.cpp 引擎使用。该模型提供多种量化版本,并给出了详细的构建和运行示例,旨在提升解码速度。
Anthropic 报告 Claude Sonnet 5 出现错误率升高的问题,影响范围包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前问题已解决,团队正在监控结果。
llama.cpp 发布 b10786 版本,主要更新为将 const 传播到预处理类(PR #28310)。该版本提供了适用于 macOS、Linux、Windows、Android 及 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端,并附带了 UI 包。
英伟达确认以129.3亿美元收购AI模型托管平台Hugging Face。Hugging Face拥有300万个模型、100万个应用和50万个数据集,服务超过1800万开发者。英伟达CEO黄仁勋表示,Hugging Face将继续作为开放平台,支持开源和开放权重模型,且不强制使用英伟达计算。此次收购旨在扩大开发者访问,并可能将英伟达的算力与Hugging F
另有 2 家信源报道
llama.cpp 发布 b10785 版本,主要新增 Metal 上的稀疏 Flash Attention 支持,通过索引压缩和单遍扫描优化了预填充阶段的性能,并修复了多行寻址问题。该版本还包含测试用例和性能测试,并提供了多平台二进制下载。
llama.cpp 发布 b10784 版本,主要修复了 Metal 后端中当 ne00=1 时 GLU 操作的调度问题,并禁用了相关的不明确测试。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Meta 发布了 Muse Spark 1.3,这是其五个月内的第四款模型,xhigh 版本现已可用,max 版本处于有限预览阶段。该模型在代理任务上表现提升,但整体仍落后于 Claude Fable 5.1 等顶尖模型。其定价为每个任务 0.55 美元,是同性能级别中最便宜的,且 Meta 表示将推出开放权重版本。
llama.cpp 发布 b10783 版本,主要更新为在 mtmd 模块中多处添加 const 限定符,包括将 mtmd context 标记为 const,以及将 tokenize 函数的输入指针标记为 const,以支持多线程安全调用。该版本同时提供了适用于 macOS、Linux、Windows、Android 等平台的预编译二进制文件。
llama.cpp 发布 b10782 版本,主要修复了多 GPU 场景下 CUDA 图优化被跳过的问题,通过显式设置设备允许每个分片并发流。该版本提供了适用于多种平台和硬件的二进制文件,包括 macOS、Linux、Windows、Android 等。
陈大年复出创立本地模型公司StartLux,推出首款27B参数模型StartLux-V1.0-27B-Preview,在信通院MCP专项测试中综合得分排名第二,仅次于DeepSeek-V4-Pro。该模型可运行于消费级PC,Agent能力接近万亿级云端模型,采用Auto Research后训练技术。StartLux计划年内推出本地智能解决方案,推动本地模型商
Langfuse 发布 v4.28.0 版本,主要新增了评估器(evals)的提示词元数据追踪、专用执行列、告警管理、观察过滤器构建器等功能,并优化了实验表格的搜索和过滤体验。修复了包括 ClickHouse 时间戳处理、S3 上传、Redis 重连抖动等多项问题。该版本还统一了评估器名称字段、重命名了观察 API 中的 providedModelName
llama.cpp 发布 b10781 版本,主要修复了 Vulkan 后端中 FA dequant 路径的启用条件问题,当 ne[3] == 1 时跳过 nb[3] 检查,避免缓存未满时路径未启用。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、Open