Claude Code 2.1.283 更新:新增模型管控与提示审计
Claude Code 发布 2.1.283 版本更新,新增网关提示头、可用/禁用模型管理设置、MCP 与 WebFetch/WebSearch 输出的 OpenTelemetry 追踪,以及 /doctor prompt-audit 审计命令等能力。同时修复了 SDK 会话工具调用丢失、MCP 后台进度通知、插件加载与校验、沙箱与权限对话框等多处问题。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Claude Code 发布 2.1.283 版本更新,新增网关提示头、可用/禁用模型管理设置、MCP 与 WebFetch/WebSearch 输出的 OpenTelemetry 追踪,以及 /doctor prompt-audit 审计命令等能力。同时修复了 SDK 会话工具调用丢失、MCP 后台进度通知、插件加载与校验、沙箱与权限对话框等多处问题。
Prism ML 在 Hugging Face 发布 Bonsai 2 27B 的 GGUF 版本,基于 Qwen3.8-27B 架构,将全部语言权重(嵌入、注意力投影、MLP 投影、LM head)量化为三值 {-1,0,+1},以约 1.72 bits/weight 存储,模型体积约 5.95 GB(PTQ1 0)或 7.21 GB(PQ2 0),相比
llama.cpp 发布 b11189 版本,主要变更是为 OpenCL 后端新增两个二进制 GEMM 内核(kernel gemm noshuffle q5 k f32 32b trans ila a8 bin 和 kernel gemm noshuffle q5 k q8 1 dp4a ila a8 bin),分别覆盖非 dp4a 与 dp4a 的 A8
llama.cpp 发布 b11188 版本,主要修复了旧版 GLSLC 编译器因不支持 cooperativeMatrix API 而导致的 Vulkan 构建问题。改动通过新增 GGML VULKAN COOPMAT GLSLC SUPPORT 宏检查、在创建前过滤不支持的 FA 两阶段内核,并将 Intel FA 着色器指针创建的锁保护移入 CM1 编
llama.cpp 发布 b11185 版本,主要变更是将共享的 Unicode 路径与字符串辅助函数提取到 common 模块(PR #29415),由 Adrien Gallouët 提交。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROC
llama.cpp 发布 b11183 版本,主要变更是将 Metal 后端的 flash attention(fa)kernel 按数据类型拆分为独立库,并附带一处注释小修正。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
华为在全联接大会2026期间正式上市昇腾950超节点,包括面向液冷数据中心的Atlas 950 SuperPoD和面向企业级风冷机房的Atlas 850E,称其为业界最大规模商用超节点。产品通过灵衢高速互联、统一内存编址、自研散热与电源等技术,宣称训练效率提升1.5-1.7倍、推理性能提升2-3倍、时延低于10ms,并已在互联网、金融、医疗等行业落地。昇腾同
llama.cpp 发布 b11182 版本,核心变更是新增 llama prec policy 精度策略并引入模型驱动的 W4A4(4位权重/4位激活)推理路径(PR #24364),由 NVIDIA 工程师 ynankani 提交,Georgi Gerganov 等人参与评审。该改动涉及 ggml CUDA 后端 mmq.cu 的 MXFP4 调度调整,
智元在横琴长隆飞船乐园部署超300台具身机器人,覆盖导览、科普、零售、酒店等七大场景,首期部署后预计整体规模达数千台。同日,第20000台具身机器人远征A3 Ultra下线交付长隆,长隆×智元具身智能文旅联合研究院揭牌,并联合中国移动发布文旅场景大规模5G-A具身智能创新应用。智元称2026年为「具身智能部署态元年」,行业评价指标从本体参数与Demo完成度转
AWS 机器学习博客介绍了一种在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 强化学习训练的架构,声称吞吐量提升 40%。文章指出大规模 RLHF/GRPO 训练面临 rollout 生成与策略训练资源竞争、计算/内存/带宽平衡、以及从节点内 NVLink 到节点间低带宽通信转变三大挑战,其中专家并行(EP)的动态 all-to-a
AWS 博客介绍在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL 进行多模态强化学习训练。方案以 Qwen3-VL-8B 视觉语言模型为策略模型,采用 GRPO 算法训练其走 2D 迷宫,从 VisGym SFT 检查点出发,在固定 64 迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。HyperP
AWS 博客介绍 NarrateAI 在 Amazon Bedrock 上为高管业务评审提供生产级 LLM 质量保障,服务超过 4000 名 AWS 高管。文章详述五种协同技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,实现约 99% 的数值准确率并支持实时流式响应。
AWS 博客介绍如何在 Amazon SageMaker AI 上通过 JumpStart 部署阿里云 Qwen 团队开源的 Qwen3-TTS-12Hz-1.7B-Base 文本转语音模型,实现实时语音克隆。该模型支持 10 种语言和跨语言克隆,仅需几秒参考音频即可复刻说话人音色,无需重新训练。部署采用 vLLM-Omni 容器和全托管实时推理端点,用户可
Hugging Face 博客发布了一篇关于 Jev AI 的实用指南。Jev AI 是 TypeSafe 的旗舰模型和首个 System One 模型,定位为面向软件团队的决策工具,通过「状态 + 类型化问题」的接口返回选项、分数、是/否判断和概率信号,而非生成文本。文章将其与生成式 LLM 对比,说明它适合分类、路由、评分和安全检查等有界决策场景,并介绍
llama.cpp 发布 b11181 版本,主要变更是提高 HIP 版本要求以支持 fp8,避免在 HIP 6.2 中缺少 hip fp8 e4m3 支持的问题。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11180 版本,主要修复了 RPC 后端中 get alloc size 缓存键未包含 nb 参数的问题,并将计算结果下限设为 ggml nbytes。该改动由 Georgi Gerganov 等人提交,旨在提升 RPC 内存分配计算的正确性。同时发布了覆盖 macOS、Linux、Windows、Android 等多平台及 C
Langfuse 发布 v4.46.0 版本,新增实验并排对比、数据集条目格式化 JSON、基础技能管理以及追踪表格 100 行分页选项等功能。同时修复了计费 webhook 时间戳解析、数据保留设置、图表与界面细节等多项问题,并进行了设计系统迁移和数据集读取性能优化。
Perplexity 将核心搜索服务层从 Amazon DynamoDB 迁移到自研的 Rust 分布式键值存储 CobbleDB,以解决向大语言模型提供多 KB 文档批次时的高延迟与高成本问题。新架构将持久化存储与热层检索解耦,使批量读取延迟降低约 5 倍,存储费用至少降低 20%。CobbleDB 由两名系统工程师配合 AI 编码智能体在两个月内完成,公
ggml-org 在 Hugging Face 上发布了小米 MiMo-V2.6-Flash-RL 的 GGUF 量化版本,支持通过 llama.app 运行。该版本提供 MXFP4、Q2 K 等多种量化输出,并附带用于投机解码的 MTP 与 DFlash drafter sidecar,以及面向视觉和音频编码器的 Q8 0 mmproj。模型由 ggml-
美国国家安全局向国会表示,今年将花费数十亿美元测试先进AI模型,其中算力是最大开支,人员薪酬也因需与AI实验室竞争而推高成本。在医疗领域,医院和保险公司利用AI进行账单编码与理赔审查,互相博弈导致护理成本上升,蓝十字蓝盾协会称医院借此两年多收近10亿美元。文章还指出,企业按token计费的模式使大客户算力支出高昂,OpenAI和Anthropic等提供商正通