DeepSeek-V4-Flash 面向 Strix Halo 的 ROCmFPX 量化 GGUF 发布
Geometric-AI 与 Lucebox 在 Hugging Face 发布了面向 128GB AMD Strix Halo 系统的 DeepSeek-V4-Flash-0731 量化 GGUF 文件,单个 98.29GB 文件在 92 题评测中取得 82/92 分,平均每权重约 2.766 比特。同时还发布了支持图像输入的 DeepSeek-V4-Fl
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Geometric-AI 与 Lucebox 在 Hugging Face 发布了面向 128GB AMD Strix Halo 系统的 DeepSeek-V4-Flash-0731 量化 GGUF 文件,单个 98.29GB 文件在 92 题评测中取得 82/92 分,平均每权重约 2.766 比特。同时还发布了支持图像输入的 DeepSeek-V4-Fl
llama.cpp 发布 b11113 版本,主要变更是 server 不再将日志文件传递给子进程(#29212)。该版本同时提供 macOS/iOS、Linux、Android、Windows、openEuler 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,token 价格较 GPT-5.6 同系列减半,Sol 为每百万输入 2 美元、输出 10 美元,Luna 为输入 0.10 美元、输出 0.50 美元,同时将缓存输入 token 折扣提升至 90%。OpenAI 称降价源于缓存与推理优化,并将新模型定位为对标 Anthropic Claude
另有 1 家信源报道
高通在年度骁龙峰会上发布两款旗舰手机处理器 Snapdragon 8 Elite Gen 6 和 Snapdragon 8 Elite Extreme Gen 6,重点强化端侧 AI 能力。新芯片配备可运行最高 2 亿参数小模型的传感中枢,支持本地个人记录、说话人区分和语音进出式智能体;Extreme 版可在本地运行 300 亿参数的混合专家(MoE)模型。
llama.cpp 发布 b11112 版本,主要更新是 server 端在 function call output 中支持 input image,即函数调用输出可以携带图像输入。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。这一
开发者 abenzerps 在 Hugging Face 发布了 Qwen/Qwen-Image-2.1 的 GGUF 量化版本,提供 Q8 0 至 Q4 0 多种量化文件,并配套打包了 Qwen3VL-8B 文本编码器和 VAE,方便在 ComfyUI 中本地运行文生图。该版本不含内置安全过滤器,作者还表示正在开发完全无审查版本。
llama.cpp 发布 b11111 版本,主要更新为在 Vulkan 后端新增 Intel Xe 闪存注意力(flash attention)优化内核,覆盖 Xe-LPG Plus、Xe2、Xe3 架构,并针对 split k 路径做优化。同时更新主机端代码以支持 Intel split k FA 内核路径选择,修复 A770 Linux 上的算子测试失
llama.cpp 发布 b11110 版本,主要变更为 mtmd 模块新增多项 sanity checks(#29276)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA 12/13、Vulkan、ROCm、SYCL、OpenVINO、OpenCL 等
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 上正式可用。GPT-6 Sol 面向编码、调试、数据分析等复杂任务,GPT-6 Sol 在内部事实性评估中的错误约为 GPT-5.6 Sol 的一半;GPT-6 Luna 面向高并发、可重复的轻量任务,两者 API 定价均显著低于 GPT-5.6 前代。两款
另有 1 家信源报道
OpenAI 发布 GPT-6 系列新成员 Sol 和 Luna,称其在效率与成本上大幅优化,API 价格降至 5.6 系列的一半,并强调事实准确性和代码错误率改善。OpenAI 声称新模型在多项任务上优于 Anthropic 的 Fable 和 Opus,而 Anthropic 在 OpenAI 发布前 90 分钟刚推出 Opus 5.5。新模型已上线 C
在AICC 2026大会上,浪潮信息发布元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,分别面向Agent时代算力的“向上”与“向广”需求。SD200 Ultra以128芯本土AI芯片、3D HyperMesh架构和8TB带宽、64TB内存,实现单机运行2.8万亿参数Kimi K3,Token生成时延首次突破5.85毫秒,并支持10
另有 1 家信源报道
海光信息正式发布海光1000系列CPU,基于C86架构,面向低功耗、嵌入式和端侧算力需求,具备4核8线程、10W典型TDP、-40°C至105°C宽温能力及10年产品生命周期承诺。该产品将海光在数据中心CPU、DCU领域的技术与生态积累延伸至机器人、工业控制、边缘计算等场景,并同步推进嵌入式生态合作。此举标志着国产芯片从数据中心向边缘端侧全场景扩展,增强与国
llama.cpp 发布 b11109 版本,主要修复了 Metal 后端中 mul mm id 的 src1 重缩放逻辑,将其置于 ggml prec 门控之下。同时,ggml-webgpu、CUDA 和 Vulkan 后端在 src1 精度为 F32 时拒绝 MUL MAT ID,并修正了 supports op 的返回值。该版本还提供了覆盖 macOS
Anthropic 的 Claude Opus 5.5 现已在 Amazon Bedrock 和 AWS 上的 Claude Platform 上线,是 Claude 5.5 系列首个模型。该模型面向智能体编程、知识工作和长时任务,据 Anthropic 称比 Opus 5 用更少 token 完成更多工作,且单 token 价格和缓存读取成本更低,从而降低
另有 2 家信源报道
NVIDIA 技术博客介绍其机密计算(Confidential Computing)方案,通过内存加密的机密虚拟机、机密 GPU 和加密 NVLink,让 LLM 推理在可信硬件环境中运行。文章以 DeepSeek-R1-0528-NVFP4 模型在 TensorRT LLM 上的测试为例,说明 CC 开启后输出吞吐保留 96.1%–98.2%,平均 TPO
AWS Machine Learning Blog 介绍了如何用 Strands Evals SDK 和 Amazon Bedrock AgentCore Evaluations 评估具备技能(Skill)的智能体。技能是遵循开放 Agent Skills 标准的模块化指令集,可让智能体按需加载领域流程。文章指出技能组合会带来两类通用指标难以发现的失败:选错
llama.cpp 发布 b11108 版本,主要变更是 ggml 中 IQ1 M 量化格式的构建前缀和(prefix sums)改为每块只计算一次,以优化性能。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO
VIDRAFT 发布零令牌置信度(ZTC)方法,通过读取模型内部隐藏状态而非生成令牌来评估答案可信度,单次前向传播即可输出校准概率,已在 Hugging Face 上线。在 2,018 项共享基准上,ZTC·Darwin-397B 以 0.7394 AUC 登顶,而模型自报置信度仅 0.5000(等同随机猜测)。在 539 项留出集上,读取内部状态比直接询问
Anthropic 于周二发布新模型 Opus 5.5,公司称其在编程和知识工作性能上创下新纪录,并在多项基准上超过更大的 Fable 模型。该模型输出 token 价格从每百万 25 美元降至 20 美元,运行更快、所需算力更低,同时调整了沟通风格,减少术语并前置关键信息。这是 Anthropic CEO Dario Amodei 主张放缓前沿能力推进节奏
英特尔在苏州技术创新与产业生态大会上提出,Agent时代AI计算配比正从CPU与GPU的1:4趋近1:1,CPU需承担更多调度、数据处理与任务编排工作。英特尔介绍了至强处理器的数据预处理加速、KV Cache无损压缩与存储优化方案,并强调与Linux、PyTorch等开源项目及国内软件伙伴的合作。大会还提及端侧CPU、GPU、NPU协同及家庭AI、车载AI、