FuriosaAI 发布 Qwen3-8B-FP8 的 RNGD 可执行包
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-8B-FP8 模型仓库,将 Qwen3-8B-FP8 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LLM 运行。该模型为 8.2B 稠密模型,支持思考/非思考模式切换、工具调
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-8B-FP8 模型仓库,将 Qwen3-8B-FP8 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LLM 运行。该模型为 8.2B 稠密模型,支持思考/非思考模式切换、工具调
Hugging Face 上发布了 gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090,这是基于 Qwen/Qwen3.8-27B 的 NVFP4 量化检查点,使用 NVIDIA Model Optimizer 量化,专为 RTX 5090(Blackwell)优化。该模型在 32GB 显存上支持完整 262,144
Agention 发布了 Qwen3.8-Flash-Next 的 ROCmFP4 量化版 GGUF 模型,该模型可在 128GB 统一内存设备(如 Strix Halo)的 GPU 上完全运行,占用 87.06 GiB,困惑度仅比未量化模型高 2.48%。该量化版本支持视觉和投机解码,并针对长上下文预填充进行了优化,在 128k 上下文下仍保持 138 t
AWS 机器学习博客发布教程,介绍如何在 Amazon SageMaker HyperPod 上使用 vLLM 部署阿里 Qwen 团队开源的 Qwen3.8-2.4T-A95B 模型。该模型总参数 2.4 万亿,激活参数 950 亿,采用混合线性注意力与全注意力架构,原生上下文 262K,支持 NVFP4 量化、推理控制和多 token 预测。文章详细说明
LangChain 发布了 langchain-openai 1.6.2 版本,主要更新包括为 GPT-6 Astra 添加推理努力参数支持,并将 httpx2 依赖从 2.10.0 升级到 2.12.0。该版本修复了与 GPT-6 Astra 相关的问题,提升了库的兼容性和稳定性。
NVIDIA 技术博客介绍了编码-预填充-解码(EPD)分离技术,用于加速多模态模型推理。该技术将视觉编码阶段与 LLM 预填充和解码阶段分离,通过 NVIDIA Dynamo 框架实现独立扩展,在图像密集型提示和短输出场景下,可将首令牌时间(TTFT)提升至 5 倍,端到端响应时间提升至 7 倍。文章还讨论了 EPD 的适用场景和硬件放置选项,并指出在长输
Claude Code 发布 2.1.267 版本更新,新增 maxEffortLevel 设置以限制各提供商的努力级别,并支持 --system-prompt-snapshot off 选项。本次更新修复了多项问题,包括 Cowork 定时任务启动失败、移动端命令输出空白、tmux/ssh 会话中的键盘输入问题、大会话恢复时工具调用丢失、以及提示缓存失效等
AWS 在 2026 年 8 月发布了多项 Amazon Bedrock、AgentCore 和 Strands 更新。Bedrock 现支持 GPT-5.6 系列模型的百万级上下文窗口、提示缓存和跨区域推理,并新增 IAM 成本分配和异常检测。AgentCore 提供长达 14 天的会话运行、时间策略和支付功能,Strands Agent Harness
Hugging Face 上发布了 GAP-models 仓库,用于备份 GAP 参考生成和量化评估所用的本地模型,包含多个模型族和检查点。仓库通过清单和 SHA256 校验确保文件来源和完整性,并记录了候选模型的资格评估结果,评估基于特定 CUDA 构建和硬件环境。文件保留原始模型的许可和归属,不统一替换许可。
llama.cpp 发布 b10883 版本,主要更新 Vulkan 后端,使用 spec constant 优化矩阵乘法 A 类型,并调整了共享内存表以减少类型相关开销。该版本还修复了多个编译器警告和特定 GPU(如 Ampere)的回归问题,并提供了多平台预编译二进制文件。
AWS 发布了 Ray Serve 深度学习容器(DLC),用于替代不再维护的 TorchServe,提供预构建、优化的推理镜像。该容器集成了 PyTorch、Ray Serve、CUDA 等组件,并支持在 Amazon EKS 上部署视觉语言模型(如 Qwen3-VL-2B)。文章详细介绍了部署步骤和架构,旨在简化模型推理的依赖管理和安全补丁更新。
IBM 将其 Granite 时间序列基础模型集成到 Confluent 的数据流平台中,通过 Confluent Cloud 和 Apache Flink 提供原生推理能力,支持实时预测、异常检测等功能。该合作旨在降低时间序列分析的门槛,使领域专家无需数据科学团队即可使用,并已在多个行业验证了显著效益。
llama.cpp 发布 b10881 版本,主要修复了 Vulkan 后端中 FILL 操作在 Intel GPU 上超出 maxComputeWorkGroupCount 限制的问题,通过将工作负载转换为 2D 分布来解决。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
支付公司Ramp对7万家企业的数据显示,8月份企业AI工具采用率仅增长0.4%,且头部1%企业的员工人均AI支出下降近10%至7205美元。Ramp经济学家Ara Kharazian指出,OpenAI和Anthropic的降价使每百万token成本从3月的1.15美元降至0.68美元,但销量增长未能弥补降价影响。这可能对依赖token收入的AI实验室和超大规
llama.cpp 发布 b10878 版本,主要变更是将 llama sampler chain n 的返回类型改为 int32 t,以解决相关问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
llama.cpp 发布 b10877 版本,主要更新为 CUDA 后端针对 RDNA3 架构的 MoE 模型推理优化,通过根据典型专家宽度调整 MMQ 的 N-tiles 大小来提升性能。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
AWS 与高通宣布合作,高通将为 AWS 设计多代定制 AI 推理芯片,并共同开发高达 1.6 Tbps 的光互连技术。作为回报,高通将使用 AWS 的 Bedrock 服务加速其芯片设计流程。这是亚马逊继 Trainium、Graviton 和 Nitro 之后的又一芯片布局,旨在提升 AI 推理能效。高通目标到 2029 年实现 150 亿美元的数据中心
llama.cpp 发布 b10876 版本,主要更新为 CUDA 后端将 GGML FA ALL QUANTS 替换为 GGML FA QUANTS,提供更细粒度的编译控制,并为未编译的组合添加运行时回退与警告。该版本同时提供了面向多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。
llama.cpp 发布 b10875 版本,正式弃用 --mmap、--mlock 和 --dio 命令行参数。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Hugging Face 上发布了越南语语音识别模型 ZipFormer-30M-RNNT-6000h,基于 ZipFormer 架构,仅 30M 参数,在 CPU 上转录 12 秒音频仅需 0.3 秒。该模型在 VLSP 2025 竞赛中获第一名,并在多个基准上优于更大模型。模型采用 RNN-T 损失,训练数据约 6000 小时,支持快速 CPU 推理,适