fraQtl 发布 Gemma-4-E2B 校准量化模型,提升端侧离线性能
fraQtl 发布了基于 Google Gemma-4-E2B-it 的校准感知量化 GGUF 模型,声称在相同文件大小下比社区 Q4 K M 基线更接近原始模型,代码/数学 KLD 降低 36%,通用 KLD 降低 27.2%。该模型专为端侧设备设计,在 iPhone 上实现完全离线运行,支持语音交互、日历操作和代码生成,实测速度达 21.6 tok/s。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
fraQtl 发布了基于 Google Gemma-4-E2B-it 的校准感知量化 GGUF 模型,声称在相同文件大小下比社区 Q4 K M 基线更接近原始模型,代码/数学 KLD 降低 36%,通用 KLD 降低 27.2%。该模型专为端侧设备设计,在 iPhone 上实现完全离线运行,支持语音交互、日历操作和代码生成,实测速度达 21.6 tok/s。
OpenAI 报告其 Sites 部署服务出现错误率升高的问题,目前已确认原因并实施缓解措施,正在监控结果,问题现已解决。
Anthropic 报告其多个 Claude 模型出现性能降级,影响范围包括 claude.ai、Claude API、Claude Code 和 Claude Cowork。问题从 16:11 持续到 18:23 UTC,现已解决,期间团队进行了调查并实施修复。
Amazon Bedrock AgentCore payments 现已正式可用,该服务与 Coinbase 和 Stripe 合作,使代理能够安全自主地进行支付。新功能包括钱包支持、支付编排(支持 x402 和 MPP 协议)、支付限额、可观测性以及付费端点发现。该服务旨在支持企业级生产工作负载,并已应用于 Anchor Browser 等客户场景。
esatapedico 发布了 Qwen3.8-27B-NVFP4-MTP-GGUF,包含八个 GGUF 文件,针对 Blackwell 硬件优化,保留了 NVFP4 密度并内置 MTP 投机解码头。该模型是原生视觉语言模型,支持图像和视频,原生上下文长度 262,144。不同文件在精度和大小上有所区分,以适应不同显存需求。
AI 芯片初创公司 Etched 宣布获得 7 亿美元新融资,估值达 210 亿美元,由量化基金 Jane Street 领投。该公司设计了两款新组件以加速推理过程,包括低电压预填充芯片和集群规模内存互连,承诺提高速度并降低成本。尽管早期曾被认为芯片为特定模型定制,Etched 表示其系统现在可运行任何前沿模型。
SemiAnalysis 的 Jordan Nanos 在演讲中分析了 AI 芯片市场现状,指出超大规模云厂商大幅上调资本支出,但台积电的晶圆产能扩张缓慢,成为关键瓶颈。他介绍了 SemiAnalysis 的 ClusterMAX 和 InferenceX 项目,用于测试云提供商和芯片性能,并强调硬件理解对软件开发的重要性。
inclusionAI 发布了新一代原生混合推理模型 Ling-3.0-flash,总参数 124B,激活参数仅 5.5B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE,在多个基准上匹配或超越前代旗舰模型。该模型针对智能体工作流优化,集成 SGLang HiCache 和 Mooncake 分层缓存,可将长输入场景的首 token 延迟降
根据 Vercel 的数据,Anthropic 的 AI 模型在 AI Gateway 上的支出占 65.1%,但仅占 token 使用量的 30%,其每 token 成本是其他提供商平均水平的 4.4 倍。Anthropic 的 Fable 5 模型在支出中占比迅速升至 13.2%,仅次于 Opus 4.8,且 7 月份使用 Fable 的团队中 90%
llama.cpp 发布了 v0.1.2 版本,主要更新包括同步 ggml 子模块、升级 ggml 版本至 0.20.2、修复 xcframework 构建问题、优化 CUDA 性能(MMVQ nwarps=8)、改进 UI 和文档(如 MCP stdio 服务器说明)、增强 mtmd 图像处理(使用 SHA256 哈希)等。该版本还提供了 nightly
llama.cpp 发布 b10485 版本,主要同步了 ggml 子模块。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 等多种平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台(如 macOS KleidiAI、Ubuntu ROCm、o
inclusionAI 发布了 Ling-3.0-tiny,一个轻量级混合推理 MoE 模型,总参数量 7.9B,每 token 仅激活 1.4B 参数。该模型采用 KDA 与 MLA 交替的混合线性架构,支持可配置的思考模式,并针对本地和边缘部署优化,在 DGX Spark 和 M4 Pro MacBook 上分别达到约 100-105 tokens/s
llama.cpp 发布 b10483 版本,主要修复了 xcframework 构建问题,并清理了 CMake 构建系统,为所有 vendored 库添加了 vendor:: 别名目标,统一了包含路径。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
mradermacher 发布了基于 p-e-w/gemma-4-E2B-it-heretic-ara 的 GGUF 量化版本,提供多种量化类型(如 Q2 K、Q4 K M、Q8 0 等),并附有使用说明和量化质量对比。该模型为 uncensored 和 abliterated 版本,旨在提供无审查的对话体验。
自2026年8月2日起,欧盟《人工智能法案》第50条正式生效,要求通用和生成式AI系统提供商以机器可检测格式标记合成输出。Anthropic、Google、OpenAI和Meta等主要模型提供商已部署统计文本水印和加密元数据标准,但开源社区迅速开发出反制工具,引发猫鼠游戏。统计水印在低熵输出或轻量后处理下存在脆弱性,且开源权重模型面临合规边界。
arXiv 论文提出 Equilibrium Forcing (EqF) 框架,用于无需噪声水平条件的自适应视频生成。EqF 通过均衡速度场和闭环反馈机制,在推理时自适应调整采样,提升视频质量和一致性。实验表明,EqF 在 1.3B 和 5B 参数的 Flow Matching 模型上微调,性能优于标准噪声条件方法。
arXiv 论文提出 BRA-Audit,一种面向 LLM 多智能体系统的预算感知运行时审计框架。它将系统执行建模为动态依赖图,在固定审计预算下优化审计点放置,以最小化未检查暴露,并通过贪心调度优先审计高影响和长期未审计区域。实验表明,该方法在保持审计效果的同时,显著降低 token 消耗,接近无审计的干净基线性能。
arXiv 论文提出 InflationAgent,一种面向智能体 LLM 系统的路由框架,通过量化 token 膨胀(重试导致的真实成本与单次调用成本之比)来优化模型选择。其引入 CoT 分支熵(CBE)作为预执行难度信号,并以语义汇率(SER)为目标进行路由,在 GSM8K 上以更少 token 达到更高准确率,同时验证了失败链转发会显著降低强模型性能。
该论文旨在复现一项关于FLOPs与执行时间关系的研究,以验证其估算公式在新硬件上的适用性。复现结果证实了原始论文的论点,即FLOPs不能直接反映执行时间,但发现新硬件上执行时间存在不稳定性和不连续性,公式往往低估了实际时间。研究还指出了原始研究在复现材料方面的不足,并提供了完整的复现包。
该研究比较了三种超参数优化协议(固定留出法、重洗留出法和5折交叉验证)在深度学习图像分类器中的性能估计误差。在医学影像数据集上,交叉验证在所有评估中均优于留出法,尤其在样本量较小时优势明显;在自然图像数据集上,三种协议差异不大。研究建议在计算资源允许时,小样本医学图像分类应采用基于交叉验证的超参数优化。