存算一体进入产业化时刻,谁在领跑规模化交付?
2026年存算一体技术进入产业化阶段,小米、谦合益邦、东方算芯等公司发布或量产相关芯片,后摩智能M50和知存科技实现规模化落地。行业面临工程化、软件工具链和市场三道门槛,不同技术路线(SRAM、RRAM、3D等)竞争激烈,市场预计2030年达312.5亿美元。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1720 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
2026年存算一体技术进入产业化阶段,小米、谦合益邦、东方算芯等公司发布或量产相关芯片,后摩智能M50和知存科技实现规模化落地。行业面临工程化、软件工具链和市场三道门槛,不同技术路线(SRAM、RRAM、3D等)竞争激烈,市场预计2030年达312.5亿美元。
llama.cpp 发布 b10731 版本,新增对 Qwen4Exp 模型循环状态回滚的支持,以优化 MTP 投机解码性能。该更新通过为每个槽位写入快照,修复了卷积状态恢复问题,使解码速度在代码和散文场景下分别提升至 183 和 144 tok/s,相比之前有显著提升。
llama.cpp 发布 b10730 版本,针对 Qwen4Exp 模型优化了 indexer 头的求和操作,通过切片方式替代转置和 sum rows,减少了内存拷贝和计算量,在 RTX PRO 6000 上提示处理速度从 2170 提升到 2366 t/s,生成速度不受影响。该版本还提供了多平台预编译二进制文件。
Fal 对 Minimax 的 H3 模型进行后训练和推理优化,实现了 35 倍速度提升,突破了实时视频生成的瓶颈,并推出了无限视频流服务。该服务因内容质量低被 Twitch 和 YouTube 下架,但 Fal 自建平台继续运营。文章认为这标志着更快实时视频生成的可能性,对 AI 行业具有前瞻意义。
MoziAI-35B-V3.8 是由中国金融领域意见领袖陈雨墨团队开发的开源多模态 AI 模型,基于 Ornith-1.5-35B-A3B 基础模型,采用 MoE 架构,通过自研 MoziSmartBit 量化压缩至 15.9GB,支持本地部署和免费商用。模型具备动态七维思考框架、Agent LOOP 迭代机制、金融垂直优化和无审查特性,支持多语言、视觉理解
国产GPU企业壁仞科技发布2026年中期业绩,上半年营收12.36亿元,同比增长约1997.6%,亏损大幅收窄76.4%至3.77亿元。公司完成互联网大客户导入,并发布新一代NPO光互连超节点方案,支持FP8/FP4精度,自研BLink 2.0协议。壁仞科技正牵头制定异构混训国家标准,并完成DeepSeek-V4等旗舰大模型适配。
本文提出了一种名为 BaryCache 的训练免费加速方法,用于扩散 Transformer(DiT)的采样过程。该方法利用重心外推器进行逐步特征预测,通过稳定的权重构造和在线解耦技术,在减少内存占用和保持生成质量的同时,实现了高达 3.30 倍的端到端加速。实验在图像和视频生成任务上验证了其有效性。
mlasli 发布了 Qwen3.8-27B-Heretic-Uncensored 模型的 GGUF 量化版本 v2.1.0,该版本通过 abliteration 技术移除安全对齐,并优化了 3-way 评估,在有害集上达到 92% 直接回答率。所有量化版本均保留 MTP 草稿头并固定为 Q8 0,支持 llama.cpp 的推测解码,并提供了各量化级别的烟
Graham Dumpleton 发布了新项目 Wrapture,这是一个 Python 库,扩展了 wrapt 的 monkeypatching 思想,用于同时进行测试和追踪。Wrapture 可以包装任何函数或方法,支持追踪和覆盖返回值,并集成了 OpenTelemetry,提供基于配置的追踪机制。该项目完全由 AI 助手在 Dumpleton 的指导下
Liquid AI 发布了 LFM2.5-VL-3B 的 GGUF 量化版本,这是一个专为边缘 AI 和端侧部署设计的新一代混合模型,支持多语言和图像到文本任务。该模型可通过 llama.cpp 运行,并支持通过命令行加载图像进行对话。此版本旨在提供高质量、高速度和内存效率,为边缘设备上的多模态 AI 应用提供支持。
Liquid AI 发布了 LFM2.5-VL-3B 多模态模型,基于 LFM2.5-2.6B 语言模型和 SigLIP2 NaFlex 视觉编码器,支持文本和图像处理,具备改进的接地、OCR 和高效推理能力。该模型专为端侧部署设计,在 Apple M5 Max 上达到 228 tok/s,在 AMD Ryzen AI Max+ 395 上达到 116 to
llama.cpp 发布 b10729 版本,主要更新是为 Apple M1 Ultra 芯片添加了 fa-vec 调优,以提升 Metal 后端性能。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10728 版本,主要更新为 CUDA 后端中 Flash Attention 的 XOR swizzle 优化,将 K/V 共享内存改为 fp16 瓦片,并修复了 DGX Spark 上的共享内存竞争问题。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。
llama.cpp 发布 b10727 版本,主要更新是为 Metal 后端添加了量化类型的 concat 支持,并提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件。该版本还包含 KleidiAI 和 openEuler 构建的禁用说明,以及相关链接。
Hugging Face 上出现了一个名为 'good and small models' 的模型集合,由用户 flyingfishinwater 发布,旨在为移动设备提供轻量级 AI 模型。该集合包含 Qwen3-4B-Instruct-2507、Qwen3-4B-Thinking-2507 和 GLM Edge 4B Chat 等模型的 GGUF 量化版
Hugging Face 上发布了 Dirk-Qwen3.8-27B-GGUF,这是基于 Qwen3.8-27B 的量化模型,采用 Unsloth Dynamic 3.0 UD 量化,保留了 MTP 头,并集成了 Sharp 聊天模板。该模型通过精简系统提示和默认中等推理强度,减少了输出 token 数量,同时提升了准确率,在 SWE-bench-Live
AWS在Forrester Wave 2025年第四季度AI基础设施解决方案评估中被认定为领导者,在13家供应商中战略类别得分最高。该评估认可了AWS提供灵活、成本高效的AI基础设施,支持从训练到推理的完整工作负载生命周期。AWS提供专有AI芯片(如Inferentia和Trainium)以及NVIDIA GPU实例,强调客户选择和成本效率,避免供应商锁定。
llama.cpp 发布 b10726 版本,主要更新为在 AVX2 指令集下加速 IQ 模型的大批量提示处理,通过引入新的批处理 GEMM 内核和 IQ 面板解码优化,提升了性能。该版本还包含代码重构、NUMA 回退支持及新增测试,并提供了多平台预编译二进制文件。
AWS 发布了一篇博客,介绍如何使用 Amazon Bedrock Managed Knowledge Base 和 AWS CloudFormation 构建可观测的企业级代理检索解决方案。该方案通过 AgentCore 和 AgenticRetrieveStream API 实现多知识库路由与迭代检索,并内置了基于 OpenTelemetry 的观测性和
kingjones777 发布了 Qwen3.8-27B 的 ROCmFP4 量化版本,专为 AMD Strix Halo 平台优化,并捆绑了多 token 预测(MTP)草稿头。该版本在 AMD Ryzen AI Max+ 395 上实现了 30.30 tok/s 的解码速度,是标准 Q4 K M 的 2.83 倍,同时困惑度与 Q4 K M 持平。作者发