llama.cpp b10676 修复多批次卷积转置问题
llama.cpp 发布 b10676 版本,修复了 conv transpose 2d 在 CPU 和 Metal 后端中多批次处理的问题,确保所有批次正确计算。该修复解决了多批次输出为零的 bug,并增加了测试用例。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10676 版本,修复了 conv transpose 2d 在 CPU 和 Metal 后端中多批次处理的问题,确保所有批次正确计算。该修复解决了多批次输出为零的 bug,并增加了测试用例。
据路透社报道,Anthropic曾商讨以约70亿美元收购AI芯片初创企业MatX,但最终放弃收购,转为合作关系磋商。Anthropic正扩大内部芯片团队,招募多位业界大牛,以加速定制硬件研发,降低对英伟达芯片的依赖,并计划在2028年实现2000亿美元营收,目标估值达2万亿美元。
NVIDIA 发布了 TensorRT Model Connect,这是一个开源参考实现集合,旨在简化开放模型在 TensorRT 上的部署。用户可以通过两条命令将 Hugging Face 模型转换为原生 C++ 推理应用,无需深入编译器知识。该项目提供语义级和模块级 API,支持自定义 GPU 内核集成,并利用 AI 原生开发流程和夜间发布保持与开放模型
迪卡侬在AWS上使用Chronos-2进行大规模需求预测,以支持其全球供应链运营。通过严格的基准测试,Chronos-2在零样本和微调配置下均优于其他时间序列基础模型,且微调后误差进一步降低。该解决方案降低了运营复杂性,提高了预测准确性,并计划扩展到更多地区。
Salesforce 在构建 Agentforce 时,面临 Amazon SageMaker AI 推理组件(IC)默认放置策略无法满足多可用区(Multi-AZ)高可用合规要求的问题。AWS 通过新增 SchedulingConfig 参数(含 AvailabilityZoneBalance 和 PlacementStrategy)实现了 IC 副本跨
llama.cpp 发布 b10675 版本,主要更新为 Vulkan 后端新增对 shader 中行 ID 和专家计数的提升支持,优化了 MoE 模型的推理性能。该版本提供了多平台预编译二进制,包括 macOS、Linux、Windows、Android 等。
Hugging Face 博客文章解释了现代LLM中的“engram”概念,即通过哈希多个token序列来创建额外嵌入,以缓解感知机学习局部序列信息的负担。文章指出engram本质上是嵌入,但通过哈希n-gram序列实现条件记忆,并讨论了哈希冲突、置信门控等技术细节。该方法由DeepSeek和美团等提出,旨在提升模型对常见序列的记忆能力,同时保留注意力机制处
llama.cpp 发布 b10673 版本,为 Apple M4 芯片添加了 fa-vec 调优记录,支持 F16、Q4 0、Q4 1、Q5 0、Q5 1 和 Q8 0 等量化格式,以优化 M4 上的推理性能。该版本同时提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CU
llama.cpp 发布 b10672 版本,主要更新 OpenVINO 后端至 2026.3.1,新增对 whisper.cpp 的支持,并优化 Qwen3.5 在 NPU 上的运行。该版本还引入了新的算子支持(如 RELU、POOL 2D 等),并修复了静态形状和分块预填充等问题。
Langfuse 发布 v4.24.0 版本,主要修复了 AI 功能中默认提供商的配置问题,现在必须显式设置 LANGFUSE AI PROVIDER 而非默认使用 Bedrock。同时修复了计费系统中 Stripe webhook 组织查找失败的日志级别问题,并清理了 Web 端的 UI 渲染和注释抽屉组件。
llama.cpp 发布 b10670 版本,主要更新为在 Intel Xe2 (BMG) 架构上使用 TILE 指令集进行量化 KV 解码,其他架构仍使用 VEC。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 和 SYCL。
llama.cpp 发布 b10668 版本,主要新增了对 Apple M3 Max、M5 和 M5 Pro 芯片的 Metal 后端 fa-vec 调优记录,以提升这些 GPU 上的推理性能。该调优由社区贡献,并借助 Qwen3.8-27B 模型辅助生成。同时发布了适用于多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件
llama.cpp 发布 b10667 版本,为 Apple M4 Pro 芯片添加了 fa-vec 调优支持,提升了 Metal 后端性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并包含 UI 组件。
Mastra 发布 1.63.0 版本,引入新的日志适配器契约,实现 trace 关联日志,并集成 Pino,改善日志与追踪的链接可靠性。部署器新增 worker 健康检查端点,调度器和恢复机制得到增强,修复了多个问题。同时包含破坏性变更,清理了 playground-ui 的 DataList API。
英伟达GTC上黄仁勋展示独立CPU机柜,引发中国投资人重新关注CPU市场。Agent推理需求推动CPU需求与价格上升,未来五年被视为国内CPU公司关键窗口期。Arm路线公司率先受益,RISC-V面临生态挑战,x86、Arm、RISC-V三路线竞争加剧,最终比拼系统能力。
Meta 发布了其首款用于训练排序和推荐模型的自研加速器 MTIA 300,该芯片将网络和集合通信直接集成到芯片中,以解决推荐模型训练中通信开销大的问题。MTIA 300 包含两个网络 chiplet,提供 1.2 TB/s 的总 I/O 带宽,并配备 16 个专用消息引擎,使通信与计算并行,性能损耗低于 0.5%。Meta 还扩展了与博通的合作,计划未来两
OpenAI 公布自研推理芯片 Jalapeño 的跑分数据,显示其在 Token 吞吐、延迟和能效上较现有方案有显著提升,引发与 NVIDIA Rubin 的对比讨论。同时,NVIDIA 将 Groq 3 LPU 引入推理系统,Google 推出训练和推理分离的 TPU 8t/8i,三家公司在推理硬件路线上出现分化。文章分析指出,推理负载中 Decode
OpenAI CEO 奥特曼在播客中表示,Sora 因算力消耗巨大而优先级低于 Codex,资源向后者倾斜。文章分析认为,Sora 的算力集中在连续的视频生成路径中,难以复用,而 Codex 的 Agent 工作流可将算力碎片化,通过缓存、批处理和调度优化提高 GPU 利用率。这种架构差异导致两者扩张速度不同。
llama.cpp 发布 b10666 版本,主要改进了测试基础设施,新增 test-save-load-state 的 --models 模式,可跨所有架构运行完整的保存/加载测试套件。修复了多个架构的测试问题,包括 deepseek4、gemma2、gpt-oss、lfm2、minimax-01 等,并优化了 on-device seq-copy 的 c
2026奇点智能技术大会北京站将于11月20-21日举行,由奇点智能研究院与CSDN联合主办。大会汇聚70余位技术专家,围绕18个前沿主题,涵盖大模型、AI原生软件研发、C++及系统软件等方向。OpenAI资深研究科学家、Transformer联合作者Łukasz Kaiser已确认发表主题演讲。