llama.cpp b10245 发布:修复 minimax m3 图未使用输入张量
llama.cpp 发布 b10245 版本,主要修复了 minimax m3 图中未使用的输入张量问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10245 版本,主要修复了 minimax m3 图中未使用的输入张量问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
llama.cpp 发布 b10244 版本,主要将 MSA(多头自注意力)逻辑从 llama-kv-cache 迁移到新的 llama-kv-cache-msa 实现中。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
Baseten在完成130亿美元融资后成为AI基础设施领域的独角兽,其团队成员Philip Kiely和Ali Taha在播客中深入探讨了推理工程这一新兴学科。他们讨论了缓存感知路由、预填充与解码分离、量化、投机解码等技术,以及如何通过优化将模型推理速度提升10倍。对话还涉及NVIDIA Dynamo、GPU并行、视频生成的计算瓶颈,以及训练与推理的融合趋势
llama.cpp 发布 b10243 版本,主要更新为仅在“完整”索引器层中分配索引器缓存,以优化内存使用。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持 CUDA、Vulkan、ROCm 等多种后端。
Together AI 发布了 QTIP,一种新的仅权重量化方法,结合 Trellis 编码量化与不连贯处理,在模型质量和推理速度上达到最先进水平。QTIP 在 QuIP# 基础上改进,速度比未量化模型快 3 倍以上,并已发布预量化模型(如 Llama 3.1 405B Instruct)和代码库。该论文将作为 Spotlight 出现在 NeurIPS 2
Together AI 的研究团队提出了一种名为 Minions 的方法,通过让小型端侧模型与云端前沿模型协作,将大量 LLM 工作负载转移到消费设备上,仅本地读取长上下文,从而降低云成本且几乎不损失质量。实验表明,Minions 在保持 97.9% 准确率的同时,成本仅为云端方案的 17.5%。该方法通过分解-执行-聚合循环,解决了小模型长上下文和多步指令
lmcoleman 发布了 ThinkingCap-Qwen3.6-27B 的 ROCmFPX 量化版本,使用 MagicQuant 混合进化搜索,针对 AMD Strix Halo 平台优化。该版本仅支持实验性 llama.cpp 分支,不支持标准 llama.cpp,且包含 MTP 自推测解码功能,可提升生成速度。
Formula 1与AWS合作构建了Data Accelerator解决方案,利用Amazon Bedrock AgentCore上的代理AI,将MarTech数据平台从手动维护转变为自动化管理。该方案将数据源接入时间从6-8周缩短至约40分钟代码生成加数小时部署,并实现了自动化的GDPR分类、异常检测和端到端可观测性。F1的IT总监和数据运营负责人强调了该
llama.cpp 发布 b10242 版本,主要更新为 CUDA 后端新增 penalties sampler 支持,包括频率和存在惩罚的调整,并添加了相应的测试。该版本还提供了多种平台和硬件的二进制文件,如 macOS、Linux、Windows、Android 等。
AWS 宣布在 Amazon Bedrock 中推出自动策略细化功能,用于自动化 Automated Reasoning 策略的故障诊断与修复流程。该功能提供两种模式:迭代细化(Iterative Refinement)处理规则问题,以及模糊变量细化(Ambiguous Variable Refinement)处理语言歧义问题。用户需审批所有更改,从而减少手
该仓库托管了适用于 React Native ExecuTorch 库的 all-MiniLM-L6-v2 模型,以 .pte 格式导出并支持 xnnpack。模型使用 ExecuTorch v0.6.0 导出,不保证向前兼容,用户需确保运行时版本匹配。仓库包含模型文件和 tokenizer.json,供开发者在移动端集成。
Anthropic 正在调查 Claude Sonnet 5 的性能下降问题,该问题影响了 claude.ai、Claude API、Claude Code 和 Claude Cowork 等多个服务。目前公司尚未公布具体原因和修复时间。
llama.cpp 发布 b10241 版本,主要修复了 CUDA 后端中 block reduce 复用共享内存时的数据竞争问题,并引入了双缓冲优化以提升 softmax 和 norm 操作的性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
Anthropic 报告了影响多个 Claude 产品(包括 claude.ai、Claude Console、Claude API、Claude Code 和 Claude Cowork)的错误率问题。该事件经历了调查、实施修复和监控阶段,目前已解决。
研究人员开发了一种利用开源大语言模型的自复制计算机病毒原型,该病毒能利用被感染机器的GPU资源进行推理,并自主发现漏洞、发起攻击和复制自身。该研究由多伦多大学、剑桥大学等机构完成,展示了AI驱动的自主网络威胁已成为现实。研究者认为未来互联网将充满攻防AI代理,需要人类部署防御性AI代理来对抗。
Cloudflare 在 Workers AI 上通过 KV 缓存量化(FP8)和模型权重压缩(INT4)优化了 Kimi 和 GLM 等大型 MoE 模型的推理效率,使内存占用减半、吞吐量提升,且模型精度几乎无损。这些技术结合预填充/解码分离架构,支持更多并发请求并降低成本,相关优化已通过 SGLang 框架开源。
Langfuse 发布了 v4.3.1 版本,主要包含多项修复和改进。修复了定价模块中 GPT-5.6 的使用别名问题,以及仪表盘中遗留 trace 组件的路由问题。此外,还进行了 CI 构建配置和代码风格规则的优化。
llama.cpp 发布 b10240 版本,主要更新为服务器默认端口将从 8080 更改为 9931,并添加了相关通知。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多个平台的预编译二进制文件,支持多种硬件加速后端如 Vulkan、CUDA、ROCm 等。
Hugging Face 博客发布了一篇关于 KV 缓存的教程,解释了该技术如何通过存储注意力层的键值对来避免重复计算,从而加速 Transformer 模型的文本生成。文章提供了 PyTorch 伪代码和 transformers 库的使用示例,并展示了在 T4 GPU 上使用 KV 缓存可获得约 5.21 倍的加速。该技术对于长文本生成尤为重要,能显著提
微软于2026年4月2日将Agent Framework升级至1.0正式版,并在Build 2026大会上发布了Agent Harness、GitHub Copilot SDK和Claude Agent SDK连接器,以及多智能体编排模式,均达到稳定版本。该框架提供统一的运行时,支持本地、容器和托管部署,并内置OpenTelemetry等治理功能。MBZUA