llama.cpp b10753 发布:修复 Hexagon 后端日志问题
llama.cpp 发布 b10753 版本,主要修复了 Hexagon 后端中 cpy、get rows、set rows、gdn 等操作的 FARF 日志缺失问题,并修正了 proc op req 日志中 ne[2] 的打印错误。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10753 版本,主要修复了 Hexagon 后端中 cpy、get rows、set rows、gdn 等操作的 FARF 日志缺失问题,并修正了 proc op req 日志中 ne[2] 的打印错误。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
arXiv 论文提出 Dreams,一种用于对话推荐系统(CRS)的双节点树结构上下文建模框架。Dreams 通过蒙特卡洛树搜索(MCTS)进行偏好 elicitation,并使用 LLM 将偏好状态转化为结构化检索查询以实现 exploitation。实验证明其在基准数据集上优于现有方法,代码已开源。
Kansas State University的研究人员提出了一种基于累积对话轮次的老年人金融诈骗风险评估框架,通过逐步聚合对话内容并重新评估风险,实现实时监控。他们构建了包含投资、慈善和技术支持诈骗场景的多轮对话数据集,并微调了Phi-4、LLaMA-3.2、DeepSeek-R1和Qwen3等小型语言模型。实验表明,Phi-4和LLaMA-3.2在参数规
REAL-Q 提出了一种新的后训练量化(PTQ)方法,通过端到端对齐的 Fisher MSE 目标和动态块级梯度下降,解决了现有方法中信息错位的问题。在 LLaMA-3.1 和 Qwen3 模型上,REAL-Q 在 W4A16 下将端到端 KL 散度最多降低 49%。该方法通过细粒度校正和滑动窗口机制,有效缓解了跨层误差传播。
该研究提出一种受控基准测试,让LLM通过逐步调用工具执行MD5哈希计算,以评估其长时程状态跟踪能力。实验表明,gpt-oss-120b模型在多数运行中能正确完成全部步骤,且当用另一个LLM替代所有原始工具时,驱动-工作模型对也能从零计算哈希。成功的关键在于将模型自身推理保留在上下文中,并对工作模型采用多数投票机制。
智平方(AI² Robotics)宣布其搭载类脑架构具身大模型NeuroVLA的AlphaBot 2(爱宝)机器人正式入驻香港兰桂坊酒吧,提供调酒与互动服务,成为香港首个真实开放场景服务机器人。此举标志着智平方跑通中国具身智能出海的全链路闭环,包括硬件出关、清关合规、取得本地饮品售卖资质及建立付费服务体系。NeuroVLA通过模拟人脑皮层-小脑-脊髓协同机制
llama.cpp 发布 b10752 版本,主要更新是为 Metal 后端添加了 xcframework 的 metallib 构建支持,方便 iOS 和 macOS 集成。该版本提供了覆盖多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件,并支持多种后端(如 Vulkan、CUDA、ROCm、OpenVINO、SYCL
Ollama 发布了 v0.33.3 版本,主要更新包括遵循 GGUF 模型定义的默认参数,并更新了 MLX、MLX-C 和 llama.cpp 组件。新贡献者 marcelpetrick 首次参与项目。
LiteLLM 发布 v1.101.0-dev.1 版本,该版本所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签进行验证的方法。更新内容涵盖代理性能改进、类型清理、Bedrock 和 Vertex AI 修复、OpenAI 工作负载身份联合支持、新增 /v1/responses/input tokens 端点、GigaCha
谷歌在2026年8月发布了一系列AI更新,包括推出Gemini 3.7 Flash模型、Pixel 11系列手机、Gemini 3.5 Transcribe语音转文字模型、Gemini Omni 1.1 Flash视频生成模型,以及Gemini应用月活用户突破10亿。这些发布旨在提升AI的实用性、降低成本,并扩展在编码、教育、视频生成和气候预测等领域的应用。
Jommarn 发布了基于 Google Gemma-4-26B-A4B-it 模型进行无审查化(abliteration)微调的 UNSEEN Gemma-4-26B NSFW 模型,并提供 2-bit 至 16-bit 的量化版本及 GGUF 格式,支持消费级 GPU 和 Apple Silicon 部署。该模型具备视觉能力,需配合视觉投影器使用,官方展
llama.cpp 发布 b10751 版本,主要更新是在 CUDA 后端中融合了 MoE 加权专家归约操作,将多个内核合并为一个,以减少全局内存流量并提升性能。该融合支持未缩放和缩放两种图模式,并可通过环境变量禁用。同时发布了适用于多个平台和硬件的二进制文件。
Anthropic于周二发布了其最先进AI模型的双版本Fable和Mythos 5.1,在性能升级的同时降低了token成本并减少了安全防护的误报限制。Mythos 5.1仅面向注册的网络安全或生命科学研究合作伙伴,而Fable 5.1即日起可通过云平台或Anthropic API使用。Anthropic还宣布了Zero Data Retention支持,允
llama.cpp 发布 b10750 版本,优化了 KV 缓存中 n-gram 历史的查找方式,通过序列位置索引直接查询,替代了原先每次重建哈希表的方法。该优化在 Qwen3.8-Flash-Next 模型上测得文本生成速度提升 4.9%,预填充速度不变,输出结果保持一致。
AWS 宣布在 Amazon Bedrock 和 Claude Platform on AWS 上推出 Claude Fable 5.1,该模型在推理、智能体编码和自主操作方面有显著提升。Anthropic 将其指定为 Covered Model,并推出 Enterprise Frontier Safeguards,允许符合条件的客户在零数据保留模式下使用。
llama.cpp 发布 b10749 版本,主要更新为在指定 YARN 缩放时自动调整 n ctx train 上下文大小。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
Hugging Face 上发布了 Qwen3.6-27B 的架构感知混合精度量化版本,由 zerodigest 使用 YMQ-Compiler v2.0 框架从原始 BF16 权重转换而来。该版本支持多 token 预测(MTP)和长上下文优化,提供从 XXS 到 XL 多个预设档位,其中 M 档在 WikiText-2 上困惑度最低(7.5295),被推
llama.cpp 发布 b10743 版本,主要更新为 Metal 后端针对 M2 Pro 芯片的 FA-VEC 调优,并适配新的数据类型。该版本提供了涵盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,以及 UI 组件。
ZeroDigest 实验室发布了基于 Qwen3.8-27B Cold-Fusion GAIN V1.1 的架构感知量化模型系列,采用自定义 YMQ-Compiler 框架进行混合精度量化,支持多 token 预测(MTP)和长上下文优化。该系列提供多个预设档位,覆盖 9.1GB 至 14.5GB 的模型大小,并报告了 WikiText-2 困惑度指标,旨
英特尔在Hot Chips 2026大会上公布了面向企业数据中心的AI推理GPU Crescent Island的软硬件细节。该卡采用Xe3P架构,配备160GB LPDDR5X显存(可扩展至480GB),功耗350W,支持FP4到FP64精度,并兼容vLLM等主流推理框架。其设计聚焦每瓦Token能效、超大显存和开放软件栈,旨在满足Agentic AI推理