llama.cpp b10297 发布:修复 /cors-proxy 空响应问题
llama.cpp 发布 b10297 版本,主要修复了 server 中 /cors-proxy 端点返回空响应的问题。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1726 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10297 版本,主要修复了 server 中 /cors-proxy 端点返回空响应的问题。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
阿里巴巴的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,追平Claude Opus 4.8,但落后于Kimi K3(57分),且Kimi K3成本低25%。在GDPval-AA基准上,Qwen3.8 Max得分超过Kimi K3,但需要更多步骤和输入token,导致成本更高。此外,该模型在AA
llama.cpp 发布 b10295 版本,主要修复了量化张量重塑后的步长问题(#26672)。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Langfuse 发布 v4.5.0 版本,新增提示词批量导入导出、Agent 工具静默模式、按用户和组织限制并发后台运行等功能,并修复了多项 UI、追踪、OTel 和 Worker 相关问题。该版本还更新了定价模型,支持 GPT-5.4/5.5 大上下文层级,并优化了错误监控和代码结构。
llama.cpp 发布 b10293 版本,主要更新包括为 AMD ROCm CI 添加 gfx1151 支持,并修复了集成 GPU 上的调试断言问题。针对 RDNA3.5 架构的 HIP 后端,通过启用 HIP LAUNCH BLOCKING 解决异步执行导致的推理错误,并暂时跳过 jamba 和 top-k 等不支持的测试。该版本提供了多平台预编译二进
Mastra 发布 2026 年 8 月 5 日更新,核心亮点包括:工作流支持声明式 JSON 图定义与持久化,可通过 HTTP API 和客户端 SDK 管理存储的工作流;新增谓词 DSL 和嵌套工作流步骤,实现可持久化的条件与循环;实验与评估功能增强,支持更细粒度的评分器控制和工具策略;可观测性与流式传输可靠性改进。同时包含破坏性变更,移除平台工作区的密
llama.cpp 发布 b10291 版本,主要修复了 Vulkan 后端中提交批处理大小的问题,并新增了用于诊断 DeviceLost 驱动错误的调试工具。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等后端。
在CCF Chip 2026大会上,中科通量发布了全球首款RISC-V数据流架构视频智能AIGC芯片金刚GC3,该芯片采用12核设计,支持128路1080P硬解码,INT8算力达200 TOPS。金刚GC3通过数据流架构优化视频处理效率,旨在解决通用芯片在视频AI场景下的能耗和延迟问题,标志着国产RISC-V高端算力在视频专用领域的商业化提速。
arXiv 论文提出 mmMind,一种雷达-语言模型,利用同步 3D 姿态作为训练监督,使基础模型能理解毫米波雷达数据。该模型通过姿态引导预训练学习人体结构和运动,推理时仅需雷达输入,并用于行为描述和时空问答。作者还发布了包含 17.9 小时真实数据的 mmMind-Bench 基准,实验表明 mmMind 在多个任务上优于现有基线。
arXiv 上发布了一篇关于多智能体系统的新论文,提出了 HELENA 框架。该框架通过蒙特卡洛树搜索和行列式点过程选择互补拓扑,构建联合图,并利用分层稀疏协调模块在每一步仅激活稀疏子图,以抑制冗余噪声传播。实验表明,HELENA 在八个基准测试上均达到最先进水平,平均提升 3.47%,在 MMLU-Pro 上提升高达 10.34%。
DeepSpeed 发布了 v0.19.4 补丁版本,包含多项修复和改进,涉及 ZeRO 优化、AutoTP、MoE 路由、学习率调度器、梯度累积等。该版本增强了 ZeRO-3 推理、AutoTP 的 HuggingFace 支持,并修复了多个 bug,提升了稳定性和性能。
llama.cpp 发布 b10290 版本,新增 ggml build forward order 函数,用于在计算图中插入节点而不设置计算标志,以解决 mtmd 音频图中 GEN WAV 调用因陈旧输入触发断言的问题。该版本提供了多平台二进制文件,包括 macOS、Linux、Windows、Android 等。
Vercel AI SDK 发布 7.0.54 版本,主要包含三项更新:允许 ToolLoopAgent 的 prepareCall 回调读取并覆盖顶层 reasoning 选项;新增 defaultInstructionsMiddleware 用于应用默认语言模型指令并保留调用级覆盖;在重新生成响应时保留前序助手消息。
Apple 与东京大学的研究者提出 DLR-Lock 方法,通过将预训练模型中的 MLP 替换为深度低秩残差网络(DLR-Net),利用自动微分的推理-训练不对称性,增加微调时的激活内存和计算开销,从而阻止未经授权的权重修改。该方法在保持模型能力的同时,能抵御完全了解防御策略的自适应攻击者。该论文已被 ICML 2024 的 Efficient System
Meta 发布了 Muse Code 和 Muse Spark 1.2,后者是面向编码的模型更新,提升了代码生成、调试和代码库理解能力,并支持长序列智能体工具调用。模型提供两种定价选项,其中 contributor 版本通过允许数据使用大幅降价。
另有 1 家信源报道
llama.cpp 发布 b10289 版本,主要强化了 server 的文件搜索功能,包括修复 Windows 符号链接和挂载点遍历问题、处理不可读目录、优化路径转换,并改进了 UI 缓存过期机制。该版本还提供了多平台二进制下载。
Mobileye 利用 Amazon Bedrock AgentCore 部署了 AI 支持代理,将响应时间缩短了 90%,准确率超过 95%,且无需管理基础设施。该代理通过 MCP 协议实时访问数据处理平台 API,解决了内部工单查询瓶颈。Mobileye 还将 AgentCore 转化为自服务平台,供公司内部团队部署自己的 AI 代理。
Anthropic 报告 Claude Opus 5 出现性能降级,影响 claude.ai、Claude API、Claude Code 和 Claude Cowork。团队已定位到错误原因并正在修复,目前事件已解决。
Anthropic 报告其多个 Claude 模型(包括 Claude Mythos 5、Claude Fable 5、Claude Opus 5 和 Claude Sonnet 5)出现性能下降,导致 API 请求错误率升高。该事件影响了 claude.ai、Claude API、Claude Code 和 Claude Cowork 等产品。团队已定位原
Langfuse 发布了 v3.225.1 版本,主要修复了客户端 trace 下载和复制时 Unicode 转义字符未正确解码的问题。该修复由开发者 bezbac 提交,通过 PR #15801 合并。此版本为补丁更新,无新增功能。