llama.cpp 发布 b11155:修复 GCC 12 误报并更新多平台构建
llama.cpp 发布 b11155 版本,主要修复了 server 和 common 模块中 GCC 12 的 stringop-overread 误报问题(由 Adrien Gallouët 提交,PR #29325)。该版本同时提供了覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 699 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11155 版本,主要修复了 server 和 common 模块中 GCC 12 的 stringop-overread 误报问题(由 Adrien Gallouët 提交,PR #29325)。该版本同时提供了覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,
llama.cpp 发布 b11154 版本,主要更新了 test-save-load-state 测试工具:在 --models 模式下改为输出每个模型的逐项测试结果表格,用彩色 PASS/FAIL/SKIP 单元格替代原先冗长的日志输出,并在 -h 帮助中增加示例用法。该改动仅影响测试工具的输出格式,单模型模式输出与退出码保持不变,同时提供覆盖 macO
清华大学联合无问芯穹开源了面向具身智能的云原生纳管平台 RLark,以自研具身设备运行时和任务级跨集群网络互联技术为核心,将机器人、相机等设备与云端算力统一纳入资源体系进行调度。平台已完成 3 个集群、近百个云边端节点、4 种型号具身设备的纳管,设备纳管从小时级缩短至约 5 分钟,任务提交后 10 秒内可启动。团队还结合 RLinf 在广东云端 GPU 集群
蒙特利尔心脏研究所等机构的研究者在 arXiv 发表评论文章,总结在开放 PACS-AI 平台上部署医学影像 AI 的经验。该平台基于 OHIF 与 Cornerstone 构建,并已在放射、神经放射、儿科肌骨超声和放疗等多个临床场景中开展前瞻性评估,同时配套开源了完整框架及一个可让智能体自动迁移模型的技能。文章还讨论了隐私影响评估与数据治理问题。
PydanticAI 发布 v2.49.0,新增 GitHubCopilotOAuthFlow 设备授权流程、BoolCriteria 布尔字段语义定义、RealtimeSession.wait for reply() 等特性,并改进 TypeSafeModel 对 None 与整数选项的处理。该版本还修复了 OpenAIChatModel 流式 logpr
Meta超级智能实验室(MSL)推出个人AI智能体Muse,主打邮件、出行、网购等生活场景,可自主拨打客服电话完成砍价、退货等任务。Muse上线13天即登顶北美App Store,增速超过2022年末刚上线的ChatGPT,带动Meta股价单日暴涨11%。亚马逊以违反用户协议为由全面拦截Muse的代购访问,而Shopify则宣布全面接入。Meta产品负责人N
开发者 smalinin 在 Hugging Face 发布了 DeepSeek-V4.1-Flash 的 GGUF 量化版本,包含 Q2 K、IQ2 XXS、IQ3 XS、MXFP4 等多种混合精度方案,模型体积从 335GB 到 508GB 不等。这些文件需要配套的 llama.cpp 自定义分支 my build deepseek41 才能运行,且仅支
Pruna AI 在 Hugging Face 上发布了一个名为 pruna-test/test-save-tiny-random-llama3-smashed-pro 的测试模型,该模型基于 tiny-random-Llama3 并使用其开源模型优化框架 pruna 生成。模型卡片提供了通过 pruna pro 库加载模型的代码示例,并附带了 smash
Strands Agents SDK 发布 harness-cli v0.1.2,主要更新包括将 MCP TypeScript 客户端切换至 @modelcontextprotocol/client 2.0、要求提供商显式指定模型 ID、为 Agent 新增基于作用域的 shutdown() 清理方法,并修复 CLI 交互、HITL 分类器决策校验及站点搜索
llama.cpp 发布 b11149 版本,主要变更是为 test-llama-archs 测试工具新增 -b/--backend 选项,用于针对特定后端进行测试。该改动由社区贡献者提交并合并。同时该版本照例提供覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。
llama.cpp 发布 v0.5.0,重点提升后端性能与正确性、扩展模型覆盖并增强服务端/路由稳定性。新增 HRM-Text(DFM Mimir 1B)、MiMo-V2.6 与 HunyuanOCR 转换支持,升级 ggml 0.25.0,并加入多地址 HTTP 绑定、函数调用图像输出及多项聊天解析器/UI 修复。
MinerU 发布 4.0.7 版本,新增对 MHTML/MHT 文件的解析与源文件在线预览支持。该版本修复了 MHTML 预览稳定性问题(保留归档样式表状态与 base URL、本地 CSS fragment URL、预加载重定向恢复、预览内链接可用),并改进 WebUI 在 PDF 预览文件切换时的 UI 状态保持、过期预览取消及移动端状态栅格布局。同时
NVIDIA 发布开源 Kubernetes 控制器 NVCRE(Cluster Readiness Engine),用于在 AI 生产负载上线前验证 GPU 集群就绪状态。它通过运行真实的分布式工作负载(如 NCCL 通信测试、DCGM 诊断、NeMo 预训练)并按拓扑感知分组测量结果,将失败精确定位到具体节点和类别。该工具填补了 Kubernetes 缺
IsValorum 在 Hugging Face 发布了 Qwen3.8-35B-A3B-Distill-MTP-APEX-I-MiniPlus-V2.1 的 GGUF 量化版本,基于 empero-ai/Qwen3.8-35B-A3B-Distill 模型。该版本针对 13-14GB 显存/内存上限优化,采用逐张量定制量化策略,保留 F32 路由门、Q6
llama.cpp 发布 b11147 版本,主要变更为在 OpenCL 后端新增 A8 Q6 K 非 MoE 的 dp4a 二值化内核(PR #29057)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SY
NVIDIA 发布开源权重模型 Nemotron 3 Diarization,参数量 1 亿,在 VoiceArena Diarization-Bench 排行榜以 14.72% 的 DER 位列第一。该模型支持最多 8 位说话人、重叠语音、分块处理和可定制流式延迟,并采用到达顺序排序与 AOSC、FIFO 记忆机制保持说话人标签稳定。它可与 ASR 结合生
llama.cpp 发布 b11146 版本,将版本号提升至 0.5.0(PR #29333)。该版本为 macOS/iOS、Linux、Android、Windows 及 openEuler 等多个平台提供预编译二进制包,覆盖 CPU、CUDA 12/13、Vulkan、ROCm、OpenVINO、SYCL 等多种后端,并附带 UI 包。
NVIDIA 发布开源项目 NodeWright,用于在 Kubernetes 集群中声明式地配置和更新节点主机操作系统,同时不中断正在运行的工作负载。NodeWright 此前以 Skyhook 之名在 NVIDIA 内部生产环境运行,现正式开源并更名。它通过 operator、自定义资源和包三个组件,结合 PodDisruptionBudgets、节点选
AWS Machine Learning Blog 介绍如何将开源权重模型与开源终端 AI 编码代理 OpenCode 结合,通过 Amazon Bedrock 在自有 AWS 账户内运行推理,避免数据外发、供应商锁定和按席位收费。文章给出配置方法、多模型工作流,并以 Moonshot AI Kimi K3、OpenAI GPT-OSS 120B、NVIDI
LangGraph 发布 langgraph-cli 0.4.32 版本。本次更新新增自托管部署监听器、--image-uri 标志,并调整 deploy 命令使用 agent id 与环境参数,同时澄清 agent 标志并支持环境变量默认值。此外还修复了示例锁文件中的 AnyIO 漏洞并升级了多项依赖。