llama.cpp b11070:Hexagon 后端 DMA 与 64 位映射重构
llama.cpp 发布 b11070 版本,主要针对 Hexagon 后端进行大规模重构,重写缓冲区和 DMA 处理以支持 64 位映射。改动涵盖二进制算子、softmax、GDN、矩阵乘法等内核的 DMA 化,并新增检查脚本与开发者文档。同时提供 macOS、iOS、Linux(含 CUDA、ROCm、Vulkan、SYCL 等)及 Android 多平
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11070 版本,主要针对 Hexagon 后端进行大规模重构,重写缓冲区和 DMA 处理以支持 64 位映射。改动涵盖二进制算子、softmax、GDN、矩阵乘法等内核的 DMA 化,并新增检查脚本与开发者文档。同时提供 macOS、iOS、Linux(含 CUDA、ROCm、Vulkan、SYCL 等)及 Android 多平
llama.cpp 发布 b11068 版本,主要修复了 macOS 27 SDK 下 Metal 后端的弃用警告(PR #29136)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
清华大学、无问芯穹、正行创新联合开源具身智能体基础设施RPent,将通用大模型的任务规划能力与VLA等专家模型的精细操作能力结合,并加入记忆系统与统一接口,形成感知-决策-执行-反馈闭环。在LIBERO-PRO基准上达到92.6%任务成功率,Flash Mode将端到端任务完成速度优化7倍以上。RPent由RLinf核心团队打造,已覆盖多种仿真环境与真实机器
该研究分析了200多个开源网络安全项目,识别了最常用的许可证类型和编程语言,并发现宽松许可证项目中被限制性许可证代码污染的情况。研究还发现大量代码缺少版权归属信息。作者认为这些结果能帮助管理者理解污染如何发生、开源社区更好地保护知识产权,以及创业者了解网络安全领域的许可证与污染问题。
阶跃星辰发布新一代旗舰基座模型 Step 5 Preview,采用 MoE 架构,600B 总参数、激活参数仅 27B,支持 1M 上下文,在 Artificial Analysis 评测中取得 44 分,位列全球开源模型 Top 2。作者实测其 Agent 能力,用其操作 Blender 建模、制作 3D 游戏和 2D 小游戏,发现模型能自主补充 Prom
IFM 在 Hugging Face 发布 K2-Horizon-0.9B,这是 K2-Horizon 系列中的紧凑型 dense 解码器模型,参数量 0.9B,支持 128K 上下文窗口(通过 YaRN RoPE 缩放)。模型采用多教师蒸馏训练,覆盖数学、代码、STEM 和指令跟随,并在数学、编程、科学和工具使用基准上与 Qwen3.5-0.8B、Open
DeepBeepMeep发布了MiniMax H3图像模型,这些模型与WanGP工具配合使用。WanGP是一个开源视频生成工具,支持多种模型,具有低VRAM需求、支持旧GPU、快速生成和Web界面等特点。该工具还提供Loras支持、队列系统和Discord社区支持。
llama.cpp 发布 b11065 版本,主要变更为针对 Gemma 4 在 Ampere 及更新架构 GPU 上调整 Flash Attention(FA)的 CUDA 实现(PR #29152)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulk
LangChain 发布了 langchain-typesafe 0.0.1a3 初始版本。该版本包含 TypeSafeClassifier、实验性的 AutoModeMiddleware 和 ModelRouterMiddleware 等新特性,并将分类器问题改为调用作用域,同时修复了 trace 使用元数据问题。
阶跃星辰发布新一代MoE旗舰模型Step 5 Preview,总参数600B、激活参数27B,支持100万Token上下文与原生文本、视觉输入,专为真实世界Agentic任务打造。该模型在Artificial Analysis Intelligence Index得分44分,位居开源模型第三,仅次于Qwen3.8 Max与GLM-5.3。其单任务成本约为Cl
开发者 bloomer010 在 Hugging Face 上发布了 inclusionAI/Ling-3.0-tiny 的 GGUF 量化版本,直接从 BF16 safetensors 转换而来,覆盖从 BF16 到 Q1 0 的多种量化档位。该模型为 7.9B 总参数、1.3B 激活参数的 MoE 架构,含 18 层 KDA 与 6 层 MLA,支持 1
Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash 的 GGUF 量化版本,该模型为 124B 总参数、5.1B 激活参数的混合 KDA + gated MLA、512 专家 MoE 架构。这些文件是 bailingmoe3 架构的参考转换,已合并进 llama.cpp PR #26608,并内
MinerU 发布 4.0.5 版本,为表格模型新增可选 CUDA ONNX session,在可用时自动启用并加入推理阶段计时;同时统一 ONNX session 线程配置并支持环境变量回退,更新物化素材图片命名规范并改进图片分辨率处理,且将 docvortex 最低版本要求提升至 0.4.20。
阿里巴巴 Qwen AI 团队发布开源权重图像生成与编辑模型 Qwen-Image-2.1,其视觉生成组件仅 70 亿参数,团队称在自家基准上超过多数闭源模型,但独立评测尚未出炉。该模型可在 3090 等消费级 GPU 上运行,原生支持 RGBA 透明图像生成与编辑,最多可同时处理十张参考图,并通过架构调整与 KV 缓存复用加速推理。模型已在 Hugging
llama.cpp 发布 b11064 版本,主要修复 Metal 后端 dsv4 hc pre 算子的问题:此前该算子通过 constexpr 将 hc 硬编码为 4,导致其他 hc 值被 supports op 拒绝并回退到 CPU。本次改动将 n hc 作为函数常量(FC DSV4 HC)传入,并为不同 n hc 生成流水线变体,同时新增 hc = 1
llama.cpp 发布 b11063 版本,主要更新是在 common/peg 中处理 AST 里的非法 UTF-8 序列,并按照 Unicode 建议返回最大子部分(maximal subpart),同时移除了 strict 参数。该版本同步提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vu
中国电信AI开源了全栈国产化的轻量级代码智能体大模型Xing4.0-29B-A4B,采用MoE架构,总参数290亿、每次推理仅激活约40亿,经4-bit量化后可在单张RTX 3090上运行。该模型完全基于华为昇腾910C算力与MindSpore/MindFormers框架训练,支持256K上下文并可扩展至512K,重点强化Coding与Agent能力,已适配
阿里巴巴开源了 AI 代码审查 CLI 工具 OpenCodeReview,采用 Apache-2.0 许可,将文件选择、打包和规则匹配等环节交给确定性流水线,仅用 LLM 代理做动态代码分析,支持空指针、线程安全、XSS、SQL 注入等检查。该工具已在阿里内部数万开发者中使用两年,兼容 OpenAI 和 Anthropic 模型,可审查 Git diff、
ESPnet 团队发布 OWSM-CTC v4 1B 语音基础模型,基于分层多任务自条件 CTC 的纯编码器架构,在 32 万小时公开音频上训练三个 epoch,支持多语言语音识别、任意语言对语音翻译和语种识别。该模型完全开源,代码、权重和训练日志均已公开,其配套论文获得 INTERSPEECH 2025 最佳学生论文奖。模型提供批量推理、长音频解码和 CT
Google 发布面向 Kotlin 的 Agent Development Kit(ADK)1.0,这是一个可用于生产环境的 AI 智能体开发框架,覆盖 Kotlin、Android 与 JVM/服务端应用,并在功能上与 Python、Java 版 ADK 对齐。该版本新增 Android 专属能力,支持端侧与混合 AI,包括 LiteRT-LM、ML K