llama.cpp 发布 b11165 版本
llama.cpp 发布 b11165 版本,主要变更是测试相关的 flush status(#28352)。该版本为 macOS/iOS、Linux、Android、Windows、openEuler 等多平台提供预编译二进制包,覆盖 CPU、CUDA 12/13、Vulkan、ROCm、OpenVINO、SYCL、Snapdragon 等多种后端。
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 699 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11165 版本,主要变更是测试相关的 flush status(#28352)。该版本为 macOS/iOS、Linux、Android、Windows、openEuler 等多平台提供预编译二进制包,覆盖 CPU、CUDA 12/13、Vulkan、ROCm、OpenVINO、SYCL、Snapdragon 等多种后端。
Simon Willison 在博客中发布了 commit-rewriter 0.2 版本。该文章页面同时列出了近期其他文章,涉及 Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 及新一轮价格战,以及 Jev 提出的新型 LLM 形态 System One(决策模型)和用 GPT-6 Astra 与 ChatGPT Work 生成跑
IFM 在 Hugging Face 发布 K2-Horizon-7B,这是 K2-Horizon 系列的中等规模稠密解码器模型,拥有 512K 原生上下文窗口。模型在数学、编程、长上下文与推理等基准上对标 Gemma 4-12B、Qwen3.5-9B、Granite 4.2-8B 等参考模型,并公开训练数据、训练配方、训练代码与评测资源,同时提供中间检查点
Fastino 在 Hugging Face 发布 GLiNER2.5 Base(fastino/gliner2.5-base-v1),一个基于 DeBERTa-v3-base 的 194M 参数英文信息抽取模型。该模型采用边界架构,可在单一 schema 下统一完成命名实体识别、文本分类、结构化记录解析、关系抽取和跨度属性打分,并支持 CPU、CUDA、M
Fastino AI 在 Hugging Face 发布 GLiNER2 大模型(fastino/gliner2-large-v1),将命名实体识别、文本分类、结构化数据抽取和关系抽取统一到一个 205M 参数模型中。该模型支持 CPU 推理、本地运行无需外部 API,采用 Apache-2.0 许可,并提供 pip 安装与多任务 schema 组合用法。
llama.cpp 发布 b11163 版本,核心变更是新增 llama batch ext API(PR #24669),支持在同一个 batch 中同时处理 token、embedding 和 state,并引入 llama embd、llama batch ext add embd、llama batch ext set embd state 等接口,
Fastino 发布 GLiNER2-PII,这是基于 205M 参数 GLiNER2 微调的多语言 PII 检测与脱敏模型,支持 42 类实体和 7 种语言。模型完全在 4,910 条约束驱动的合成语料上训练,在 SPY 基准上取得最高 span 级 F1(0.477),超过 OpenAI Privacy Filter、NVIDIA GLiNER-PII
Fastino AI 在 Hugging Face 上发布了 GLiNER2 多语言模型 gliner2-multi-v1,将命名实体识别、文本分类、结构化数据抽取和关系抽取统一到一个 205M 参数的 BERT 类编码器中。该模型支持 CPU 本地推理,无需 GPU 或外部 API,采用 Apache-2.0 许可,可通过 pip 安装 gliner2 库
由加州理工学院研究人员创立、UC Berkeley 的 Ion Stoica 担任顾问的 AI 实验室 PrismML,为搭载高通 Snapdragon 芯片的智能眼镜开发了其微型语言模型版本。在高通 Snapdragon 峰会上,高通展示了 PrismML 的 1-bit Bonsai LLM,可在基于 Snapdragon AR1 Gen 1 平台的 A
Meta 推出消费级 AI 代理 Muse,上线后登顶 App Store 榜单,据 Apptopia 估计在美国有 60 万日活用户。社交媒体用户指控 Muse 直接基于开源平台 OpenClaw 构建,因为两者使用相同的核心文件名(SOUL.md、memory、tools 等)和相似的人格设定文档。Meta 产品负责人 Nat Friedman 否认抄袭
Black Forest Labs 发布面向机器人领域的开源 AI 模型 FLUX 3 Action,它基于多模态 FLUX 3 构建,属于 world-action 模型,可接收机器人工作区的多摄像头视频并预测下一步动作及环境变化。据 BFL 称,该模型仅用 70 亿参数就在 RoboLab-120 排行榜上创下成功率纪录,规模不到此前最佳开源模型的一半,
ElevenLabs 联合创始人兼 CEO Mati Staniszewski 在多伦多 Nrth 大会上接受 TechCrunch 采访,透露公司年经常性收入(ARR)达 6 亿美元,投资者对其估值 reportedly 达 220 亿美元。公司主要为企业提供语音 AI 模型,客户包括 Klarna、Deutsche Telekom、Cisco、Adobe
UkisAI 在 Hugging Face 发布了 Swift-Qwen3.8-27B 的 GGUF 量化版本,该模型是 Qwen3.8-27B 的推理高效衍生版本。据其评测,Swift 版本在保持性能损失小于 1% 的前提下,平均思考 token 减少约 58.3%,并在多项任务上实现约 1.95 倍加速。该模型采用自定义的 swift-open-lice
Strands Agents SDK 发布 mcp/v0.3.0 版本,包含大量功能更新。主要变更包括:MCP 客户端切换到 @modelcontextprotocol/client 2.0、新增 Agent.shutdown() 清理机制、默认使用 opus 5 和高思考模式、合并 Strands harness、新增 bm25 搜索策略、支持 MCP S
llama.cpp 发布 b11159 版本,主要修复了 Vulkan 后端在 conv 2d 和 conv 3d 卷积操作中的内存对齐(misalignment)问题,并修正了 test-backend-ops 的打印输出。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan、RO
llama.cpp 发布 b11158 版本,主要变更为在 Vulkan 后端为 Adreno GPU 调优 KHR cooperative matrix 支持(PR #29328),包括启用 coopmat 支持并修复 mul mat s。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
inclusionAI 开源了 Ling 2.0 系列首个模型 Ling-mini-2.0,这是一个基于 MoE 架构的大语言模型,总参数 16B、每 token 仅激活 1.4B(非嵌入 789M),在 20T+ tokens 上训练。该模型采用 1/32 激活比、MTP、QK-Norm 等设计,宣称以 1.4B 激活参数达到 7-8B 稠密模型性能,在
Langfuse 发布 v4.44.0 版本,主要新增 LLM 连接、AI 网关与评估相关功能:支持在 Vertex AI Gemini 请求中发送额外请求头,AI 网关可转发 Anthropic Messages 并采集用量遥测与完整内容,评估模块新增对话信号决策模型模板。同时修复了会话工具行展示、ClickHouse 写入关闭、仪表盘聚合错误等问题,并推
llama.cpp 发布 b11157 版本,主要变更是为 CUDA 后端新增基于 implicit GEMM 的 conv3d 支持,并对其进行了细化、处理空 kernel 的情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。
用户 xidisdg 在 Hugging Face 发布了 Qwen3.8-27B 的 NInfer 原生 .ninfer 量化模型文件,包含 NVFP4、NVFP4Full 及 DFlash2 变体,并区分原始版本与适配最新版 NInfer 的 V3 版本。文件仅兼容 NInfer 运行时,非 GGUF 或 Safetensors,发布者提示 uncens