llama.cpp b10662 发布:新增统一 KV 缓存槽位参数
llama.cpp 发布 b10662 版本,主要更新为 server 端新增 ctx-per-slot 参数(--kv-unified-per-slot),用于统一 KV 缓存管理,并重构了上下文池槽位逻辑。该版本提供了多平台(macOS、Linux、Windows、Android、iOS)的预编译二进制文件,支持多种硬件后端如 CUDA、Vulkan、R
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 07:58
llama.cpp 发布 b10662 版本,主要更新为 server 端新增 ctx-per-slot 参数(--kv-unified-per-slot),用于统一 KV 缓存管理,并重构了上下文池槽位逻辑。该版本提供了多平台(macOS、Linux、Windows、Android、iOS)的预编译二进制文件,支持多种硬件后端如 CUDA、Vulkan、R
阿里巴巴发布了Qwen3.8-Flash-Next模型权重,作为Qwen4架构的预览,供开发者实验和评估。该模型是一个多模态MoE模型,主模型125B参数,附加51B N-gram嵌入,每token激活6B参数,原生上下文窗口262,144 token,可通过YaRN扩展到1M。NVIDIA提供了Day 0功能支持,包括SGLang、vLLM和TensorR
vLLM 发布 v0.28.0 版本,包含 584 个提交,重点优化了 Kimi-K3 和 DeepSeek V4 的性能,支持稀疏 MLA、DCP、FlashKDA 等特性,并改进了推测解码和模型运行器。该版本还引入了新的默认配置、破坏性变更,并扩展了模型支持,如 Muse Glimmer、Ling 3.0 Flash 等。
OpenCompass 发布 v0.5.4 版本,集成了 VLMEvalKit 以支持多模态评估,并新增多轮推理能力及 Multi-IF 基准。该版本扩展了模型 API 生态,支持 LiteLLM 网关和 TurboMind 的 PPL 评估,并新增了金融、长上下文、对齐、信息抽取和代码推理等多个基准测试。此外,修复了多项评估正确性和生成行为问题,并提升了安
LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V10-GGUF,该模型通过其自研的 Genesis 算法对 GGUF 格式的模型进行张量噪声修复,并融合了 Hermes 智能体微调数据。模型在保持无审查能力的同时,旨在提升稳
KVBoost 是一个面向 HuggingFace 兼容解码器模型的块级 KV 缓存复用系统,通过双哈希键控和偏差引导的重计算,解决了共享内容出现在提示任意位置时的缓存命中问题。在 Qwen2.5-3B 模型上,KVBoost 相比全量重计算实现了 4.49 倍的 TTFT 加速,比 vLLM 前缀缓存快 16%,且无质量损失。该系统支持 KV 量化、磁盘溢
Wazobia Labs 发布了 Wazobia Eval,一个针对尼日利亚皮钦语的情感理解、讽刺检测和文化推理的基准测试。该基准基于包含超过550个示例的手动标注数据集,并引入了一个16类别的文化情感分类体系。其目标是填补现有评估基准对尼日利亚皮钦语等低资源语言覆盖不足的空白,为尼日利亚语言AI提供标准化的评估基础设施。数据集已在 Hugging Face
原力灵机发布具身智能模型DM0.5,登顶RoboDojo基准测试,综合得分24.90,平均成功率19.34%,并在记忆任务中表现突出。该模型在LIBERO、RoboTwin 2.0等多个评测中取得领先,并已全面开源,包括模型权重、训练框架和下游工作流。DM0.5通过长记忆、具身思维链和高效推理优化,实现了9.29倍加速,旨在推动具身智能生态发展。
NVIDIA 发布了 Nemotron-3-Super-120B-A12B-FP8 大型语言模型,采用 LatentMoE 混合架构,总参数 120B,激活参数 12B,支持最长 1M token 的上下文,并内置多 token 预测(MTP)以加速生成。该模型针对智能体工作流、长上下文推理和高吞吐量场景(如 IT 工单自动化)进行了优化,支持多种语言,并采
汤森路透投资约4000万美元,基于阿里巴巴的Qwen开源模型构建了自有法律AI模型“Thomson”,并利用公司内部数据和领域专家进行训练。测试显示,Thomson在访问公司专属内容时能超越GPT-5.4等竞品,但在推理和编码方面表现较弱。公司计划将Thomson用于文档审查等高频任务,并发布小版本模型供非商业使用,以降低成本并保持独立性。
Jina AI 发布了 jina-embeddings-v5-omni-nano,一个约 1.04B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型支持检索、分类、聚类和文本匹配任务,可通过 Hugging Face 或 Elastic Inference Service 使用。它定义了开放权重全模态嵌入模型
一篇论文提出了一种计算高效的两步超参数迁移框架,用于预测大规模混合专家(MoE)模型的最优学习率。该方法首先通过宽度缩放迁移学习率,然后外推至万亿级token训练范围,并在155B总参数(17B激活参数)的模型上成功预训练了10万亿token。实验表明,通过小规模代理模型即可高保真地预测大规模训练的最优配置,显著降低消融成本。
Hugging Face 上发布了 Qwen3.6-27B 的 PrismaSCOUT 量化版本,采用 NVFP4+BF16 混合精度,大小为 20.17 GB,比之前的 5.5 bpp 版本小 11%。该版本通过 PrismaSCOUT 算法基于端到端 KL 散度选择位分配,而非逐层代理指标,旨在减少量化漂移。实测平均 KL 为 0.0779,相比其 BF
OmniAssistBench是一个用于评估全模态大语言模型(Omni-LLMs)作为实时视频助手能力的基准测试。该基准通过逆向工程现有互联网视频构建多轮交互数据集,要求模型根据预定义路径引导用户。测试结果显示,专有模型Gemini-3-Pro得分66.4,开源模型Qwen3-Omni-Instruct得分51.2,当前模型普遍存在视觉提示理解、上下文保持和
该论文介绍了一个面向电信客服场景的合成孟加拉语语音数据集,包含10,000个音频-文本对,约26.82小时,已在Hugging Face上以CC-BY-4.0许可发布。数据集使用OmniVoice的语音克隆模式生成,并提供了原始文本和归一化文本字段。通过微调的Whisper ASR模型评估,平均词错误率为2.54%,字符错误率为0.59%,表明文本-音频一致
huihui-ai 发布了基于 Qwen3.8-27B 的 uncensored 版本模型,通过 abliteration 技术移除模型的拒绝机制,仅对第 18 至 51 层进行消融,以保留更多原始性能。该模型支持通过 Hugging Face transformers 库和 Ollama 使用,旨在提供无审查的对话体验。
SKT 发布了 A.X K2,这是一个 6880 亿参数、330 亿激活参数的 MoE 语言模型,作为 A.X K1 的继任者,支持思考与非思考模式,并采用 Think-Fusion 训练方法。该模型原生 FP8 训练,支持 256K 上下文,并针对多语言和代码进行了优化。它是韩国政府主权 AI 基础模型项目的一部分,旨在提升韩语和文化理解能力。
UmeAiRT 在 Hugging Face 上发布了 ComfyUI-Auto-Installer-Assets 资源库,这是一个纯资产存储库,通过 Git LFS 提供多种扩散模型(如 FLUX、WAN、QWEN、HiDream、LTX-2 等)的预打包模型文件、文本编码器、二进制文件和 Python 包,支持多种精度(如 fp16、fp8、GGUF 量
中国开发者通过“中转站”代理服务,以官方价格约10%的费用获取Anthropic的Claude模型API访问权限,绕过了地理封锁和身份验证。牛津大学研究员Zilan Qian的分析指出,这种模块化供应链不仅削弱了Anthropic的滥用监控能力,还可能助长身份和支付欺诈的黑色市场。运营商通过利用免费额度、模型替换和潜在的数据日志变现来压低价格。
Hugging Face 上发布了名为 Qwen3.8-27B-OBLITERATED 的模型,基于 Qwen3.8-27B 进行去审查(abliteration)处理,旨在消除安全拒绝和说教式回应。V3 版本通过迭代细化和定向语料库,在 MMLU 上仅下降 2.1 个百分点,同时实现了对受限查询的真实回答,并在代码生成任务中表现良好。该模型提供 GGUF、