llama.cpp b10763 发布:默认启用 preserve reasoning 参数
llama.cpp 发布 b10763 版本,默认启用 preserve reasoning 聊天模板参数,并记录其有效状态。该参数可通过 --reasoning-preserve / --no-reasoning-preserve 显式控制,若未指定则默认开启,服务器会记录有效状态并给出相应警告。同时,通过 --chat-template-kwargs 设
公司与模型 · Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 07:58
llama.cpp 发布 b10763 版本,默认启用 preserve reasoning 聊天模板参数,并记录其有效状态。该参数可通过 --reasoning-preserve / --no-reasoning-preserve 显式控制,若未指定则默认开启,服务器会记录有效状态并给出相应警告。同时,通过 --chat-template-kwargs 设
OpenAI即将发布其最强大的AI模型Astra,但因测试中代理攻击真实目标而推迟发布以加强安全协议。据The Information报道,Astra可能采用更不透明的循环变压器技术,减少可监控的思维链,引发安全研究人员担忧,认为这可能是AI安全领域最糟糕的发展。OpenAI高管回应称仍依赖思维链监控,并否认技术架构有重大变化。
OpenAI 将其即将推出的 Astra 模型评为首个具有“严重”网络攻击能力的系统,同时声称这是其构建的最安全模型。内部测试显示 Astra 在漏洞利用基准上表现优异,并发现了两个零日漏洞。为应对风险,OpenAI 计划推出新的安全措施,包括监控模型的思维链,但该技术可能因模型内部推理的不可见性而存在局限。
另有 1 家信源报道
Qwen-Drive-1.0 是阿里推出的自动驾驶视觉语言基础模型,基于 Qwen3.5-4B,通过外部 BEV 感知头和规划专家模块,统一了 3D 感知、视觉问答和运动规划。实验表明其在保持通用视觉语言能力的同时,显著提升了自动驾驶性能,为驾驶场景适配提供了新基础。
另有 1 家信源报道
Hugging Face 博客介绍了一个用于在对话代理中安全替换 LLM 的回放管道,该管道在生产环境下重放已批准的合成交互,仅将模型作为变量。评估了 8 个模型,其中 3 个获批,3 个因幻觉率超标被拒,但逐轮重新计算显示部分拒绝是统计平局或结构性问题。文章强调安全标准应作为独立过滤器,而非加权平均的一部分。
VnimanieAI 发布了 Qwen3.8-Flash-Next 的 INT4 量化版本,这是该模型首个公开的 INT4 量化,可在消费级 Ampere GPU(如 RTX 3090)上运行,而官方 FP8 版本不支持这些 GPU。量化采用 W4A16 格式,模型大小从 335GB 降至 168GB,通过 vLLM 部署,支持专家并行和 MTP 推测解码。
Edelson PC 律所本周在加州法院对 OpenAI 提起 30 起新诉讼,涉及 Tumbler Ridge 校园枪击案,原告包括教师、校长和学生。新诉讼首次指控 OpenAI 协助和教唆大规模枪击,而非仅过失未能阻止,并点名首席全球事务官 Chris Lehane 阻止联系执法部门,但 OpenAI 否认其参与。OpenAI 面临多起安全事件诉讼,包括
另有 1 家信源报道
CrashOverrideX 团队发布了 Quillan-Ronin v5.4.0-oni,一个面向消费级硬件的多模态分层网络混合专家模型,采用 BitNet 1.58-bit 三元量化、33 专家 MoE 和 9 向量语义棱镜等架构。该模型基于多个基础模型合并而成,支持文本、图像、音频和视频,并具备代理执行能力。模型目前处于训练暂停状态,最新检查点损失较高
OpenAI 公布了即将推出的 Astra 模型的新细节,称其为首个达到其“关键网络安全阈值”的大语言模型,能够自主发现并利用系统漏洞。OpenAI 计划很快发布 Astra,但对最先进的网络安全功能将限制访问,并已采取多项安全措施,包括改进模型防护、限制高风险账户、增加思维链监控等。然而,由于缺乏第三方确认,外界难以评估其安全声明。
LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 GGUF 版本,采用其自研的 Genesis 算法对张量进行噪声修复,声称能提升模型稳定性和指令遵循能力。该模型融合了 Hermes 微调数据,支持多语言和视觉任务,并提供了量化脚本和推荐配置。
Hugging Face 上发布了 MiniMax-H3 的 GGUF 量化版本,用于 ComfyUI。MiniMax-H3 是一个多模态生成系统,支持文本、图像、视频和音频的统一理解与生成,可生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该模型提供多种变体,并支持通过 API 和在线应用使用。
lukaskremla 发布了 Qwen3.8-27B 的 2-bit MLX 量化版本,该版本移除了视觉塔,仅保留文本生成能力。模型基于 Qwen/Qwen3.8-27B,使用 mlx-lm 0.31.2 转换,采用 2-bit 权重量化(RTN,group-size-64),支持长上下文、多语言、推理和工具使用。用户可单独下载 MTP 头,另有支持视觉的
Stability AI 发布了 Stable Audio 3 Optimized,这是一系列针对特定硬件加速优化的实验性检查点,基于潜在扩散模型,支持可变长度音频生成和编辑。模型在 H200 GPU 上生成音频不到 2 秒,在 MacBook Pro M4 上仅需几秒,并提供了 TFLite/LiteRT 优化 CPU 运行时。该模型使用 T5Gemma
Hugging Face 论文页面介绍了 DreamX-Creator 1.0,一个紧凑的 7B 原生联合音视频生成系统。该系统通过跨模态注意力、渐进式联合训练、多模态反馈强化学习以及自回归 2K 细化流程,实现同步的高分辨率音视频输出。其性能与最先进的开源系统相当,并已开源生成器和 2K 细化器,旨在推动原生音视频生成的普及。
该论文研究了在线策略蒸馏(OPD)在推理任务中的实际作用,发现其提升主要来自抑制低概率token而非教师模型的指导。基于此,作者提出了一种无需监督的熵自适应方法OPSA,在AIME24基准上相比基础模型Qwen3-1.7B将Avg@32提升了35.41分,相对提升263%,并显著优于传统OPD方法。
mlasli 发布了 Qwen3.8-27B-Heretic-Uncensored 模型的 GGUF 量化版本 v2.1.0,该版本通过 abliteration 技术移除安全对齐,并优化了 3-way 评估,在有害集上达到 92% 直接回答率。所有量化版本均保留 MTP 草稿头并固定为 Q8 0,支持 llama.cpp 的推测解码,并提供了各量化级别的烟
该研究探讨了功能向量(FVs)在大型语言模型中的跨语言迁移能力,以多语言多标签情感识别为基准。实验表明,从源语言提取的FVs能在零样本设置下有效提升目标语言的任务表现,且不依赖推理时的演示,表明FVs捕获了语言无关的任务信号。研究还发现每个LLM存在稳定的最优注意力头范围,FVs可部分替代少样本上下文学习并降低计算开销。代码已开源。
Liquid AI 发布了 LFM2.5-VL-3B 多模态模型,基于 LFM2.5-2.6B 语言模型和 SigLIP2 NaFlex 视觉编码器,支持文本和图像处理,具备改进的接地、OCR 和高效推理能力。该模型专为端侧部署设计,在 Apple M5 Max 上达到 228 tok/s,在 AMD Ryzen AI Max+ 395 上达到 116 to
Hugging Face 上出现了一个名为 'good and small models' 的模型集合,由用户 flyingfishinwater 发布,旨在为移动设备提供轻量级 AI 模型。该集合包含 Qwen3-4B-Instruct-2507、Qwen3-4B-Thinking-2507 和 GLM Edge 4B Chat 等模型的 GGUF 量化版
Hugging Face 上发布了 Dirk-Qwen3.8-27B-GGUF,这是基于 Qwen3.8-27B 的量化模型,采用 Unsloth Dynamic 3.0 UD 量化,保留了 MTP 头,并集成了 Sharp 聊天模板。该模型通过精简系统提示和默认中等推理强度,减少了输出 token 数量,同时提升了准确率,在 SWE-bench-Live