AgentionAI 发布 Signal 3.8 27B:Qwen3.8 高效微调 GGUF
AgentionAI 发布 Signal 3.8 27B,这是对 Qwen3.8-27B 的微调版本,以 GGUF 格式提供,采用自蒸馏训练,不引入外部数据。官方评测显示其答案 token 减少 25%、思考 token 减少 41%,同时 GSM8K 准确率持平或提升,并借助内置 MTP 草稿头提升投机解码接受率,端到端生成时间最多缩短约 19%。
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
AgentionAI 发布 Signal 3.8 27B,这是对 Qwen3.8-27B 的微调版本,以 GGUF 格式提供,采用自蒸馏训练,不引入外部数据。官方评测显示其答案 token 减少 25%、思考 token 减少 41%,同时 GSM8K 准确率持平或提升,并借助内置 MTP 草稿头提升投机解码接受率,端到端生成时间最多缩短约 19%。
Biohub 在 Hugging Face 上发布 ESMC-6B 蛋白质语言模型,拥有 60 亿参数、80 层,基于 UniRef、MGnify 和 JGI 的蛋白质序列训练。同时开源了 300M 和 600M 参数变体,并基于冻结的 ESMC-6B 训练了 ESMFold2 结构预测模型和稀疏自编码器。该模型可用于蛋白质表示、变体效应预测和蛋白质工程等
llama.cpp 发布 v0.4.1,新增 Maple 20B-A1B 三元 MoE、腾讯 Hy 4 预览版和 Spark2.5 模型支持,并改进 JSON schema 处理、聊天解析、日志和服务器子进程管理。核心变更包括修复 DeepSeek2、GLM-MoE 等模型的 MTP KV 缓存分配,以及 Qwen/Kimi/GLM 的 GDN 归一化问题。
llama.cpp 发布 b10964 版本,将版本号提升至 0.4.1(PR #28900)。该版本为 macOS、iOS、Linux、Android、Windows 及 openEuler 等多个平台提供预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
llama.cpp 发布 b10955 版本,修复了 ggml-cpu 中因预编译头(PCH)导致的 CACHE LINE SIZE 不一致问题。PCH 强制在 ops.h 之前包含 ggml-impl.h,使 C++ 内核使用 256 字节的硬件破坏性干扰大小,而 C 工作缓冲区代码仍用 64,导致 rope 工作缓冲区偏小并引发堆缓冲区溢出,最终在 gg
Hugging Face 用户 ngquocvinh 发布了 IFM/K2-Horizon-MoVA-36B-A4B 的社区 GGUF 量化版本,提供从 Q8 0 到 Q1 0 共 15 种量化档位。该基础模型是采用 Mixture-of-Values 注意力的稀疏 MoE 模型,总参数 36B、每 token 激活约 4B,原生支持 524,288 tok
蚂蚁灵波联合魔搭社区、阿里云天池发起首届蚂蚁灵波具身大模型挑战赛,以外滩大会论坛为启动场合。大赛以2026年7月全面开源的LingBot-VLA 2.0具身智能基座模型为技术底座,面向全球企业、高校和个人开发者开放。赛程包括线上初赛(含RoboTwin 2.0仿真任务与可选真机任务)和11月在上海举行的线下真机黑客马拉松,旨在推动LingBot-VLA在开发
llama.cpp 发布 b10952 版本,主要修复了 SYCL 后端中 oneDNN scratchpad 破坏内存池释放顺序的问题(PR #28704)。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
mlx-optiq 发布了 mlx-community/gemma-4-12B-it-qat-OptiQ-4bit,这是基于 Google 量化感知训练(QAT)版 Gemma-4 12B 的 4-bit 混合精度 MLX 量化模型。它采用敏感度引导的逐层比特分配(157 个组件用 8-bit,171 个用 4-bit,平均 5.25 bits-per-we
llama.cpp 发布 b10951 版本,其中一项改动是将 llama n rs seq 检查移到 llama decode 调用之前,若检查为真则直接返回,从而在不需要时避免调用 llama decode。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SY
研究团队发布 Occamy-1.0,一个基于 Qwen3.6-35B-A3B 检查点继续训练得到的 35B 规模协作(co-work)智能体模型。该模型通过执行导向数据、可回放长程轨迹基础设施以及分阶段后训练(Marathon Expert 与 Sprint Expert 合并)来提升工具调用、状态跟踪与长任务连续性。在多个协作基准上,Occamy-1.0
中国公司深度机智于2026年9月9日发布物理基座模型PhysBrain 1.5,在28项公开基准上取得72.5综合均分,位居开源模型首位,与GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)差距收窄至1分以内。该模型围绕其提出的Physical Loop物理智能循环架构,将具身理解、动作生成与未来状态预测统一在同一训练框架中,并
开发者 jcbtc 在 Hugging Face 发布了 Qwen3.8-Flash-CIRU-STRIX-IU4 v4.0.0,这是面向 128 GB AMD Strix Halo(Ryzen AI Max+ 395)机器的 Qwen3.8 Flash 量化包,支持长上下文文本生成、OpenAI 兼容 API、Web UI 和可选图像输入。该包基于 Qwe
Simon Willison 发布了一个名为 commit-rewriter 0.1 的小型 Web 应用,用于编辑 Git 仓库的提交信息。该工具最初是为了清理 Datasette 安全版本发布中带有编码代理痕迹和私有仓库 issue ID 的提交记录。用户可通过 uvx commit-rewriter path/to/repo 运行,提交编辑后工具会创建
Simon Willison 为其截图自动化工具 shot-scraper 增加了 WebP 格式支持,用户可通过 --quality 参数控制质量,不指定时输出无损 WebP。作者称 WebP 截图文件体积通常明显小于 JPEG 或 PNG,该功能是为其新的 commit-rewriter 工具生成截图而开发。
handy-computer 在 Hugging Face 发布了 nvidia/nemotron-3.5-asr-streaming-0.6b 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型是 0.6B 参数的 cache-aware 流式 FastConformer 编码器加 RNN-T 解码器,支持 32 种语言区域的多语言语音
handy-computer 在 Hugging Face 发布了 openai/whisper-small 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型支持多语言转录、语言检测和语音翻译,提供 F32 到 Q4 K M 六种量化规格,其中 Q8 0 仅 270MB 且 LibriSpeech test-clean WER 为 3.
handy-computer 在 Hugging Face 发布了 openai/whisper-medium 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型支持多语言转录、语种检测和语音翻译,提供 F32 到 Q4 K M 共六种量化规格,其中 Q4 K M 仅 504 MB 且 LibriSpeech test-clean WER
Hugging Face 用户 koongrizzly 发布了 MiniMax H3 的量化模型合集,包含来自 Winnougan 的 INT4/W4A8 ConvRot 量化 transformer 与文本编码器,以及自行转换的混合 FP16/FP32 Video VAE,并整合了 Turbo LoRA。该仓库面向消费级 GPU 的本地低显存推理,官方适配
llama.cpp 发布 b10948 版本,主要变更是将 HY V4 从 WebGPU 的 test-llama-archs 测试中排除(PR #28855,由 Stanisław Szymczyk 共同提交)。该版本同时提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CUDA、V