斯坦福发布 CT 视觉-语言基础模型 Merlin
斯坦福 MIMI 团队在 Hugging Face 发布 Merlin,一个面向计算机断层扫描(CT)的 3D 视觉-语言基础模型,利用结构化电子健康记录(EHR)和非结构化放射报告进行预训练。仓库提供模型权重、示例图像以及放射报告生成和五年疾病预测等任务的权重,并配套 GitHub 代码与 pip 安装包 merlin-vlm。相关成果已发表于 Natur
技术方向 · 开源模型、框架与仓库动态:权重开放、社区项目、开源与闭源的力量对比 · 共 700 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
斯坦福 MIMI 团队在 Hugging Face 发布 Merlin,一个面向计算机断层扫描(CT)的 3D 视觉-语言基础模型,利用结构化电子健康记录(EHR)和非结构化放射报告进行预训练。仓库提供模型权重、示例图像以及放射报告生成和五年疾病预测等任务的权重,并配套 GitHub 代码与 pip 安装包 merlin-vlm。相关成果已发表于 Natur
AgentionAI 在 Hugging Face 发布了 Qwen/Qwen3.8-Flash-Next 的 Agention Precision (AP) GGUF 量化版本,兼容主线 llama.cpp,无需 fork。该系列提供从 AP-Q5 K XL 到 AP-IQ2 S 共 7 个量化档位,按每 GiB 显存精度优化,并给出各档位的 KL 散度与
DSPy 发布 3.4.0b1 首个 beta 版本,将语言模型执行迁移到共享引擎接口,新增本地 CPython 解释器 LocalInterpreter,并为实验性 ReActV2 加入异步执行支持。该版本还引入 GEPA 自定义 Flex 代码提案,并修复评估、流式传输和示例采样相关缺陷。官方强调这是预发布版本,API 和行为在稳定版前可能变化,3.4
Y Combinator CEO Garry Tan 在接受 CNBC 和 TechCrunch 采访时表示,美国不应监管中国 AI 实验室通过蒸馏技术从前沿模型获取知识的行为,反而主张美国小型开源权重 AI 实验室也应获准对美国前沿 AI 实验室进行蒸馏。他认为限制客户对闭源模型 API 的使用是一种过度干预,并指出专有 AI 实验室在训练时也曾未经许可使
llama.cpp 发布 b10917 版本,修复了此前在 MSVC 下为 llama-server 启用预编译头(PCH)时引入的构建问题,该修复跳过 MSVC 场景下的 PCH。此次发布同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
Together AI 发布博客,系统梳理开源 AI 技术栈,将其拆解为模型、推理、网关与路由、Harness、工具(Skills 与 MCP)五个相互独立的层次。文章指出开源模型质量已接近闭源模型,开发者无需自行训练模型或购置 GPU 即可迁移,并强调分层解耦让开发者能快速切换新模型。文中以 Kimi K3(1.8T 总参数、104B 激活参数)和 GLM
LangChain 发布 langchain-core 1.6.3 版本。该版本新增功能:允许基于网关响应覆盖模型名称和提供商的追踪元数据;同时补充了针对已废弃 .text() 访问路径的测试,并清理了 FileCallbackHandler. write 与 ChatGeneration.set text 文档中过时的 Args/Raises 条目。此次更
RunningHub 开源了 MiniMax H3 视频生成加速方案 H3 Lightning,通过 RH 后训练加速模型将生成步数从 50 步压缩至 9 步,并叠加 SageAttention2、Cache-DiT、torch.compile 及 TP2+Ulysses4 多卡并行优化,在 4 张 RTX 6000D 上把 5 秒视频生成耗时从 348.8
另有 1 家信源报道
Simon Willison 在其博客中推荐了 Graham Dumpleton 于 2026 年 8 月 31 日发布的新 Python monkey patching 库 wrapture,认为它有望成为 Python 开发者的必备工具。wrapture 同时服务于测试和可观测性(类似 New Relic 风格的追踪),支持单元测试、调用记录、分阶段行为
Xinference 发布 v3.4.0,新增 vLLM 原生多进程执行器路由、Gemma-4 Transformers 后端批处理支持、prefill/decode 分离、多 worker 副本扩缩容等特性,并加入 MonkeyOCR、dots OCR、Fish Audio S1-mini/S2-Pro、MiniCPM5-2B 等模型支持。该版本还增强了缓
Interconnects AI 作者 Nathan Lambert 发布并持续更新一份关于开源 AI 与开放模型的阅读清单,汇总近几年的代表性文章。清单按基础概念、中美竞争、技术细节等主题组织,涵盖开放模型的定义、发布动机、商业战略、安全风险、数据缩减以及中国模型(如 Kimi K3、GLM-5.2)对生态的影响。文中还提到西方公司采用中国模型引发监管关注
开发者 aj9o9 将 EschaLabs 的 Qwen3.8-27B-Escha-W2 模型移植到 llama.cpp,通过新增 GGML OP ESCHA MUL MAT 算子在内核中直接解码原生 2-bit escha 量化数据,无需解包为稠密张量。提供 Q8 0 和 F16 两种 GGUF 构建及可选的 MTP 推测解码草稿模型,但需要其 llama
llama.cpp 发布 b10909 版本,主要重构 Metal 后端的算子融合机制,将所有可融合模式统一到单张融合表(ggml-metal-fuse.cpp),供图优化器和算子编码器共用。修复了融合模式中输出索引使用相对索引导致 norm/MUL 融合被静默禁用、token 生成性能回退约 5% 的问题。新增 gated delta net 与 KV c
llama.cpp 发布 b10907 版本,主要修复了 deepseek2、glm4moe、cohere2moe 等架构下 MTP(多 token 预测)上下文的 KV cache 分配问题,并新增了反向架构门控与针对 MTP 层过滤的架构测试。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。
llama.cpp 发布 b10906 版本,修复了服务器端在图像输入后进行推测解码(speculation)时的位置传递问题:此前向 drafter 传递的是 token 数量而非实际位置,该问题影响所有 drafter 而不只是 DFlash。同时将 draft 参数 n past 重命名为 pos0,以明确其表示位置而非 token 数。该版本同步提供
zai-org 发布并开源了多模态 OCR 模型 GLM-OCR,基于 GLM-V 编码器-解码器架构,引入多令牌预测(MTP)损失和全任务强化学习,并集成 CogViT 视觉编码器与 GLM-0.5B 语言解码器。该模型在 OmniDocBench V1.5 上取得 94.62 分排名第一,参数量仅 0.9B,支持 vLLM、SGLang、Ollama 等
llama.cpp 发布 b10905 版本,主要更新为 CUDA/HIP 上的 Flash Attention 调优(针对 gfx1201)。该改动在 RDNA4 上为 head size 256 启用 mma Flash Attention 并调整配置,同时在 AMD WMMA 上优先使用整块 tile 的 FA 网格而非 stream-k,并修订了 s
Hugging Face 用户 LessThanThreeAI 发布了 Qwen3.8-27B-Humanlike-Chat-GGUF,这是基于 huihui-ai/Huihui-Qwen3.8-27B-abliterated 量化并叠加 rank-256 Humanlike Chat LoRA 适配器的 27B 本地模型,主打拟人化角色扮演与个人聊天而非助
华为昇腾社区发布 TorchNPU,这是面向昇腾 NPU 的 PyTorch 适配插件,使 PyTorch 框架可直接调用昇腾 NPU 算力。该插件复用上游 PyTorch 能力并针对昇腾 NPU 做深度适配,涵盖基础计算、分布式训练(FSDP2、DTensor、集合通信)、图模式加速、调试调优及内存管理等模块。最新版本 TorchNPU 26.0.0 已支
在2026 Inclusion·外滩大会上,蚂蚁密算董事长韦韬宣布可信原生智能体HOP 3.0正式开源,向开发者、企业和行业专家开放智能体原生语言技术能力。HOP 3.0提出以智能体原生语言融合显性结构化逻辑与大模型推理,并借鉴SQL事务commit机制实现探索—核验—提交分离,以解决自主智能体在金融、医疗、政务等严肃场景中的三重失控问题。据披露,在复杂规格