llama.cpp v0.4.0 发布:新增多模型支持与稀疏注意力
llama.cpp 发布 v0.4.0 版本,新增对 Qwen3.8-Flash-Next、Nemotron-3-Puzzle 等模型的支持,并引入按需张量读取、服务器每槽上下文限制和视频输入选项。核心更新包括 ggml 0.23.0 的稀疏闪存注意力与 RDMA 支持,以及多项多模态和服务器功能改进。
公司与模型 · DeepSeek(深度求索)的模型发布、开源权重与技术报告——开源大模型价格与能力的搅局者
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 19:03
llama.cpp 发布 v0.4.0 版本,新增对 Qwen3.8-Flash-Next、Nemotron-3-Puzzle 等模型的支持,并引入按需张量读取、服务器每槽上下文限制和视频输入选项。核心更新包括 ggml 0.23.0 的稀疏闪存注意力与 RDMA 支持,以及多项多模态和服务器功能改进。
商汤奖学金设立十年,累计资助280位本科生,包括DeepSeek核心作者郭达雅、vLLM联合创始人游凯超等。奖学金不仅提供资金,还提供算力、导师资源和学术网络,支持青年研究者早期成长。获奖者研究方向从CV转向大模型与具身智能,商汤CEO徐立表示将继续支持青年人才。
南京大学计算机学院副教授蒋炎岩在秋季新开设的《生成式软件工程》课程中,提出“没有Token的CS学生应立即退学”的言论,并规定“禁止古法编程、Token自费”,引发知乎热议。课程旨在让学生适应AI时代,学会高效使用大模型,而非依赖传统编程方式。蒋老师推荐使用DeepSeek-V4-Flash模型,并鼓励学生通过AI工具提升能力,缓解CS学生的集体焦虑。
PydanticAI 发布 v2.38.0 版本,新增了 context window 字段、gemini-3.8-flash 模型支持,以及 Claude Fable 5.1 和 Claude Mythos 5.1 模型支持。同时修复了多个 bug,包括 DeepSeek 和 Together 的 tool choice 处理、Bedrock Mantle
谷歌发布Gemini 3.8 Flash及其网络安全版本3.8 Flash Cyber,这是六周内第三款Flash模型。该模型在编码和智能基准上超越前代,价格与3.7 Flash持平,但推理成本更高。谷歌强调其性能提升源于额外推理步骤,并推荐效率敏感场景使用3.7 Flash。
雷峰网专访了前华为“天才少年”李博杰,他谈及对标签的无奈、创业经历及对AI技术的认知。李博杰开源了《深入理解AI Agent》一书,两周获2.8万星,并反思了首次创业的失误,目前以顾问身份参与Pine AI。
国产GPU企业壁仞科技发布2026年中期业绩,上半年营收12.36亿元,同比增长约1997.6%,亏损大幅收窄76.4%至3.77亿元。公司完成互联网大客户导入,并发布新一代NPO光互连超节点方案,支持FP8/FP4精度,自研BLink 2.0协议。壁仞科技正牵头制定异构混训国家标准,并完成DeepSeek-V4等旗舰大模型适配。
筷子科技发布视频商业AI能力统一价值单位“KP”及企业“KP钱包”,旨在统一管理模型调用、内容生产、分发等环节的预算与能力。KP建立在Token之上,覆盖模型、算力、Agent、工具等资源,企业可通过KP钱包分配预算并管理多业务环节。目前Kuaizi已积累超1.2亿条商业视频,服务13500多家付费企业,并展示了多个客户效率提升案例。
AgenticRag-R1 是一个基于强化学习的框架,通过内存栈和细粒度动作空间深度融合推理、检索和记忆,并采用分层动作感知奖励和信息感知轨迹拒绝策略,以解决现有 RAG 系统在多步推理中自适应检索和上下文修订的不足。实验表明,该方法在多个多跳、开放域和智能体推理基准上优于强基线,并展现出更稳健、可解释且记忆感知的推理行为。代码已在 GitHub 上匿名公开
llama.cpp 发布 b10727 版本,主要更新是为 Metal 后端添加了量化类型的 concat 支持,并提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件。该版本还包含 KleidiAI 和 openEuler 构建的禁用说明,以及相关链接。
智东西报道,OpenClaw 2.0 在停更7周后发布,这是其史上最大更新,涉及安装流程、浏览器界面、共享会话等全面翻新。新版本由 OpenClaw Foundation 运营,创始人加入 OpenAI 但项目保持独立。实测显示安装更简单,支持导入 Hermes 记忆,但仍有极客风格,对非开发者不友好。社区反响不一,有人认为其丰富了开源生态,也有人仍偏爱 H
在2026世界机器人大会上,八位AI创业者围绕世界模型展开讨论,认为其需从生成走向理解物理世界,并面临数据、算力、安全等挑战。他们提出世界模型应具备生成、物理和认知智能,落地路径宜从工业到商业再到家庭。
前 Kimi CLI 负责人、Raft 创始人 stdrc 在采访中提出,模型越强,Harness 反而越厚,但复杂度从能力层转移到协作层。他基于 Kimi CLI 的实践,指出底层 Harness 可被模型内化,而上层多智能体协作、状态管理等需求催生更厚的 Harness。Raft 正是这一理念的实践,通过跨厂商通信协议和团队协作机制,将 Harness
NVIDIA 发布了 Kimi-K2-Thinking-NVFP4,这是 Moonshot AI 的 Kimi-K2-Thinking 模型的量化版本,采用 TensorRT Model Optimizer 进行 NVFP4 量化,支持 vLLM、SGLang 和 TensorRT-LLM 推理,专为 NVIDIA Blackwell 硬件优化。该模型拥有
剑桥大学计算机科学教授兼OCaml编译器核心维护者Anil Madhavapeddy报告称,OCaml项目在补丁讨论后几分钟内就遭到利用尝试,表明自动化监控者正关注公共仓库。现代编码代理能快速发现漏洞,仅凭漏洞传闻即可找到利用方法,这使现有开源安全披露流程面临挑战。rclone维护者Nick Craig-Wood也证实,该项目最近一个月收到超过40份安全披露
据传英伟达将以130亿美元收购开源AI模型平台Hugging Face,此前英伟达已与Poolside达成60亿美元协议,Stripe也以70多亿美元收购了OpenRouter。这些交易表明,科技巨头正通过收购开源AI公司来对冲对前沿实验室的依赖,并应对推理成本上升和自研芯片趋势。开源模型目前使用率较低,但因其成本效益和可定制性,未来可能被更多企业采用。
智东西报道,Hermes Agent 推出 Real Profile Browsing 功能,可复制 Chrome 登录态到隔离浏览器,使 Agent 能以用户身份访问网站。实测发现存在浏览器卡死、Cookie 覆盖、macOS 加密限制等问题,且与 Claude Code、OpenAI Codex 的浏览器方案相比,便利与风险并存,当前可用性有待优化。
Hugging Face 博客文章解释了现代LLM中的“engram”概念,即通过哈希多个token序列来创建额外嵌入,以缓解感知机学习局部序列信息的负担。文章指出engram本质上是嵌入,但通过哈希n-gram序列实现条件记忆,并讨论了哈希冲突、置信门控等技术细节。该方法由DeepSeek和美团等提出,旨在提升模型对常见序列的记忆能力,同时保留注意力机制处
腾讯混元团队发布了新一代MoE旗舰模型Hy4 preview,总参数770B,激活参数49B,支持1M上下文长度。该模型在软件工程、办公分析、游戏开发和科学研究等领域进行了优化,并与CodeBuddy、WorkBuddy等产品协同设计。内部盲评显示,Hy4 preview在工程任务上略优于GLM 5.3和Kimi K3。模型权重已在Hugging Face、
OpenCompass 发布 v0.5.4 版本,集成了 VLMEvalKit 以支持多模态评估,并新增多轮推理能力及 Multi-IF 基准。该版本扩展了模型 API 生态,支持 LiteLLM 网关和 TurboMind 的 PPL 评估,并新增了金融、长上下文、对齐、信息抽取和代码推理等多个基准测试。此外,修复了多项评估正确性和生成行为问题,并提升了安