智谱完成335亿元融资,押注RSI自训练体系
智谱宣布完成约50亿美元(约合人民币335.4亿元)融资,包括约20亿美元股份配售及约30亿美元零息可转债,资金约60%用于下一代GLM基础模型与完全自训练体系研发,重点探索递归式自我改进(RSI)循环。公司披露2026年上半年营收9.54亿元、同比增长近400%,MaaS及API收入8.25亿元,ARR达16亿美元。此举反映国产大模型头部厂商融资与上市竞赛
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
智谱宣布完成约50亿美元(约合人民币335.4亿元)融资,包括约20亿美元股份配售及约30亿美元零息可转债,资金约60%用于下一代GLM基础模型与完全自训练体系研发,重点探索递归式自我改进(RSI)循环。公司披露2026年上半年营收9.54亿元、同比增长近400%,MaaS及API收入8.25亿元,ARR达16亿美元。此举反映国产大模型头部厂商融资与上市竞赛
Hugging Face 用户 rahul7star 发布了一个名为 gemma-gguf 的 GGUF 量化模型合集,基于 google/gemma-4-E2B-it、gemma-4-12B-it 和 ornith-ai/Ornith-1.5-9B 等基础模型,主要以 Q6 K 量化为主,并提供了 Gradio 在线演示空间。该合集包含多个面向编码 Age
llama.cpp 发布 b10931 版本,主要变更是为 UI 添加缓存功能(PR #28802),由 Adrien Gallouët 提交。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
研究者提出一个端到端多智能体框架,可从自然语言问题描述自动生成 QUBO(二次无约束二值优化)公式,并支持结构化或非结构化测试用例。团队同时发布 QUBOBench 基准,涵盖 12 个应用领域的 100 个组合优化问题。实验显示该框架在 QUBOBench 上达到 68% 准确率,比直接单次调用基线(46%)高出 22 个百分点,其中迭代自修复被识别为提升
开发者 aj9o9 将 EschaLabs 的 Qwen3.8-27B-Escha-W2 模型移植到 llama.cpp,通过新增 GGML OP ESCHA MUL MAT 算子在内核中直接解码原生 2-bit escha 量化数据,无需解包为稠密张量。提供 Q8 0 和 F16 两种 GGUF 构建及可选的 MTP 推测解码草稿模型,但需要其 llama
研究者提出 ReqEvolve,一个面向用户驱动软件自演化的运行时代码生成系统,通过自动需求工程与测试驱动开发,将用户的高层自然语言请求转化为可执行功能。在 18 个项目、72 个软件演化案例上,ReqEvolve 达到 89.2% Pass@1,分别比 SpecFix 和消融基线高出 18.8% 和 32.6%。根因分析显示 64.5% 的失败案例源于代码
研究提出 ORCH(Organizing Roles and Coordination Hierarchies)框架,将人类组织理论中的池化与顺序依赖原则操作化,用于组织大规模异构具身智能体。在 25 个野火响应任务中,使用 8 个大语言模型评估最多 50 个异构智能体,ORCH 组织在任务结果、执行效率、探索和计算资源使用上均优于四种代表性具身多智能体方法
该论文提出 M3-Former,一个结合大语言模型与多模态 Transformer 的船舶轨迹预测框架,用于长期(1-4 小时)轨迹预测。方法将船舶静态属性与航行意图作为语义先验,通过预训练 LLM 编码并与动态轨迹特征对齐,同时引入双粒度混合专家(MoE)架构分别建模全局航线规划与局部机动行为,并设计转向加权交叉熵损失缓解稀疏转向样本的长尾问题。在丹麦真实
研究团队开发了一个面向临床问诊训练的脚手架式多智能体LLM系统(AI标准化病人),包含病人智能体、导师智能体和回合级评估智能体。在100名医学生的随机对照试验中,多智能体脚手架条件相比结构化非LLM对照组提升了最终考试成绩,尤其在沟通、共情表达和病史采集行为上改善显著,但诊断准确率无显著差异。团队还发布了多专家标注数据集以支持后续研究。
研究者发布 CMNIE,一个面向中文军事新闻的信息抽取基准数据集,联合标注了事件触发词、事件论元、命名实体和实体关系四层信息。数据集包含 13,000 条来自公开中文军事新闻的实例,人工标注了 7 种事件类型、10 种论元角色、7 种实体类型和 8 种关系类型。实验显示监督模型、零样本大模型和微调大模型在该基准上仍具挑战性,尤其在关系抽取和事件论元跨度精确匹
Hugging Face 用户 DavidAU 发布了基于 Qwen/Qwen3.8-27B 微调的模型 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NM-DAU,采用 Apache-2.0 许可,主打去审查(uncensored)与多阶段调优。作者称该模型在 ARC-C 等核
Google Research 在 ACL 2026 发表 ToolGrad,一种「答案优先」的工具使用数据集生成框架:先生成工具调用链,再反向标注用户查询,并借鉴 TextGrad 的「文本梯度」迭代构建复杂 API 工作流。基于 ToolBench 的 1.6 万+ API 生成 ToolGrad-500 数据集,微调 Gemma-3(1B/4B/12B
AWS 为 Amazon SageMaker HyperPod 上的推理推出模型缓存功能,通过预加载模型权重和容器镜像到集群节点的本地 NVMe 存储,将推理 Pod 的冷启动时间从数十分钟缩短到数秒。该功能针对 DeepSeek-R1 等 600GB 以上大模型,解决自动扩缩容时因重复下载镜像和权重导致的响应延迟问题。缓存采用优先调度而非强制调度,未命中缓
AWS Machine Learning Blog 介绍了一种基于 LLM 的模型无关 PII 检测器,通过指令驱动检测逻辑,可在 Amazon Bedrock 或自托管模型上运行。该方案将实体类型和输出格式变为可配置项,无需重新训练即可扩展检测范围,并在五个公开 PII 语料库上与包括 OpenAI PrivacyFilter 在内的九种 LLM 检测器进
Hugging Face 用户 peculiar-ragdoll 发布了 Nail-Qwen3.6-35B-A3B-GGUF-MTP,这是基于 Qwen3.6-35B-A3B 的 4-bit GGUF 量化模型,保留了标准量化中被丢弃的多 token 预测(MTP/nextn)张量,并内置改进的聊天模板与强制系统提示。该模型面向推理、多轮对话和 agenti
Arena.ai 分析了 Anthropic 的 Claude 从 Fable 5 到 Fable 5.1 在数万条高推理 Text Arena 输出中的写作变化。Fable 5.1 减少了附和式开场、破折号以及“honestly”“frankly”等措辞,但回答变得更长,中位长度从 319 词升至 414 词,仍比 Opus 5 的 525 词短 21%。
美团技术团队发布《Agent 评测白皮书》系列第一篇《Agent 评测全览》,指出过去三年基座模型能力提升与 Agent 框架功能丰富使搭建 Agent 门槛持续降低,但绝大多数 Agent 项目因缺少可靠判断机制而失败。文章提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产,并强调评测应从答案评测走向行为评测,同时需通过 Case 挖掘与
Noora Health 在印度基于 WhatsApp 的母婴护理服务中,将原本由 LLM 直接分类紧急情况的 triage 系统重构为两步:LLM 按临床医生编写的词表抽取规范症状与患者背景,再由确定性规则引擎判断是否紧急。新系统将召回率从 0.565 提升至 0.810,F1 从 0.606 提升至 0.702,并带来可审计性,临床专家可逐阶段检查错误、
该论文针对IoT-边缘-云连续体中的资源管理问题,指出现有深度强化学习(DRL)虽擅长快速自适应控制,但难以处理自然语言意图、合规规则等高层约束,而LLM可充当其上的可解释编排层。作者在Wang等人的DRL连续体编排分类法基础上新增两个维度:AI增强范式(LLM0-2,衡量LLM如何被使用)和反馈通道(F,衡量执行反馈是否及如何返回LLM以闭合MAPE控制环
该研究通过观察分析和控制实验,探究代码注释对LLM代码生成性能的影响。在LiveCodeBench上,注释频率和意图无法可靠预测pass@1;但用强模型生成的正确注释预填充弱模型,可使pass@1平均提升17.2%,而错误注释无增益,不同问题的注释则降低20.8%。提示工程最多只能恢复约24%的外部注释增益,表明注释帮助代码生成的关键在于其包含正确解题内容,