开放模型当前的力量格局:中美竞争现状
Interconnects AI 作者向美国国会议员及幕僚介绍开放权重模型在中美竞争中的现状。文章指出,自 2025 年 4 月起中国 AI 公司在开放权重模型领域明显领先,Hugging Face 下载量约为美国的两倍(32 亿对 16 亿),在 Artificial Analysis 智能指数上中国模型 GLM-5.3、Kimi K3 等得分 42-45
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Interconnects AI 作者向美国国会议员及幕僚介绍开放权重模型在中美竞争中的现状。文章指出,自 2025 年 4 月起中国 AI 公司在开放权重模型领域明显领先,Hugging Face 下载量约为美国的两倍(32 亿对 16 亿),在 Artificial Analysis 智能指数上中国模型 GLM-5.3、Kimi K3 等得分 42-45
该项目基于 OpenRouter 公开 API 构建了一个覆盖 425 个模型的排行榜,展示每百万 token 价格、服务商、精度、可用性、上下文长度、实测响应速度和韩语质量。作者对 330 个模型从敬语、韩国制度知识、格式遵循、术语等七个维度独立评分,发现约三分之一模型韩语评级为 F,且质量、性价比、速度领先者几乎从不重合。此外,作者用付费 API 对 3
OceanBase团队提交的Data Agent方案Scout在国际数据智能体基准DAB上以90.62%准确率登顶,成为首个突破90%的参评方案。该方案基于国产大模型GLM-5.2构建,超过多项基于GPT、Claude Opus、Claude Fable等海外模型的方案。方案通过DataLens数据画像、执行路径规划与证据追踪校验形成闭环,相关能力将融入Oc
另有 1 家信源报道
马萨诸塞大学洛厄尔分校与阿默斯特分校的研究者提出 DischargeBench,一个以患者人设为基础、开放式多轮对话的模拟框架,用于评估 LLM 作为出院教育者的能力。他们构建了包含 477 个病例、覆盖 24 个 ICD 章节的 MIMIC-IV-Ext-DischargeBench 数据集,并引入教育监督智能体来维持虚拟患者的真实感。评估从对话质量、主题
研究者提出 Bayesian Chronicle Agents (BCA),在 LLM 智能体的 persona 与语言生成之间加入一个显式贝叶斯信念层,将每个立场表示为概率,每听到一句话做一次贝叶斯更新,并用单一 prior-strength 参数控制固执程度。该参数可扫描出共识、持续分歧、坚定少数影响三种经典舆论动力学机制,并在四个 LLM 上验证了信念
研究者从公开来源收集真实世界BI项目(.pbix文件),人工提取业务问题与标准答案,构建了首个端到端BI基准BI-Bench。测试发现前沿LLM在BI-Bench上准确率不足50%。为此提出工具增强的BI-Agent,将BI工作流分解为搜索、连接、转换等子任务,并开发后训练框架合成训练轨迹,结合SFT和RL进行训练。BI-Agent在BI-Bench上相比原
越南多所高校与VNPT AI的研究者提出HERMES,一个仅基于临床文本的图推理框架,用于患者结局预测。该方法利用LLM引导的抽取构建个性化知识图谱,并通过对比逻辑建模显式捕捉时间动态、治疗失败与结局变化,再用图注意力网络生成患者表示。在MIMIC-III和MIMIC-IV上的院内死亡率和30天再入院预测任务中,HERMES持续优于纯文本基线。
研究者提出 BirdsongChat,一个混合多智能体框架,用于多模态具身行为模拟。该框架通过统一参数表示(UPR)将基于 LLM 的推理智能体与物理模拟智能体连接,把多模态输入转化为可解释的行为状态和控制参数,从而生成同步的 3D 运动、空间化声音和环境行为。原型系统以鸟类行为模拟为测试平台,在文本和图像引导场景中取得跨模态一致性 94.4%、情感一致性
百曜科技发起、《麻省理工科技评论》中国团队调研撰写的《AI虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告》于9月21日在中关村科学城管理委员会指导下发布。报告将AIVC定义为AI时代生命科学的新型基础设施,梳理了从分子层面走向细胞层面的研究范式,并提出模型泛化能力、私有与新生产数据、干湿闭环三大产业趋势。百曜科技同时介绍了其基于LLM-JEPA架构
开发者 bloomer010 在 Hugging Face 上发布了 inclusionAI/Ling-3.0-tiny 的 GGUF 量化版本,直接从 BF16 safetensors 转换而来,覆盖从 BF16 到 Q1 0 的多种量化档位。该模型为 7.9B 总参数、1.3B 激活参数的 MoE 架构,含 18 层 KDA 与 6 层 MLA,支持 1
llama.cpp 发布 b11063 版本,主要更新是在 common/peg 中处理 AST 里的非法 UTF-8 序列,并按照 Unicode 建议返回最大子部分(maximal subpart),同时移除了 strict 参数。该版本同步提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vu
阿里巴巴开源了 AI 代码审查 CLI 工具 OpenCodeReview,采用 Apache-2.0 许可,将文件选择、打包和规则匹配等环节交给确定性流水线,仅用 LLM 代理做动态代码分析,支持空指针、线程安全、XSS、SQL 注入等检查。该工具已在阿里内部数万开发者中使用两年,兼容 OpenAI 和 Anthropic 模型,可审查 Git diff、
微软与伊利诺伊大学的研究团队提出 StudentSim 系统,通过有限数据为每个学生构建能复现其典型错误、并能根据导师提示修正答案的数字孪生。该系统以阿里 Qwen3-4B-Instruct 为基础模型,采用两阶段训练,在国际象棋、英语和数学三个科目上表现优于被提示扮演学生的 GPT-5.4。研究者还用学生副本训练国际象棋导师,其解释质量和适应性评分最高,但
智用开物创始人管震(前微软19年员工)提出用AI Agent解决工业互联网落地难题,将Agent做成虚拟工厂员工(排产员、报价员、设备维护工程师等),通过工业语义引擎理解企业业务逻辑,让多个智能体以'虚拟班组'形式协作,四步上岗、半小时可用。管震认为工业互联网过去十年被误读,大模型相当于'什么都懂一点的老师傅',使'松耦合'理念得以落地,但企业认知落差大,2
Nature 报道了诺奖得主、Google DeepMind 联合创始人哈萨比斯提出的「爱因斯坦测试」:若只给 AI 1911 年前的知识,它能否自行提出相对论。独立研究者 Michael Hla 用 Karpathy 的 nanochat 框架从零训练了 33 亿参数的 GPT-1900,预训练语料约 220 亿 token 的 1900 年前书籍报纸,并
Simon Willison 在 2026 年 9 月 18 日的博客短记中,将当下拒绝关注 LLM 的计算机科学家比作拒绝关注刚开园的侏罗纪公园的遗传学家,暗示 LLM 领域正发生不可忽视的重大变化。文末列出近期文章,涉及 GPT-6 Astra 与 ChatGPT Work 生成跑步路线、OpenAI agents 曾于 5 月攻击 RubyGems,以
NVIDIA 发布 AIPerf,作为 GenAI-Perf 的继任者,从零重写以解决 LLM 推理基准测试中客户端成为瓶颈的问题。AIPerf 采用多进程架构,通过 ZMQ 协调工作进程与结果处理服务,支持 15+ 端点类型、多种公开数据集和可调负载模式。文章以 Qwen3-0.6B 配合 vLLM 为例,演示了安装、启动服务及运行 profile 的完整
中国团队稳准智能联合清华大学发布400M参数结构化数据基础模型LimiX-2,在TabArena、TALENT、BCCO三个国际主流基准测试的二分类、多分类和回归任务上均排名第一,超过Google TabFM、TabPFN、TabICL、Mitra等模型。该模型提出上下文机制网络CMNs,将建模目标从以目标变量为中心的预测转向面向全变量联合依赖和数据生成机制
另有 1 家信源报道
小米MiMo大模型团队负责人罗福莉公开分享MiMo-V2.6强化学习中间阶段进展,展示实时训练页面,透露每小时训练成本超20万元,并计划数周内逐步开源细节。华为汪涛宣布昇腾960芯片提前至2027年Q1发布,坚持一年一代节奏。月之暗面发布Kimi金融行业AI解决方案,首批落地工商银行、中信建投等机构。九识建成业内首个L4万卡GPU集群,转向多模态大模型范式。
Cloudflare 介绍其客户端安全机器学习模型 Page Shield ML 在真实流量中发现的四个恶意 JavaScript 操作,共八个载荷。这些载荷在 VirusTotal 和 URLScan 等传统扫描工具中大多未被标记,但 Page Shield ML 全部检出。系统采用图神经网络分析代码结构,并用 Workers AI 上的轻量 LLM 复核