返回主题地图

大语言模型

技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 7 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

清华稳准智能发布LimiX-2,结构化数据基础模型登顶国际评测榜单

稳准智能联合清华大学计算机系崔鹏教授发布新一代结构化数据基础模型LimiX-2,参数规模提升至400M,在TabArena、BCCO、TALENT三个国际主流结构化数据Benchmark中Elo分数均位列第一,超过Google、SAP、Amazon等国际大厂同类模型。模型沿上下文机制网络CMNs、自动化合成数据生成引擎升级、参数Scaling三条技术路线推进

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位模型发布

清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单

稳准智能联合清华大学计算机系崔鹏教授团队于9月16日发布新一代结构化数据基础模型LimiX-2,参数规模提升至400M。该模型在TabArena、BCCO、TALENT三个国际主流结构化数据评测基准上Elo分数均位列第一,超过Google、SAP、Amazon等国际大厂的同类模型。技术路线包括上下文机制网络CMNs、升级自动化合成数据生成引擎以及进一步Sca

正文结构化主题已通过公开置信门槛
量子位产品发布

B站AI无限竞技场上线,全球百大模型同场竞技

B站于9月16日正式上线「AI无限竞技场」,这是一个汇集UP主大模型测评的竞技广场,首期榜单同步公布。GPT-6 Astra在10个UP主测评中拿下榜首,前五名中国产大模型占据三席。该平台由各领域UP主对上百个大模型进行真实场景实测,涵盖代码、推理、协作、知识等主题,排名实时更新并持续开放报名。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

TAARDIS-27B 全三值量化模型发布:1.75bit 仅 5.9GB

开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

ToMAS:从多智能体LLM失败中构建心智理论基准的试点

该论文提出 ToMAS,一个从多智能体 LLM 失败案例中构建心智理论(ToM)基准的试点流程。作者将 MAST-Data 中标注为 FC2(智能体间错位)的执行轨迹,按四条可转换性标准筛选,从 242 条合格训练轨迹中生成 39 个 Clean 条目,标注者间原始一致率为 94.4%。随后用 Qwen2.5-1.5B 做小规模 GRPO 可行性实验,但事后

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

普通打字错误如何破坏LLM激活探针

该论文研究普通打字错误(typo)如何破坏基于激活的LLM安全探针。作者发现,扰动token处的激活向量会发生大幅旋转,并在下游token迅速衰减,导致单位置提示注入探针的TPR@FPR1%显著下降,且无法仅靠阈值重校准恢复。为此提出KV-cache fork方法,在用户消息后附加固定后缀让探针读取扰动下游的token,将差距缩小约一个数量级,优于扰动增强训

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

IBM 发布 Granite Time Series PatchTST-FM-r2 模型

IBM 发布 Granite Time Series PatchTST-FM-r2 时间序列基础模型,采用约 3.85 亿参数、Conformer 架构,支持零样本预测、概率预测和缺失值填补。截至 2026 年 9 月 8 日,该模型在 GIFT-Eval 基准的可复现零样本模型中排名第二,并且是同类中唯一采用 Apache 2.0 与 OpenMDW 1.

9月15日周二 · 6 条
正文结构化主题已通过公开置信门槛
Google AI一手来源研究

Google 发布 AI 与经济 ATLAS 新洞察及交互体验

Google 发布 AI & Economy ATLAS 的新洞察,并推出开放访问的交互式体验,展示不同职业和国家的 AI 使用情况。数据显示印度创意产业 AI 使用率高于全球,美国技术类职业领先。Google、Google DeepMind 与 MIT FutureTech 合作研究还发现近半数受访科学家每天使用 AI,每周节省近 7 小时,但验证输出和假

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

云原生 Graph-RAG 错误归因解耦:数据完整性诊断框架

该论文提出一个三层解耦诊断框架,用于将云原生 Graph-RAG 系统的错误正交归因于推理损失、知识图谱缺陷和 Cypher 生成错误。作者在青藏高原东南部时空生态知识图谱上注入八类缺陷进行评测,发现数据完整性而非算法推理是主要性能瓶颈,结构缺陷使系统准确率从 0.93 降至 0.39。研究还观察到参数化知识掩蔽效应(PKME),即 LLM 用内部记忆补偿断

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

难度感知拓扑选择:多智能体代码生成的自适应协作

该研究指出多智能体代码生成系统通常固定使用单一通信拓扑,但实验发现层级协作相对单智能体的优势随问题难度从2.4分(简单)升至21.1分(困难),而token成本始终约为10倍。作者提出Difficulty-Aware Topology Selector(Dats),用图网络预测各拓扑解题概率并结合成本选择最优拓扑,在预算匹配协议下以40%的层级成本达到77.

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

XHToken 发布 Spark-X2.5-4B 与 1.7B 通用语言模型

XHToken 发布 Spark-X2.5-4B 与 Spark-X2.5-1.7B 两款紧凑型通用语言模型,采用混合注意力架构(1 层全注意力加 3 层滑动窗口注意力),原生支持最高 1M token 上下文与 200 多种语言。模型在华为昇腾集群上基于约 20 万亿 token 预训练,并通过大规模强化学习与 MOPD 后训练提升推理、编码与智能体能力。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

阿尔伯塔大学提出FAME双系统框架破解持续强化学习遗忘困局

加拿大阿尔伯塔大学强化学习团队提出持续强化学习框架 FAME,通过快速学习模块与元学习模块的双系统设计,分别模拟海马体与大脑皮层协同机制,解决智能体学习新任务时遗忘旧知识的灾难性遗忘问题。论文定义了环境间距离与灾难性遗忘的数学度量,并在 MinAtar、Atari 和 Meta-World 上验证,在平均性能、前向迁移和遗忘三项指标上全面优于 Reset、微

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

cRia-LM-75M:75.7M 参数递归 Transformer 基座模型发布

Hugging Face 上发布了 cRia-LM-75M,一个 75.7M 参数的基座语言模型,采用 Relaxed Recursive Transformer(RRT)架构,用 11 层共享循环块执行两次遍历,第二次遍历使用 rank-172 LoRA 参数。训练分三阶段:Stage 1 在 10B token 上预训练 2K 上下文,Stage 2 用

9月14日周一 · 7 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Benchmark Radar:AI 评测基准的活数据库与搜索引擎

研究者发布 Benchmark Radar,一个面向 AI 评测基准的可搜索活数据库与发现引擎,聚合来源、分数历史与证据以支持基准选择与比较。系统每日从 37 个来源(13 个直连、24 个一方研究/工程源)发现基准论文、仓库、数据集与发布,目录含 1,283 条来源记录、790 条记录上的 12,916 个数值观测。作者审计了完整目录,并分析基准饱和、采用

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

语言模型与先验的能力门控池化用于事件预测

伊利诺伊大学厄巴纳-香槟分校的研究者提出了一种“能力门控池化”方法,用于在混合预测中判断语言模型相对于已有外部预测(市场、群体或统计预测)是否具有边际价值。该方法基于Brier损失推导出模型分歧何时能改善外部预测,并从已解决结果中估计领域级源权重,向全局权重收缩并进行等渗重校准。在2357个已解决二元问题和五个语言模型上,该方法将主外部基线的Brier分数从

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

弱监督框架结合LLM标签精炼抽取流离失所文档中的数据集提及

研究团队提出一种弱监督框架,用于在强迫流离失所及脆弱、冲突与暴力(FCV)领域文档中抽取数据集提及。该方法先用通用研究文献上训练的轻量模型生成候选提及,再由前沿大语言模型在上下文中审核、修正边界,并补充合成与对比样本以微调轻量模型。在包含1706个文本片段的独立基准上,模型提及级精确率74.1%、召回率70.5%,含数据集引用片段精确率达89.5%,片段级准

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源观点

立场:推荐系统应从平台中心排序转向个人代理中介推荐

一篇 arXiv cs.IR 立场论文提出推荐系统应从平台中心排序转向个人代理中介推荐(PAMR),由面向用户的个人代理在分布式来源间发现、过滤、聚合和治理推荐证据。作者定义了 PAMR 的边界标准、核心中介决策和以中介为中心的评价框架,并在 Yelp 餐厅推荐任务上做了概念验证,显示来源选择与受控披露在效用、可追溯性、暴露和成本之间取得最佳平衡。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源观点

Agentic Web 中推荐系统向谁推荐?

这篇 arXiv cs.IR 立场论文指出,随着 LLM 驱动的 AI 代理在 Agentic Web 中代替用户浏览、比较、谈判和交易,推荐系统的核心假设——推荐由人类直接消费——正在被打破。作者提出推荐范式正在分叉:在可委托场景(如常规购物、旅行)中,代理成为推荐的主要操作消费者,需要新的优化目标、交互协议和评估标准;在体验型场景(如娱乐、艺术)中,人类

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

代码LLM离线后训练:性能、效率与崩溃

该研究探讨代码大语言模型能否完全离线进行强化学习后训练,而不依赖在线采样。作者在Qwen Coder、DeepSeek Coder和CodeLLaMa等0.5B至7B参数模型上,使用CodeNet数据集进行实验,发现仅需数小时训练即可显著提升零样本代码生成性能。研究还发现离线RL对学习率和训练轮数高度敏感,长时间训练会导致模型崩溃,其主因是logit方差而非

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Ornith-1.5-35B-A3B 去审查版 GGUF 量化发布

Hugging Face 用户 gbuzhf 发布了 Ornith-1.5-35B-A3B 的 abliterated(去审查)GGUF 量化版本,基于 huihui-ai 的 abliterated 权重,提供 19G/21G/23G/25G 四档 ICE 量化及 BF16 主模型。该版本使用 27,513 条全语料重要性矩阵校准,并嵌入模型自带的 MTP