返回主题地图

大语言模型

技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月26日周六 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布17

Prism ML 发布三值量化 Bonsai 2 27B GGUF 模型

Prism ML 在 Hugging Face 发布 Bonsai 2 27B 的 GGUF 版本,基于 Qwen3.8-27B 架构,将全部语言权重(嵌入、注意力投影、MLP 投影、LM head)量化为三值 {-1,0,+1},以约 1.72 bits/weight 存储,模型体积约 5.95 GB(PTQ1 0)或 7.21 GB(PQ2 0),相比

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源8

llama.cpp 发布 b11185:提取共享 Unicode 路径/字符串辅助函数

llama.cpp 发布 b11185 版本,主要变更是将共享的 Unicode 路径与字符串辅助函数提取到 common 模块(PR #29415),由 Adrien Gallouët 提交。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROC

9月25日周五 · 9 条
正文结构化主题已通过公开置信门槛
量子位研究3

Skild AI 机器人自我对弈140年学会踢球

美国具身智能公司 Skild AI 发布人形机器人 Messinator,其大脑基于旗舰机器人基础模型 S1,并在 NVIDIA Isaac Sim 虚拟足球场中通过强化学习与自我对弈训练约 140 年。训练中仅设定进球奖励,机器人自行学会盘带、护球、抢断和倒地起身等动作,并迁移到真实人形机器人上。该成果延续了 Skild AI 跨硬件基础模型 Skild

正文结构化主题已通过公开置信门槛
量子位商业3

华为大模型双子星联手创业,要做物理世界基础模型

前华为云大模型CTO李寅与前华为多模态首席科学家张含望联合创办Physical AI公司息壤开物,连续完成数亿元种子轮及天使轮融资,估值达5亿美元。公司提出LPM(Large Physics Model)路线,计划从海量视频、机器人轨迹和真实交互中预训练物理基础模型,以解决VLA路线在跨本体、跨场景泛化上的局限。其模型RiXin在World Arena 2.

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究4

PTC-Bias:语音大模型音素级时间竞争偏置检索与解码后纠正

西安交通大学利物浦大学的研究者提出 PTC-Bias,一个基于音素级时间竞争的两阶段上下文偏置框架,用于语音大模型(SpeechLLM)的稀有词识别。预填充阶段通过 PTC Retrieval 做帧同步音素解码与候选发音时间竞争,生成紧凑的偏置词候选表及对应语音区间;解码后 PTC Correction 在同一区间内对候选词与不匹配转写片段做二次局部竞争,实

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

PAWS:政策驱动的智能体世界模拟数据集

新加坡国立大学、清华大学和香港城市大学的研究者发布 PAWS,一个政策驱动的多智能体世界模拟数据集,覆盖 36 个美国金融经济政策事件、12,727 条政策相关新闻和 65,291 条利益相关者行动。每条行动都关联支撑新闻,并用多层事件框架表示,实体归一化后与每日市场收益对齐,支持政策-智能体模拟回放。在 2,522 条分层样本上,AI 与人类评审对交互模式

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究4

BaseCamp:自动化DNA测序数据流水线的智能体AI框架

该论文提出 BaseCamp,一个用于自动化 DNA 测序数据流水线决策层的智能体 AI 框架。它将流水线拆分为六个专用 AI 智能体,分别负责样本接收与质控、比对、变异检测、注释解读、跨阶段监控和报告;智能体本身不执行序列分析,而是选择、配置并解读既有经过验证的生物信息学工具的输出。框架使用一组微调的领域专用大模型并由中央推理 LLM 协调,全部推理在本地

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究4

REAT:面向多轮数学辅导的反思性经验增强框架

该论文提出REAT(反思性经验增强辅导)框架,通过多智能体Observer-Critic-Mentor(OCM)蒸馏流程,将历史辅导对话提炼为结构化、与问题无关的教学经验,并在实时辅导中通过状态感知检索模块注入这些经验,以根据学生认知状态提供自适应支架。实验表明,该框架显著优于仅提示和SFT基线,尤其在复杂、低分辅导场景中提升明显,且蒸馏经验在不同模型架构和

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布8

RedHatAI 发布 Qwen3.8-27B-NVFP4 量化模型

RedHatAI 发布了 Qwen3.8-27B-NVFP4,这是对 Qwen/Qwen3.8-27B 的混合精度量化版本,采用 FP4/FP8 方案,MLP 投影量化为 FP4,注意力投影和最终 MLP 层量化为 FP8,KV 缓存量化为 FP8,语言模型头保持全精度。该模型使用 LLM Compressor 结合 AWQ 与 GPTQ 在 perfect

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究4

Agent-Editing World Model:重新思考 LLM 智能体的世界建模

该论文提出 Agent-Editing World Model(AEWM),重新思考长时程 LLM 智能体的世界建模方式,将目标从预测环境观测转向建模推理与动作如何影响未来任务进展。AEWM 结合 Action Judge(区分关键、探索性、噪声决策)与 State Revision(直接编辑噪声推理-动作延续),其推理框架 EditAct 与真实环境交互结

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog开源2

commit-rewriter 0.2 发布

Simon Willison 在博客中发布了 commit-rewriter 0.2 版本。该文章页面同时列出了近期其他文章,涉及 Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 及新一轮价格战,以及 Jev 提出的新型 LLM 形态 System One(决策模型)和用 GPT-6 Astra 与 ChatGPT Work 生成跑

9月24日周四 · 8 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究2

SpeakerMem-R1:面向多方对话的说话人中心双轨记忆

研究者提出 SpeakerMem-R1,一种以说话人为中心的双轨记忆框架,用于多方对话中的长期记忆。其双轨记忆分别存储带说话人标注的逐字消息和派生状态,并按人物级与群组级视图组织,查询时按实体、事件和时间融合两轨证据。团队用 SpeakerLevenshtein 奖励和说话人条件 GRPO 训练 Writer-R1(基于 Qwen2.5-3B),在 Grou

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业1

讯飞医疗AI赋能胸痛中心院外管理,共识更新与行动项目启动

在第八届“儒道心学”心血管病学会议等会议上,葛均波院士领衔的专家团队完成了《急性冠状动脉综合征患者院外长期随访管理共识》更新研讨,并正式启动胸痛中心智慧全程管理行动项目。共识明确将信息化与人工智能列为院外管理的重要辅助手段,管理范围从单一ACS扩展至胸痛中心全病种,周期延伸至全周期全程管理。讯飞医疗作为核心技术与运营支撑方,依托星火医疗大模型打造AI诊后患者

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点1

为移动前端设计快速愉悦的 LLM 用户体验

亚马逊高级软件工程师 Bala Ramdoss 在 InfoQ 分享为移动前端设计快速、愉悦 LLM 用户体验的经验。他基于构建 Amazon Lens 和 Lens Live 的实践,指出约 90% 的头部应用已集成 AI,其中 36 个含聊天机器人,但即插即用的聊天机器人服务难以与移动应用深度集成。他分析了对话式前端如何应对 LLM 流式响应带来的延迟与

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究1

Kubernetes 错误配置分类、演化与 LLM 自动修复研究

该论文基于 Stack Overflow 上 2,662 个开发者报告的问题,构建了 Kubernetes 安全错误配置的分类体系,并分析其严重程度及在项目孵化期与稳定期之间的演变。研究发现关键安全错误配置常持续存在或反复出现。作者评估了 LLM 在逐步丰富上下文条件下的自动修复效果,最佳独立模型准确率达 89.06%;进一步提出结合上下文推理与确定性模式校

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究2

利用跨模型分歧定位专家投入,加速LLM代码本修订

该研究提出利用多个LLM在标注同一数据时的分歧来定位代码本中的模糊或缺失规则,从而有针对性地引导专家投入。在数千条辅导会话转录文本上,研究者比较了三种专家反馈方式:代码本验证、问答和理由标注。结果显示,理由标注使LLM标注准确率达到64.9%,优于专家耗时六个月修订的代码本(57.8%),问答方式也达到60.5%。这表明LLM可帮助将代码本修订从数月缩短至数

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究2

审计多智能体审议中的置信度路由、校准与承诺

该研究审计了多智能体审议中常见的「置信度路由」协议:让各智能体报告置信度,由最高分者发言。作者将审计拆分为路由(是否选对候选)、校准(置信度是否像概率)和承诺(被选智能体是否公开说出赢得回合的答案)三个可分别测量的维度。在 4,181 条 gpt-oss-120b 奥数轨迹上,置信度能区分对错(AUROC 0.72)但严重过度自信(79% 置信 vs 52%

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究1

LLM用户画像在生产流媒体推荐中何时真正增值

该论文在真实生产流媒体推荐数据集上系统比较了四种语义用户画像策略,按表示类型(聚合式物品嵌入 vs. LLM生成的自然语言摘要)和时间处理(全历史 vs. 短期/长期注意力融合)进行2×2交叉实验。结果显示,LLM画像的优势具有用户分群条件性:对习惯型用户聚合方法更优,对探索型用户LLM方法能带来准确率提升。此外,LLM画像虽使单条推荐列表略更多样,却导致系

正文结构化主题已通过公开置信门槛
Mem0 Releases一手来源API 更新2

Mem0 Python SDK v2.2.0 新增用户画像功能

Mem0 发布 Python SDK v2.2.0,为 MemoryClient 和 AsyncMemoryClient 新增用户画像(User Profiles)功能,包括 get profile、generate profile、get profile settings、update profile settings、sample profiles 和

9月23日周三 · 1 条
正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源教程1

Cerebras 用 AI 代理以纯英文测试云控制台

Cerebras 团队开发了内部框架 console-prompt-tests,用纯英文段落描述测试意图,由 LLM 代理通过 Playwright MCP 驱动真实浏览器执行,替代传统依赖 CSS 选择器的脆弱 E2E 测试。该框架还支持从 PDF 测试计划或实时 UI 自动生成测试,并引入 PR 覆盖代理和自愈机制,以应对 UI 变动导致的测试失败。