返回主题地图

大语言模型

技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月7日周五 · 7 条
正文结构化主题已通过公开置信门槛
量子位产品发布

Keep推超级AI会员,探索AI运动服务付费新路径

Keep在88全民健身日推出“超级AI会员”,通过自研运动大模型Keepace.ai提供AI语音互动跑、个性化计划、吃练睡分析等服务,覆盖运动前中后全流程,旨在从内容交付转向服务交付。该会员卡试图验证用户是否愿意为AI服务付费,成为Keep在2025年首次年度盈利后的新增长引擎。文章还对比了多邻国和Cursor的AI商业化路径,认为AI从工具变为服务是行业趋

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

CRAFTER:黑盒预测器纠错特征发现代理

arXiv 上发布了一篇关于黑盒预测器纠错特征发现的研究论文,提出了 CRAFTER 代理。CRAFTER 通过组合搜索和 LLM 生成候选特征,并用验证门控筛选,在六个数据集和六个冻结骨干网络上超越了专用特征工程系统,将最弱骨干的错误率降低最多 27%。该研究为模型纠错提供了新思路。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

DiSR:解耦3D建模与空间推理的新框架

该研究提出了一种名为DiSR的框架,将3D感知与空间推理分离,利用现成的专家感知模型重建结构化3D证据,并通过LoRA微调LLM仅基于这些几何证据进行推理。DiSR在空间推理基准上取得了有竞争力的性能,同时提供了更好的可解释性、模块化和计算效率,表明显式分离感知与推理是端到端建模的可扩展替代方案。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

BioMedJImpact:生物医学期刊 AI 参与度与科学影响分析数据集及 LLM 流程

arXiv 发布 BioMedJImpact 数据集,包含 174 万篇 PubMed Central 文章和 2744 种生物医学期刊,整合文献计量指标、合作特征和基于 LLM 的 AI 参与率。研究发现作者团队规模与引用影响正相关,而 AI 参与率仅在 2019 年子集中与影响因子正相关。该数据集和验证框架为生物医学与 AI 交叉领域的科学计量分析提供了

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

基于Koopman谱分析认证多智能体系统集体推理

该研究提出一种基于Koopman算子理论的新框架,用于验证多智能体系统中大型语言模型(LLM)集体推理的收敛性和可解释性。通过将集体视为非线性动力系统,从交互轨迹中估计Koopman传递算子,其谱可提供收敛期限、派系识别和压缩消息基础等机器可检查的证书。实验表明,该框架在注意力共识模型上以高相关性预测收敛时间,并在多数配置中提供有效边界,且计算高效,可在CP

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

软件工程师对LLM的依赖、过度依赖与成瘾行为研究

一项针对119名软件从业者的探索性调查显示,大型语言模型(LLM)已深度融入日常开发工作,主要体现为功能性依赖,并出现过度依赖的迹象,如优先使用LLM而非文档或同行咨询,但成瘾相关行为较少。研究建议通过信任校准、专业判断和验证来促进合理依赖。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

超越情感:传统NLP与LLM多维分析在政治新闻评估中的比较

本研究对比了基于RoBERTa的传统情感分析与基于LLM的多维框架分析在政治新闻评估中的表现。结果显示,RoBERTa将70%的文章归类为中性,导致信息扁平化,而LLM方法能捕捉政治偏见、煽情性、情感诉求和框架等维度。作者认为,对于政治媒体分析,传统情感分析不足,LLM多维框架更适合社会科学和人文学科研究。

8月6日周四 · 4 条
正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

Baseten 加入 Hugging Face 推理提供商,支持多款前沿模型

Hugging Face 宣布 Baseten 成为其推理提供商生态的新成员,用户可在 Hub 模型页面和 SDK 中直接使用 Baseten 托管的模型。Baseten 支持多种模型类型,初期提供对话和文本生成任务,包括 Kimi K3、DeepSeek V4 Flash 等。用户可通过自定义 API 密钥直接调用,或通过 Hugging Face 路由计

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

BBOWP-Bench:评估LLM解决黑箱优化词问题的基准

本文介绍了黑箱优化词问题(BBOWP)这一新问题设置,要求系统从自然语言描述中推断搜索空间和优化算法。作者建立了BBOWP基准套件(BBOWP-Bench),包含数据集和评估框架,每个实例结合自然语言问题描述、可执行评估环境和人工设计的基线公式。初步评估显示,当前LLM能根据评估预算选择合适算法,但在搜索空间设计上存在困难,尤其是在问题描述信息不足或搜索空间

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

SONAR:面向 LLM 消费者的无参考代码摘要评估框架

arXiv 论文提出 SONAR,一个无需参考摘要的代码摘要评估框架,从正确性、抽象性、简洁性和流畅性四个维度评估代码摘要。SONAR 采用基于代码再生成的方法,利用摘要重建代码作为质量信号,避免依赖人工或 LLM 的主观判断。实验表明,正确性和抽象性与 LLM 在下游软件工程任务中的表现显著相关,相关性比最佳基线高 14 倍,而简洁性和流畅性对 LLM 消

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

谷歌将于2026年9月关闭Google Assistant,Gemini全面接管

谷歌宣布将于2026年9月4日起在Android和Wear OS上关闭Google Assistant,由AI助手Gemini全面接管。此举影响智能手机、平板、手表、耳机及Android Auto车辆,但部分内置Google的汽车暂时保留Assistant。该计划原定2025年实施,现推迟至2026年。谷歌认为这是对Gemini能否胜任日常简单指令的考验,因

8月5日周三 · 3 条
正文结构化主题已通过公开置信门槛
Groq Blog一手来源教程

Groq 科普:AI 推理基础与实时应用

Groq 博客发布了一篇关于 AI 推理(inference)的科普文章,解释了推理在机器学习中的定义、工作原理、类型及实际应用。文章强调推理是模型部署后对新数据做出预测或生成文本的关键步骤,并指出 Groq 的 LPU 推理技术能以高速度和低成本支持实时应用,如语音识别和智能体工作流。文章还提及 Meta 的 Llama 3.3 70B 模型在质量上接近

正文结构化主题已通过公开置信门槛
Groq Blog一手来源研究

Groq 详解 LPU 架构:AI 推理速度与能效远超 GPU

Groq 公司发布了其 LPU(语言处理单元)AI 推理技术的详细介绍,该处理器专为运行大型语言模型等 AI 工作负载而设计,相比 GPU 在架构层面能效提升高达 10 倍。LPU 采用软件优先、可编程流水线架构、确定性计算与网络以及片上内存等核心设计原则,旨在提供更快的推理速度和更高的效率。Groq 的 GroqCloud 平台由 LPU 驱动,展示了其在

正文结构化主题已通过公开置信门槛
THE DECODER商业

普利策奖创纪录:八位获奖者披露使用AI

今年普利策奖创纪录地有八位获奖者披露使用了人工智能,包括五位获奖者和三位入围者。自2024年起,披露要求成为强制规定。今年参赛者更频繁地使用AI工具和大语言模型,主要用于快速搜索大量文档。例如,《华尔街日报》使用内部LLM总结德克萨斯州洪水的公共文件,《明尼苏达明星论坛报》用ChatGPT翻译日记并请专家核查,美联社用LLM搜索中国监控技术相关文件,《纽约时

8月4日周二 · 6 条
正文结构化主题已通过公开置信门槛
Microsoft AI Blog一手来源研究

微软与Paige发布病理学基础模型PRISM2

微软研究院与Paige(现为Tempus旗下)合作开发了病理学基础模型PRISM2,该模型基于组织图像和真实病理报告中的语言进行训练。在多项基准测试中,PRISM2在前列腺癌、乳腺癌和乳腺淋巴结转移检测等任务上达到或超过了专门的癌症检测系统,且无需为每个任务单独建模。PRISM2的完整模型权重已在Hugging Face上公开发布,供研究使用。

正文结构化主题已通过公开置信门槛
量子位模型发布

腾讯混元发布Hy ASR 3.0 preview,语音识别理解上下文

腾讯混元于8月4日发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度语音识别与语义理解,在通用识别、上下文感知、多场景鲁棒性及方言覆盖等维度显著提升。该模型在开源和自建评测集上WER表现领先,已上线腾讯云提供API服务,并集成于腾讯元宝等产品。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

CoT-Core:通过思维链感知的核心集选择加速 LLM 评估

CoT-Core 是一种新的无需训练的 LLM 评估核心问题选择框架,通过提示 LLM 生成零样本思维链推理轨迹,并在潜在空间中对问题进行聚类,以逻辑等价性而非表面文本相似性进行选择。在 GSM8K、MMLU、MMLU-Pro 和 GPQA 上的实验表明,CoT-Core 能大幅降低评估成本,同时保持高保真度分数估计,且其有效性受任务复杂度的限制。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

MemoryForge:为类人LLM智能体合成终身记忆

arXiv 论文提出 MemoryForge 框架,用于为 LLM 智能体合成类人的终身记忆。该框架通过记忆条件化替代传统提示方法,包含上下文生成器、生活组织器和多分辨率模拟器三个组件。实验表明,MemoryForge 生成的记忆库能使冻结的 LLM 在角色扮演和用户模拟任务中表现出更类人的行为。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

AutoFOAM:自精炼自主 OpenFOAM 智能体

AutoFOAM 是一个基于大型语言模型的自进化智能体,可根据自然语言指令自动创建、评估、运行和优化 OpenFOAM 计算流体力学模拟。该模型基于 Qwen-coder 2.5-14B 微调,采用七阶段进化循环和三种防退化机制,旨在降低 CFD 使用门槛并加速原型设计。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

RubricReviewer:从直接批评到客观全面的评分标准驱动同行评审

RubricReviewer是一个全新的同行评审框架,通过将评分标准生成作为显式中间步骤,并融合无训练代理(Scout)与人类对齐训练模型(Aligner),解决了现有LLM评审员的两大结构性局限。实验表明,该框架生成的评审比现有系统更全面、更具区分度,且对对抗性提示注入攻击的鲁棒性最强。消融研究证实了每个组件的必要性。