返回主题地图

大语言模型

技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月28日周五 · 1 条
正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究

Google 推出行星预测引擎,自动化地理空间建模

Google Research 推出行星预测引擎(PPE),作为 Earth AI 计划的一部分,该实验性研究系统能自主执行从数据发现到模型训练的完整地理空间建模流程。在公共卫生、粮食安全、环境风险和社会经济等领域的测试中,PPE 相比人工专家流程显著提升了预测精度,例如将疾病健康指标的 R² 从 60.0% 提升至 76.8%,并将建模时间从数周缩短至数分

8月27日周四 · 1 条
正文结构化主题已通过公开置信门槛
Google Research Blog一手来源模型发布

Google 发布 GlucoFM:面向连续血糖监测的基础模型

Google Research 发布了 GlucoFM,一种用于连续血糖监测(CGM)数据的轻量级自监督基础模型。该模型采用双流设计,分别建模缓慢血糖趋势和短期偏差,在糖尿病风险、胰岛素抵抗等多项代谢预测任务中超越了现有模型(如 GluFormer),并在餐后血糖反应预测中取得最低平均绝对误差。模型在 109,066 小时的未标记 CGM 数据上预训练,展现

8月26日周三 · 3 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

大型语言模型创造力自动评估的局限性研究

博洛尼亚大学和伦敦大学学院的研究人员调查了大型语言模型(LLM)生成文本的创造力自动评估方法的可靠性。他们收集了人类对WritingPrompts数据集中人类和AI生成短故事的11个创造力维度的评估,并与自动客观指标和LLM-as-a-Judge评估进行比较。实验发现自动评估与人类判断存在显著不一致,LLM法官系统性地偏好AI生成的故事,而广泛使用的自动指标

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

从分诊到出院:急诊科NLP任务、方法与挑战综述

这篇综述分析了46篇关于急诊科(ED)自然语言处理(NLP)的论文,覆盖分诊、诊断和处置三个阶段,涉及分诊分类、临床摘要、自动诊断、报告生成和出院文档等任务。研究发现,研究趋势从任务特定架构转向预训练语言模型,并越来越关注交互式临床系统和临床评估。文章还指出了泛化性有限、临床输入噪声和工作流约束等开放挑战。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

机器人初创公司 Generalist 估值达 30 亿美元

机器人初创公司 Generalist 在获得由 8VC 领投的约 2 亿美元新融资后,估值达到 30 亿美元。该公司由前 Google DeepMind 和 Boston Dynamics 的研究人员创立,正在开发能适配多种机器人的 AI 基础模型,其 Gen 1.5 模型可通过 3 至 12 秒的视频演示让机器人学会新任务。此轮融资反映了投资者对机器人领域

8月25日周二 · 3 条
正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

LitReview Arena:基于竞技场式同行评审平台的文献综述智能体评估

LitReview Arena 是一个用于评估文献综述智能体的竞技场式平台,通过领域专家对匿名草稿进行多维度的偏好投票。研究收集了约3000条专家判断,发现最强模型在整体效用上仅以23.0%的胜率击败人类草稿,而Sonar Deep Research等智能体LLM比基础模型性能提升超过60%。此外,现有LLM-as-a-judge方法与人类专家存在显著不一致

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

SLICE:规范级隔离的契约强制执行框架

SLICE 是一个针对代码生成中输入契约强制执行的框架,通过图结构规范分解、功能体生成和契约断言生成三个阶段,分别处理功能实现与输入条件验证。在 ContractEval 基准上,SLICE 在四个 LLM 上相比最强基线平均提升了 6.58% 的规范满足率(SSR)。该框架旨在解决生成代码时对输入契约的过度或不足强制问题。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

KSE-Web:低资源高棉语语义搜索的混合检索与LLM查询扩展分析

KSE-Web 研究针对低资源语言高棉语的语义搜索,构建了包含 3K 篇清洗文档和 300 条人工审核查询的数据集,并评估了字符 n-gram BM25、多语言稠密检索、混合检索及基于 Qwen2.5 的 LLM 查询扩展。实验结果显示 BM25 性能最佳(Recall@10 0.943,nDCG@10 0.876),混合检索表现相当,而稠密检索单独使用效果

8月24日周一 · 5 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

AWS 推出 AI 驱动的元数据修正与协调工作流

AWS 机器学习博客介绍了一种基于 AI 的元数据修正与协调工作流,该工作流利用 Amazon Bedrock 上的大语言模型进行模式对齐和修正建议,结合 S3、DynamoDB、Cognito 和 ECS 构建。系统通过人工参与验证和自主代理驱动两种方式,支持模式对齐、字段验证和修正建议,旨在自动化元数据管理,提升数据互操作性和开放科学支持。

正文结构化主题已通过公开置信门槛
MIT Technology Review AI观点

如何在课堂中鼓励更明智的 AI 使用

MIT Technology Review 报道了康涅狄格州 Cheshire Academy 如何鼓励课堂中明智使用 AI。该校不强制教师使用 AI,但多数教师会使用 ChatGPT、Perplexity 及专为教育设计的 MagicSchool 等工具。学校通过培训教师掌握提示词技巧和了解 AI 局限性,并采用红绿灯标签系统规范学生使用 AI。该校还试点

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

词汇理解失败导致临床推理缺陷:评估面向Gen Alpha的治疗机器人安全风险

该研究评估了面向Gen Alpha(2010-2024年出生)的AI心理治疗机器人的安全性,发现Claude、GPT-4o、Llama-3.1等模型虽能理解76-82%的青少年词汇,但临床风险校准仅64-72%,存在10-14个百分点的词汇理解与临床推理差距,而人类治疗师仅3个百分点。研究识别出六种失败模式,如讽刺掩盖、最小化接受等,并建议采用人类介入架构、

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

面向LLM推荐器的上下文感知物品画像框架

本文提出了一种面向LLM重排序的用户上下文感知物品画像框架,通过结构化元数据和评论生成客观特征与主观特质,并利用轻量级画像器为每个用户-物品对选择最相关信息,以解决大规模异构元数据带来的上下文窗口限制、特征重要性随物品和用户变化等挑战。实验表明该方法能持续提升LLM重排序效果,代码已开源。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

王田苗三问具身大牛:大模型仍处拨号时代,机器人如何拿下真实订单?

在2026世界机器人大会上,王田苗教授向五位具身智能企业高管提出关于规模化量产卡点、大模型可靠性和产业终局的尖锐问题。嘉宾分为技术派和工程派,分别强调算法可靠性和硬件制造标准的重要性。讨论指出当前大模型仍处于早期阶段,商业化应优先从B端高刚需场景切入,未来可能走向软硬一体或解耦的生态。

8月22日周六 · 5 条
正文结构化主题已通过公开置信门槛
Ahead of AI研究

Claude 文本水印技术详解:从零理解其工作原理

Anthropic 宣布为其 Claude 模型生成的文本添加水印,以识别 AI 生成内容。本文通过视频讲座形式,详细解释了水印技术的底层机制、实现方式及其潜在失效场景,并强调从零开始理解 LLM 内部采样过程的重要性。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

DoorDash 构建 SafeChat:实时市场中的 AI 安全系统

DoorDash 软件工程师 Bruna Pereira 在演讲中介绍了 SafeChat 系统,该系统用于实时市场平台中的 AI 安全检测。他们先收集数据训练小型分类器,快速过滤明显安全的消息,仅对少数消息调用 LLM 进行多维度评分,以平衡延迟和成本。该系统每天处理数百万条消息,确保平台安全。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

LinkedIn 多智能体 AI 代码审查平台:提升大规模审查效率

LinkedIn 工程师构建了一个多智能体 AI 代码审查平台,以应对大规模代码审查的挑战。该平台通过多个独立 AI 审查器、深度定制和 Kubernetes 架构,提高了审查信号质量并减少了幻觉。评估显示,63.9% 的 AI 建议被开发者接受,其中并发错误修复的接受率达 100%。

正文结构化主题已通过公开置信门槛
THE DECODER研究

Netflix测试语言模型推荐系统GenRec,性能超越传统方法

Netflix开发了基于语言模型的推荐系统GenRec,将用户行为转换为纯文本,通过微调开源权重模型进行推荐排序。离线测试和在线A/B实验显示,其推荐质量优于现有系统,且所需标注数据减少约40倍。Netflix认为这是从定制架构向通用语言模型转变的一部分,但尚未完全替代现有系统。

正文结构化主题已通过公开置信门槛
Latent Space研究

模拟成为新扩展定律:Simile AI 融资 20 亿美元构建人类行为数字孪生

Simile AI 联合创始人兼 CEO Joon Sung Park 在播客中分享了从生成式智能体到人类行为基础模型的路径,其公司已获 2B 美元 B 轮融资,为 CVS 等财富 100 强客户运行数千万次模拟,数字孪生对人类行为的复现准确率达 85%。他探讨了模拟作为新扩展定律的潜力,包括模拟 80 亿人的长期目标,以及模拟在政策测试、社会问题研究中的应

8月21日周五 · 2 条
正文结构化主题已通过公开置信门槛
量子位模型发布

机器人GPT-3时刻:GEN-1.5看3秒演示即学会新动作

Generalist AI 发布了机器人基础模型 GEN-1.5,该模型通过大规模物理数据预训练,实现了 one-shot learning,机器人仅需观看 3-12 秒的动作演示即可学会新任务,且无需梯度更新或微调。模型还能拼接不同演示、从模拟器迁移到真实世界,这些能力是自发涌现的,被视为机器人领域的 GPT-3 时刻。在 10 种任务测试中,零样本平均成

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

基于LLM常识推理的多智能体编排自动驾驶框架

该研究提出一种混合自动驾驶框架,通过编排器协调PPO强化学习与PID控制,并利用大语言模型(LLM)的常识推理能力作为顾问和奖励机制,而非直接控制车辆。在CARLA模拟器的随机场景中评估,结果显示该方法在保持实时性和安全性的同时,提升了上下文推理能力。