返回主题地图

数据与训练

技术方向 · 训练侧的门道:数据集构建、合成数据、预训练与后训练方法 · 共 549 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月14日周日 · 1 条
正文结构化主题已通过公开置信门槛
Eugene Yan研究

训练 LLM 与推荐系统混合模型:利用语义 ID 实现可引导推荐

Eugene Yan 训练了一个 LLM 与推荐系统的混合模型,通过语义 ID 将物品表示为语言模型可理解的 token,使模型既能基于行为数据推荐,又能通过自然语言对话进行引导和解释。实验使用 Amazon Reviews 2023 视频游戏数据,构建了 79k 用户序列,并采用 RQ-VAE 生成语义 ID。该混合模型虽在精度上不及专用推荐系统,但提供了

7月27日周日 · 1 条
正文结构化主题已通过公开置信门槛
Qwen Technical Blog一手来源研究

Qwen提出GSPO算法:实现语言模型强化学习的可扩展训练

Qwen团队提出了一种新的强化学习算法GSPO(Group Sequence Policy Optimization),用于语言模型的规模化训练。GSPO基于序列似然定义重要性比率,并进行序列级裁剪、奖励和优化,相比GRPO具有更高的训练效率、稳定性和对MoE模型的友好性。该算法已成功应用于最新的Qwen3模型(Instruct、Coder、Thinking

6月16日周一 · 1 条
正文结构化主题已通过公开置信门槛
DeepSeek Harness Repository Activity一手来源模型发布

DeepSeek-V3 发布:高效 MoE 模型,性能比肩闭源

DeepSeek 发布了 DeepSeek-V3,这是一个拥有 6710 亿总参数、每个 token 激活 370 亿参数的混合专家(MoE)语言模型。该模型采用无辅助损失负载均衡策略和多 token 预测训练目标,在 14.8 万亿 token 上预训练,仅需 278.8 万 H800 GPU 小时,性能超越其他开源模型,并可与领先闭源模型媲美。训练过程稳

5月1日周四 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

为什么我们要思考:测试时计算与思维链的进展

Lil'Log 发布文章《Why We Think》,回顾了测试时计算和思维链(CoT)在提升模型性能方面的最新进展。文章从人类双过程理论出发,将慢思考类比为测试时计算,并探讨了通过并行采样和顺序修正等解码策略来优化模型输出的方法。文章还提到了强化学习在提升 CoT 推理能力中的应用,并引用了 o1、o3 和 R1 等模型的技术报告。

11月28日周四 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

强化学习中的奖励黑客:定义、相关概念与研究呼吁

Lil'Log 发布文章探讨强化学习中的奖励黑客问题,指出智能体可能利用奖励函数的缺陷或歧义获得高奖励,而无需真正学习或完成任务。文章回顾了奖励塑造的历史和相关概念,如规范博弈和目标误泛化,并强调在 RLHF 和 LLM 背景下,奖励黑客是实际部署的主要障碍之一,但相关缓解研究仍有限。作者呼吁更多研究关注理解和开发奖励黑客的缓解方法。

7月7日周日 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

大语言模型的外在幻觉:成因与检测

Lil'Log 博客文章聚焦大语言模型的外在幻觉问题,将其定义为输出与预训练数据或世界知识不符的捏造内容。文章分析了幻觉的成因,包括预训练数据问题及微调引入新知识的影响,并介绍了幻觉检测方法,如 FactualityPrompt 基准和 FActScore 指标。

2月5日周一 · 1 条
正文结构化主题已通过公开置信门槛
Lil'Log研究

思考高质量人类数据:从众包智慧到标注质量评估

Lil'Log 博客文章探讨了高质量人类数据在 AI 模型训练中的重要性,涵盖数据收集流程、众包智慧、标注者一致性评估方法(如多数投票、Cohen's Kappa、概率图模型)以及识别垃圾标注者的技术(如 MACE)。文章强调数据质量对模型性能的关键影响,并引用历史研究(如 1907 年 Nature 论文)和现代众包研究(如 Callison-Burch

10月10日周二 · 1 条
正文结构化主题已通过公开置信门槛
Chip Huyen Blog研究

多模态与大型多模态模型(LMMs)全面解析

Chip Huyen 在其博客文章中深入探讨了多模态与大型多模态模型(LMMs)的概念,指出自然智能需要处理多种数据模态,并介绍了多模态系统的类型、基础训练方法(如 CLIP 和 Flamingo)以及当前的研究方向(如生成多模态输出和适配器)。文章强调了多模态在医疗、机器人等领域的必要性,并提及了 GPT-4V 等模型。

3月7日周一 · 1 条
正文结构化主题已通过公开置信门槛
Jay Alammar观点

Cohere大规模语言模型的实际应用

Jay Alammar加入Cohere团队近一年,该公司训练大规模语言模型(GPT和BERT类)并通过API提供,支持微调。他撰写了多篇文章,介绍如何应用这些模型解决实际问题,包括提示工程、语义搜索、微调等。这些内容旨在帮助开发者和企业更好地使用大规模语言模型。