Jay Alammar博客迁移至Substack
Jay Alammar宣布冻结其博客,转而使用Substack平台发布内容,理由是Substack的写作体验更便捷。他邀请读者关注其Substack,并提及了《The Illustrated DeepSeek R-1》文章和《How Transformer LLMs Work》课程。
技术方向 · 通用文本大模型的发布、能力更新与技术路线 · 共 283 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Jay Alammar宣布冻结其博客,转而使用Substack平台发布内容,理由是Substack的写作体验更便捷。他邀请读者关注其Substack,并提及了《The Illustrated DeepSeek R-1》文章和《How Transformer LLMs Work》课程。
DeepMind 的 RETRO 模型通过检索数据库增强语言模型,以 7.5B 参数达到 GPT-3 的性能,仅为后者规模的 4%。该模型将事实知识存储在外部数据库中,减少参数负担,训练更快且部署成本更低。文章强调构建更大模型并非提升性能的唯一途径,检索增强是重要方向。
Jay Alammar 发布了关于语言模型隐藏状态可视化的文章,介绍了开源工具 Ecco,用于展示 Transformer 模型各层隐藏状态的演变,以揭示模型生成 token 的决策过程。文章通过示例展示了如何追踪特定 token 的排名变化,并探讨了该方法在分析句法数一致性和性别偏见等任务中的应用。