返回全部动态

BF1:用于高效长上下文 Transformer 的因果二进稀疏注意力改造

原标题:BF1: A Causal Dyadic Sparse-Attention Retrofit for Efficient Long-Context Transformers

arXiv cs.LG一手来源研究质量 85

AI 摘要

BF1 是一种确定性的块对齐二进稀疏注意力机制,结合局部邻域、全局首块和对数间隔历史块,实现 O(n log n) 交互和 O(log n) 通信深度。在 NVIDIA RTX PRO 6000 Blackwell GPU 上,BF1 在 32K 上下文下实现每层 10.91 倍加速,并将 Qwen3-0.6B 模型的首 token 时间降低 15.3%。在匹配的 1000 步、1638.4 万 token 适应协议中,BF1 在三个训练种子中均排名第一,平均困惑度为 1.68639,优于密集继续训练和静态随机图。该研究验证了 BF1 作为稀疏算子和选择性改造原语的有效性,但未声称完全次二次模型或通用能力保留。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

[Page 1] BF1: A Causal Dyadic Sparse- Attention Retro:t for E=cient Long-Context Transformers Correctness, Systems Scaling, and Replicated Matched Adaptation Hina Dixit Decompute Inc., Cupertino, CA, USA August 2026 ABSTRACT Dense causal attention remains expensive at long context even when implemented with highly optimized exact kernels. We study BF1, a deterministic block-a


发布时间:2026-08-24 12:00
抓取时间:2026-08-24 12:12
来源机构:arXiv
阅读原文arxiv.org