BF1:用于高效长上下文 Transformer 的因果二进稀疏注意力改造
原标题:BF1: A Causal Dyadic Sparse-Attention Retrofit for Efficient Long-Context Transformers
AI 摘要
BF1 是一种确定性的块对齐二进稀疏注意力机制,结合局部邻域、全局首块和对数间隔历史块,实现 O(n log n) 交互和 O(log n) 通信深度。在 NVIDIA RTX PRO 6000 Blackwell GPU 上,BF1 在 32K 上下文下实现每层 10.91 倍加速,并将 Qwen3-0.6B 模型的首 token 时间降低 15.3%。在匹配的 1000 步、1638.4 万 token 适应协议中,BF1 在三个训练种子中均排名第一,平均困惑度为 1.68639,优于密集继续训练和静态随机图。该研究验证了 BF1 作为稀疏算子和选择性改造原语的有效性,但未声称完全次二次模型或通用能力保留。
正文节选
[Page 1] BF1: A Causal Dyadic Sparse- Attention Retro:t for E=cient Long-Context Transformers Correctness, Systems Scaling, and Replicated Matched Adaptation Hina Dixit Decompute Inc., Cupertino, CA, USA August 2026 ABSTRACT Dense causal attention remains expensive at long context even when implemented with highly optimized exact kernels. We study BF1, a deterministic block-a