FEATURED · 精选文章

腾讯:FlashPrefill V2实现长文本高效推理

发布时间 / 2026/8/31 5:42:08
来源 / 创域科博编辑部
栏目 / 资讯中心
腾讯:FlashPrefill V2实现长文本高效推理 标题FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving来源arXiv, 2608.19758v1️文章简介研究问题如何解决大语言模型在长上下文预填充阶段因注意力机制二次复杂度导致的计算瓶颈并克服现有稀疏注意力算法在精度损失、硬件适配性及系统集成方面的不足主要贡献论文提出了FlashPrefill V2通过引入均值校正项、重构适配Hopper架构的稀疏算子以及原生支持分页KV缓存实现了从算法原型到生产级长文本服务系统的跨越。重点思路引入均值校正项以抑制近似误差。针对极端稀疏度下被剪枝块导致的精度下降问题利用池化的K/V统计量对未选中块进行零阶均值补偿将其贡献纳入Softmax计算中从而在保持极低计算密度的同时有效控制精度损失。重构适配最新硬件的稀疏注意力算子。基于FlashAttention-3/4的设计理念采用PackGQA内存访问模式优化分组查询注意力的数据共享利用Warp特化生产者-消费者流水线及Pingpong重叠技术隐藏延迟并原生支持FP8量化推理充分释放NVIDIA Hopper架构GPU的性能潜力。原生支持现代推理框架的系统级集成。设计了兼容分页KV缓存和连续批处理的执行模型无需修改模型定义即可作为注意力后端无缝集成至SGLang等主流推理引擎中解决了传统稀疏算子与显存管理系统不兼容的问题。分析总结在NVIDIA H20 GPU上的实验显示FlashPrefill V2在128K上下文长度下相比FlashAttention-2实现了最高27.19倍BF16和47.26倍FP8的加速即使与对齐FA3/4的密集基线相比仍保持了30.49倍FP8的显著速度优势。精度评估表明该方法在RULER和LongBench基准测试中表现优异。在128K长度下其平均精度损失控制在1.5个点以内且FP8变体在启用均值校正后精度几乎与BF16全精度注意力持平证明了校正项在低精度量化下的有效性。端到端服务测试证实了其在实际部署中的价值。集成至SGLang后在连续批处理场景下首令牌生成时间TTFT降低了3.4至4.8倍且在混合负载的开环测试中显著提升了请求吞吐量和解码效率验证了其作为生产级后端的高效性与稳定性。个人观点论文通过均值校正巧妙平衡了稀疏带来的精度风险并通过深度定制的内核设计填补了稀疏计算与先进GPU架构之间的性能鸿沟。
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻