FEATURED · 精选文章

Accelerating Streaming Video Large Language Models via Hierarchical Token Compression

发布时间 / 2026/8/18 14:32:43
来源 / 创域科博编辑部
栏目 / 资讯中心
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression 文章主要内容与创新点总结一、主要内容本文针对流式视频大语言模型(Streaming VideoLLMs)在实时部署中面临的高计算成本问题展开研究。这类模型在处理连续视频流的密集视觉令牌时,存在两大核心瓶颈:一是视觉Transformer(ViT)编码阶段中,时间相似帧的冗余处理导致效率低下;二是LLM预填充阶段令牌序列膨胀,加剧延迟和内存开销。为解决上述问题,作者提出了流式令牌压缩(STC)框架,这是一种即插即用的分层加速方案,可无缝集成到现有流式VideoLLMs中,同时优化ViT编码和LLM预填充两个阶段。STC包含两个核心模块:STC-Cacher:通过缓存和复用时间相似帧的特征,减少ViT编码开销,仅对动态令牌进行选择性计算,避免冗余运算;STC-Pruner:基于空间和时间相关性筛选最显著的令牌,在视觉令牌进入LLM前进行压缩,缩短预填充序列长度。作者在5个基准测试集上对4种基线流式VideoLLMs进行了大量实验,结果表明STC在保持高准确性(如在ReKV框架上保留99%准确率)的同时,显著降低了延迟——ViT编码延迟减少24.5%,LLM预填充延迟减少45.3%,且与端到端在线模型(如Dispider、LiveCC)和离线转在线框架(如ReKV)均具有良好兼容性。二、创新点针对性解决流式场景核心瓶颈:首次明确流式视频的两大特性(ViT编码中的时间冗余、无全局视频信息
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻