FEATURED · 精选文章

谷歌提出Transformer架构中,表示崩塌、过度压缩的5个解决方法,看到就是赚到!!

发布时间 / 2026/8/27 17:46:33
来源 / 创域科博编辑部
栏目 / 资讯中心
谷歌提出Transformer架构中,表示崩塌、过度压缩的5个解决方法,看到就是赚到!! 前言Transformer架构的出现极大推动了生成式AI的发展在此基础之上开发出了ChatGPT、Copilot、讯飞星火、文心一言、Midjourney等一大批知名产品。但Transformer架构并非完美还存在不少问题例如在执行需要计数或复制输入序列元素的任务经常会出错。而这些操作是推理的基本组件对于解决日常任务至关重要。所以谷歌DeepMind和牛津大学的研究人员发布了一篇论文深度研究了在解码器Transformer架构中的“表示崩塌”和“过度压缩”两大难题同时提供了几个简单的解决方案。表示崩塌表示崩溃是指在某些情况下输入给大模型的不同序列在经过处理后会生成非常相似甚至几乎相同的表示并导致模型无法具体区分它们。这是因为Transformer架构中的自注意力机制和位置编码的设计使得随着序列的增长信息的表示越来越集中从而导致信息的损失。为了更好地解释这种表示崩溃研究人员定义了两个序列的表示差异并在Gemma 7B大语言模型中进行了实验。一组是逐渐增长的1的序列另一组是在1的序列末尾添加了一个额外的1。通过观察这两组序列在Transformer模型中的表示。研究人员发现随着序列长度的增加两组序列的表示差异逐渐减小直至低于机器的浮点精度这时大模型已经无法精准区分这两个序列了。过度压缩过度压缩现象的出现与表示崩塌有很大关系。在Transformer模型中过度压缩的表现为早期输入的token在模型的最终表示中的影响力减弱特别是当这些token距离序列的末尾较远时。由于Transformer模型的自注意力机制和层叠结构数据在每一层都会经过多次的压缩和重新分配这可能导致一些重要的信息在传播过程中被稀释或变得非常不明显。为了展示过度压缩在Transformer中的详细表现研究人员深度分析了如何通过模型的每一层传递并最终影响下一个token的预测。研究人员发现对于序列中较早的token由于它们可以通过更多的路径影响最终的表示因此它们的影响力会随着序列长度的增加而减少。这种影响力随着token在序列中的位置而变化序列开始的token比序列末尾的token更容易在模型的表示中保留其信息。同样为了验证该现象的存在研究人员在Gemini 1.5和Gemma 7B模型中进行了复制和计数任务实验。结果显示当序列长度增加时模型在复制序列末尾的token时表现不佳而在复制序列开始的token时表现较好这基本验证了过度压缩的现象确实存在。5个解决方案为了解决Transformer架构中的表示崩塌和过度压缩两大难题研究人员提出了5个简单有效的解决方法。改进注意力机制最直接的方法就是改进Transformer架构中的自注意力机制。通过调整注意力权重的分配可以增强模型对序列中早期token的关注。这可以通过修改注意力分数的计算方式来实现例如通过增加对早期token的权重或者重新设计一种机制使得模型在处理长序列时不会忽略这些token。改进位置编码位置编码是Transformer模型中用于捕捉序列中token位置信息的关键组件。可以改进这个模块例如使用相对位置编码或可学习的动态位置编码有助于模型更好地保持序列中各个token的独特性从而减少表示崩溃的发生。增加大模型深度和宽度增加模型的深度和宽度可以提供更多的参数来学习复杂的表示有助于模型更好地区分不同的输入序列。但是对AI算力的需求也非常大不适合小型企业和个人开发者。使用正则化例如使用权重衰减可以帮助模型避免过拟合有助于减少表示崩溃现象。通过在训练过程中引入噪声或限制权重的大小能抵抗输入序列的微小变化。引入外部记忆组件可以使用外部记忆组件例如差分记忆或指针网络可以帮助模型存储和检索长序列中的信息。这种外部记忆可以作为模型内部表示的补充提供一种机制来保持序列中关键信息的活跃度。为了验证方法的有效性研究人员在谷歌的Gemini 1.5和Gemma 7B大语言模型中行了综合评测。结果显示改进注意力机制和引入外部记忆组件等方法确实能有效缓解这两大难题。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
RELATED — 相关阅读

相关资讯

LATEST — 最新资讯

最新发布

TODAY — 本日精选

新闻

WEEKLY — 本周精选

新闻

MONTHLY — 本月精选

新闻