有理论基础,我们就可以进行深度优化了。
作者:WeekendLife
时间:2023-10-06
浏览:0
为什么transformer性能这么好?它给众多大语言模型带来的上下文学习(In-ContextLearning)能力是从何而来?在人工智能领域里,transformer已成为深度学习中的主导模型,但人们对于它卓越性能的理论基础却一直研究不足。最近,来自GoogleAI、苏黎世联邦理工学院、GoogleDeepMind研究人员的新研究尝试为我们揭开谜底。在新研究中,他们对transformer进行了逆向工程,寻找到了一些优化方法。论文《Uncoveringmesa-optimizationalgorith


。概括了 von Oswald 等人的理论,并展示了从理论上,Transformers 是如何通过使用基于梯度的方法优化内部构建的目标来自回归预测序列下一个元素的。 通过实验对在简单序列建模任务上训练的 Transformer 进行了逆向工程,并发现强有力的证据表明它们的前向传递实现了两步算法:(i) 早期自注意力层通过分组和复制标记构建内部训练数据集,因此隐式地构建内部训练数据集。定义内部目标函数,(ii) 更深层次优化这些目标以生成预测。 与 LLM 类似,实验表明简单的自回归训练模型也可以成为上下文学习者,而即时调整对于改善 LLM 的上下文学习至关重要,也可以提高特定环境中的表现。 受发现注意力层试图隐式优化内部目标函数的启发,作者引入了 mesa 层,这是一种新型注意力层,可以有效地解决最小二乘优化问题,而不是仅采取单个梯度步骤来实现最优。实验证明单个 mesa 层在简单的顺序任务上优于深度线性和 softmax 自注意力 Transformer,同时提供更多的可解释性。

在初步的语言建模实验后发现,用 mesa 层替换标准的自注意力层获得了有希望的结果,证明了该层具有强大的上下文学习能力。



,这对应于选择 W_0 = 0。
图 3:对构建的 token 输入进行逆向工程的多层 Transformer 训练。
结论




作者最新文章
打印机暂停打印的解决方法及恢复正常打印步骤
2026-09-22 14:32
华强北手机全线涨价:涨幅400-1500元,存储成本推高售价
2026-09-08 19:22
PDF转XML操作步骤与在线工具使用指南
2026-09-03 10:06
如何把多个PPT转成PDF?批量转换PDF的方法有哪些?
2026-09-02 19:32
CorelDRAW 2021图片虚化与边缘处理教程
2026-09-02 15:44
上一篇:
如何升级win10?
热门文章
更多
精品专题
更多
Mac软件
更多
WINDOWS
更多


































