当前位置：首页 > 文章列表 > 科技周边 > 人工智能 > Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

来源：51CTO.COM 2023-05-11 11:34:58 0浏览收藏

本篇文章主要是结合我之前面试的各种经历和实战开发中遇到的问题解决经验整理的，希望这篇《Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了》对你有很大帮助！欢迎收藏，分享给更多的需要的朋友学习~

今天，AI圈被一个惊天「翻车」刷屏了。

谷歌大脑的NLP奠基之作、提出Transformer架构的开山鼻祖级论文《Attention Is All Your Need》中的图，被网友扒出与代码并不一致。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

论文地址：https://arxiv.org/abs/1706.03762

自2017年问世以来，Transformer已经成为AI领域的基石王者。就连大红大紫的ChatGPT真正的幕后大佬也是它。

2019年，谷歌还专门为它申请了专利。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

归宗溯源，现在各类层出不穷的GPT（Generative Pre-trained Transformer），都起源于这篇17年的论文。

据Google Scholar，截止目前，这篇奠基之作已有7万多次的引用。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

所以，ChatGPT的奠基石都不稳了？

作为「开山鼻祖」的论文，结构图竟是错的？

Lightning AI创始人、机器学习研究者Sebastian Raschka发现，这篇论文中Transformer的图是错误的。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

图中被圈出的地方，LayerNorms是在注意力和全连接层之后。在残差块之间放置层归一化，会导致输出层附近参数的预期梯度很大。

而且，这也与代码不一致。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

代码地址：https://github.com/tensorflow/tensor2tensor/commit/f5c9b17e617ea9179b7d84d36b1e8162cb369f25#diff-76e2b94ef16871bdbf46bf04dfe7f1477bafb884748f08197c9cf1b10a4dd78e

不过有网友指出，Noam shazeer在几周后对代码进行了纠正。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

随后，Sebastian称，在论文Layer Normalization in the Transformer Architecture中，Pre-LN表现得更好，可以解决梯度问题。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

这是很多或者大多数架构在实践中所采用的，但它可能导致表征崩溃。

如果层归一化在注意力和全连接层之前被放置在残差连接之中，就会实现更好的梯度。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

Sebastian提出，虽然关于使用Post-LN或Pre-LN的讨论仍在进行中，但也有一篇新论文提议把二者结合起来。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

论文地址：https://arxiv.org/abs/2304.14802

在这种双残差Tranformer中，表征崩溃和梯度消失的问题都得到了解决。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

网友热议

针对论文中的疑点，有网友指出：中间不是已经有了PreLN和PostLN了吗？

Sebastian回答说，自己也觉得有点奇怪。或许2nd LN指的是最后一个输出层，而不是每个transformer块，但他对此也不确定。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

有网友表示：「我们经常遇到与代码或结果不匹配的论文。大多数就是出于错误，但有时也会让人很奇怪。而这篇论文已经流传甚久了，为什么这种问题此前从没被人提出过，这真的很奇怪。」

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

Sebastian表示，公平地讲，最原始的代码是和图片一致的，但他们在2017年修改了代码版本，却没有更新图片。所以，这很令人困惑。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

有网友表示，已经有论文在NormFormer中展示了一个不太复杂的架构，而他的团队最近也证实了他们的结果。而ResiDual论文没有在任何地方提到NormFormer，这让人很惊讶。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

同时，评论区不断出现网友证实：Transformers中使用的LN，与CNN中使用的方式并不同。

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了

所以，论文真的存在漏洞，还是乌龙事件？

让我们静观后续。

到这里，我们也就讲完了《Transformer开山论文惊天「翻车」？图与代码不一致，神秘bug看傻了》的内容了。个人认为，基础知识的学习和巩固，是为了更好的将其运用到项目中，欢迎关注golang学习网公众号，带你了解更多关于开源,代码的知识点！

开源代码

版本声明

本文转载于：51CTO.COM 如有侵犯，请联系study_golang@163.com删除

对标必应聊天：百度搜索小范围公测“对话”功能，基于文心一言大语言模型

对标必应聊天：百度搜索小范围公测“对话”功能，基于文心一言大语言模型

上一篇: 对标必应聊天：百度搜索小范围公测“对话”功能，基于文心一言大语言模型

mysql前缀索引是什么

下一篇: mysql前缀索引是什么

查看更多

最新文章

科技周边 · 人工智能 | 7分钟前 |

豆包AI生成员工总结的技巧与实例

413浏览收藏
科技周边 · 人工智能 | 25分钟前 |

豆包AI绘图技巧与关键词使用方法

388浏览收藏
科技周边 · 人工智能 | 50分钟前 |

豆包AI创建数字分身教程及音色形象生成指南

401浏览收藏
科技周边 · 人工智能 | 1小时前 |

PersonaPlex：英伟达双工语音AI模型发布

278浏览收藏
科技周边 · 人工智能 | 1小时前 |

GoogleAI助力YouTube视频SEO优化技巧

130浏览收藏
科技周边 · 人工智能 | 9小时前 |

AI简历生成器：一键制作专业简历

227浏览收藏
科技周边 · 人工智能 | 9小时前 |

BeautifulAI交互式雷达图制作教程

286浏览收藏
科技周边 · 人工智能 | 10小时前 | 微信AI数字人

微信AI数字人生成教程及使用技巧

366浏览收藏
科技周边 · 人工智能 | 10小时前 |

好的，请提供你想要模仿的“大咖”代表作内容，我会根据其语气和风格进行模拟，并输出符合游戏博主风格、符合SEO的标题。请开始输入吧！

497浏览收藏
科技周边 · 人工智能 | 10小时前 |

AI换背景教程：智能抠图替换技巧

239浏览收藏
科技周边 · 人工智能 | 11小时前 |

GLM-4角色扮演技巧：AI秒变律师写合同方法

469浏览收藏
科技周边 · 人工智能 | 11小时前 |

JasperAI提示词怎么写？详细教程指南

299浏览收藏

查看更多

课程推荐

前端进阶之JavaScript设计模式

设计模式是开发人员在软件开发过程中面临一般问题时的解决方案，代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景，打造一站式知识长龙服务，适合有JS基础的同学学习。

543次学习
GO语言核心编程课程

本课程采用真实案例，全面具体可落地，从理论到实践，一步一步将GO核心编程技术、编程思想、底层实现融会贯通，使学习者贴近时代脉搏，做IT互联网时代的弄潮儿。

516次学习
简单聊聊mysql8与网络通信

如有问题加微信：Le-studyg；在课程中，我们将首先介绍MySQL8的新特性，包括性能优化、安全增强、新数据类型等，帮助学生快速熟悉MySQL8的最新功能。接着，我们将深入解析MySQL的网络通信机制，包括协议、连接管理、数据传输等，让

500次学习
JavaScript正则表达式基础与实战

在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。

487次学习
从零制作响应式网站—Grid布局

本系列教程将展示从零制作一个假想的网络科技公司官网，分为导航，轮播，关于我们，成功案例，服务流程，团队介绍，数据部分，公司动态，底部信息等内容区块。网站整体采用CSSGrid布局，支持响应式，有流畅过渡和展现动画。

485次学习

查看更多

AI推荐

ChatExcel酷表

ChatExcel酷表是由北京大学团队打造的Excel聊天机器人，用自然语言操控表格，简化数据处理，告别繁琐操作，提升工作效率！适用于学生、上班族及政府人员。

3747次使用
Any绘本

探索Any绘本（anypicturebook.com/zh），一款开源免费的AI绘本创作工具，基于Google Gemini与Flux AI模型，让您轻松创作个性化绘本。适用于家庭、教育、创作等多种场景，零门槛，高自由度，技术透明，本地可控。

4039次使用
可赞AI

可赞AI，AI驱动的办公可视化智能工具，助您轻松实现文本与可视化元素高效转化。无论是智能文档生成、多格式文本解析，还是一键生成专业图表、脑图、知识卡片，可赞AI都能让信息处理更清晰高效。覆盖数据汇报、会议纪要、内容营销等全场景，大幅提升办公效率，降低专业门槛，是您提升工作效率的得力助手。

3957次使用
星月写作

星月写作是国内首款聚焦中文网络小说创作的AI辅助工具，解决网文作者从构思到变现的全流程痛点。AI扫榜、专属模板、全链路适配，助力新人快速上手，资深作者效率倍增。

5126次使用
MagicLight

MagicLight.ai是全球首款叙事驱动型AI动画视频创作平台，专注于解决从故事想法到完整动画的全流程痛点。它通过自研AI模型，保障角色、风格、场景高度一致性，让零动画经验者也能高效产出专业级叙事内容。广泛适用于独立创作者、动画工作室、教育机构及企业营销，助您轻松实现创意落地与商业化。

4326次使用

查看更多

相关文章

GPT-4王者加冕！读图做题性能炸天，凭自己就能考上斯坦福

2023-04-25 501浏览
单块V100训练模型提速72倍！尤洋团队新成果获AAAI 2023杰出论文奖

2023-04-24 501浏览
ChatGPT 真的会接管世界吗？

2023-04-13 501浏览
VR的终极形态是「假眼」？Neuralink前联合创始人掏出新产品：科学之眼！

2023-04-30 501浏览
实现实时制造可视性优势有哪些？

2023-04-15 501浏览

Golang学习网：公益在线Go学习平台，帮助Go学习者快速成长！

技术交流群

Copyright 2023 http://www.17golang.com/ All Rights Reserved ｜苏ICP备2023003363号-1

关注公众号

Golang学习网

微信登录更方便

密码登录
注册账号

登录即同意用户协议和隐私政策

返回登录

重置密码