news 2026/9/8 15:59:39

PPT Master 论文精读示例实战:从《Attention Is All You Need》Figure 1 拆解 Transformer 架构总览

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
PPT Master 论文精读示例实战:从《Attention Is All You Need》Figure 1 拆解 Transformer 架构总览

PPT Master 论文精读示例实战:从《Attention Is All You Need》Figure 1 拆解 Transformer 架构总览

【免费下载链接】ppt-masterAI turns documents or topics into real, native PowerPoint decks—with native shapes, transitions and animations,>项目地址: https://gitcode.com/GitHub_Trending/ppt/ppt-master

本篇技术指南以 ppt-master 仓库中「Attention Is All You Need」论文精读示例的第五页讲稿 05_architecture_overview.md 为核心骨架,系统讲解 Transformer 的整体架构——输入嵌入与位置编码、编码器栈、解码器栈、残差与层归一化,以及 Linear + Softmax 输出端。文中同时结合同目录下相邻讲稿、设计规格 design_spec.md 与 SVG 成品页,给出这一架构知识点如何在 PPT Master 中被还原成一张可导出为原生 PPTX 的论文精读页。读完你可以独立讲清 Figure 1 每一层方块的含义,并掌握该示例仓库「每页一讲稿、自底向上读论文图」的工程组织方式。

一、先定位:这是精读 Deck 中的哪一页,讲给谁听

Attention Is All You Need(Vaswani et al., 2017)是一份 16 页的论文精读 PPT,存放于 examples/ppt169_attention_is_all_you_need/,针对 AI/NLP 工程师、机器学习研究生与论文精读小组。该示例遵循 PPT Master 的"每页一份讲稿"约定(见 design_spec.md 的 Speaker Notes Requirements):每个演讲页在notes/目录下有一个与 SVG 页面同基名的.md讲稿文件(例如05_architecture_overview.svg对应notes/05_architecture_overview.md),同时汇总版 total.md 使用#标题组织全部 16 页。

本文所述的 05 号讲稿处于整个 Deck 的Part 3:The Transformer,页标题为「Encoder–Decoder, stacked self-attention, point-wise FFN」,是全套架构拆解的第一张总览图——它对应的就是论文 Figure 1。整页按照 design_spec 第 IX 节的规划,采用"论文原图 + 右侧编号热点图注(1-5 条 sidebar legend)"的信息架构:从原始架构图中引导出五个关注点,与后续各页(注意力机制、位置编码等)形成"先总览、后深入"的阅读节奏。

二、读图方法论:为什么 Transformer 架构图要"自底向上"读

讲稿开头就给出一个关键阅读指令:"Read it from the bottom up."(自底向上读)。这张图本质上是一条数据流管线而不是抽象的关系图,自底向上的顺序恰好就是前向传播(inference)时数据真实流经的路径:

  1. 输入侧(Encoder 下方):源序列 token 先映射为嵌入向量,叠加正弦位置编码;
  2. 数据向上穿过 N 个相同的编码器层;
  3. 编码器输出作为"键/值"供给右侧解码器的交叉注意力层;
  4. 输出侧(Decoder 下方):已生成的目标 token 经嵌入 + 位置编码进入解码器,解码器输出向上经过一层线性投影与 Softmax,最终产出下一个 token 的概率分布。

05_architecture_overview.svg 中编号图注 1–5 正是按这条顺序组织的:Inputs + Positional EncodingNx Encoder blockNx Decoder blockAdd & Norm包裹规则 →Linear + Softmax — output probabilities,把图注文字与右侧原图一一对应,方便演讲者顺着数据流逐条解释。

讲稿中给图的读者定的"阅读契约"是:架构骨架与早期 seq2seq 模型相同,真正的创新在于"盒子里面装了什么"。因此下面每一节都在做两件事——先讲清盒子间的连接方式(骨架),再说明每个盒子内的实现(填充物)。

三、输入端:嵌入向量 + 正弦位置编码

自底向上的第一步是输入。架构中 Encoder 与 Decoder两侧的输入都先被表示为 embedding,并叠加一份正弦位置编码(sinusoidal positional encoding)

为什么要显式加位置编码?因为 Transformer 没有循环也没有卷积,模型本身没有任何关于 token 顺序的内建概念(这一点在 11_positional_encoding.md 中单独展开)。论文采用的是一份确定性、不参与学习的正弦编码:

  • 偶维索引2i使用正弦,奇维索引2i+1使用余弦;
  • 波长从10000·2π构成几何级数(对应公式PE(pos,2i) = sin(pos / 10000^(2i/d_model))d_model即嵌入维度);
  • 关键性质:对任意固定偏移 k,pos + k处的编码可以写成pos处编码的线性函数,因此模型可以用简单的线性组合来"按相对位置"进行注意力。

用讲稿的原话概括就是 "Order is injected, not learned"(顺序是被注入的,不是学出来的)。该 Deck 对这条公式的处理也值得一提:design_spec 的 Formula Rendering Policy 规定 block 级公式渲染为 PNG(formula_003.png即位置编码公式,透明背景、主色#1A365D),而d_model=512O(n)这类行内短数学保留为可编辑文本,兼顾公式精度与排版可编辑性。

四、编码器栈:六个相同层,每层两块

架构图左侧的Encoder 是 N 个完全相同层的堆叠,示例中 N=6(design_spec 第 IX 节 P06 内容标注 "Encoder (N=6)")。每一层内部包含两个子层(sub-layer)

  1. 多头自注意力(Multi-Head Self-Attention)——同一层内每个位置都能关注到本层其它所有位置;
  2. 逐位置的(Position-wise)前馈网络 FFN——两个线性层中间夹一个 ReLU,内维 2048,且对每个位置用完全相同的一组参数、逐位置独立应用(见 10_ffn_residual_layernorm.md)。

每个子层外面都套着一层Add & Norm,即"残差连接 + 层归一化"(见第五节)。

设计细节上,多头注意力会把 512 维向量切成 8 个头、每个头在 64 维投影上独立计算(详见 08_multi_head_attention.md),因此讲稿 06_encoder_decoder.md 特别强调:所有子层与嵌入层的输出统一为 512 维向量,残差相加才有意义——d_model = 512是整个网络的"统一交换口径"。

五、解码器栈:对称骨架上的三处不对称

架构图右侧的Decoder 同样堆叠 N=6 层,但每一层插入第三个子层,于是每层包含三块:

  1. 掩码多头自注意力(Masked Multi-Head Self-Attention):与编码器自注意力同构,但把"未来位置"设为负无穷再进 softmax,使位置 i 只能关注到 ≤ i 的位置——causal mask 保证了自回归性质,解码器无法"偷看"尚未生成的 token(掩码机制在 09_three_uses.md 中有展开);
  2. 编码器-解码器注意力(Encoder-Decoder Attention):Q 来自解码器自身,K、V 来自编码器输出,让每个解码位置都能从整个源序列中检索信息——这正是经典 seq2seq 中"attention 桥接两个栈"的角色;
  3. 逐位置前馈网络:与编码器一致。

讲稿把两侧差异概括为decoder 侧的三处不对称(symmetric skeleton、three asymmetries):

对比维度Encoder(左侧)Decoder(右侧)
堆叠层数N = 6(相同层)N = 6(相同层)
每层子层数2:多头自注意力 + FFN3:掩码自注意力 + 编码器-解码器注意力 + FFN
注意力掩码无(可关注全部源位置)因果掩码(只能关注 ≤ i 的位置)
输出嵌入右移一位(one-position shift),保证预测的是"下一个"token
包裹方式LayerNorm(x + Sublayer(x))相同
输出端顶层接 Linear + Softmax

架构的收尾在解码器栈顶端:经过最后一层后,一个线性投影(linear projection)把表示映射到词表大小,再经 softmax 得到下一个 token 的概率分布——这也是每页原图最上方那块 "Linear + Softmax" 方块的职责。

六、Add & Norm:让深度堆叠可训练的"配角三件套"

每个子层外面都包着同样的结构,即output = LayerNorm(x + Sublayer(x))——这是 06_encoder_decoder.md 与 10_ffn_residual_layernorm.md 反复强调的统一包裹规则。它由三个小部件组成:

  • 残差连接(Residual connection):把子层的输入 x 加回到子层输出Sublayer(x)上,让梯度信号能够稳定穿越几十层深的堆叠;
  • 层归一化(Layer Normalization):沿特征维度对向量做标准化,稳定训练;
  • 两者合成图中的"Add & Norm"标记块。

讲稿给出一个清醒的论断:这三样东西单独看都不是新发明,但在每个注意力子层外围组合使用,才是架构能在 N=6 深度下稳定训练的原因。注意它与多头注意力 / 前馈网络"谁该被归一化在前、残差接在哪"的细节在不同论文中有变体,本页只锁定论文原始约定:LayerNorm(x + Sublayer(x)),其中 x 为子层输入。

七、骨架未变,盒子已换:为什么说"新意全在方框里"

讲稿在结尾点明全页主旨:"The skeleton is the same as prior seq2seq models — what is new is what fills the boxes."(骨架与早前 seq2seq 相同——新的东西是盒子里填的内容)。

放到论文语境里,"骨架相同"指仍是经典的 Encoder-Decoder + 嵌入/位置信息 + 线性输出的布局;"盒子换了"则指此前 seq2seq 用循环网络(RNN/LSTM/GRU)填充的这些子层,被替换为:

  • 编码器:多头注意力;
  • 解码器:掩码自注意力 + 编码器-解码器交叉注意力;
  • 位置信息:显式正弦编码注入而非 RNN 的隐式逐步累积。

换言之,注意力成为序列建模的唯一骨干(没有循环、没有卷积),并带来了两大工程收益:位置间的最短路径从 O(n) 缩短为常量级操作,训练可并行度大幅提升。这正是为什么这页总览在整套 Deck 中扮演"承上启下"的角色——它先给你完整的组件地图,后续页面(07 缩放点积注意力、08 多头机制、09 注意力的三种用法、11 位置编码)再逐个放大解释每个盒子内部的工作原理与数学形式。

八、仓库里的工程还原:从讲稿文本到可导出 PPTX

如果要在仓库中复现并研究这一页的完整链路,可以按下面的文件顺序追踪:

  1. 讲稿:notes/05_architecture_overview.md——本文核心文本;汇总版见 notes/total.md;
  2. 设计规格:design_spec.md——第 IX 节 P05 定义了画布(1280×720 / PPT 16:9)、布局模式(左侧放 Figure 1 原图、右侧放编号热点图注)与图像资源用途;spec_lock.md 记录执行的锁定参数(颜色、字体、图标库等,均为 SVG 生成约束);
  3. 页面成品:svg_final/05_architecture_overview.svg——实际页面 SVG,正文即讲稿图注的落地;同目录svg_output/保留原始输出版本;
  4. 图像与公式资产:images/attention_p3_0.png(本页所用 Figure 1 原图)、images/formula_manifest.json(P07/P08/P11 三处 block 公式清单,经 codecogs 渲染、透明底、色值#1A365D);
  5. 导出产物:exports/attention_is_all_you_need_narrated.pptx——最终原生 PPTX。

在 ppt-master 的整体流水线中,这一页是"Default Generate"主流程(见 workflows/generate-pptx.md)的产物:svg_output/是页面设计的唯一事实来源,design_spec.mdspec_lock.md只是创作/控制输入,两者不得向 SVG 注入缺失的可见内容;导出阶段则由编译器将带语义标记的 SVG(含formula_manifest.json登记的 block/inline 公式)转换为带原生形状、过渡动画与可编辑 Office Math 的 PPTX。对读者而言,这意味着想改造这一页架构总览,只需编辑对应讲稿与svg_final/页面再走一次导出流程即可。

结语

作为整套精读 Deck 的架构总览页,05_architecture_overview.md用"自底向上读 Figure 1"这一句话框定了全部讲述顺序:嵌入与位置编码 → 编码器(6 层 × 2 子层)→ 解码器(6 层 × 3 子层 + 因果掩码)→ Linear + Softmax。配合"骨架继承 seq2seq、新意在盒子内"的判别框架,读者可以快速在脑内建立 Transformer 的完整组件地图。在 PPT Master 仓库中,这一页同时也是理解其工程组织方式的绝佳样本——从讲稿、设计规格、SVG 页面到导出 PPTX 的一一对应关系,恰好演示了"一篇深度技术讲稿如何被结构化地转化为原生演示文稿"。

【免费下载链接】ppt-masterAI turns documents or topics into real, native PowerPoint decks—with native shapes, transitions and animations,>项目地址: https://gitcode.com/GitHub_Trending/ppt/ppt-master

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/8 15:58:56

旅游服务网站源码 Java+SpringBoot+Vue 前后分离

一、关键词旅游服务网站,文旅出行服务网站,在线旅游服务平台二、作品包含源码数据库全套环境和工具资源本地部署教程三、项目技术前端技术:Html、Css、Js、Vue2、Element-ui后端技术:Java、SpringBoot2、MyBatis四、运行环境&…

作者头像 李华
网站建设 2026/9/8 15:58:19

室内定位工具哪个好?2026室内定位导航平台推荐

摘要:面对复杂的室内空间,如何选择合适的导航工具成为2026年众多场所关注的重点。本文围绕室内定位导航平台的挑选展开,探讨选择标准与核心能力。其中,北京大希科技有限公司凭借室内外一体化技术及多场景落地经验,为行…

作者头像 李华
网站建设 2026/9/8 15:57:58

开放科学实践指南:从预注册到数据复现的完整工作流

去年我在复现一篇顶刊论文时,前后折腾了整整三周,最后因为作者的补充材料里只给了一份排版混乱的附录文档——没有原始数据、没有分析代码、连变量定义表都不全——只能无奈放弃。更讽刺的是,那篇论文的核心结论后来被另一个更大样本的团队直…

作者头像 李华
网站建设 2026/9/8 15:56:48

光刻机到底是怎么工作的?一篇给普通人的原理详解

如果你关注过芯片新闻,一定听过“光刻机”这个名字。它是制造芯片的核心设备,也被称为“超精密尖端装备的珠穆朗玛峰”。一台最先进的光刻机售价近10亿元人民币,由几万个甚至十几万个零部件组成。 但光刻机到底在做什么?它的原理真…

作者头像 李华
网站建设 2026/9/8 15:55:49

RK3588+RK1288双芯架构:破解机器人智能巡检算力与实时控制难题

搞机器人巡检的同行应该都有同感:看着实验室里跑得好好的样机,一拉到客户现场就现原形。要么电池撑不过半天,要么识别卡顿把关键帧漏掉,要么现场电磁干扰让传感器数据乱跳。我不是说AI算法不重要,但真正决定一个巡检方…

作者头像 李华