
文档教程人工智能【免费下载链接】AISystemAISystem 主要是指AI系统包括AI芯片、AI编译器、AI推理和训练框架等AI全栈底层技术项目地址https://gitcode.com/GitHub_Trending/ai/AISystem点击查看免费下载本文聚焦 AISystem 开源课程「国外 AI 芯片」章节的核心主题系统梳理谷歌 TPU 从 v1 到 v4 的架构演进脉动阵列、MXU、量化、BF16、3D Torus 与光路交换以及特斯拉 DOJO 的存算一体近存计算体系D1 芯片、DOJO Core、Training Tile 与 ExaPOD。读完本文你将掌握两类 DSADomain Specific Architecture芯片的完整设计脉络、关键参数与对比方法论并能在后续阅读仓库文档时直接定位每一代架构的对应资料。该章节在仓库中的入口为 02Hardware/05Abroad/README.md其下以 TPU 为主讲解了数据流Data Flow式脉动阵列加速矩阵运算的路线以 DOJO 为主讲解了近存计算Near Memory路线——这是两种完全不同的产品形态。技术细节分别沉淀在 04TPUIntrol.md、05TPU1.md、06TPU2.md、07TPU3.md、08TPU4.md 五篇正文文档以及 DOJO 系列的字幕资料srt/01.srt、srt/02.srt、srt/03.srt。一、谷歌 TPU从推理协处理器到 AI 计算集群1.1 TPU 的出现背景早在 2006 年谷歌内部就讨论过在自建数据中心中部署 GPU、FPGA 或自研 ASIC 的可能性但当时能在特殊硬件上运行的应用程序极少几乎可以零成本地利用数据中心过剩算力完成因此项目并未落地。2013 年风向突变谷歌研究人员预测如果人们每天使用语音搜索并通过 DNN 进行 3 分钟语音识别数据中心需要双倍算力才能满足需求仅靠传统 CPU 代价极高。TPU 由此立项。从立项到大规模部署TPU 只用了 15 个月。项目领头人 Norm Jouppi 曾表示首批交付的硅片无需任何错误修正或掩模更改且整个过程中还在同步组建团队、招募 RTL 设计专家、补充设计验证团队。1.2 历代 TPU 芯片与产品线仓库 04TPUIntrol.md 给出了历代 TPU 芯片的完整参数对比表这是理解 TPU 演进最直接的素材TPU 比较TPU v1TPU v2TPU v3Edge TPU v1Pixel Neural CoreTPU v4iTPU v4谷歌 Tensor推出日期20162017201820182019202020212021制程技术28nm16nm16nm--7nm7nm-芯片大小 (mm²)330625700--400780-芯片内存 (MB)283232--144288-时钟速度 (MHz)700700940--10501050-内存8 GiB DDR316 GiB HBM32 GiB HBM--8 GiB DDR32 GiB HBM-内存带宽 (GB/s)300700900--3001200-热设计功耗 (W)75280450--175300-TOPS92451234--275-TOPS/W0.310.160.562--1.62-产品层面谷歌除芯片外还推出了由众多 TPU 单元构成的超大规模计算系统 TPU Pod名称时间性能应用TPU v1201692 TOPS 8 GB DDR3数据中心推理TPU v22017180 TFLOPS 64 GB HBM数据中心训练和推理TPU v32018420 TFLOPS 128 GB HBM数据中心训练和推理Edge TPU2018可处理高吞吐量的稀疏数据IoT 设备TPU v2 Pod201911.5 万亿次运算/秒4 TB HBM数据中心训练和推理TPU v3 Pod2019100 万亿次运算/秒32 TB HBM数据中心训练和推理TPU v42021-数据中心训练和推理TPU v4 Pod2022-数据中心训练和推理TPU 也延伸到了消费端2017 年 Pixel 2/3 搭载 Pixel Visual Core2019 年 Pixel 4 搭载基于 Edge TPU 框架研发的 Pixel Neural Core后续的 Tensor G3 则面向设备端生成式 AI升级了 ARM CPU、GPU、图像信号/数字信号处理器及专门为谷歌神经网络模型打造的 TPU。二、TPU v1脉动阵列的奠基之作05TPU1.md 深入剖析了 TPU v1 的芯片架构。第一代 TPU 主要服务 8 比特矩阵计算由 CPU 通过 PCIe 3.0 总线驱动 CISC 指令28nm 工艺、700MHz、热设计功耗 40W另有 75W 的统计口径配备 28MiB 芯片内存与 4MiB 32 位累加器封装内还有 8GiB 双通道 2133MHz DDR3 SDRAM34GB/s 带宽。2.1 关键构成单元DDR3 DRAM / Weight FIFO模型权重通过 DDR3-2133 接口存储在片上 DDR3 RAM经 PCIe 从主机内存预加载再传输到 Weight FIFO 供 MXU 使用。MXU矩阵乘法单元以脉动阵列形式工作提供 256×256×8 bit 乘加计算每个时钟周期输出 256 个 16 bit 部分和内含 64KB Weight Tile 与双缓冲缓存单元被工程师称为TPU 的心脏。累加器Accumulators4 MiB 32-bit 存储即 4096 个各含 256 个元素的累加器。之所以是 4096谷歌发现每字节运算次数达到峰值约需 1350先向上舍入到 2048再翻倍让编译器在峰值运行时能使用双缓冲。控制指令Control四级流水线设计指令集为 CISC共 12 条指令平均每条指令执行 1020 个时钟周期。核心指令包括Read_Host_Memory从 CPU host 读取数据到 Unified BufferRead_Weight从 Weight DRAM 读取数据到 Weight FIFOMatrix_Multiply/Convolve执行乘法或卷积运算Activate执行 ReLU、Sigmoid 等激活计算Write_Host_Memory把计算结果从 Unified Buffer 输出到 CPU host由于目标是单一的神经网络推理TPU 控制逻辑只占芯片面积的 2%远低于 CPU/GPU配合简化的设计、增大的片上内存与缩小的芯片面积成本与良品率都更优。2.2 三大优化特性特性一低精度量化。推理并非总需要 FP32/FP16 精度。TPU 通过量化把权重和激活从 FP32/FP16 转为 INT8实现模型压缩——INT8 能近似表示预设最小值和最大值之间的任意数同时优化存储与计算效率。单个数据点虽失去超高精度但整体数据分布保持大致准确得益于神经网络泛化能力分类等推理任务可在接近原始精度下获得更快速度和更低资源消耗。特性二脉动阵列 MXU。CPU 通用性强但寄存器、ALU、程序控制付出了功耗和面积代价MXU 只需用 ALU 大批量处理矩阵加乘输入数据在运算中被多次复用某些情况下每个输入值只读取一次即可用于多个操作。MXU 本质是一个包含 256×25665536 个 ALU 的超大脉动阵列每个时钟周期可处理 65536 个 INT8 加乘运算。与 700MHz 相乘TPU v1 每秒可处理约 4.6×10¹² 次加乘运算。Systolic脉动一词源自心脏收缩——数据在阵列中像心脏泵血一样有节奏地流动。特性三专用硬件Minimal and Deterministic Design。CPU/GPU 为当多面手导致行为难以预测、延迟不可控TPU 只服务神经网络推理控制逻辑仅占 2%设计简单实用延迟可预测。2.3 脉动阵列的计算原理仓库文档以两个 3×3 矩阵为例逐拍拆解了脉动阵列工作过程矩阵 A 与 B 的数据被人工错位、以阶梯状分别从左侧和上方进入阵列A 的每一行点乘 B 的每一列。T1a₀,₀ 与 b₀,₀ 进入第一个处理器计算T2a₀,₀、b₀,₀ 沿原方向传到下一个处理器与新传入的 a₁,₀、b₀,₁ 计算同时 a₀,₁、b₁,₀ 进入第一个处理器与上一轮结果累加依此类推T3 至 T7数据如波浪般流过阵列最终在下方输出矩阵 A 每一行与矩阵 B 每一列的点乘结果。关于延迟TPU 采用流水线技术CISC 使用四级流水线处理指令Matrix_Multiply等指令耗时较长TPU 通过指令重叠overlap技术隐藏延迟——一条计算指令未完成时已开始准备或执行下一条从而抵消计算延迟对整体性能的影响。2.4 与 CPU/GPU 的竞品对比TPU v1 使用 SIMDGPU 使用 SIMTTPU 通过多级流水隐藏时延、减少缓存/乱序执行/多线程/预取更符合神经网络的计算逻辑。TPU 的目标是提高计算吞吐GPU 则通过多级缓存和计算核心降低延迟二者本质目的不同。谷歌用屋顶线性能模型Roofline Model基于 MLP、LSTM、CNN 三大类六个模型在 Haswell E5-2699 v3CPU、NVIDIA K80GPU和 TPU v1 上实验TPU v1 时延更低、用户体验更好。单 Die 对比优势计算性能每秒约 9.2×10¹² → 92 TOPS片上大缓存对抗 2015 年前后缓慢的内存访问首次在推理场景引入 INT8 量化配合大缓存可放入更大 batch。三、TPU v2面向训练的特定领域超级计算机2017 年谷歌推出 TPU v2定位用于训练神经网络的特定领域超级计算机恰逢《Attention Is All You Need》发布TPU v2 也是支撑 Transformer 时代的重要算力底座。3.1 训练场景的难点06TPU2.md 归纳了五个难点更难的数据并行推理任务彼此独立可横向拓展训练需一个模型迭代百万次、每次调整全部参数须跨集群协调并行。计算复杂度更高反向传播需对每一层每个权重和输入求偏导包括高精度激活值和转置权重矩阵乘法Wᵀδ。内存需求更大前向/反向传播的临时变量每层激活值、优化器值会把模型膨胀至原始大小的 89 倍。更具可编程性训练算法和模型快速变化芯片需适应日新月异的架构更新。高精度数据格式INT8 可用于推理但训练需 FP16、BF16、FP32 等混合精度以保证收敛、捕捉梯度信息。3.2 TPU v2 相对 v1 的四处改动改动一Vector Memory——把 Accumulators 与 Activation Pipeline 两个独立缓冲区合并为 Vector Memory更像传统 L1 Cache提升可编程性。改动二Vector Unit——v1 的 Activation Pipeline 是专为激活函数场景特殊处理的 ALUv2 改为 Vector Unit处理一系列向量激活函数。改动三MXU——v1 中 MXU 与 Vector Memory 相连v2 将 MXU 与 Vector Unit 相连数据出口和计算都由 Vector Unit 分发MXU 成为 Vector Unit 的协处理器对编译器和编程人员更友好。改动四DDR3→HBM——训练产生大量中间层变量DDR3 回写速度不足v2 将 HBM 与 Vector Memory 放在一起读写速度提升约 20 倍。3.3 计算核心拆解标量单元Scalar Unit处理起点从指令存储器取出完整 VLIW超长指令集指令执行标量操作并分发给向量/矩阵单元。VLIW 由两个标量槽、四个向量槽两个用于向量加载/存储、两个矩阵槽一推一弹、一个杂项槽和六个立即数组成。Core Sequencer 从 Instruction Mem 取 VLIW4K 32-bit 标量内存、32 个 32 位标量寄存器将向量指令送往 VPU。矢量单元Vector Unit含 128 个 Vector Lane每通道有 8 路执行维度子通道每子通道配备双发射 32 位 ALU 并连接 32 深度寄存器文件每时钟周期可同时操作 8 组 128 宽度矢量特别适合批量归一化。矩阵乘法单元MXUv2 选用 128×128 而非 v1 的 256×256。谷歌模拟器显示四个 128×128 MXU 的卷积模型利用率 37%48%明显高于单个 256×25622%30%且占相同芯片面积——因为部分卷积天然小于 256×256 会导致闲置十六个 64×64 利用率虽稍高38%52%但需要更多面积小 MXU 面积受 I/O 和控制线限制。因此 128×128 在带宽、面积、利用率间达到更好平衡。此外 v2 的 MXU 使用 bfloat16 乘法 32 位浮点累加BF16 相比 IEEE FP16 有约 1.5 倍能效优势且无需损失缩放loss scaling更易用、更省面积后被业界广泛采用。转置/规约/置换核心TRP Unit支持 128×128 矩阵的转置、规约、置换等特殊操作允许矩阵数据重排优化反向传播中常见的矩阵场景。3.4 芯片互联与 PodTPU v1 是单芯片推理协处理器v2 在板上设计了 Interconnect 模块Interconnect Router用于高带宽规模化。每个芯片有四个自定义核间互联ICI链接每链路每方向 496 Gbit/s。TPU v2 Pod 采用 16×16 二维环网256 芯片双向带宽 32 条链路 × 496 Gbit/s 15.9 Tbit/s——是传统 Infiniband 集群64 端口 × 100 Gbit/s ≈ 6.4 Tbit/s的 2.5 倍且省去了网卡、交换机及经 CPU 主机通信的延迟成本。TPU v2 芯片平面布局中两个核心一上一下互连路由器位于中间提供核心间互联两个 MXU 分别位于顶部/底部中心。四、TPU v3POD 形态与水冷超节点4.1 v3 相对 v2 的提升07TPU3.md 给出的三代对比表注意表中 TOPS 口径为整卡/模块级TPU v1TPU v2TPU v3Date introduced201620172018Process node28nm16nm16nmDie size (mm²)330625700On-chip memory (MB)286464Clock speed (MHz)700700940Memory8 GB DDR316 GB HBM32 GiB HBMMemory bandwidth300 GB/s700 GB/s900 GB/sTDP (W)75280450TOPS92180360TOPS/W0.310.160.56TPU v3 晶体管数量增加 11%时钟频率、互连带宽、内存带宽提升约 1.35 倍MXU 数量翻倍2→4面积仅增 6%理论峰值性能提升 2.7 倍。更关键的是能效大幅领先用水冷代替风冷使芯片更容易运行在合理温度下为 TPU v3 提供了约 1.6 倍的功率支持。4.2 从单卡到集群基本概念澄清在 20172018 年BERT 出现前多数人并不相信一个模型需要集群训练实际上仅 3 亿参数的 BERT 就在 4 个 TPU v3 Pod 上训练了四天而当今万亿参数模型普遍用万卡集群训练数个月。分布式架构参数服务器训练需在每张计算卡上计算损失和梯度再聚合梯度、更新并广播参数可用同步或异步方式同步并行全部节点完成本次通信后再进行下一轮本地计算。优点执行逻辑与串行等价、易保证一致性缺点早完成的工作节点需等待其他节点浪费计算硬件。异步并行当前 batch 迭代完即与其他服务器通信传输参数。优点执行效率高、无阻塞等待缺点模型可能不收敛、训练时间长、参数反复使用难以工业化。Host Bound 与 Device BoundHost Bound 指计算受主机资源通信或主机负载限制Device Bound 指受设备算力限制。大模型训练数据量大、计算复杂集群环境通常是 Device Bound。4.3 Pod 形态与通信谷歌官方定义TPU Pod 是一组通过专用网络连接在一起的连续 TPU 单元。TPU v2 基板四个 TPU v2 芯片与散热片A2 个 BlueLink 25GB/s 电缆接口BIBM BlueLink 端口协议Intel OPA 电缆C类似 InfiniBand电路板电源连接器D。支持 10Gbps 以太网与 100Gbps Intel OPA 两种网络配置。TPU v2 Pod每机柜 64 个 CPU 板 64 个 TPU 板共 128 个 CPU 芯片和 256 个 TPU v2 芯片TPU 集群居中、CPU 在两侧BlueLink/OPA 铜缆和光纤长度受限需避免信号衰减机柜中看不到存储模块数据经数据中心网络连接至 CPU。TPU v3 基板与 v2 结构相似但散热改为液冷散热管TPU v3 Pod 规模为 1024 芯片是 v2 的 4 倍。虚拟架构AI 框架通过 RPC 远程连接 TPU Host基于 CPU 控制 TPU 实现互联运作。算力对比TPU v2 Pod256 块 v2 11.5 PFLOPSTPU v3 Pod1024 块 v3 100 PFLOPS。TPU v3 本质是 v2 的强化版核心架构差异不大主要提升在于规模化能力。Pod 通信方式谷歌在 v2/v3 Pod 采用 2D Torus 网络每个 TPU 与相邻 TPU 直接连接形成二维平面网络减少通信延迟和带宽瓶颈。通过 all-reduce 方法优化同步训练避免对参数服务器的依赖同等资源下性能领先异步 SGD。五、TPU v4稀疏计算与光路交换5.1 TPU v4 架构概览TPU v4 与 v3 相隔四年期间英伟达迭代了 Volta、Ampere、Hopper 三代架构PyTorch 取代 TensorFlow 成为首选训练框架。每个 TPU v4 有两个 Tensor Core每个 Tensor Core 含六个单元四个 MXU脉动阵列 Scalar Unit Vector Unit两个 HBM 模块分别放在 Tensor Core 左右两侧以降低电缆时延。产品形态要点7nm 工艺MXU 数量较 v3 翻倍内存增至 244 MBHBM 仍 32 GB带宽增至 1.2 TB/s提升 33%新增 Sparse Core 支持稀疏计算首次采用 3D Torus 互联紧密耦合 4096 个 TPU v4 引擎TPU v4 Pod 总计 1.126 Exaflops BF16 峰值算力。5.2 Sparse Core 稀疏计算核Embedding 层的本质Embedding 处理离散型分类特征是稀疏化典型计算范式。输入矩阵中存在极大量 0按传统矩阵方式会重复计算大量 0 相乘浪费资源且稀疏变量的小规模内存访问易触及 CPU 和 DRAM 性能瓶颈尤其在 TPU:CPU 4:1 集群上。因此需要将稀疏特征压缩为稠密表达例如搜推场景经典的 Wide Deep 模型——wide 部分是广义线性模型deep 部分是把稀疏用户特征先处理成稠密 Embeddings 再进入全连接神经网络的隐藏层。Sparse Core 核心架构见 08TPU4.md 配图 08TPU404.png16 个 tiles计算瓦片是最通用单元每个瓦片关联一个 HBM 通道支持多个内存访问每个瓦片有 Fetch Unit从 HBM 读取激活与参数到 2.5 MiB 稀疏向量内存 Spmem 切片、可编程 8 路 SIMD 向量处理单元scVPU区别于 Tensor Core 的 VPU、Flush Unit反向传播时将更新参数写回 HBM另有五个跨通道单元在 16 个 Spmem 上执行嵌入操作。与 TPU v1 类似这些单元执行类 CISC 指令、处理可变长度输入。TPU v4 在 Sparse Core 中原生支持 Embedding 的模型并行和数据并行为大集群内的 Embedding 计算提供并行灵活度。5.3 TPU v4 PodCube、3D Torus 与 OCS谷歌将 4×4×464 个 TPU v4 芯片互联成立方体结构Cube再把 Cube 用光互联连成含 4096 个 TPU v4 的超级计算机。OCS光交换器由 64 颗 TPU 构成一组 Slice 间互连实现 Pod 内 Slice 间全光互连也可用于 Pod 之间。在芯片可靠率 99% 时可配置光互连可使系统平均性能提升高达 6 倍。3D Torus 拓扑每个节点通过三个维度与相邻节点连接可在 X-Y-Z 上形成连续循环提供高带宽、低延迟Cube 若要实现 6 面连接每面需 16 条链路、每个 Cube 共 96 条光链路连到 OCS每个 Cube 连接到 6×16÷248 个 OCS48 个 OCS 连接 64 个 Cube 的 48 对光缆并联 4096 个 TPU v4。每个端口对应一颗芯片端口连接交换机提供 6 Tb/s 带宽。这意味着搭建一个 TPU v4 集群需要 4096 片 TPU v4 48 个 OCS成本相当高。与 NVIDIA 集群对比DGX SuperPod 搭配第四代 NVLink/NVSwitch 最多连接 32 节点共 256 颗 H100每颗 GPU 900 GB/s 互连带宽NV 每机架 4 台 DGX32 颗 H100需要更多收发激光器和光纤网络成本高若部署 4096 颗 GPU 需切分多个 SuperPod 并多层交换约需采购 568 个 Infiniband Switch。反观 TPU v4 Pod 按切片64/128/256 芯片提供算力OCS 成本不到系统成本的 5%、功耗不到系统功耗的 3%Sparse Core 可将依赖嵌入的模型加速 57 倍但仅使用 5% 的裸片面积和功耗。5.4 Palomar 光路交换机OCS 光路开关芯片名为 Palomar基于 MEMS 反射镜阵列技术使用 2D MEMS 反射镜阵列通过控制反射镜位置调整光路实现切换具备低损耗、毫秒级低切换延迟、低功耗、低成本特点。每个陶瓷封装内含单个大型芯粒芯粒中有 176 个可单独控制的微反射镜每个微反射镜四周有四个梳状驱动区域用于在两个方向旋转反射镜。工作原理带内光信号路径绿色叠加 850 纳米波长监控通道红色用于校准镜面输入/输出光信号经 2D 光纤准直器阵列NxN 光纤阵列 2D 透镜阵列进入光学核心两组 2D MEMS 阵列在监控通道校准下驱动、倾斜镜面将信号切换到对应准直光纤。与传统交换机光→电→光转换相比OCS 提供光到光的转换节省大量电力并解决时延问题。5.5 TPU v4 优缺点分析优点低时延3D Torus 相邻节点短直接连线适合密集 I/O 紧耦合并行任务低网络代价同节点数下网络直径低于 Clos交换机/线材/连接器保有量更低路由可重配OCS 支持动态可重配路由集群部署后可立即投产易于隔离/下线故障节点更好集群布局物理相邻节点在逻辑上临近密集通信发生在局部流域优化延迟和功耗。缺点系统成熟度低Clos 拓扑非阻塞、性能一致可预测3D Torus 无法保证拓扑僵硬Clos 扩容叶交换机简单3D Torus 扩缩需重新配置整个拓扑负载均衡问题Clos 任意两节点间路径更多替代路径数量多于 3D Torus。六、特斯拉 DOJO近存计算路线的代表与 TPU 的脉动阵列 数据流路线不同DOJO 采用**存算一体近存计算**架构将存储与计算放在一起统一了高带宽与低延迟。仓库内 DOJO 的正文为 PPT 与视频形式见 01DOJOArch.pptx、02DOJODetail.pptx、03DOJOSystem.pptx以下要点整理自其配套字幕资料srt/01.srt、srt/02.srt、srt/03.srt。6.1 DOJO 超级计算机的分层体系DOJO 是特斯拉自研的神经网络加速超级计算机系统从底向上分为五层DOJO Core计算节点可视为一个微型 PC拥有独立 CPU、专用内存和 IO1.25 MB SRAM 作为主存而非缓存SRAM 以 400 GB/s 加载数据给 Scalar/Vector 计算、以约 270 GB/s 存储单个 Core 算力约 1.024 TFLOPS含四个 8×8×4 矩阵乘计算核心。D1 芯片台积电 7nm 工艺645 mm² 面积约一个手指甲盖大小集成约 500 亿晶体管含 354 个 DOJO Core不是 360因为预留容错率主打 BF16 与 CFP8 数据格式BF16/CFP8 算力 362 TFLOPS与同期 NVIDIA A100 接近FP32 算力 22.6 TFLOPS热设计功耗 400 W片上 SRAM 共 440 MB。Training Tile训练瓦片5×525 颗 D1 裸芯片通过台积电 SoW 晶圆级封装技术封装成一个训练 Tile整体采用晶圆系统解决方案片上 SRAM 约 11 GB算力约 9050 TFLOPS一个 Tile 大致对应一块 A100 的定位。主机Cabinet/Server六个 Training Tile 组成一台主机内含计算、IO、功率与液冷模块主机接口含 512 个 x86 内核、8 TB 主存PCIe 带宽 640 GB/s。ExaPOD每台机柜两台主机每个 ExaPOD 集成 128 个 Training Tile、约 3000 颗 D1 芯片、100 万个训练节点DOJO CoreBF16/CFP8 峰值算力达 1.1 EFLOPS提供约 1320 GB 片上 SRAM。6.2 DOJO Core 的内部结构DOJO Core 由四部分构成Front End前端、执行引擎Execution Engine、SRAM Memory存储、NoC Router片上网络路由。前端BTB分支目标缓冲区预测分支路径、缓冲分支信息以减少流水线分支损失、PC程序计数器、I-CacheL1 指令缓存直接与 Core 内 SRAM 相连取指令、Fetch Buffer取指缓冲4 路、最多容纳 8 条指令、Decoder译码并按指令分配 Scalar/Vector 执行单元随后是线程调度Scalar Scheduler、SMT Vector Scheduler。执行引擎针对 Scalar 和 Vector 各提供四路 SMT执行单元含两路 ALU、两路 AGU、512 位 SIMD以及最核心的 MatMul 矩阵计算单元类似 NVIDIA Tensor Core。存储与寻址代码不能直接访问系统内存只能访问自己的 SRAM 与矩阵计算单元与 NVIDIA 的共享内存/全局内存/本地内存体系完全不同本地 SRAM 完全由编译器管理不能用作缓存不支持虚拟内存SRAM 中存放的是物理地址借此减少控制部件面积、把更多面积留给 MatMul 和 ALU。NoC 路由把众多 DOJO Core 连成非常大的 2D 网络每个时钟周期可在四个方向上以 64B 粒度读写搬运数据到具体 SRAM。DOJO Core 的设计哲学是三个精简面积精简把大量计算核心集成进芯片最大化 AI 计算吞吐、延迟精简内核以 2 GHz 运行只保留基本分支预测和小指令缓存去掉对 AI 计算不必要的部件把面积留给向量化张量计算、功能精简不支持数据端缓存、虚拟内存、精确异常一切为提升 AI 计算吞吐服务。6.3 DIP 与系统级互联DIPDOJO Interface Processor以 PCIe 插槽形态出现的高带宽内存卡内含 32 GB HBM传输协议是特斯拉自定的 TTPTesla Transport Protocol在特斯拉主机与 Training Tile 之间通过 DIP 连接。带宽数据最多可将 5 个 DIP 以 900 GB/s 连接到一个 Training Tile使 Training Tile 吞吐达 4.5 TB/s每个 Training Tile 拥有 160 GB HBM32 GB × 5。D1 芯片布满了 576 个双向串行通道接口单边带宽约 4 TB/s。Z 平面链路主机内的 TTPOE 可将标准以太网转换为 Z 平面拓扑用于 Training Tile 间的数据交换与存算一体协同绕过冗长的 2D 网络路径实现跨系统访问数据。通信优化系统通信依赖 AI 编译器如编译通信树、barrier domain、lookup table 等机制将通信树索引触达到每个 DOJO Core加速索引和运算避免逐节点传输导致的低效线程唤醒本地/远程线程执行与休眠调度。6.4 DOJO 与 A100 的对比及软件思考从字幕资料看DOJO D1 与同期 A100 对比片上 SRAM 接近 A100 的 10 倍算力相近362 vs 312 TFLOPSFP16/BF16 口径计算核心数量上 A100 128 个 SM × 4 个 Tensor Core 与 DOJO 354 个 Core 相差不大A100 甚至略有优势——但 DOJO 因存算一体架构整体吞吐更高。字幕资料也提出了软件层面的开放性问题DOJO 高度依赖 AI 编译器生态若需对接业界 TVM 等工具链存在较大挑战对云服务多任务场景的任务分配支持尚不明确训练精度异常等模块、以及自研模型调试的易用性都留待时间去验证。七、总结两条路线的对照纵观「国外 AI 芯片」章节可以清晰提炼出两条技术路线维度谷歌 TPU特斯拉 DOJO加速范式数据流Data Flow近存计算Near Memory计算核心256×256/128×128 MXU 脉动阵列4 路 8×8×4 MatMul 512-bit SIMD关键精度INT8v1、BF16v2BF16、CFP8内存策略DDR3→HBM累加器/Vector Memory大容量片上 SRAM 作主存编译器管理规模化2D Torus256/1024 芯片→ 3D Torus4096 芯片 OCSTile→主机→ExaPOD1.1 EFLOPS设计哲学低精度 专用硬件 简化控制面积/延迟/功能三重精简TPU 系列验证了算法-芯片协同设计的价值量化、BF16、Sparse Core 均围绕深度学习特性定制DOJO 则验证了以近存计算消除访存瓶颈的另一种可能。仓库中 Groq 芯片09Groq.pdf作为本章节的另一个独立产品形态PPT 形式可结合视频资料继续深入学习。进一步学习可继续阅读同章节的 04TPUIntrol.mdTPU 发展史、05TPU1.md脉动阵列原理、06TPU2.md训练芯片、07TPU3.mdPOD 形态、08TPU4.md光路交换以及整个硬件篇的入口 02Hardware/README.md。赞分享文档教程人工智能【免费下载链接】AISystemAISystem 主要是指AI系统包括AI芯片、AI编译器、AI推理和训练框架等AI全栈底层技术项目地址https://gitcode.com/GitHub_Trending/ai/AISystem点击查看免费下载相关推荐谷歌 TPU 历史发展全解析AISystem 视角下的 AI 芯片架构演进与脉动阵列设计谷歌 TPU 历史发展全解析AISystem 视角下的 AI 芯片架构演进与脉动阵列设计 本文是 AISystemAI 系统全栈底层技术课程中《国外 AI文档教程人工智能谷歌 TPU v1 脉动阵列架构深度解析芯片布局、数据流与矩阵乘法原理谷歌 TPU v1 脉动阵列架构深度解析芯片布局、数据流与矩阵乘法原理 本篇文章基于仓库《国外 AI 芯片》系列中的 05TPU1.md https://li文档教程人工智能谷歌 TPU v4 与光路交换AISystem 视角下的 AI 芯片架构与超级互联解析谷歌 TPU v4 与光路交换AISystem 视角下的 AI 芯片架构与超级互联解析 本文是 AISystem 仓库《国外 AI 芯片》系列课程的 TPU文档教程人工智能上一篇ssh-audit与Terrapin漏洞检测全面防护SSH协议安全威胁下一篇Facenet-Pytorch实战指南5步掌握人脸识别技术创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考