A100-80G-SXM4:A100 是型号代号,80G 表示 80GB 显存,SXM4 指 SXM 第四代板型(高带宽底座,需搭配专用服务器);另有 40GB 版与 PCIe 版。
基于 Ampere 架构,以 TF32 · 第三代张量核心 · 结构化稀疏 · MIG 多实例 · NVLink 3 为底座。它先是点燃大模型元年的主力算力,如今转身为存量时代的性价比之选——一张卡,两段人生。

一、开篇导读

A100 是 NVIDIA 2020 年 5 月发布的数据中心 AI 训练旗舰 GPU,基于 Ampere 架构。ChatGPT、LLaMA 等第一批引爆公众认知的大模型,几乎都在它组成的集群上训练——可以说,A100 是"大模型元年"的主力算力底座

为什么今天还值得回头读它? 两个理由:一是它承前启后——读懂 H100读懂 H200 里那些"更快、更省"的进步,全都是以 A100 为标尺量出来的;二是它并未退场——凭借巨大的存量、最成熟的生态和独有的 MIG 多实例能力,A100 从"训练主力"平滑转型为"性价比推理与多租户"的当红卡。本文不按"它比 H100 差在哪"来写,而是讲清它从哪来、成就了什么、今天还值不值得用

二、认知锚点:用类比看懂它

一句话类比:如果 H100 是一座吞吐惊人的自动化超级货运港,那 A100 就是这座港的一代目——它当年第一次把堆场、传送带、分拣线整合成"现代化大港",只是传送带速率约为后来 H100 的六成,分拣工人也还没学会 FP8 那套"先粗分、快速拣"的省力新法。

把数字变直觉

  • 显存 80GB(堆场大小):A100 80GB 版与 H100 容量相同,装大模型时撞的是同一堵"显存墙"——70B 模型光 FP16 权重就约 140GB,单卡都放不下。可见容量并不是它与 H100 的差距所在。
  • 带宽 2.0 TB/s(传送带速率):每秒约搬运 425 张 DVD 的数据(DVD 按 4.7GB 计),但也只有 H100(3.35 TB/s)的六成。传送带偏慢,是 A100 的第一处短板。
  • FP16 张量算力 312 TFLOPS(分拣工人的速度):A100 最快的档位止步于 TF32/FP16,始终学不会 H100 那套"先粗分、再快拣"的 FP8 省力法——这才是两者训练效率真正拉开的地方。

三个常见误区

  1. A100 显存比 H100 小? 不一定。A100 有 40GB 与 80GB 两版,80GB 版与 H100 容量相同;代差在带宽与精度(无 FP8),不在容量。
  2. A100 过时、不能用了? 错。它存量巨大、生态最成熟,至今仍是性价比训练与多租户推理的主力(详见第六节"第二段人生")。
  3. 新卡一定全面碾压 A100? 看精度。同精度(FP16/TF32)下 H100 张量算力约为 A100 的 3 倍;官方宣称的"约 6 倍"来自 A100 不具备的 FP8。

三、身世:从 V100 到 A100

H100 那篇讲的是"A100 → H100"如何进化;这一节正好是它的镜像前传——A100 是怎么从上一代 V100 脱胎而来的。看懂这段,才知道 A100 当年为何是"天花板"。

3.1 A100 为何而生

2020 年前后,深度学习的算力需求正从"卷积网络"转向"超大 Transformer":BERT(2018)、GPT-2(2019)、GPT-3(175B,2020)接连出现,参数规模从亿级跳到千亿级。上一代 V100(Volta,2017)的显存(16/32GB)、带宽(0.9 TB/s)与缺乏 TF32 的算力档位,越来越吃不消。A100 用 Ampere 架构一次性回应了这些痛点:

上一代 V100 痛点 A100 的解法 关键技术与量化
显存与带宽不足:32GB HBM2、0.9 TB/s,大模型频繁换入换出 40/80GB HBM2e,带宽提到 2.0 TB/s(80GB SXM4) 带宽约为 V100 的 2.2 倍
缺训练友好的中间精度:只有 FP16/FP32,调精度与调速度难两全 引入 TF32 张量核心,代码不改即获张量加速 TF32 156 TFLOPS(稠密)
算力利用率低:稠密矩阵计算存在冗余 第三代张量核心 + 2:4 结构化稀疏,稀疏吞吐翻倍 FP16 312→624 TFLOPS(稀疏)
单卡难以多任务共享:一张卡只能整卡分配 MIG(Multi-Instance GPU),单卡切分最多 7 个隔离实例 推理/多租户利用率大幅提升
多卡互联瓶颈:NVLink 2 代带宽有限 NVLink 3 代 600 GB/s + NVSwitch,8 卡全互联 支撑千卡级训练集群

3.2 代际与产品线位置

  • 架构:Ampere(命名自物理学家安培),是 Volta(V100)的继任、Hopper(H100)的前代。
  • 节奏:2020-05 GTC 发布,同年量产;80GB 版于 2020-11 追加。
  • 产品线位置:上代 V100(2017,Volta)|中国特供衍生 A800(NVLink 砍至 400 GB/s,应对出口管制)|下代 H100(2022,Hopper,引入 FP8)。

四、关键参数全景

进入 A100 的硬规格。这张参数全景表是全文的专业层重心,也是与 H100/H200 横比的基准。读表时重点看三处 A100 的身份标记:没有 FP8、支持 MIG、有 40/80GB 两版

下表以 A100 SXM4 80GB 为主,附 PCIe 80GB 变体对照。算力单位 TFLOPS(INT8 用 TOPS)。

参数 A100 SXM4 80GB A100 PCIe 80GB
架构 / 制程 Ampere / TSMC 7N 同左
晶体管数 542 亿 542 亿
die 面积 826 mm² 826 mm²
显存容量 80 GB HBM2e 80 GB HBM2e
显存位宽 5120-bit 5120-bit
显存带宽 2.0 TB/s 1.94 TB/s
FP64(非张量 / 张量) 9.7 / 19.5 9.7 / 19.5
FP32(非张量) 19.5 19.5
TF32 张量(稠密/稀疏) 156 / 312 156 / 312
FP16·BF16 张量(稠密/稀疏) 312 / 624 312 / 624
INT8 张量(稠密/稀疏) 624 / 1248 TOPS 624 / 1248 TOPS
FP8 不支持(Ampere 无 FP8) 不支持
NVLink 3 代,600 GB/s 桥接 600 GB/s(双卡)
PCIe Gen4 x16 Gen4 x16
TDP(功耗) 400 W 300 W
MIG 多实例 最多 7 个(每实例 10GB) 最多 7 个
互联拓扑 8 卡 NVSwitch 全互联 单/双卡为主

注:显存带宽公式 带宽 = 位宽(bit) × 每引脚速率(Gbps) ÷ 8;A100 80GB 以 5120-bit × ~3.2 Gbps ÷ 8 ≈ 2.0 TB/s。40GB 版用 HBM2(非 HBM2e),带宽约 1.56 TB/s,其余算力档位与 80GB 一致。A100 是 PCIe Gen4(非 H100 的 Gen5),无 FP8 张量核心。参数以 NVIDIA 官方 datasheet 为准。

SXM4 与 PCIe 是同一颗 GA100 芯片的两种交付形态(张量峰值相同,差在 400W/300W 功耗、NVLink 与扩展性),机理与 H100 完全一致,此处不再展开,详见 H100 · 4.2 两种交付形态。集群选 SXM4,单机试验选 PCIe。

五、A100 的看家本领:MIG 与 TF32

参数表之外,A100 有两项设计让它"好用"且"耐用"——TF32 让训练提速几乎零门槛,MIG 让它在推理时代获得第二春。这两项,才是 A100 区别于前后代的身份标签。

微架构:Ampere(GA100)——台积电 7N、826 mm² die、542 亿晶体管、6912 CUDA 核心、432 个第三代张量核心。

TF32:代码不改,训练即加速
TF32 是一种 19 位中间精度,动态范围同 FP32、精度介于 FP16 与 FP32 之间。开发者无需改一行代码,原本跑在 FP32 上的训练就能自动走张量核心加速——这是 A100 训练易用性的关键,也是它当年迅速铺开的重要原因。

MIG(Multi-Instance GPU):一卡拆七,A100 的招牌
MIG 能把单张 A100 在硬件层切分为最多 7 个相互隔离的实例,每个实例有独立的显存、缓存与算力,互不干扰。它的价值在推理与多租户场景被彻底放大:

  • 云厂商可以把"一张卡"拆成"几分之一卡"售卖,小模型推理不必独占整卡;
  • 多个团队/任务共享一张卡而互不抢占,利用率大幅提升。

这是 A100 首创、H100 才继承的能力,也是 A100 在训练主力身份褪色后,仍能在推理市场站稳的技术底气(见第六节"第二段人生")。

其余关键技术:2:4 结构化稀疏(满足稀疏模式的权重张量吞吐翻倍,如 FP16 312→624 TFLOPS)、NVLink 3 代 600 GB/s + NVSwitch(8 卡全互联)、HBM2e 显存(80GB 版 2.0 TB/s,较 V100 的 0.9 TB/s 大幅提升)。

看家本领的边界——为什么 H100 更快:A100 的最高精度档位止步 TF32/FP16/BF16没有 FP8 与 Transformer Engine。同精度(FP16 张量)下,H100 SXM5 峰值约为 A100 的 3 倍(989 vs 312 稠密);官方宣称的"最高约 6 倍"端到端训练吞吐,主要来自 A100 不具备的 FP8 稠密算力(1979 vs 312,约 6.3 倍)与更高带宽(详见 H100 · 第五节)。一句话:A100 与 H100 的代差,七分在 FP8、三分在带宽,容量并非主因

六、A100 的两段人生

A100 的故事不是"一款卡的规格清单",而是一条清晰的生命周期曲线——它先当了两年训练主力,又靠存量与 MIG 拿到了推理时代的"续命剧本"。下面用公开可参照的示例做量级估算(假设 MFU 模型利用率约 40%,训练算力按 Chinchilla 经验 C≈6×参数量×训练token数)。

6.1 第一段人生(2020–2022):大模型训练的主力

这段时期,A100 就是数据中心 AI 训练卡的绝对主力:ChatGPT、LLaMA 系列等标志性模型的训练平台均以 A100 集群为核心,全球头部云厂商与模型厂商大规模采购 A100 组建千卡至万卡集群。

  • 典型任务:大语言模型预训练(十亿~千亿参数)、指令微调(SFT)、RLHF、LoRA 后训练、推荐系统大规模 Embedding。
  • 量化估算(以 LLaMA-70B、训练 1T tokens 为例)
    • 显存:70B 在 FP16 权重 ≈ 140GB → 需 ≥2 张 80GB A100(与 H100 同样撞显存墙)。
    • 训练算力:总需求 ≈ 4.2×10²³ FLOPs。千张 A100(FP16 稠密、MFU 40%)有效算力约 1.25×10¹⁷ FLOPs/s → 理想耗时 ≈ 5–6 周
    • 对比:同规模千张 H100 集群(FP8)约 6 天A100 把训练压在"以周计",H100 才进一步压到"以天计"——差距主要来自 FP8。
  • 部署形态:以 8 卡为一个训练节点,代表整机是 DGX A100(单机 8 卡、6U、约 6.5 kW;注意 DGX H100 才是 8U,勿混用),可堆叠成 DGX A100 SuperPOD(1120 卡起步)。其余云实例 / 裸金属 / 自建 PCIe 形态与 H100 一致

6.2 第二段人生(2023–今):存量性价比与多租户推理

H100 量产铺开后,A100 并未退场,而是凭三样东西转型为"务实之选":巨大的存量、最成熟的生态、独有的 MIG

  • 多租户推理主力:借助 MIG,一张 A100 可切成多个隔离实例并行服务多个中小模型,云厂商得以按"几分之一卡"售卖,单位推理成本显著下降。
  • 量化估算:70B 模型 INT4 单卡 A100 推理吞吐约百级 tokens/s(依 batch/实现浮动);同模型 H100 因带宽与 FP8 优势约为其 2–4 倍。A100 胜在"够用且便宜"。
  • 成本账:A100 单卡价格与租金通常低于 H100,但因无 FP8、带宽较低,单位算力的训练效率约为 H100 的 1/3–1/6(依精度与实现)。核心看"每 token 成本",不看"每卡标价"——预算敏感、存量充足或受管制的场景,A100 仍最划算。
  • 生命周期:已停止迭代,处于"存量长尾"阶段;NVIDIA 主力已转向 Hopper(H100/H200)与 Blackwell(B200)。

A100 无显示输出、无 RT Core,不用于图形渲染;图形/渲染需求见 RTX / L40S 篇。

6.3 价格与供货(含 A800 合规)

供货与出口管制:A100 与 H100 同属美国出口管制受限范畴,时间线须分轮次厘清(详见 H100 · 第七节):2022 年 A100/H100 即需出口许可、实质禁售中国大陆,NVIDIA 随即推出中国特供版 A800(NVLink 从 600 GB/s 砍至 400 GB/s,算力与显存不变);2023-10 管制升级后 A800/H800 亦被限,改由 H20 承接。当前国内合规采购主要走 H20 通道,A100/A800 以存量流通为主。据公开政策,以官方为准。

价格区间

  • 灵算云平台采集价格(云租赁,数据源:本平台采集价格,截至 2026-07-22):A100-80G-SXM4 约 34.84 元/卡·时(当日发布加权均价)/ 约 8889 元/卡·月;当日样本区间 30.18–42.25 元/卡·时(4 家厂商样本)。
  • 官方发售价(整卡采购,公开资料):A100 80GB 发布期约 $15,000–$17,000 / 卡(2020 上市)。
  • 二手/拆机:A100 存量大、二手流通活跃,价格波动大,需甄别来源与保修。

注:平台采集为小样本(近日 2–5 家厂商),单日跨型号横比受样本波动影响较大,价格一律以平台实时采集为准。

竞争格局:同代对标 AMD MI100/MI210、Google TPU v3/v4;下代被 H100 全面接替;国产对标昇腾 910、寒武纪 MLU370 等(当时代次)。CUDA 生态仍是 A100 长期在位的最大护城河

七、选型指南:今天还该不该上 A100

A100 的选型是一道"现在时"的题——在 H100/H200/B200 已铺开的 2026 年,什么情况下 A100 仍是更优解?

适配决策树

  • 训练/微调十亿~百亿参数 + 预算敏感 → A100 SXM4 80GB(生态成熟、租金通常低于 H100)。
  • 推理为主 + 多模型/多租户 → A100 + MIG(单卡切分多实例,利用率高)。
  • 追求极致训练效率、跑千亿参数 → 优先 H100(FP8 + TE,单位 token 成本更低,见 H100 · 第八节)。
  • 显存成瓶颈(模型装不下 80GB)→ 上 H200(141GB)(见 H200 · 第四节)。
  • 受出口管制(中国区)→ 选合规特供 H20,或存量 A800,或评估国产替代。

兄弟型号怎么选

  • A100 vs H100:同为 80GB,差在带宽(2.0 vs 3.35 TB/s)与精度(A100 无 FP8)。追效率选 H100,控成本选 A100。
  • A100 80GB vs 40GB:80GB 用 HBM2e、带宽 2.0 TB/s,40GB 用 HBM2、带宽 1.56 TB/s;显存吃紧或跑较大模型选 80GB。
  • A100 SXM vs PCIe:集群必选 SXM(互联与扩展),单机试验 PCIe 即可(见第四节表注)。
  • A100 vs A800:A800 是 A100 的中国特供版,仅 NVLink 带宽下调(600→400 GB/s),单卡算力与显存不变;受管制时选 A800。

避坑提示

  • 显存墙同样存在:80GB 跑 70B+ 模型 FP16 仍需张量并行 / 梯度检查点,别以为"和 H100 同容量就够用"。
  • 没有 FP8:想用 FP8 省算力的框架在 A100 上无法生效,最低有效档是 FP16/TF32。
  • 供电散热:SXM 400W 需整机底座与强冷,勿按消费卡经验估算。
  • PCIe Gen4 上限:A100 是 Gen4(非 Gen5),插最新 Gen5 平台不会获得额外带宽。

附录:统一速查卡

项目
型号 NVIDIA A100 SXM4 80GB
架构 / 制程 Ampere / TSMC 7N
显存 80GB HBM2e,2.0 TB/s
FP16/BF16 张量 312(稠密)/ 624(稀疏)TFLOPS
TF32 张量 156 / 312 TFLOPS
FP64(非张量 / 张量) 9.7 / 19.5 TFLOPS
INT8 张量 624 / 1248 TOPS
FP8 不支持
NVLink 3 代 600 GB/s
TDP 400 W
特色 MIG 多实例(最多 7)、TF32、2:4 结构化稀疏
定位 training(上一代大模型训练主力,现存量性价比之选)
适合场景 性价比训练/微调、多租户推理(MIG)、存量集群
参考价 约 34.84 元/卡·时 / 8889 元/卡·月(灵算云平台采集价格,2026-07-22)
中国特供版 A800(NVLink 600→400 GB/s)

系列导航:上一篇 读懂 H200(显存升级版)|对照阅读 读懂 H100(FP8 代际标杆,本文的主要对比基准)。

Logo

AtomGit AI 社区提供模型库、数据集、Agent、Token等资源

更多推荐