美团二面被问:几万人并发提问,AI为何能“秒回”?我说:GPU多呗。他笑了:卡多虽好,但关键还是背后的系统设计啊…
你有没有想过,当你和朋友同时打开ChatGPT或者豆包提问,几乎在同一秒得到回复,而全球可能有几十万人正在和它对话——这背后到底发生了什么?
答案不是"AI很聪明所以算得快"这么简单。这是一场统计学、硬件工程、分布式系统共同导演的精密协作。今天我们就把这层"魔法"拆开,看看里面到底是什么。
✦ ✦ ✦
一、先纠正一个误解:不是真的"同时"处理几万个请求
用户感知的"秒回",其实包含两层体验:
- ◆首字延迟(TTFT, Time To First Token):第一个字出现要多久,这是被优化到极致的核心指标,通常在几十到几百毫秒。
- ◆流式输出:后面的内容是逐字吐出来的,不是生成完整段落后一次性甩给你。所以"秒回"很大程度上是一种视觉错觉——你看到的是"第一个字秒回",而不是"整段话瞬间生成完"。
理解了这一点,后面的推导才有意义。

✦ ✦ ✦
二、Roofline模型:AI推理慢,到底慢在哪?
这是理解一切优化手段的起点。
定义算术强度(Arithmetic Intensity, AI):
算术强度 = 计算量(FLOPs) ÷ 访存量(Bytes)
GPU有两个硬件上限:峰值算力,峰值带宽。理论可达吞吐量取两者中较小的那个:
可达吞吐量 = min(峰值算力, 算术强度 × 峰值带宽)
当算术强度低于"算力/带宽"这个临界值时,系统处于访存瓶颈区——GPU的计算单元大部分时间在空转,真正卡住速度的是"从显存里把参数搬进计算单元"这个动作。
具体算一下LLM生成阶段(decode)的情况:每生成一个token,每个参数只参与一次乘加运算,但必须从显存搬运一次。
- ◆计算量:每参数约2 FLOPs(一乘一加)
- ◆访存量(FP16):每参数2 Bytes
算术强度(decode) = 2 FLOPs ÷ 2 Bytes = 1 FLOP/Byte
以英伟达H100为例:
- ◆峰值算力 ≈ 989 TFLOPS(FP16)
- ◆峰值带宽 ≈ 3.35 TB/s
临界算术强度:
临界值 = 989万亿 ÷ 3.35万亿 ≈ 295 FLOP/Byte
而decode阶段的算术强度只有1,远低于295。结论很扎心:单条请求解码时,GPU 99%以上的算力单元在空转,瓶颈根本不在"算得快不快",而在"数据搬得快不快"。
这解释了一个反直觉的现象:为什么单条请求快不起来,但塞更多请求进去,延迟却几乎不涨——因为反正大部分算力本来就闲着。

✦ ✦ ✦
三、Batching:把"闲置算力"喂饱的关键一招
既然瓶颈是"搬数据",那就让GPU顺便多干点活。Batching(批处理) 的思路是:把多个用户的请求打包成一个大矩阵一起算,参数只搬一次,但同时服务B个请求。
算术强度(batch) = 2 × B FLOPs ÷ 2 Bytes = B FLOP/Byte
也就是说,算术强度与batch size成正比。当batch size达到临界值(前面算出的295左右)时,系统就从"访存瓶颈"翻转成"算力瓶颈",GPU利用率逼近满载。
由此可以画出吞吐量随batch size变化的曲线:先线性增长,后趋于饱和。这条曲线,正是vLLM、TensorRT-LLM等推理框架调度batch size的理论依据。
现在业界主流用的是Continuous Batching(连续批处理):不需要等一批请求凑齐才处理,谁先到就先插进去算,谁先生成完就先出去,GPU利用率被压榨到接近极限。
**案例:PagedAttention(vLLM)**vLLM团队发现,传统KV Cache管理会为每个请求预先分配一大块连续显存,导致大量碎片,实测显存利用率经常只有20%-40%。他们借鉴操作系统"虚拟内存分页"的思路,把KV Cache切成固定大小的block,按需分配、非连续存储,用一张"页表"管理映射。结果显存浪费从60%-80%降到不到4%,一张卡能塞下的并发请求数从十几个提升到上百个,吞吐量提升2-4倍。


✦ ✦ ✦
四、Little’s Law:几万人是怎么被"稀释"掉的
把整个推理系统看成一个排队系统,排队论中的Little’s Law给出:
系统内平均并发请求数 = 请求到达速率 × 单请求平均停留时间
假设全球某一时刻有5万用户提问,但请求不是脉冲式同时砸过来,而是分散在一个时间窗口内。设平均到达速率为每秒1000个请求,单请求平均处理时间2秒,那么:
系统内真实并发数 = 1000 × 2 = 2000
也就是说,任意时刻系统里真正"在处理"的请求只有2000个,不是5万个同时压满。这2000个请求会被负载均衡器分发到全球上百个集群,每个集群再靠batching吸收:
单集群并发数 = 系统内并发数 ÷ 集群数
如果有100个集群,单集群只需承担20个并发——这正好落在Roofline曲线里"batching能吃满算力"的合理区间,GPU利用率高,延迟自然低。

✦ ✦ ✦
五、并行切分:大模型是怎么被"拆开"塞进显卡的
一个几百B参数的模型,单张显卡根本装不下,必须跨卡切分。这里用弱扩展效率衡量并行的划算程度:
并行效率 = 单卡理论耗时 ÷ (卡数 × 实际并行耗时)
以Tensor Parallelism(张量并行)为例,每层的矩阵乘法被切成多份并行算,但会引入额外的通信开销(卡与卡之间要同步中间结果)。总耗时可以理解为:
并行耗时 ≈ 计算耗时 ÷ 卡数 + 通信耗时(随卡数增加而增加)
这说明并行度不是越高越好,存在一个通信开销与计算收益的平衡点。工程上,这也是为什么大模型部署要混合使用:
- ◆Tensor Parallel(卡内高速互联,通信开销小,适合层内切分)
- ◆Pipeline Parallel(跨节点,通信开销大但可以和计算重叠,适合跨层切分)
案例:GQA分组查询注意力标准Multi-Head Attention每个注意力头都有独立的Key/Value,头数一多,KV Cache本身就占用巨量显存和带宽。GQA让多个Query头共享同一组Key/Value(比如8个Query头共享1组KV),直接压低了每token的实际访存量。LLaMA 2/3、Mistral都采用了这个设计,实测推理速度提升30%以上,还能支撑更大的batch size。
案例:FlashAttention标准Attention要先算出完整的N×N注意力矩阵并写回显存,再读出来做后续计算,长序列下这个矩阵巨大,访存开销远超计算开销。FlashAttention把矩阵分块,在GPU的高速片上内存里完成计算,避免把中间大矩阵写回显存——计算量基本不变,但访存量大幅下降。这正是Roofline模型里"通过降低访存量提升有效算术强度"的直接工程实现,长序列下能带来2-4倍加速,而且是精确计算,没有近似误差。
**案例:投机解码(Speculative Decoding)**一个反直觉但很巧妙的技巧:用一个小而快的"草稿模型"先连续生成几个候选token,再让大模型一次性并行验证这几个token是否合理。因为"验证"是一次前向传播就能搞定的(算术强度高,接近算力瓶颈区),比逐个token生成(访存瓶颈区)划算得多。命中率高时,能带来2-3倍解码加速,且理论上保证输出分布和直接用大模型生成完全一致。
案例:MoE混合专家模型DeepSeek-V3、Mixtral这类模型虽然总参数量高达几千亿,但每次推理只激活其中一小部分"专家"(比如总共256个专家,每次只用8个)。这意味着实际参与计算和访存的参数量,远小于总参数量,大幅降低了单token延迟,同时保留了大模型的整体表达能力。
✦ ✦ ✦
六、把所有环节串起来:一次提问的完整旅程
用户感知的首字延迟,可以拆解为三段:
首字延迟 = 排队等待时间 + 首次前向计算时间 + 批处理调度时间
- ◆排队等待时间:由Little’s Law决定,靠负载均衡和多集群分摊压低
- ◆首次前向计算:处理你输入的那段文字,这一步天然是算力瓶颈(因为所有输入token一起算,算术强度天然很高),靠堆算力和FlashAttention之类的算子优化
- ◆批处理调度时间:请求进入batch队列的等待,靠Continuous Batching压到毫秒级
而后续逐字输出的速度,则完全由第二节的访存瓶颈公式决定——GQA、KV Cache优化、MoE稀疏激活,本质上都是在压低"每生成一个字需要搬运的数据量"这件事。
✦ ✦ ✦
一句话总结
单条请求推理天然卡在"搬数据"上;通过batching把多个用户的请求打包,让GPU顺便吃满算力;几万个"同时"到达的请求,经过负载均衡分摊到全球集群后,真实并发远比想象中温和;单张卡装不下的大模型,通过合理的并行切分,在计算和通信开销之间找到最优点。
四层机制协同工作,把"几万人同时提问"这个听起来很吓人的并发问题,压缩成了每块GPU上一个可预测、可调度的普通batch任务。这就是秒回背后,不那么"魔法"但更有意思的真相。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

更多推荐



所有评论(0)