06
CHAPTER
5 节 · 按顺序完成
asyncio 基础
GPU 推理是 IO + 计算的混合体 — 异步是榨干 GPU 利用率的钥匙
01
6.1 协程与 async/await
GPU 一边在算,下一波请求就该开始 tokenize 了,同步写法会浪费 GPU 时间
→
02
6.2 asyncio.gather:并发执行多个协程
推理 batching 的本质就是同时跑多个请求
→
03
6.3 asyncio.create_task:把协程扔后台跑
推理服务里"日志上报"、"metrics 推送"都是后台任务
→
04
6.4 asyncio.Queue:推理请求的"传送带"
推理服务的核心架构:producer 收请求塞 queue,consumer 从 queue 取出来调 GPU
→
05
6.5 aiohttp:异步 HTTP 客户端
推理网关 → 模型服务、模型服务 → 远程 tokenizer 服务,都用异步 HTTP
→