自顶向下从 EngineArgs → LLMEngine → EngineCore → Scheduler → Executor → Worker/ModelRunner → 模型加载 → KV Cache → Attention → 采样 → 分布式,一层层往下展开。
v1 架构与 PagedAttentionv0.25 已切到 v1 架构:EngineCore 走 ZMQ 后台进程,Scheduler 做连续批处理与抢占,KVCacheCoordinator + BlockPool 实现 PagedAttention 与 prefix caching。