自頂向下從 EngineArgs → LLMEngine → EngineCore → Scheduler → Executor → Worker/ModelRunner → 模型載入 → KV Cache → Attention → 採樣 → 分佈式,一層層往下展開。
v1 架構與 PagedAttentionv0.25 已切到 v1 架構:EngineCore 走 ZMQ 後臺行程,Scheduler 做連續批次與搶佔,KVCacheCoordinator + BlockPool 實現 PagedAttention 與 prefix caching。