De arriba abajo
Desde EngineArgs → LLMEngine → EngineCore → Scheduler → Executor → Worker/ModelRunner → carga del modelo → KV Cache → Attention → sampling → distribuido,una capa detrás de otra.
Un sitio de estudio en español que descompone capa por capa el diseño global de vllm-project/vllm,un motor de inferencia LLM de alto throughput;cada paso enlaza directamente a las líneas correspondientes del código en GitHub;versión fijada en v0.25.1.