Top-down
De EngineArgs → LLMEngine → EngineCore → Scheduler → Executor → Worker/ModelRunner → chargement du modèle → KV Cache → Attention → sampling → distribué, on descend couche par couche.
Un site d'apprentissage en français, qui dissèque couche par couche la conception globale de vllm-project/vllm, ce moteur d'inférence LLM à haut débit ; chaque étape pointe en direct vers les lignes correspondantes sur GitHub, version figée à v0.25.1.