Why Is My vLLM Inference Slow? A Bandwidth-Wall Analysis
Eine optimierte vLLM-Baseline erreicht 88,7 % der Speicherbandbreite. Wenn Sie dort angekommen sind, bleibt nur noch 1,13× – und der Weg dorthin führt über kleinere Gewichte, nicht über Scheduler-Tuning.
Warum ist meine vLLM-Inferenz langsam · 8 Min.
FP8 Quantization for LLM Inference: The Real Accuracy Cost
Jeder sagt, FP8 sei „praktisch verlustfrei“. Unsere token-genaue Gegenüberstellung zeigt: 5 von 6 Prompts weichen ab, durchschnittliche Präfix-Übereinstimmung 55,5 %.
FP8-Quantisierung Genauigkeit · 11 Min.
KV-Cache Quantization Doesn’t Always Help (Measured)
Derselbe Schalter zerstörte ein Modell und ließ ein anderes unberührt. Warum die offizielle Validierung Ihren Grafikprozessor wahrscheinlich nicht abdeckt – und wie Sie das in 20 Minuten selbst prüfen.
KV-Cache-Quantisierung · 9 Min.