
Warum der GPU-Speicher voll ist, bevor er es sein müsste
Eine kurze Antwort kann viel GPU-Speicher blockieren. Paged Attention teilt den KV-Cache in Blöcke auf, die eine Anfrage erst bei Bedarf erhält.

Eine kurze Antwort kann viel GPU-Speicher blockieren. Paged Attention teilt den KV-Cache in Blöcke auf, die eine Anfrage erst bei Bedarf erhält.

Weniger Bits sparen Platz für Modellgewichte. Ob die Antworten noch gut genug sind und das Modell schneller läuft, zeigt erst der Vergleich auf den eigenen Aufgaben.

Acht Anfragen starten gleichzeitig auf demselben Server. Die kürzeste ist nach drei Tokens fertig. Trotzdem kommt ihre Antwort erst an, wenn die längste der acht ihr letztes Wort geschrieben hat.

Eine Extraktion liest zuverlässig Werte aus Verträgen, bis ein Feld einmal fehlt. Dieselbe Anfrage liefert trotzdem eine Zahl, sauber formatiert, nur erfunden. Warum ein Sprachmodell keine Datenbank ist und was das für die Prüfung bedeutet.

Zweimal dieselbe Frage an dasselbe Modell, zweimal eine andere Antwort. Kein Fehler: Das Modell zieht bei jedem Wort aus einer Wahrscheinlichkeitsverteilung. Was Temperature, Top-p und Top-k dabei tatsächlich einstellen.

Bei der einen Anfrage kommt die Antwort sofort und tröpfelt dann langsam. Bei der anderen dauert das erste Wort, danach läuft der Rest zügig durch. Der Grund: zwei Phasen mit unterschiedlichen Grenzen.