Publikation von Christoph Puppe
The Five Levers That Actually Decide Your LLM Bill
Feldführer durch die Token-Ökonomie von OpenAI, Gemini und Claude, mit der These, dass die meisten Teams ihre KI-Ausgaben auf der falschen Ebene verhandeln: Sie streiten über das Flaggschiffmodell und betreiben es so, dass derselbe Workload das Zehnfache kostet. Fünf Hebel, nach Rendite pro Aufwand sortiert. Caching bringt bis zu 90 Prozent auf wiederverwendete Eingaben, aber die Mechanik ist pro Anbieter verschieden: Claude berechnet Cache-Writes mit Aufschlag, OpenAI bestraft schlampige Prompt-Reihenfolge mit stillem Cache-Miss, Gemini verlangt Speichergebühren pro Stunde. Batch-Verarbeitung liefert flache 50 Prozent, Routing über eine Triage-Stufe spart 60 bis 80 Prozent, dazu Output-Deckelung. Das Fazit: Tokenkosten sind kein Modellauswahl-, sondern ein Betriebsproblem.