Publikation von Christoph Puppe
Technisch-ökonomische Analyse: DeepSeek v3.2 (671B) Inference in Deutschland
Machbarkeits- und Kostenrechnung für den Selbstbetrieb eines offenen 671-Milliarden-Parameter-Modells in 8-Bit-Präzision. Die physikalische Grenze zuerst: real 750 bis 800 GByte VRAM mit KV-Cache, ein Standard-Knoten mit acht 80-GByte-Karten scheidet aus. Zwei Architekturen bleiben: ein empfohlenes H200-HGX-System für 350.000 bis 420.000 Euro oder zwei gekoppelte A100-Knoten für 240.000 bis 280.000 Euro, erkauft mit Komplexität. Betriebskosten: 1000 bis 1600 Euro Energie plus 800 bis 1500 Euro Colocation im Monat. Der Hebel ist die MoE-Architektur: Nur rund 37 Milliarden Parameter rechnen pro Token mit, der Speicherbedarf bleibt total. Eine Entscheidungsvorlage für jeden, der Souveränität als Investitionsrechnung behandelt.