Publikation von Christoph Puppe
whoami for LLMs
Ein selbst gebauter Benchmark gegen ein Genre, das auf LinkedIn nicht totzukriegen ist: der Screenshot, auf dem ein Modell „I am ChatGPT“ sagt, als Beweis für Distillation. Der Unix-Anker trägt die These: whoami introspiziert nicht, es liest eine Datei, und Sprachmodelle haben nicht einmal die Datei. whoami-bench fragte 74 Endpunkte mit steigendem Framing-Druck, blind bewertet von einem Judge-Modell: 1024 Antworten für unter zehn Dollar. Identität wird pro Aufruf rekonstruiert, ein Endpunkt lieferte elf Identitäten in fünfzehn Versuchen, und die Fehlbenennungsrate trennt offene Gewichte von kontrollierten Endpunkten schärfer als China vom Westen. Das Fazit: Wer als Beweis einen Chatbot-Screenshot hat, hat keinen Beweis, sondern ein Banner.