Publikation von Christoph Puppe

funstuff: One-Page-Werkzeuge und LLM-Benchmarks

2026 · GitHub · HTML/JS · englisch · Christoph Puppe

Eine Sammlung eigenständiger HTML-Dateien, jede ein komplettes Werkzeug ohne Server und ohne Build-Prozess: Datei öffnen, benutzen. Den Kern bilden drei selbst entworfene LLM-Benchmarks. whoami-bench prüft mit steigendem Framing-Druck und blinder Judge-Bewertung, was Modelle über die eigene Identität wissen; der Essay „whoami for LLMs“ wertet 1024 Antworten aus 74 Endpunkten aus. nihilartikel-bench testet die Erkennung erfundener Lexikonartikel, an der Halluzinationsneigung messbar wird. phylo-bench lässt Modelle phylogenetische Verwandtschaften einordnen. Dazu Alltagswerkzeuge aus der Beratungspraxis, vom OSCAL-Schema-Validator bis zur Schach-Arena für zwei KI-Modelle samt Protokoll ihrer Regelverstöße. Der rote Faden: Behauptungen über KI-Fähigkeiten werden messbar gemacht, mit offengelegter Methode, statt geglaubt.

← Alle Publikationen von Christoph Puppe