Zum Inhalt springen
Philippos MelikidisRegion Stuttgart, Oktober 2026

2025 · Open Source

prompt-contracts

Vertragstests für LLM-Prompts, damit ein Modell-Update eine Integration nicht still kaputt macht.

Das Problem

Wenn ein Anbieter ein Modell aktualisiert, einen Standardwert ändert oder man auf ein lokales Modell wechselt, können Prompts, die gestern funktioniert haben, heute etwas leicht anderes liefern. Nichts schlägt laut fehl, die Integration wird einfach schlechter.

Was ich gebaut habe

Eine Spezifikation mit Werkzeug, um Verträge für Prompt-Ausgaben zu schreiben, zu Struktur, Stabilität und Konsistenz, und sie wie Tests auszuführen. Vergleiche kommen mit sauberer Statistik, Wilson- und Jeffreys-Intervallen und McNemar-Tests, damit ein Unterschied nur dann einer ist, wenn er einer ist.

Was dabei herauskam

Veröffentlicht auf PyPI. Daraus ist geworden, wie ich LLM-Systeme grundsätzlich bewerte, auch in der Masterarbeit.

Gebaut mit

Python, veröffentlicht auf PyPI

Quellcode auf GitHub

← Alle Arbeiten