Wo im Code steckt der Fehler?
Ein Benchmark mit 918 echten GitHub-Issues, der misst, wie gut verschiedene Suchverfahren die Datei finden, die repariert werden muss.
Das Problem
Bevor jemand ein Issue beheben kann, Mensch oder KI-Werkzeug, muss er die richtige Stelle im Code finden. Viele Verfahren versprechen das. Fair auf echten Daten verglichen werden die wenigsten.
Was ich gebaut habe
Ein Hochschul-Teamprojekt mit zwei Engineers und einer Forschungsgruppe. Mein Teil waren die Ground-Truth-Pipeline und ihre Validierung, das Framework zum Vergleich der Anfragemodi, die Statistik, die Auswertung von Code vor und nach ChatGPT und das Tooling, mit dem ein lokales LLM Suchanfragen erweitert.
Was dabei herauskam
Der eigentliche Hebel war, ein LLM wahrscheinliche Funktions- und Dateinamen zur Anfrage hinzufügen zu lassen, nicht die aufwendigere zweistufige Suche, und der Unterschied ist statistisch signifikant. Die Validierung der Ground Truth zeigte außerdem, dass der erste Datensatz nur 149 eindeutige Issues unter 206 Einträgen enthielt, was mehrere Schlüsse verändert hat.
Gebaut mit
Python, Elasticsearch, Embedding-Modelle, ein lokales LLM, Bootstrap-Statistik