Mechanistic Interpretability versucht, ein neuronales Netz so zu verstehen, wie ein Ingenieur einen Schaltkreis versteht: nicht nur „es funktioniert", sondern wie welche Teile welche Berechnung ausführen und wie sie verdrahtet sind. Das Ziel ist, ein trainiertes Netz vom Einzel-Neuron über deutbare Merkmale bis zu ganzen Circuits (Schaltungen) zurückzuverfolgen, die eine bestimmte Aufgabe lösen.
Das Distill-Programm „Circuits" formuliert drei Bausteine, aus denen sich das Verständnis aufbaut.
Ein konkretes Beispiel aus der Bildverarbeitung: Ein „Auto-Detektor" entsteht nicht aus dem Nichts, sondern aus einfacheren Merkmalen früherer Schichten Fenster oben, Räder unten, Karosserie in der Mitte. Der Circuit kombiniert sie mit positiven und negativen Gewichten zu einem höheren Merkmal.
Wegen Superposition sind die Bausteine im Rohzustand verschmiert. Sparse Autoencoders ziehen erst die sauberen Merkmale heraus sie liefern damit die Knoten, aus denen sich Circuits überhaupt sinnvoll zeichnen lassen. Mechanistic Interpretability und SAEs greifen also ineinander.
| Motiv | Nutzen |
|---|---|
| Sicherheit | gefährliche Berechnungen erkennen, bevor sie schaden |
| Vertrauen | nachvollziehen, warum ein Modell etwas tut |
| Fehlersuche | verzerrte oder falsche Circuits gezielt finden |
| Wissenschaft | verstehen, wie Lernen Strukturen hervorbringt |
Der Ansatz ist ehrgeizig: Ein großes Modell hat Milliarden Parameter, und vollständige Schaltpläne existieren bisher nur für kleine Ausschnitte. Aber jeder entschlüsselte Circuit macht das Innere ein Stück weniger zur Blackbox.