← Übersicht

Mechanistic Interpretability und Circuits

Mechanistic Interpretability versucht, ein neuronales Netz so zu verstehen, wie ein Ingenieur einen Schaltkreis versteht: nicht nur „es funktioniert", sondern wie welche Teile welche Berechnung ausführen und wie sie verdrahtet sind. Das Ziel ist, ein trainiertes Netz vom Einzel-Neuron über deutbare Merkmale bis zu ganzen Circuits (Schaltungen) zurückzuverfolgen, die eine bestimmte Aufgabe lösen.

Die drei Ebenen

Das Distill-Programm „Circuits" formuliert drei Bausteine, aus denen sich das Verständnis aufbaut.

1. Features deutbare Merkmale (z.B. „Kurve", „Ohr") 2. Circuits verschaltete Merkmale, die etwas berechnen 3. Universalität gleiche Circuits tauchen in vielen Modellen auf
Merkmale sind die Bausteine, Circuits ihre Verschaltung, Universalität die Beobachtung, dass dieselben Schaltungen modellübergreifend wiederkehren.

Ein Circuit als Schaltplan

Ein konkretes Beispiel aus der Bildverarbeitung: Ein „Auto-Detektor" entsteht nicht aus dem Nichts, sondern aus einfacheren Merkmalen früherer Schichten Fenster oben, Räder unten, Karosserie in der Mitte. Der Circuit kombiniert sie mit positiven und negativen Gewichten zu einem höheren Merkmal.

Fenster (oben) Karosserie (Mitte) Räder (unten) Auto- Detektor + wenn oben + wenn Mitte + wenn unten feuert, wenn die Teile richtig angeordnet sind
Ein Circuit als Schaltplan: Der Auto-Detektor kombiniert untergeordnete Merkmale mit Gewichten, die auch deren erwartete Lage kodieren (Fenster oben, Räder unten).

Aufgelöste Merkmale dank Sparse Autoencoders

Wegen Superposition sind die Bausteine im Rohzustand verschmiert. Sparse Autoencoders ziehen erst die sauberen Merkmale heraus sie liefern damit die Knoten, aus denen sich Circuits überhaupt sinnvoll zeichnen lassen. Mechanistic Interpretability und SAEs greifen also ineinander.

Warum man das will

MotivNutzen
Sicherheitgefährliche Berechnungen erkennen, bevor sie schaden
Vertrauennachvollziehen, warum ein Modell etwas tut
Fehlersucheverzerrte oder falsche Circuits gezielt finden
Wissenschaftverstehen, wie Lernen Strukturen hervorbringt

Der Ansatz ist ehrgeizig: Ein großes Modell hat Milliarden Parameter, und vollständige Schaltpläne existieren bisher nur für kleine Ausschnitte. Aber jeder entschlüsselte Circuit macht das Innere ein Stück weniger zur Blackbox.

Quellen

Verwandte Themen