Vorlesungsskript · Universität Potsdam · Reihe „KI in der juristischen Praxis“ (Teil 2/4)
Vorlesungsskript zur Vorlesung vom 26. Juni 2026 · Stand: Juli 2026
Sven Hallwirth · LinkedIn-Profil
Dieses Skript ist aus der Vorlesung vom 26. Juni 2026 an der Universität Potsdam entstanden — Teil 2 der Reihe „KI in der juristischen Praxis“. Es ist kein Foliensatz mit Anmerkungen, sondern ein durchgeschriebener Lehrtext: Der gesprochene Vortrag ist eingearbeitet, die Live-Übungen sind so umgebaut, dass Ihr sie allein am eigenen Rechner durchführen könnt, und alle Behauptungen sind mit Fundstellen versehen. Zur Einordnung in die Vorlesungsreihe siehe das Nachwort.
Drei Lesewege. Ihr könnt dieses Skript unterschiedlich tief lesen:
Alle externen Links (mit ↗ markiert) öffnen in einem neuen Fenster und wurden zuletzt am 6. Juli 2026 geprüft. Eine PDF-Fassung erzeugt Ihr über den Knopf „Als PDF speichern“ oben rechts (im Druckdialog „Als PDF sichern“ wählen) — Rechtehinweis und Autorschaft laufen dabei in der Fußzeile jeder Seite mit.
Die fünf Kastentypen haben feste Funktionen:
| Kasten | Funktion |
|---|---|
| Zwischenbilanz | Der rote Faden des Skripts — die dreimal gestellte Frage „Ist ein LLM (ein großes Sprachmodell) ein Werkzeug?“ und ihre schrittweise Beantwortung. |
| Handwerk | Die drei etablierten Handwerke (Werkzeug bauen · Methoden machen · Kompetenz entwickeln), jeweils mit ihren internationalen Normen und Belegen. |
| Übung | Selbstversuche mit Anleitung und Prompt-Vorlage; Lösungen und typische Verläufe im Anhang. |
| Exkurs | Vertiefung — für das Verständnis der Folgekapitel nicht erforderlich, ausdrücklich überspringbar. |
| Aus der Vorlesung | Momente aus dem Vortragssaal (Abstimmungen, Live-Demonstration) — Atmosphäre, kein Pflichtstoff. |
Daneben markiert ein gestrichelt gerahmter These-Kasten Zuspitzungen, die als Deutung des Verfassers gekennzeichnet sind — bewusst unterscheidbar von belegten Aussagen.
Zwei Hinweise zu den Übungen mit KI: Die Ergebnisse variieren je nach Modell und Datum — genau das ist Teil der Lektion. Und: Gebt in öffentliche KI-Systeme niemals echte Mandats- oder personenbezogene Daten ein (warum, erklärt Kapitel 3).
Eine Navigations-App, eine Doppelfrage und vier Leitfragen: Die Einleitung verspricht nur — eingelöst wird in den drei Teilen.
Beginnen wir mit etwas, das jeder von Euch heute schon benutzt hat: Google Maps. Man gibt ein Ziel ein, folgt der blauen Linie — und vertraut dabei einer Karte, die man nie selbst geprüft hat. Maps navigiert nur deshalb zuverlässig, weil dahinter aufbereitete Karten-Daten liegen: vermessene Straßen, Hausnummern, Verkehrsregeln, Sperrungen. Daneben denke man sich eine bewusst leere Fläche — und stelle die Doppelfrage, die dieses ganze Skript trägt: Erstens — was ist die Karte des Rechts? Und zweitens — wann darf man blind fahren, und wer haftet dann? Die erste Frage beantworten Teil I und Teil II; die zweite hebt sich Teil III auf.
Aus der Doppelfrage werden vier Leitfragen — sie sind zugleich die Gliederungsachse dieses Skripts. Für das Recht bleiben die Antworten hier bewusst offen; die Google-Maps-Spalte steht als Anschauung daneben:
| Leitfrage | Recht | Google Maps | Antwort in |
|---|---|---|---|
| 1 · Welche Daten? (Input) | Normen, Urteile & die Strukturen dahinter — offen | vermessene Straßen, Hausnummern, Verkehrsregeln, Echtzeit-Verkehr | Teil I |
| 2 · Wie herankommen? (Zugang) | über Quellen und Textsorten — offen | Satellit, Street View, lizenzierte Kartendaten, GPS-Schwarm, Nutzer-Meldungen | Teil I |
| 3 · Wie verarbeiten? (Methode) | (juristische) Methodik — offen | Routing-Algorithmus auf dem Straßennetz | Teil II |
| 4 · Prüfbar? (Qualität) | Nachvollziehbarkeit & Herkunftsnachweis — offen | ständiger Abgleich (Satellit/Street View) + Korrekturschleife | Teil III |
Dazu ein Begriffsanker, der den ganzen Text trägt: Methode heißt hier eine bewusste, prüfbare Operation, die Unsicherheit reduziert — nicht „irgendein Vorgehen“, sondern eines, das man benennen, wiederholen und kontrollieren kann. Die Wörterbuch-Definition und ihre Konsequenzen für die KI folgen in Kapitel 2.
Und schließlich die Zielmarke, die bis zum Schluss stehen bleibt: Was braucht Ihr für die Zukunft? Die Antwort dieses Skripts heißt Kompetenzen — konkret: Was müsst Ihr am Ende können? Die Einleitung verspricht das nur. Eingelöst wird es in drei Teilen: Teil I stellt die Diagnose (Was ist dieses Werkzeug — und was fehlt ihm?), Teil II zeigt die Konstruktion (Wie liefert man das Fehlende?), Teil III klärt die Verantwortung (Wer steht für das Werk gerade?).
Was ist es? · Leitfragen 1 und 2: Daten und Zugang
Teil I — Diagnose: ein Werkzeug ohne Karte
Eine Sehschule am eigenen Fach: Was Ihr lest, wenn Ihr Recht lest — Daten, Trias, Ausbildungsgeschichte und die klassischen Methoden. Das Kapitel endet mit einer Tabelle, in der genau eine Zelle leer bleibt.
Wir steigen mit einer Norm ein, die alle kennen:
Was lest Ihr hier eigentlich? Im Hörsaal kamen — wie immer — drei Antworten, und alle drei sind richtig. Inhaltlich: Wucher — die Ausbeutung einer Schwächelage bei auffälligem Missverhältnis, Rechtsfolge Nichtigkeit. Dogmatisch: ein benannter Spezialfall der Sittenwidrigkeit aus Absatz 1 — das „insbesondere“. Strukturell: eine vorangestellte Rechtsfolge, ein Tatbestand mit kumulativen und alternativen Merkmalen, eine wertungsoffene Klausel, eine Verweisungsbeziehung.
Diese dritte, strukturelle Lesart ist die Zielschicht dieses Skripts. Genau sie liest der Experte unbewusst mit — und genau sie kehrt in Kapitel 5 eingefärbt zurück. Die These, die sich daraus entwickeln wird: Der Unterschied zwischen Anfänger und Experte ist keine Frage des Wissens, sondern der Repräsentation — der Struktur, die der Leser auf den Text projiziert.
Dieselbe Sehschule lässt sich an allen Textsorten der Praxis wiederholen — das ist die operative Antwort auf Leitfrage 1 (Welche Daten?). Das Gesetz haben wir gesehen: Tatbestand führt zu Rechtsfolge, mit Verweisungen. Die Gerichtsentscheidung hat ihre eigene Bauform: Tenor, Tatbestand, Entscheidungsgründe. Der wissenschaftliche Aufsatz: These, Beleg, Gegenansicht. Das Muster dahinter: Jede Textsorte hat eine Struktur — wer sie kennt, liest gezielt statt linear. Und die Pointe, die wir bald brauchen werden: Diese Struktur steckt nicht in den Daten. Sie steckt im geschulten Leser. Der Zugang zu diesen Daten (Leitfrage 2) läuft heute über amtliche freie Quellen — gesetze-im-internet.de, „Rechtsprechung im Internet“, EUR-Lex — und kommerzielle Datenbanken wie juris und beck-online; auch er setzt Textsorten-Wissen voraus, denn man findet nur, was man einzuordnen weiß.
Für den ganzen Text hilft eine Orientierungsbrille aus drei Fragen — die Trias:
| Werkzeuge → | Methoden → | Kompetenzen |
|---|---|---|
| „Womit arbeitet der Jurist?“ | „Wie arbeitet er damit?“ | „Was muss er können?“ |
| Gesetz, Kommentar, Datenbank, Schriftsatz … | Auslegung, Subsumtion, Recherche … | lesen, werten, prüfen … |
Werkzeug und Methode entwickeln sich dabei nicht getrennt, sondern gemeinsam — ein Allzweck-Werkzeug wird erst durch eine domänenspezifische Methodenschicht zum Fachwerkzeug. Merkt Euch für alles Folgende die Frage: Wessen Zweck steckt im Werkzeug? In Kapitel 2 wird das Sprachmodell gegen genau diese drei Begriffe geprüft; Kapitel 3 stellt dieselbe Frage ökonomisch.
Ein kurzer Blick zurück, auf zwei parallelen Zeitachsen. Die erste zeigt die Werkzeuge: vom Corpus Iuris über die Glossatoren, Savignys System, die Begriffsanalyse Hohfelds und die Wertungsjurisprudenz des 20. Jahrhunderts zu den juristischen Datenbanken um 2000, Legal Tech ab etwa 2013 — und nun den großen Sprachmodellen. Das Muster: Jede Werkzeug-Welle nahm dem Juristen Routinen ab und ließ ihm das Urteil. Diese jüngste Welle — die der großen Sprachmodelle (LLMs) — ist die erste, die die Kerntätigkeit selbst trifft: das Textverstehen.
Die zweite Zeitachse stellt die andere Frage — nicht womit der Jurist arbeitet, sondern wie er ausgebildet wurde: wie gelehrt wurde (Methode), womit (Material) und — entscheidend — woran geübt wurde. Von der Exegese am Corpus Iuris über die Systemvorlesung des 19. Jahrhunderts und die Fall- und Gutachtenschulung des 20. bis zum Klausurdrill der Repetitorien-Ära. Und hier liegt eine Pointe, die man aussprechen muss: „Woran geübt wurde“ ist nichts anderes als die Trainingsdaten des Juristen. So wie ein Sprachmodell an Daten trainiert wird, wurde der Jurist immer an kuratierten, strukturierten Beispielen geschult — an Fällen, am System. Die offene Frage der KI-Ära ist deshalb dieselbe wie beim Modell: An welcher Struktur trainieren wir die nächste Generation — und wer kuratiert sie? Dorthin läuft dieses Skript; die Antwort sammelt Kapitel 8 ein.
Der Ausschuss der Justizministerkonferenz zur Koordinierung der Juristenausbildung hat im Frühjahr 2026 seinen Bericht „Zukunft der volljuristischen Ausbildung“ vorgelegt. Verfolgt man diese Berichte über 25 Jahre, wandert der Fokus: von Struktur und Stoff (Bologna abgelehnt; Pflichtstoff-Entschlackung 2016) über Kompetenzen (die Reform 2003 brachte die Schlüsselqualifikationen in § 5a DRiG) bis zur Digitalisierung. Zwei Dinge bleiben konstant: das Gesamtfazit „kein grundlegender Reformbedarf“ — und die immer wieder aufgeschobene KI-Frage (2016 nicht erwähnt, 2024 ein Kapitel, 2026 auf einen gesonderten Bericht vertagt). Bemerkenswert ist, was das Gremium gleichwohl festhält: Die Fähigkeit, „rechtliche Informationen kritisch zu bewerten und methodisch einzuordnen“, werde durch automatisierte Recherchewerkzeuge „noch wichtiger“ (Bericht 2026, S. 58/61). Das Gremium stellt die Frage — und lässt sie offen. Einordnung: Der Ausschuss ist ein Verwaltungsgremium, kein wissenschaftlicher Beirat; der Bericht ist ein amtlicher, kein wissenschaftlicher Anker. Diese Lücke nimmt Kapitel 8 wieder auf.
Der Auslegungskanon ist das Handwerkszeug, mit dem Juristen Normtexte lesen. Savigny formulierte vier Elemente: „So müssen wir in ihr [der Auslegung] Vier Elemente unterscheiden: ein grammatisches, logisches, historisches und systematisches“ (System des heutigen Römischen Rechts, Bd. I, 1840, S. 213 ff.). Die heutige Fassung nennt vier leicht andere: grammatisch, systematisch, historisch, teleologisch — dazu die verfassungs- und unionsrechtskonforme Auslegung. Oft falsch erinnert: Das teleologische Element fehlte bei Savigny; es kam erst über Jhering („Der Zweck im Recht“), Hecks Interessenjurisprudenz und die Wertungsjurisprudenz in den Kanon. Ein Rangverhältnis gibt es nicht — nach der Formel des Bundesverfassungsgerichts hat unter den Auslegungsmethoden „keine einen unbedingten Vorrang vor einer anderen“ (BVerfGE 105, 135 [157]); sinnvoll beginnt man gleichwohl beim Wortsinn. Dazu tritt das Prüfprogramm der Fallbearbeitung: Subsumtion im Gutachtenstil — Obersatz, Definition, Subsumtion, Ergebnis.
Jenseits der Auslegung, deren Grenze der Wortlaut ist — im Strafrecht zulasten des Beschuldigten absolut (Analogieverbot, Art. 103 Abs. 2 GG; die begünstigende Analogie ist nicht gesperrt) —, beginnt die Rechtsfortbildung: die Analogie (planwidrige Regelungslücke plus Vergleichbarkeit), die teleologische Reduktion (ein zu weit geratener Wortlaut wird eingeschränkt — die „verdeckte Gesetzeslücke“), der Erst-recht-Schluss und der Umkehrschluss. Entscheidend gegen ein verbreitetes Vorurteil: Das ist kein „anything goes“. Möllers ordnet die Argumentationsfiguren einer abstrakten Gewichtung in vier Regeltypen zu — Vorrang-, Vermutungs-, Abwägungs- und Argumentationslastregeln (Juristische Methodenlehre, 6. Aufl. 2025, § 14 Rn. 126 f.). Und Friedrich Müllers Einsicht rahmt das Ganze: Der Normtext ist nicht die Norm — die Norm wird aus dem Text erst konstruiert.
Der gemeinsame Nenner all dessen: Lese-Anleitungen für Menschen. Canones, Gutachtenstil, Gewichtungsregeln — implizit gelernt, in Jahren der Ausbildung, und nirgendwo „in den Daten codiert“. Genau diese Schicht wird uns beim Sprachmodell wieder begegnen — als das, was ihm fehlt.
Jetzt lässt sich die Gegenüberstellung aus der Einleitung präzise füllen — fast:
| Schicht | Google Maps | Recht — die Entsprechung |
|---|---|---|
| Datengrundlage = Input | Satellit · Street View · GPS-Schwarm · Nutzer-Meldungen | Gesetze · Entscheidungen · Kommentare · Verträge |
| Aufbereitung (Struktur) | Straßengraph · Hausnummern · Verkehrsregeln | ? |
| Kompetenzen | Geodäsie · Kartografie | Methodenlehre — aber implizit, im Kopf |
| Nutzung | Routing-Algorithmus (Echtzeit) | Subsumtion · Auslegung — und KI? Auf welcher Karte? |
Genau eine Zelle bleibt leer: die Aufbereitung im Recht. Google baut aus Rohdaten einen Straßengraphen; im Recht steckt die entsprechende Struktur nicht in den Daten, sondern im Kopf des Juristen — das war der Befund der Abschnitte 1.1 bis 1.5. Auf dieser offenen Zelle endet die Bestandsaufnahme: Was ist das eigentliche Werkzeug — und was fehlt dem Sprachmodell, das wir als Nächstes betrachten? Gefüllt wird die Zelle in Kapitel 5.
Ein gutes Bild zeigt seine Grenzen — und beim Maps-Vergleich sind es genau zwei Bruchstellen, die beide zum Programm dieses Skripts werden. Bruchstelle 1 — „viele Wege nach Rom“: Selbst Maps kennt mehrere Routen (schnellste, kürzeste, ohne Maut). Im Recht trennt die Wege aber nicht die Minute, sondern die bessere Begründung — mehrere Antworten können vertretbar sein, beliebig sind sie nicht: manche Wege sind falsch, einer ist der bestbegründete. Was das für die Messbarkeit juristischer KI bedeutet, zeigt Kapitel 7. Bruchstelle 2 — Vermessung ist nicht Wertung: Maps vermisst Fakten; Sollenssätze sind keinem Wahrheitsbeweis zugänglich (Sein/Sollen), und eine Straßenkarte kennt keine Markierung „hier musst du urteilen“. Und doch: Die Bauform einer Norm lässt sich konsensfähig beschreiben — manches faktisch (was vorliegen muss), manches als markierte Wertungsstelle (wo zu werten ist). Beschreiben ist nicht Bewerten. Wie eine Karte aussieht, die eine Wertungsstelle markieren kann, ohne sie auszufüllen — das löst Kapitel 5 auf.
Teil I — Diagnose: ein Werkzeug ohne Karte
Was ein Sprachmodell wirklich ist — und was dabei herauskommt, wenn man es mit der Juristen-Methode subsumiert: Definition als Tatbestand, dann prüfen. Drei Brillen, sechs Einsatzformen, eine Frage, die offen bleibt.
Ist ein LLM ein Werkzeug für Juristen — ja oder nein? Im Hörsaal wurde diese Frage per Handzeichen abgestimmt, bevor irgendetwas erklärt war — ohne Diskussion, nur als Bild des Saals. Haltet auch Ihr Eure spontane Antwort fest, bevor Ihr weiterlest. Dieselbe Frage kehrt am Ende dieses Kapitels wieder — und wird erst am Ende von Kapitel 6 aufgelöst.
Die Entmystifikation passt in einen Satz: Ein LLM (Large Language Model, großes Sprachmodell — die Technik hinter ChatGPT, Claude, Gemini) ist ein Wahrscheinlichkeitsmodell über Wortbausteine. Es zerlegt Sprache in Tokens (Wortbausteine — die kleinste Verarbeitungseinheit; ein Absatz wie § 138 Abs. 2 BGB zerfällt, je nach Modell, in größenordnungsmäßig 80 solcher Bausteine) und sagt zu jeder Eingabe — dem Prompt (der Arbeitsauftrag in natürlicher Sprache) — den jeweils wahrscheinlichsten nächsten Token voraus. Kein Verstehen, keine Bedeutung: Statistik über Sprache. Merkt Euch außerdem eine ökonomische Nebentatsache, die in Kapitel 3 zur Hauptsache wird: Abgerechnet wird pro Token.
Ebenso wichtig wie das Wie ist das Wofür: Ein LLM ist ein Allzweck-Werkzeug für Text, gebaut von Machine-Learning-Ingenieuren — kein juristischer Zweck steckt darin. Der Kontrast macht es deutlich: juris und beck-online wurden von Juristen für Juristen gebaut; das LLM ist fachfremd, es bringt kein Domänenwissen mit. Der Leitbegriff für diesen Teil lautet deshalb: ein geliehenes Werkzeug — mächtig, aber nicht für das Recht gemacht.
Und ein Merkbild, das dieses Skript bis zum Ende begleitet: Die KI ist wie ein hochbegabter Alien — er spricht perfekt Deutsch, hat aber nie ein Rechtssystem von innen erlebt. Die Worte, aber nicht die Welt. Was das methodisch bedeutet, entfalten die vier Stimmen der Methodenlehre in Kapitel 5.
Jetzt wenden wir die Juristen-Methode auf die eigene Leitfrage an — Definition als Tatbestand, dann subsumieren. „KI“ ist dafür zu unscharf, ein Etikett; wir prüfen das LLM. Erste Brille — das Werkzeug. Der Duden definiert das Werkzeug als „für bestimmte Zwecke geformten Gegenstand, mit dessen Hilfe etwas [handwerklich] bearbeitet oder hergestellt wird“. Hier fällt das LLM bereits durch: Es ist nicht zweckbestimmt — ein Allzweck-Textmodell, für Text überhaupt gebaut, nicht für einen juristischen Zweck geformt. Daraus folgt eine Markt-Beobachtung, die als Deutung des Verfassers gekennzeichnet sei: Die großen Modellanbieter haben — noch — kein Fachprodukt im Sinne dieser Werkzeug-Definition; sie liefern ein zweck-offenes Rohmodell, keine zweckgeformte Fach-Anwendung (dass sie gleichwohl in den Rechtsmarkt drängen, zeigt Kapitel 3). Rohfähigkeit ist noch kein Fachwerkzeug: Ein Werkzeug ohne festen Zweck ist Rohstoff — wer den Zweck setzt, formt daraus erst das Werkzeug.
Zweite Brille — die Methode, und für dieses Skript die entscheidende. Der Duden definiert die Methode als „auf einem Regelsystem aufbauendes Verfahren zur Erlangung von [wissenschaftlichen] Erkenntnissen oder praktischen Ergebnissen“. Das LLM ist nicht regelbasiert: Es sagt das wahrscheinlichste nächste Wort voraus, es folgt keinem Regelsystem. Genau hier setzt Legal Tech an — es stülpt dem Modell eine Methode über: Suchschritte, Prompt-Ketten, Prüfschritte, Agenten (die Begriffe gleich in Abschnitt 2.3). Der Haken: Das Modell wendet diese Methode nicht regelgeleitet an — es folgt der Anleitung nur wahrscheinlichkeitsbasiert. Die Methode ist außen aufgeklebt; der Motor bleibt Blackbox. Die Garantie einer echten Methode — nachvollziehbare, anfechtbare Regelanwendung — fehlt. Michèle Finck bringt die Konsequenz auf die Formel einer „fluent surface that masks absent reasoning“ — einer flüssigen Oberfläche, die fehlendes Schließen verdeckt (The Measurement Gap in the Automation of EU Law, 2026).
Dritte Brille — die Kompetenz, und mit ihr die Auflösung. Duden: Kompetenz ist „Sachverstand; Fähigkeiten“. Sachverstand hat weder das LLM noch Google Maps — er bleibt beim Menschen. Damit schließt sich der Trichter: Den fehlenden Zweck (Brille 1) und die fehlende regelgeleitete Methode (Brille 2) liefert Eure Kompetenz — Sachverhalt strukturieren, Maßstab setzen, Ergebnis prüfen. Erst damit wird aus dem Rohmodell ein juristisches Werkzeug. Wie genau man diese Methodenschicht liefert, ist der Bauplan von Kapitel 5 und Kapitel 6; dass das Recht diese Kompetenz inzwischen ausdrücklich verlangt, zeigt Kapitel 7.
Die Subsumtion im Überblick — mit Google Maps als Vergleichsobjekt:
| Tatbestand (Duden) | LLM | Google Maps |
|---|---|---|
| Werkzeug („für bestimmte Zwecke geformt“) | ~ Allzweck-Textmaschine, geformt für „Text“, nicht fürs Recht → kein Fachwerkzeug | ✓ zweckgeformt für Navigation → echtes Fachwerkzeug |
| Methode („auf einem Regelsystem aufbauend“) | ✗ kein Regelsystem, nur Statistik — zielt aufs wahrscheinlichste Wort, nicht auf Erkenntnis | ✓ Routing-Regelsystem auf der strukturierten Karte |
| Kompetenz („Sachverstand; Fähigkeiten“) | ~ sprachliche Fähigkeit, kein Sachverstand | ~ Routing-Fähigkeit, kein Sachverstand |
Pointe: Ausgerechnet bei der Methode — dem Titelbegriff dieses Skripts — ist das LLM am schwächsten; Maps schlägt es dort, weil hinter Maps ein Regelsystem auf einer strukturierten Karte liegt. Sachverstand hat keines von beiden — er bleibt beim Juristen.
Man könnte einwenden: schönes Argument — aber es hängt an einem deutschen Wörterbuch. Die Gegenprobe in den führenden KI-Nationen und den internationalen Standards zeigt das Gegenteil — die Trias wird schärfer. Werkzeug: Merriam-Webster definiert das tool als „a means to an end“; das chinesische 工具 ist die „Sache, um einen Zweck zu erreichen“; und der Weltstandard ISO/IEC 22989:2022 schreibt die Zweckfrage in die KI-System-Definition selbst: „human-defined objectives“. Methode: griechisch méthodos = metá + hodós, „der Weg zu etwas hin“ — die Methode ist in praktisch jeder Sprache ein Weg; Wege brauchen Karten. Kompetenz: Merriam-Webster ergänzt „judgment“ (Urteilsvermögen), die OECD sagt wörtlich „more than just knowledge and skills“, das UNESCO-Kompetenzrahmenwerk 2024 setzt human agency und accountability an die erste Stelle — die Kompetenzpflicht des Art. 4 KI-VO (Kapitel 7) ist also kein europäischer Sonderweg. Zwei sprachgeschichtliche Anekdoten am Rande — Schmuck, kein Argument: Das japanische Wort für Werkzeug, 道具, hieß ursprünglich „Gerät des Weges“ (buddhistisch: die Utensilien der Praxis) — das Werkzeug über den Weg definiert, nicht umgekehrt. Und im chinesischen 方法 („Methode“) steckt das Zeichen 法 — dasselbe wie in „Recht“. Ein antizipierter Einwand zum Schluss: Die OECD-Definition von 2023 (Vorlage des Art. 3 Nr. 1 KI-VO) lässt auch „implicit objectives“ zu — gerade weil der Zweck im Modell nur implizit steckt, muss der Mensch ihn explizit setzen.
Wie wird KI im Recht heute tatsächlich genutzt? Als Leiter mit sechs Stufen, vom Naiven zum Ausgefeilten. Stufe 1 — direkt fragen: ChatGPT, Claude oder Gemini im Chat. Stufe 2 — vorkonfiguriert: „Custom GPTs“ oder vergleichbare Vorlagen — ein fester Prompt plus angebundenes Wissen; das Modell selbst bleibt unverändert. Stufe 3 — der Wrapper: Eine Anwendung legt eine Bedienoberfläche um ein fremdes LLM; das Modell gehört dem Anbieter (die Datenhoheits-Frage dazu stellt Kapitel 3). Das Gemeinsame der ersten Hälfte: Sie ändern das Modell nicht — sie umhüllen es.
Die zweite Hälfte der Leiter stellt das Finden ins Zentrum. Stufe 4 — Embeddings: Embedding-Modelle (sie übersetzen Text in Zahlenreihen — Vektoren —, sodass sich sprachliche Ähnlichkeit rechnerisch messen lässt) dienen der semantischen Suche: dem Finden, nicht dem Antworten. Stufe 5 — RAG: RAG (Retrieval-Augmented Generation: erst wird im eigenen Datenbestand gesucht, dann formuliert das LLM die Antwort aus dem Gefundenen) — das LLM bleibt der Sprach-Kern. Stufe 6 — Agenten: ein Agent (eine Schleife aus wiederholten LLM-Aufrufen plus angebundenen Werkzeugen, die mehrschrittige Aufgaben scheinbar selbständig abarbeitet). Wo dieses Suchen und Verketten technisch bricht, vermisst Kapitel 4.
Die Pointe, die den ganzen Teil trägt: Alle sechs Stufen nutzen denselben LLM-Kern — und erben seine Schwächen. Je ausgefeilter die Hülle, desto besser versteckt, aber nicht behoben. Ein konkretes Bild dazu: Embeddings finden Wort-, nicht Normverwandtschaft. In einem solchen Ähnlichkeitsraum können — je nach Modell — § 433 und § 280 BGB weit auseinanderliegen, obwohl beide Anspruchsgrundlagen sind, während „Kaufvertrag“ und „Mietvertrag“ benachbart sind. Sprachliche Nähe ist nicht dogmatische Nähe: Suchoptimierung ist keine Karte.
Dieselbe Diagnose noch einmal von der anderen Seite — wie tief kann man ein LLM ins Recht „zwingen“? Drei Eskalationsstufen, jeweils am Recht und an Maps gespiegelt: Bild (ein Foto oder PDF der Norm bzw. ein Screenshot der Karte — die KI sieht es, aber ohne Struktur; dem Kartenbild fehlt der Straßengraph), Beschreibung (Texte über das Recht bzw. eine Wegbeschreibung in Worten — Prosa über das Ziel, nicht die Norm selbst) und Brute Force (gar keine Struktur: „finde es irgendwo“ — das System muss alles absuchen). Ausgerechnet die naivste Stufe kostet am meisten; für dieses Immer-mehr-Rechnen hat sich das Schlagwort Tokenmaxxing eingebürgert (ökonomisch dazu Kapitel 3). In allen drei Stufen fehlt dasselbe: der Straßengraph. Maps funktioniert nicht, weil es das Kartenbild „versteht“, sondern weil dahinter die aufbereitete Struktur liegt.
An dieser Stelle entzündet sich regelmäßig die Diskussion: Ist das, was wir „KI-Agent“ nennen, noch ein Werkzeug — oder etwas, das selbst handelt? Ein Werkzeug wird geführt; es hat keine Ziele — der Hammer beschließt nichts. Ein Agent scheint Ziele über viele Schritte selbst zu verfolgen — technisch ist er im Kern die eben definierte Schleife aus LLM-Aufrufen und Werkzeugen: Brute Force in glatter Hülle. Der tiefere Grund, warum ihm die echte Gebrauchsmethode fehlt: Eine Subsumtion verläuft über Gründe, die man nennen und anfechten kann — auch dort, wo sie wertet. Ein Wahrscheinlichkeitsmodell nennt keinen Grund, nur eine Wahrscheinlichkeit; eine nachgelieferte Begründung ist selbst nur wahrscheinlichster Text — Oberfläche der Subsumtion, nicht der begründete Schluss.
Die ontologische Frage — Werkzeug oder Agent? — bleibt hier bewusst offen; sie ist ein lohnender Diskussionsgegenstand. Die normative Frage ist dagegen klar zu schließen: Juristisch entscheidend ist nicht, was es ist, sondern wer das Ergebnis verantwortet. Die „agentische“ Inszenierung verführt dazu, Verantwortung an ein Ding zu delegieren, das keine trägt — der Automation-Bias, den Kapitel 4 als Denkfigur und Kapitel 7 als Rechtsbegriff wieder aufnimmt. Die Verantwortung bleibt beim Juristen, egal wie die Technik sich nennt.
Noch einmal die Frage vom Kapitelanfang: Ist ein LLM ein Werkzeug für Juristen? Nach der Subsumtion lässt sich sagen: Werkzeug ja — aber ein geliehenes. Es fehlen der juristische Zweck und die regelgeleitete Methode; beides muss von außen kommen. Im Hörsaal verschob sich das Abstimmungsbild an dieser Stelle sichtbar. Endgültig beantwortet wird die Frage erst, wenn klar ist, was genau fehlt und wie man es liefert — am Ende von Kapitel 6.
Teil I — Diagnose: ein Werkzeug ohne Karte
Ein nüchterner Ökonomie-Blick: Erlösmodell, Marktbewegung, Zahlen — und was die Cloud-Nutzung für Mandatsgeheimnis und Abhängigkeit bedeutet.
Warum gerade jetzt der Legal-Tech-Goldrausch? Juristen arbeiten mit Sprache — also wirkt ein Sprachmodell wie für sie gemacht. Genau das ist die Falle: Juristische Sprache ist strukturierte, wertende Sprache, keine Fließtext-Oberfläche. Wer nur die Oberfläche reproduziert, erzeugt Fincks „fluent surface“ — flüssigen Text ohne das Schließen dahinter (Kapitel 2).
Zugleich gilt der Befund aus der Trias-Subsumtion: Der Anbieter hat — noch — kein zweckgeformtes Fachwerkzeug für das Recht, sondern ein Allzweck-Rohmodell. Was bleibt dann als Geschäftsmodell?
Die nüchterne Frage zuerst: Wem nützt der Status quo? Das Erlösmodell der großen Anbieter ist der Token-Durchsatz — abgerechnet wird pro verarbeitetem Wortbaustein (Kapitel 2). Brute Force maximiert Tokens; Agenten multiplizieren sie — jede Schleife, jeder Unter-Agent zahlt ein. Strukturierte Daten würden Tokens senken. Daraus folgt die Kapitel-These: Die Struktur-Arbeit hat im Markt keinen natürlichen Fürsprecher — diese Kompetenz muss von der Fachseite kommen. Das ist eine Anreiz-Analyse des Verfassers, keine Studienaussage; sie beschreibt eine Anreizstruktur, keine Verschwörung.
Dazu kommt eine Psychologie-Falle, die man benennen kann, ohne sie zu überdehnen: Was sichtbar Rechenleistung kostet, wirkt wertvoll. Aber Aufwand ist nicht Qualität — das „Tokenmaxxing“ aus Kapitel 2 ist teuer, langsam und unprüfbar, nicht klug. Und oft greift man zum stärksten Modell — der schnelle, scheinbar billige Erfolg — statt die Hausaufgabe zu machen: eigene Datenbestände strukturieren und aufbauen.
Der Markt bewegt sich in zwei Lagern Richtung Recht: Die Modellanbieter selbst (Anthropic mit „Claude for Legal“; Perplexity mit einem Enterprise-Angebot „Legal“; für OpenAI kursiert „Codex for Legal“ bislang nur als — hier bewusst so gekennzeichnetes — Gerücht) und die Legal-Tech-Plattformen, die sich Modelle einkaufen (Harvey integriert Mistral). Bemerkenswert ist eine Anbieter-Stimme: Microsoft kündigte am 30. April 2026 einen „Legal Agent“ in Word an und schrieb dazu, allgemeine KI-Werkzeuge „aren’t designed to follow the structured processes“, auf die Rechtsabteilungen angewiesen sind — eine Vendor-Aussage, kein wissenschaftlicher Beleg, aber exakt die Struktur-Lücke dieses Skripts, aus Anbietermund. Beide Lager bauen auf demselben Allzweck-Kern; die juristische Struktur fehlt und muss erst gebaut werden.
Zahlen statt Bauchgefühl — McKinsey Global Institute, „Agents, robots, and us“ (Mai 2026, Europa-Report über zehn Länder): 58 % der heutigen Arbeitsstunden sind danach mit existierender Technik theoretisch automatisierbar — 44 % über KI-Agenten, 14 % über Roboter; das ist eine Machbarkeits-, keine Adoptions- oder Jobverlust-Prognose. Agenten tragen etwa 82 % des Automatisierungswerts (des Werts, nicht der Stunden); das Potenzial beziffert der Report auf bis zu 1,9 Billionen US-Dollar bis 2030 (mittleres Szenario). Die für uns entscheidende Zahl stammt aus der globalen McKinsey-Unternehmensumfrage (11/2025), die der Report zitiert: Fast 90 % der Unternehmen berichten, KI regelmäßig zu nutzen — aber weniger als 40 % sehen messbare Ergebnisse. Adoption ja, Nutzen offen. Der Nutzen entsteht nicht durch mehr Tool, sondern durch Methode und Struktur.
Ihr ladet einen Schriftsatz in ein Cloud-KI-Tool. Drei Fragen, bevor Ihr weiterlest: Wem „gehören“ die Daten jetzt? Wo werden sie verarbeitet und gespeichert — und wer darf sie sehen oder zum Training verwenden? Und: Dürft Ihr das mit Blick auf die anwaltliche Verschwiegenheit überhaupt? Die Auflösung folgt unmittelbar in Rn. 38.
Die praktischen Folgen für eine Kanzlei: Vendor-Lock-in — der Anbieterwechsel wird teuer, Arbeitsabläufe binden an ein Haus. Keine lokale Verarbeitung — die Daten laufen beim Anbieter, nicht im eigenen Haus. Und die scharfe Spitze, sauber formuliert: Berufsrechtlich gilt die Verschwiegenheitspflicht des § 43a Abs. 2 BRAO; strafrechtlich flankiert sie § 203 Abs. 1 Nr. 3 StGB (unbefugtes Offenbaren fremder Geheimnisse). Strafbar kann insbesondere die Eingabe von Mandatsdaten in ein Consumer-Cloud-LLM ohne Absicherung sein — etwa ohne Dienstleistervertrag und bei Trainingsnutzung durch den Anbieter. Zulässig ist die Einschaltung externer Dienstleister dagegen unter den Voraussetzungen des § 43e BRAO (sorgfältige Auswahl, Verpflichtung auf die Verschwiegenheit, Textform; für Drittstaaten Abs. 4) bzw. mit Einwilligung oder bei wirksamer Anonymisierung. Kurz: nicht „Cloud verboten“, sondern „Cloud nur mit Rechtsgrund und Absicherung“. Dazu kommt die FOMO-Adoption: Einführung aus Angst, etwas zu verpassen, statt aus Bedarfsanalyse — genau das Muster hinter der 90/40-Schere aus Rn. 37.
Zwei Folgekosten stehen selten auf der Rechnung. Umwelt: Jeder Token kostet Energie und Wasser — die Brute-Force-Logik hat physische Kosten. Cognitive Debt: Das dauerhafte Auslagern von Denkarbeit kann die eigene Prüffähigkeit schwächen — und die ist Berufspflicht. (Der Begriff stammt aus einer MIT-Vorstudie von 2025; er ist als Denkfigur zu führen, nicht als gesicherte Evidenz.)
Der Merkzettel, der Teil I bündelt — drei Sorgenfelder des Status quo: Abhängigkeit (Vendor-Lock-in · keine Datenhoheit · FOMO-Adoption) · Prüfbarkeit (Blackbox, nicht auditierbar · Halluzinationen potenzieren sich in agentischen Ketten · Pseudo-Standards je Kanzlei) · Folgekosten (Umwelt · Cognitive Debt). Womit die Diagnose steht: Das Werkzeug ist geliehen, die Methode fehlt, und der Markt hat keinen Anreiz, sie zu liefern. Teil II baut sie deshalb selbst.
Wie macht man es? · Leitfrage 3: Verarbeitung
Teil II — Konstruktion: die Karte bauen
Vier Versagensmuster — Schnitt, Bias, Halluzination, übersehene Mitte — zwei Selbstversuche, und zwei Studien, deren gemeinsamer Befund die Rampe für alles Weitere ist.
Hier kehrt § 138 BGB zurück — als Opfer. Verarbeitet ein KI-System lange Rechtstexte, zerlegt es sie zunächst in kurze Fragmente: Chunking (das Zerteilen langer Texte in Stücke von einigen hundert Tokens, damit sie durchsuchbar werden). Der Schnitt folgt technischen Längen, nicht der Norm-Logik — er läuft quer durch Tatbestand, Rechtsfolge und die „insbesondere“-Brücke zwischen Absatz 2 und Absatz 1. Finck bringt es auf den Punkt: Die Fragmentierung „detaches an individual provision from the instrument … stripping away the systematic context doctrinalism depends on“ — sie löst die Einzelvorschrift aus ihrem Regelungszusammenhang und zerstört genau den systematischen Kontext, von dem die Dogmatik lebt.
Schlimmer noch: Das anschließende Suchen (Retrieval, Kapitel 2) rangiert die Fundstücke nach sprachlich-semantischer Ähnlichkeit, nicht nach rechtlicher Geltung — es bevorzugt, was ähnlich klingt, nicht was bindend ist (das Merkbild aus Rn. 28 — „Suchoptimierung ist keine Karte“ — hier technisch unterlegt). Normhierarchie, Spezialität, Verweisungszusammenhänge: alles Kategorien, die ein Ähnlichkeitsmaß nicht kennt. Schon die Eingangsstufe der Verarbeitung ist damit blind für genau die Struktur, die Kapitel 1 als Kern juristischen Lesens herausgearbeitet hat.
„Bias“ ist nicht gleich Bias; die Trennung ist eine Frage intellektueller Redlichkeit. Auf der Modellseite: die Dominanz des Common Law in den Trainingsdaten; fehlendes Aktualitätswissen ohne Warnung; ein Sog zur herrschenden Meinung, in dem die Mindermeinung verschwindet; der Familien-Effekt, bei dem Modelle desselben Herstellers einander bestätigen — und ein Gegenstück zum Confirmation-Bias auf der Modellseite selbst: Das Modell „versteht“ besser, was es kennt. Was in den Trainingsdaten häufig vorkam, wird bevorzugt erkannt, vervollständigt und reproduziert — das Vertraute wirkt auf das Modell „plausibler“ als das Seltene, unabhängig davon, was rechtlich zutrifft. Auf der Nutzerseite: der Automation-Bias (die Neigung, Maschinen-Ausgaben unkritisch zu vertrauen) und der Confirmation-Bias — beides etablierte Begriffe der Mensch-Maschine-Forschung, hier als Denkfiguren geführt, nicht als eigene Messung. Die Falle entsteht im Zusammenspiel: Professioneller Ton plus sichtbarer Rechenaufwand wirken vertrauenswürdig. In Kapitel 7 wird aus der Denkfigur ein Rechtsbegriff — der „Automatisierungsbias“ steht wörtlich in der KI-Verordnung.
Die bekannteste Schwäche ist die Halluzination (eine souverän formulierte, aber falsche Antwort — etwa ein erfundenes Aktenzeichen; in der Fachdebatte auch Konfabulation genannt). Die Zahlen überraschen selbst Profis: Die Stanford-Studie von Magesh, Surani, Dahl, Suzgun, Manning und Ho — die erste vorregistrierte Messung kommerzieller Rechts-KI mit RAG, also genau der Werkzeuge, die als „hallucination-free“ beworben wurden — fand Halluzinationsraten von 17 bis 33 %: Lexis+ AI rund 17 %, Westlaws KI-Recherche rund ein Drittel, GPT-4 ohne RAG 43 % (Tools getestet Mai 2024; publiziert im Journal of Empirical Legal Studies 2025). „RAG systems are no panacea“, so die Autoren — der Quellen-Rückgriff senkt das Problem, behebt es nicht. Zwei anschauliche Funde: ein erfundener Paragraph der US-Insolvenzverfahrensregeln; ein echtes Urteil, einem fiktiven Richter zugeschrieben. Einordnung: gemessen an US-Tools und US-Recht — aber an der Architektur, nicht an der Rechtsordnung hängend.
Die eigentliche Gefahr ist jedoch nicht der plump erfundene Fall — den merkt man. Gefährlich ist die Antwort, die richtig aussieht: ein echtes Urteil, eine echte Fundstelle, korrekt zitiert — die die behauptete Aussage aber nicht stützt. Stanford nennt das misgrounded und hält es für gefährlicher als die glatte Erfindung, weil subtiler und schwerer zu entdecken. Finck katalogisiert ihn als Fehlertyp Nr. 21, „Mismatching citation and proposition“ — hier kurz citation ≠ proposition: Zitat und Quelle sind echt, und erst die sorgfältige Lektüre des zitierten Dokuments offenbart, dass es die Behauptung nicht trägt. Selbst mit angebundenem Kontext gibt es keine Garantie, dass das Modell ihn treu verwendet (so die CoCoLex-Untersuchung 2025, Preprint). Die Folge für Eure Praxis: Eine Fußnote beweist nichts — geprüft werden muss, ob die Quelle die Aussage trägt. Das ist die Kompetenz, auf die dieses Skript zuläuft.
Runde 1 — aus dem „Gedächtnis“ des Modells: Prompt-Vorlage: „Erstelle eine Liste aller Legaldefinitionen im Allgemeinen Teil des BGB (§§ 1–240). Nenne je Paragraph und definierten Begriff.“
Runde 2 — am echten Text: Kopiert einen Abschnitt des tatsächlichen Gesetzestextes (z. B. §§ 90–103 BGB auf gesetze-im-internet.de) in den Chat: „Finde jetzt alle Legaldefinitionen NUR in diesem Text.“
Vergleicht beide Listen: Was hat Runde 1 erfunden (steht nicht im Text)? Was hat sie übersehen (steht im Text, fehlt in der Liste)? Typischer Verlauf und Auflösung: Anhang. Als kuratierte Referenzliste könnt Ihr die Gesetzesanalyse-Strukturtaxonomie heranziehen. Ergebnisse variieren je Modell und Datum — das ist Teil der Lektion.
Nicht nur der Schnitt zerstört Struktur — auch in einem ganzen, langen Text übersieht die Maschine systematisch, was in der Mitte steht. Das ist das dokumentierte lost-in-the-middle-Verhalten (erstmals systematisch gemessen von Liu u. a. 2023; bei neueren Modellen abgeschwächt, aber nicht verlässlich verschwunden): Was am Anfang oder Ende eines langen Kontexts steht, wird meist gefunden; die Mitte wird häufig übersehen — und die Antwort klingt trotzdem souverän. Juristisch ist das fatal, denn die übersehene Ausnahme oder der Widerspruch in der Mitte ist oft das Entscheidende: Die systematische Gesamtschau, die Ihr beim Lesen leistet, fällt aus — lokal plausibel, global falsch.
Nehmt eine strittige oder höchstrichterlich offene Frage aus Eurer eigenen Vorlesung — einen echten Meinungsstreit, dessen Offenheit Ihr kennt. Zwingt die KI zur Festlegung: „Antworte nur mit Ja oder Nein und einem Satz: Ist [Eure Streitfrage] zulässig/erfüllt?“ Hakt danach nach: „Wie sicher bist du auf einer Skala von 0–100 %? Gibt es eine Gegenansicht?“ Fällt Euch keine Streitfrage ein, nehmt einen Wertungs-Grenzfall (etwa: „sittenwidrig?“). Was dabei typischerweise passiert — und was es bedeutet — steht im Anhang; den rechtlichen Maßstab dazu liefert Kapitel 7.
Was passiert, wenn man viele LLM-Schritte zu einem „agentischen“ System verkettet (Kapitel 2, Stufe 6)? Jede Stufe erbt die eben vermessenen Schwächen — und in der Kette potenzieren sie sich: Eine früh eingeschleppte Halluzination wandert durch alle Folgeschritte. Brute Force in glatter Hülle. Ob das trägt, ist messbar — und gemessen worden.
An dieser Stelle lief im Hörsaal ein kurzer satirischer Clip über einen „agentischen KI-Workflow“ — viele automatische Schritte hintereinander, niemand durchschaut mehr, was passiert. Ihr könnt ihn Euch ansehen: „Agentic AI Workflow“ (YouTube-Short, ca. 1:30 Min.). Das Video macht den Witz; die beiden folgenden Studien machen den Ernst.
Empirie I — Agents’ Last Exam (ALE): Ein Benchmark (ein standardisierter Test aus Aufgaben, Soll-Ergebnissen und einem Bewertungsmaß, an dem Systeme gemessen werden) der UC Berkeley (2026): Über 250 Branchenexperten bauten 1.490 Aufgaben-Instanzen aus 960 Experten-Workflows in 55 Berufsfeldern — alle mit prüfbarem Ergebnis. Resultat: Auf der schwersten Stufe („Last Exam“) lösen die gängigen Agent-Konfigurationen im Durchschnitt nur 2,6 % der Aufgaben vollständig; selbst die beste Konfiguration bleibt dort unter 10 %. Die Zahl ist aber nicht der Punkt. Der Punkt ist eine Design-Entscheidung der Autoren: „ALE deliberately avoids LLM-as-judge wherever a deterministic alternative exists“ — bewertet wird, wo immer möglich, deterministisch gegen eine prüfbare Referenz, nicht durch die Frage an ein Modell, ob das Ergebnis „richtig aussieht“ (nur für genuin wahrnehmungsbezogene Artefakte wie gerenderte Szenen sind eng geführte Ja/Nein-Prüffragen zugelassen). Das ist Misstrauen ins Modellurteil in Reinform — von denen, die es am genauesten kennen.
Empirie II — GradeLegal (Universität Passau, angenommen für ICAIL 2026) zeigt dieselbe Lehre von der anderen Seite. 27 Modelle benoteten deutsche Jura-Klausurlösungen (87 studentische Bearbeitungen: 71 Strafrecht, 16 Öffentliches Recht) auf der 18-Punkte-Skala. Ohne jede Aufgabeninformation liegt die Übereinstimmung mit den Expertennoten nahe dem Zufall. Mit Bewertungsrubrik und Musterlösung erreicht das beste Modell im öffentlichen Recht ein QWK (quadratisch gewichtetes Cohen’s Kappa — ein Übereinstimmungsmaß zwischen Bewertern: 0 = Zufall, 1 = perfekt) von 0,911 — auf drei Dezimalen identisch mit der höchsten gemessenen Übereinstimmung zweier menschlicher Korrektoren (0,911 ± 0,066). Im Strafrecht dagegen: nur 0,599. Die ehrliche Doppelzahl gehört zur Lehre: Die Rubrik hebt das Modell — sie ist kein Zauberstab.
Denn nicht das Modell wurde klüger; die strukturierte Referenz hat es gehoben — und zwar die punktbezogene Struktur der Rubrik mehr als der Detailreichtum der Musterlösung. Die Autoren: „structure, not detail, drives performance.“ Das ist der Kernsatz dieses Skripts, empirisch: Verlässliche automatische Bewertung entsteht nicht durch das Urteilsvermögen des Modells, sondern durch die Struktur der Referenz, an der es arbeitet. Beide Studien — ALE und GradeLegal — zeigen aus entgegengesetzten Richtungen dasselbe: Dem Modellurteil traut niemand, der genau misst; der strukturierten Referenz schon. Woraus diese Referenz im Recht besteht, ist die Frage des nächsten Kapitels.
Teil II — Konstruktion: die Karte bauen
Dieses Kapitel legt offen, was der geübte Jurist beim Lesen einer Norm unbewusst leistet — und zeigt, dass sich genau diese Leistung beschreiben, typisieren und damit maschinenlesbar machen lässt: als Karte, die Wertungsstellen markiert, ohne sie auszufüllen.
Kapitel 4 endete mit einem empirischen Kernbefund: Nicht das Urteilsvermögen des Modells macht dessen Ergebnisse verlässlich, sondern die Struktur der Referenz, an der es arbeitet. Damit ist die Richtung dieses Kapitels vorgezeichnet. Wenn das Sprachmodell selbst keine Methode hat — wer bringt sie dann mit? Ein Bild macht die Antwort greifbar: Muss der Hammer zimmern können? Nein — der Zimmermann. Das Werkzeug muss nicht Jura „können“; wer es einsetzt, muss wissen, wie. Konkret heißt das: Die Fachexpertise muss die strukturierten Daten erzeugen, auf denen das Sprachmodell aufsetzt — im Bild der Vorlesung: die Karte, auf der ein Navigationssystem erst rechnen kann.
Genau an dieser Stelle endet der heutige Stand der Technik. RAG (Kapitel 2) überlässt dem Modell das Finden; sogenannte „Skills“ überlassen ihm das Anwenden vorformulierter Arbeitsanweisungen. Beides liefert keine Methode — es umhüllt nur den verständnislosen Kern, dessen Bruchstellen Kapitel 4 vermessen hat.
Das Ziel der Aufbereitung, um die es im Folgenden geht, lässt sich mit der Merkfigur aus Kapitel 2 präzise fassen: Die Norm ist so zu strukturieren, dass der „Alien“ — das sprachmächtige System ohne jede Innenansicht des Rechts — sie korrekt anwenden kann, ohne sie zu verstehen. Das Verständnis bleibt beim Juristen; abgegeben wird nur die explizit gemachte Form. Was aber tut ein Jurist eigentlich, wenn er einen Normtext liest? Die folgenden Abschnitte rekonstruieren diese Frage in drei Schritten: erst die Leserichtung (5.2), dann das Ordnungssystem (5.3), dann die sichtbar gemachte Vorarbeit am konkreten Beispiel (5.4).
Wie man aus Rohmaterial ein Werkzeug macht, ist kein Geheimnis: Das Ingenieurwesen hat dieses Handwerk in Weltnormen gegossen — und es sind immer dieselben vier Schritte.
| Schritt | Was heißt das? | Wo es kodifiziert ist |
|---|---|---|
| 1 · Zweck festlegen | Welche Aufgabe? Welcher Nutzer? Welche Fehlertoleranz? | ISO/IEC/IEEE 29148 — der Weltstandard des Anforderungs-Handwerks: erst definierte Anforderungen, dann bauen |
| 2 · Nutzer & Kontext verstehen | Gestaltung „based upon an explicit understanding of users, tasks and environments“ | ISO 9241-210 — menschzentrierte Gestaltung, iterativ, durch Nutzer-Evaluation getrieben |
| 3 · Formen | die fehlende Fach-Schicht einbauen | → Gegenstand dieses und des nächsten Kapitels |
| 4 · Prüfen & wiederholen | gegen vorab definierte Kriterien messen, dann nachbessern — immer wieder | PDCA-Zyklus (Shewhart/Deming, ab 1951 Kern der japanischen Qualitätsbewegung); auf Organisationsebene seit 2023 ISO/IEC 42001 eigens für KI-Systeme |
Die Doppel-Lehre: Die Schritte 1 und 2 kann bei einem juristischen Werkzeug nur der Jurist leisten — Zweck und Kontext sind exakt das, was dem Allzweck-Modell fehlt (Teil I). Und Schritt 4 bedeutet: Es gibt kein fertiges KI-Werkzeug ohne vorab definierte Prüfkriterien — dieser Gedanke kehrt in Kapitel 6 als Methode M2 wieder.
Das Werkstück dazu, frei zugänglich: die Gesetzesanalyse-Strukturtaxonomie — 107 Gesetze, zerlegt in drei Ebenen (Normtyp → Satz-Funktionstyp → Entität), mit Codebuch je Ebene. Eine statische Seite ohne Anmeldung; sie zeigt, wie ein Ergebnis aussieht, wenn man die vier Schritte geht. Und speziell für dieses Skript gibt es das Struktur-Labor BGB & StGB: Dort könnt Ihr die Karte § für § selbst befahren — Normtyp je Absatz, Satz-Funktion je Satz, Entitäten je Paragraph, jeweils mit Codebuch-Erklärung per Maus-Hover.
An dieser Stelle wurde das Werkstück live gezeigt: der Übersichts-Tab des Gesetzesanalyse-Viewers mit der Gesamtzählung — 107 Gesetze, 66.823 Absätze, 106.570 Sätze, 643.494 erkannte Entitäten. Die Reaktion im Saal: Die vier Schritte sind keine Theorie; so sieht es aus, wenn man sie geht.
Ein Jurist liest ein Gesetz nicht linear von der ersten bis zur letzten Zeile. Er navigiert Ebenen — wie ein Kartenzoom, der vom Kontinent bis zur Hausnummer führt. Beim Gesetz lauten die Stationen: Gesetz → Gliederung (Buch, Abschnitt, Titel) → Norm (der einzelne Paragraph) → Norminhalt (Absatz und Satz: Tatbestand, Rechtsfolge) → Bedeutung (der einzelne Begriff, etwa eine Legaldefinition). Wer § 138 Abs. 2 BGB aufschlägt, hat diese Zoom-Treppe längst durchlaufen — meist, ohne es zu bemerken.
Die Treppe ist kontextabhängig: Jede Textsorte hat ihre eigenen Ebenen. Ein Urteil gliedert sich in Tenor, Tatbestand und Entscheidungsgründe; ein wissenschaftlicher Aufsatz in These, Beleg und Gegenansicht (vgl. die Textsorten-Übersicht in Kapitel 1). Wer eine Textsorte beherrscht, weiß, wo er sucht, bevor er weiß, was dort steht.
Entscheidend ist die unterste Stufe. Ganz unten, bei der Bedeutung, sitzt die Wertungsstelle — die Stelle, an der der Text eine Wertung verlangt, statt sie mitzuliefern. Dorthin gelangt der Alien allein nie; warum das kein Mangel der Karte ist, sondern ihr Bauprinzip, klärt Abschnitt 5.6.
Auf jeder dieser Ebenen sortiert der Jurist das Gelesene in Typen — meist unbewusst. Man kann die Sortierleistung sichtbar machen, indem man die Erkennungszeichen benennt: Woran erkennt man eine Legaldefinition — und woran erkennt sie ein Leser ohne jedes juristische Vorwissen? An Markern im Text: Die Legaldefinition sagt „ist …“, „im Sinne dieses Gesetzes“ oder „gilt als“; das Gebot sagt „muss“; das Verbot „darf nicht“; die Erlaubnis „kann“; die Verweisung „… gilt entsprechend“; die Sanktionsnorm „wird bestraft mit“. Solche Marker sind keine Eselsbrücken, sondern die sprachliche Oberfläche der Normstruktur — und damit genau das, was sich maschinell erkennen lässt.
Die Typisierung selbst ist keine Erfindung dieses Projekts, sondern gefestigte Dogmatik: die Normtypenlehre, wie sie Larenz/Canaris (dort in der Terminologie der vollständigen und unvollständigen Rechtssätze), Röhl und Rüthers entfaltet haben. Für die maschinelle Verarbeitung wurde sie zu einem dreistufigen Typsystem verdichtet:
| Ebene | Typsystem | Anzahl | Beispiele |
|---|---|---|---|
| Norm (§) | Normtyp (NT) | 17 benannte Typen + Auffangklasse* | Gebot · Legaldefinition · Verweisung · Rechtsfolgenbestimmung … |
| Satz | Satz-Funktionstyp (SF) | 7 | Hauptregel · Konkretisierung · Ausnahme · Verweisung … |
| Begriff / Entität | Entitätsklasse (EK) | 9 benannte Klassen + Sonderklasse* | Tatbestandsmerkmal · Rechtsfolge · Akteur · Schutzgegenstand … |
* Der Gesetzesanalyse-Viewer zählt 18 bzw. 10, weil er Auffang- und Sonderklassen (NT-NEW, EK-HIST) mitzählt — beide Zählweisen bezeichnen denselben Bestand. Die 17 benannten Normtypen speisen sich aus der Larenz/Canaris-Tradition (14 Typen) und drei empirisch aus der Regulierungspraxis gewonnenen Typen (Katalog-, Kriterien-, Erläuterungsnorm). Die vollständigen Tafeln aller Typen mit Definitionen enthält der Anhang.
Quer zu allen drei Ebenen liegt die klassische Unterscheidung von Tatbestand und Rechtsfolge. Zusammen ergibt das die Karte: NT × SF × EK — jede Einheit getypt, am Marker erkannt. Dass dies keine Skizze auf dem Papier ist, zeigt das erwähnte Werkstück: In einem Forschungsprojekt des Verfassers ist diese Karte für über 100 Gesetze real gebaut worden, mit rund 297.000 kanonischen Entitäten, jede mit nachvollziehbarer Herkunft. Ein Sprachmodell kann eine solche Auszeichnung nutzen — von allein findet es sie nicht.
Damit lässt sich eine Rechnung begleichen, die seit Kapitel 1 offen ist. Dort blieb in der Gegenüberstellung von Google Maps und Rechtsdomäne genau eine Zelle leer — die Aufbereitung: Google baut aus Rohdaten einen Straßengraphen; im Recht steckte die entsprechende Struktur bislang nur im Kopf des Juristen. Die Tabelle lässt sich jetzt vollständig ausfüllen:
| Schicht | Google Maps | Recht — die Entsprechung |
|---|---|---|
| Datengrundlage = Input | Satellit · Street View · GPS-Schwarm · Nutzer-Meldungen | Gesetze · Entscheidungen · Kommentare · Verträge |
| Aufbereitung (Struktur) | Straßengraph · Hausnummern · Verkehrsregeln | NT × SF × EK — jede Einheit getypt, am Marker erkannt (in Kapitel 1 noch: „?“) |
| Kompetenzen | Geodäsie · Kartografie | Methodenlehre — bisher implizit, hier explizit gemacht |
| Nutzung | Routing-Algorithmus (Echtzeit) | Subsumtion · Auslegung — und die KI? → Kapitel 6 |
Nur die letzte Zeile bleibt bewusst halb offen: Wie ein KI-System auf dieser Karte arbeitet — und was dabei aus den klassischen Einsichten der Methodenlehre wird —, ist Gegenstand von Kapitel 6.
Die Idee, Rechtsstrukturen formal abzubilden, ist vier Jahrzehnte alt: 1986 wurde der British Nationality Act als Logikprogramm implementiert; die 1980er brachten juristische Expertensysteme, später dedizierte Rechtssprachen und Ontologien. Der heutige Referenzstandard ist LegalRuleML (Athan et al. 2013; OASIS-Technical-Committee unter Palmirani, Governatori u. a.): Er unterscheidet prescriptive statements (deontische Operatoren: Gebot, Erlaubnis, Verbot) und constitutive statements (Definition, Fiktion, „count-as“) — ein Split, der der dogmatischen Unterscheidung von Regelungsnormen und unvollständigen (erläuternden, einschränkenden, verweisenden) Rechtssätzen bei Larenz/Canaris entspricht.
Die doppelte Grenze: Erstens erfasst deontische Logik nur die modalen Normen — in realen Gesetzen ist die Mehrheit der Sätze konstitutiv; eine reine Gebots-/Verbots-Formalisierung verliert also den größeren Teil des Materials. Genau deshalb braucht es das reichere Typsystem aus Abschnitt 5.3. Zweitens bleibt die offene Textur der Rechtsbegriffe (Hart) jeder Formalisierung entzogen — die Forschung pendelt seit jeher zwischen präziser Handarbeit, die nicht skaliert, und lernenden Verfahren, die zur Blackbox werden. Diese Lücke ist kein historischer Zufall, sondern der systematische Ort, an dem dieses Kapitel ansetzt.
Jetzt kehrt die Leitnorm dieses Skripts zurück. In Kapitel 1 war § 138 Abs. 2 BGB der Ausgangspunkt der Frage „Was lest Ihr eigentlich?“; in Kapitel 4 wurde er zum Anschauungsfall dafür, wie maschinelles Zerteilen (Chunking) quer durch die Normstruktur schneidet. Diesmal erscheint dieselbe Norm mit aufgedeckter Bauform — eingefärbt nach den drei Schichten, die im weiteren Verlauf tragend werden:
Was hier farbig vorliegt, leistet der geübte Leser beim ersten Kontakt mit der Norm in Sekunden und unbewusst: Er erkennt den Normtyp, den Satz-Funktionstyp (vorangestellte Rechtsfolge, dann Tatbestand), die Entitäten und die Verknüpfungen. Man kann diese Leistung Pre-Reading nennen — Vorarbeit, die dem inhaltlichen Verstehen vorausliegt und es erst ermöglicht.
Und damit schließt sich der Bogen zu Kapitel 4: Exakt diese Struktur ist es, die beim Chunking zerschnitten wird. Die Maschine zerlegt den Text technisch — nach Zeichenlänge, nicht nach Bauform. Der Experte zerlegt ihn strukturell. Der Unterschied zwischen beiden Zerlegungen ist präzise das, was diesem Werkzeug fehlt und was ihm nur die Fachseite geben kann.
Nehmt § 823 Abs. 1 BGB und zerlegt ihn schriftlich in drei Spalten — dieselben drei Fragen passen auf jede Norm:
① Faktisch — was muss vorliegen? · ② Normativ — wo wird gewertet? · ③ Dispositional — was kann die Norm auslösen?
Stellt Euch anschließend die Kontrollfrage der Vorlesung: Könntet Ihr mit Euren drei Spalten dem Alien die Norm so erklären, dass er einen Fall lösen kann, den Ihr ihm nie gezeigt habt? → Lösung im Anhang.
Warum ist Lesen nicht Verstehen? Diese Frage ist lange vor jeder KI beantwortet worden — von vier Denkern, in vier Sprachen, mit einer gemeinsamen Erkenntnis. Engisch beschrieb das juristische Verstehen als Bewegung: Der Blick wandert hin und her zwischen Sachverhalt und Obersatz — Verstehen ist kein einmaliges Ablesen (Logische Studien zur Gesetzesanwendung, 1943). Gadamer und, für die Rechtswissenschaft, Larenz zeigten: Niemand versteht ohne Vorverständnis; man tritt immer schon mit einer Erwartung an den Text heran — der hermeneutische Zirkel. Für die juristische Praxis hat Esser diesen Befund zugespitzt: Das Vorverständnis steuert bereits die Wahl der Methode (Vorverständnis und Methodenwahl, 1970).
Busse ergänzte die sprachwissenschaftliche Seite: Rechtsbegriffe aktivieren Frames — ganze Wissensrahmen, die nicht im Text stehen, sondern im Leser abgerufen werden. Und Eco formulierte es am weitesten: Lesen ist Mitarbeit; der Leser bringt seine Enzyklopädie mit, ohne die jeder Text unterbestimmt bliebe. Vier Vokabulare, ein Befund: Das Verständnis liegt nicht im Text, sondern im methodisch vorbereiteten Leser.
Für alle vier Stimmen gibt es ein gemeinsames Gesicht — den Alien: Er hat kein Vorverständnis, keine Frames, keine Enzyklopädie. Er liest jedes Wort und versteht trotzdem nicht. Das ist die präziseste Kurzbeschreibung des Sprachmodells, die dieses Skript anzubieten hat — und zugleich die Begründung, warum die Struktur von der Fachseite kommen muss: Was dem Leser fehlt, kann nur der liefern, der es hat.
In Kapitel 1 blieb neben der leeren Tabellenzelle eine zweite Rechnung offen: die Bruchstelle des Maps-Vergleichs. Google Maps vermisst Fakten — Geodäsie kennt einen Wahrheitsbeweis. Das Recht ist insoweit anders gebaut: Sollenssätze sind keinem Wahrheitsbeweis zugänglich, und eine Straßenkarte kennt keine Markierung „hier musst du urteilen“. Schien damit die ganze Kartenmetapher zu scheitern?
Die Auflösung liegt in einer Unterscheidung, die dieses Kapitel vorbereitet hat: Die Rechtskarte vermisst die Wertung nicht — sie markiert die Wertungsstelle. Die Karte sagt, wo gewertet wird, nicht wie. Den Weg durch die Wertungsstelle geht der Mensch. Genau das habt Ihr in Übung 5-1 selbst getan: Die normative Spalte („widerrechtlich“, „fahrlässig“) ließ sich konsensfähig identifizieren, ohne dass damit eine einzige Wertung vorweggenommen wäre. Beschreiben ist nicht Bewerten.
Daraus folgen zwei Dinge zugleich — und beide tragen den Rest dieses Skripts: Die Struktur ist baubar, weil ihre Beschreibung konsensfähig ist. Und das juristische Urteil bleibt unersetzlich, weil die Wertung es nicht ist. Die drei Schichten der Bauform — faktisch, normativ, dispositional — sind dafür das Arbeitsvokabular. Wie aus dieser beschreibbaren Karte ein prüfbares Verfahren wird, und was dabei aus den vier Stimmen dieses Kapitels wird, zeigt Kapitel 6.
Teil II — Konstruktion: die Karte bauen
Die vier Stimmen bekommen eine technische Form, aus der Struktur wird ein Verfahren mit Voraussetzungen, Methoden und Haltepunkten — und am Ende fällt der Satz, auf den alles zuläuft.
Kapitel 5 endete bei den vier Stimmen der Methodenlehre — Engisch, Gadamer/Larenz, Busse, Eco — und ihrem gemeinsamen Befund: Das Verständnis liegt im methodisch vorbereiteten Leser. Jetzt bekommt jede dieser Stimmen ihre explizite, technische Form — belegt an realer Architektur aus dem Forschungsprojekt des Verfassers:
| Klassische Stimme | Einsicht | Technische Übersetzung | Real gebaut |
|---|---|---|---|
| Engisch | Der Blick wandert hin und her zwischen Sachverhalt und Obersatz | iterative Suchschleifen mit Rückkopplung | Two-Pass-Klassifikation: jede Einordnung zweimal — einmal „blind“, einmal mit Kontext; Abweichungen werden zum Prüfsignal (ein technisches Vier-Augen-Prinzip) |
| Gadamer / Larenz | Kein Verstehen ohne Vorverständnis | explizit mitgegebenes Regelwerk statt implizitem Vorwissen | das NT×SF×EK-Codebuch (ein Katalog aller Kategorien mit Definitionen, Markern und Ankerbeispielen) |
| Busse | Begriffe aktivieren Frames | typisierte Wissensrahmen in einer Ontologie (einer formalen Landkarte der Begriffe eines Gebiets und ihrer Beziehungen) | Entitäten-Katalog mit Rollen-Feldern: Akteur, Schutzgegenstand, Modalität … |
| Eco | Der Leser bringt seine Enzyklopädie mit | kuratierte Wissensbasis mit Provenance (lückenlosem Herkunftsnachweis — die Fundstellenkette zu jeder einzelnen Angabe) | rund 297.000 kanonische Entitäten, jede mit Herkunftskette |
Mehr passiert in diesem Abschnitt nicht — vier alte Einsichten, vier technische Übersetzungen. Aber es ist der Schlussstein des Gewölbes: Die Methodenlehre muss nicht neu erfunden werden, damit Maschinen mit Recht arbeiten können. Sie muss explizit werden.
Die zweite Tafel ist die direkte Antwort auf die Zielmarke der Einleitung — Was müsst Ihr können? Zwei Voraussetzungen: V1 — die Quelle verstehen: Textsorte, Funktion, Schichten, Adressat erkennen; das ist das Pre-Reading der vier Stimmen. V2 — das Werkzeug verstehen: wissen, was ein LLM, ein Embedding, ein RAG leistet und was nicht — die Sorgfaltsschicht, die in Kapitel 7 zur Rechtspflicht wird.
Und vier Methoden: M1 — Strukturieren: das Skelett explizit machen — Codebuch, Klassifikation, Schema. M2 — Maßstab setzen: vor jeder Bewertung definieren, was „gut“ heißt — Rubrik und Quality Gate; genau das, was GradeLegal in Kapitel 4 empirisch gezeigt hat, und in der Sache der Gutachtenstil. M3 — Mehrfach prüfen: mehrere unabhängige Stimmen, Konsens nur bei Übereinstimmung — das Vier-Augen-Prinzip. M4 — Spuren legen: jede Aussage rückverfolgbar zur Stelle — der Audit-Trail als Pflichtfeld (den rechtlichen Anschluss dazu stellt Kapitel 7 her).
Diese vier Methoden sind keine Hausmarke. Es sind die internationalen Konstruktionsregeln des Methoden-Machens: das Regelwerk externalisieren (M1 = Codebuch) · den Maßstab vor der Ausführung festlegen (M2 — dieselbe Logik, mit der die Wissenschaft ihre Studien präregistriert: Der Untersuchungsplan wird hinterlegt, bevor die Ergebnisse bekannt sind, damit hinterher nichts zurechtgebogen wird) · unabhängige Mehrfachprüfung (M3) · Spuren erzwingen (M4) — plus menschliche Freigabe-Haltepunkte, zu denen gleich Abschnitt 6.3 kommt. Woher man weiß, dass genau das die Regeln sind? Ein Blick in zwei fremde Disziplinen — und auf Euer eigenes Fach:
Für das Werkzeug-Bauen gibt es Weltnormen (Handwerk ①), für das Kompetenz-Entwickeln auch (Handwerk ③, Kapitel 8). Für das Methoden-Machen gibt es keine allgemeine, disziplinübergreifende Weltnorm — es existiert zwar eine Wissenschaft davon („Method Engineering“, Informatik, seit den 1990ern; die nächste Annäherung an eine Norm, ISO/IEC 24744, ist ein Software-Metamodell aus derselben Nische), aber das Methoden-Machen ist das am wenigsten industrialisierte der drei Handwerke. Wer beherrscht es dann? Zwei Belege.
Beleg 1 — die Chirurgie: Die WHO konstruierte eine 19-Punkte-Checkliste für Operationen. In acht Kliniken weltweit sanken danach Komplikationen (11 % → 7 %) und Sterblichkeit (1,5 % → 0,8 %) — um mehr als ein Drittel (Haynes u. a., NEJM 2009). Fünf Jahre später die Gegenprobe in Ontario: 101 Kliniken führten dieselbe Checkliste verpflichtend ein — ohne messbare Wirkung (Urbach u. a., NEJM 2014). Die plausibelste — nicht die bewiesene — Erklärung der Differenz ist die Implementierung: eingeführt „auf dem Papier“ statt gelebt; beide Studien haben zudem methodische Grenzen (Vorher-Nachher-Design bzw. kurzes Zeitfenster und selbstberichtete Befolgung). Die Doppel-Lehre bleibt gleichwohl stark: Eine konstruierte Methode macht fähige, aber fehlbare Ausführende zuverlässig — aber nur, wenn jemand sie lebt und durchsetzt. Das LLM ist Euer fähiger, fehlbarer Ausführender. Ihr seid die, die die Checkliste durchsetzen. (Grenze der Analogie, ehrlich benannt: Ein LLM ist kein OP-Team — die Checkliste trägt die Architektur-Idee, keine Wirksamkeits-Prognose für das Recht.)
Beleg 2 — Euer eigenes Fach: Juristische Fallmethoden sind konstruierte Artefakte, die sogar wandern:
| Rechtskreis | Konstruierte Fallmethode | Herkunft |
|---|---|---|
| USA | IRAC: Issue → Rule → Application → Conclusion — Standard in Law Schools und Bar Exam | US-Eigenbau (Ursprung ungeklärt) |
| Japan | 法的三段論法 — der Rechts-Syllogismus (Obersatz → Untersatz → Schluss), Standard im Justizexamen; wissenschaftliche Vertiefung: Aufsatz der Law School Tsukuba (PDF, jap.) | Rezeption kontinentaler Methodik |
| China | 请求权基础分析法 — die Anspruchsgrundlagen-Prüfung, heute eine der beiden führenden Fallmethoden | Import: Larenz (München) → Wang Zejian (Taiwan) → Festland |
| Deutschland | Gutachtenstil / Anspruchsmethode | das Original — Export-Artefakt |
Die Pointe: Die Lücke der Weltnormen ist Euer Terrain. Die juristische Methodenlehre ist die älteste dokumentierte Praxis, verlässliche Prüfverfahren für nicht formalisierbares Material zu bauen — Deutschland ist Methoden-Exporteur. „Neue Methodenlehre für KI“ heißt darum nicht Neuanfang, sondern Euer altes Handwerk, angewandt auf ein neues Werkstück.
Das Werkstück dazu, frei zugänglich: die Methodenlehre-Taxonomie — das eigene Fach als strukturierte Taxonomie: elf Methoden, je mit Ankerbeispielen, lateinischen Rechtsregeln und Fundstellen. Das ist M1, angewandt auf die Methodenlehre selbst.
Die Methodenschicht dieses Skripts ist nicht die einzige. Zwei reale Bundes-Projekte zeigen denselben Bedarf: FIM (Föderales Informationsmanagement, IT-Planungsrat) zerlegt Normen von Hand in Datenfelder und Leistungen — präzise, aber Handarbeit, die nicht skaliert. SPARK (BMDS, Open Source seit 2026) lässt eine „KI-gestützte digitale Rechtsdogmatik“ das Recht automatisch in kleinste Prüfbestandteile zerlegen — per LLM, also Blackbox. Dazwischen liegt der hier beschriebene Weg: jeden Normsatz deterministisch — nach festen, reproduzierbaren Regeln — in faktische, normative und dispositionale Elemente zerlegen; dieselben drei Fragen wie in Übung 5-1. „Dispositional“ meint dabei die Latenz: was eine Norm auslösen kann („Glas → kann zerbrechen“; § 223 StGB → kann ein Strafverfahren auslösen). Wissenschaftstheoretischer Hintergrund ist Carnaps Analyse der Dispositionsbegriffe — wobei schon Carnap zeigte, dass sich Dispositionen gerade nicht in einer simplen Wenn-dann-Definition erschöpfen (Testability and Meaning, 1936/37: Reduktionssätze). Genau diese Nicht-Trivialität ist der Grund, die Zerlegung als eigene Methodenschicht ernst zu nehmen.
Ein konkretes Beispiel dafür, wie M1 und M2 in heutige Werkzeuge einwandern: Moderne KI-Systeme können so eingestellt werden, dass sie zuerst einen Plan vorlegen — Vorgehen, Quellen, Prüfschritte — und erst nach menschlicher Freigabe arbeiten (etwa der „Plan-Modus“ von Claude). Das Prinzip ist alt:
| Plan-Modus = | Klassisches Pendant |
|---|---|
| Aufbau/Obersatz vor dem Ergebnis | Gutachtenstil — Prüfungsaufbau vor der Lösung |
| Methode festlegen, bevor man das Ergebnis sieht | Präregistrierung — schützt vor nachträglichem Zurechtbiegen |
| Kategorien/Schema vor der Bearbeitung | Forschungsdesign · Codebuch vor dem Codieren (= M1) |
| Vorläufige Linie offenlegen, bevor entschieden wird | der richterliche Hinweis (§ 139 ZPO) — als Analogie, nicht als Gleichsetzung |
Der Mehrwert: Die Aufsicht wandert nach vorn. Man greift am Plan ein, nicht erst am fertigen Output — die „Stopptaste“ (Kapitel 7) stromaufwärts. Und der Plan macht den geplanten Weg prüfbar, bevor ein Ergebnis existiert — statt einen fertigen Blackbox-Output nachträglich zu rationalisieren. Das ist exakt die Checklisten-Logik aus Handwerk ②: ein Gate, an dem der fähige, fehlbare Ausführende anhalten muss.
Die ehrliche Grenze gehört dazu: Auch der Plan wird probabilistisch erzeugt — das Werkzeug lädt zur Methode ein; die Strenge kommt daher, dass Ihr den Plan prüft. Ein Angebot, kein Ersatz.
Im Hörsaal wurde der Plan-Modus live gezeigt: Aufgabe an die KI — „Trägt § 823 Abs. 1 BGB als Anspruchsgrundlage in diesem Fall?“ —, Plan-Modus an. Die KI legte zuerst einen Plan vor: Vorgehen, Quellen, Prüfschritte, noch kein Ergebnis. Dann prüfte der Saal (= M2, Maßstab setzen): Stimmt der Aufbau? Fehlt ein Tatbestandsmerkmal? Ist die Quelle die richtige? Erst nach der Freigabe arbeitete das System. Die Pointe: geprüft, bevor etwas entstand — Gutachtenstil am Werkzeug.
Was in diesem Teil entstanden ist, ist keine neue Methodenlehre. Es ist die alte, explizit gemacht: Engisch wird zum Suchkreislauf, Larenz zum Codebuch, Busse zur Ontologie, Eco zur Wissensbasis. Die KI muss diese Methoden nicht lernen — sie muss das Resultat methodischer Arbeit als Struktur nutzen können. Das ist die Aufgabe Eurer Generation: der eigenen Methodenlehre eine technische Form zu geben, die Maschinen brauchen können. Was nicht übersetzt wird, sind Euer Urteil und Eure Verantwortung — die bleiben Eure Sache.
Und damit löst sich das Bild vom Anfang auf: Die Struktur, die der Experte mitbringt, IST die Karte. Ihr seid der Methodiker — die KI ist der Navigator auf Eurer Struktur.
Zum dritten und letzten Mal die Frage: Ist ein LLM ein Werkzeug für Juristen? Jetzt ist sie beantwortbar: Ja — ein Werkzeug. Aber ein geliehenes, das erst durch Eure methodische Struktur zum Fachwerkzeug wird. Damit schließt sich die Klammer aus Kapitel 2 — und die erste Frage der Einleitung („Was ist die Karte des Rechts?“) ist beantwortet. Offen ist noch die zweite: Wann darf man blind fahren — und wer haftet? Das klärt Teil III.
Wer verantwortet es? · Leitfrage 4: Prüfbarkeit
Teil III — Verantwortung: fahren mit Karte
Von „klug“ zu „geboten“: die Kompetenzpflicht des Art. 4 KI-VO, das Bindungs-Spektrum, die fünf Buchstaben der menschlichen Aufsicht — und warum die Messlücke eine Rechtslücke ist.
Bis hierher war Struktur eine gute Idee. Jetzt wechselt die Tonart: Das Recht verlangt sie — und an einer Stelle sagt es sogar wörtlich, was Ihr können müsst. Der Anker ist Art. 4 der KI-Verordnung („KI-Kompetenz“), anwendbar seit dem 2. Februar 2025 — und zwar für alle KI-Systeme, nicht nur für Hochrisiko-Systeme: Anbieter und Betreiber müssen „nach besten Kräften“ ein „ausreichendes Maß an KI-Kompetenz“ ihres Personals sicherstellen. Was KI-Kompetenz heißt, definiert Art. 3 Nr. 56: Fähigkeiten, Kenntnisse und Verständnis, um KI-Systeme sachkundig einzusetzen und sich der Chancen und Risiken bewusst zu werden. Die Bundesrechtsanwaltskammer wendet Art. 4 in ihrem KI-Leitfaden (12/2024) ausdrücklich auf Rechtsanwältinnen und Rechtsanwälte als „Betreiber“ an. Damit spricht — selten genug — eine Rechtsvorschrift eine Kompetenzpflicht direkt aus. Zur Einordnung: Es handelt sich nicht um ein deutsches Gesetz, sondern um eine EU-Verordnung — und die gilt nach Art. 288 Abs. 2 AEUV unmittelbar in jedem Mitgliedstaat, ohne dass es eines deutschen Umsetzungsakts bedürfte.
Zur Einordnung der schärferen Pflichten: Bestimmte Justiz-KI — Systeme, die Justizbehörden bei Sachverhalts- und Rechtsermittlung oder Subsumtion unterstützen — ist nach Anhang III Nr. 8 KI-VO Hochrisiko; dann greifen zusätzlich die Art. 12–15 und 26. Nicht jede juristische KI-Nutzung fällt darunter, und nicht automatisch jedes Kanzlei-Tool — aber die Wertungen dieser Vorschriften zeigen, welche Kompetenzen der Gesetzgeber für kritische Anwendungen voraussetzt.
Der Befund: Anhang III Nr. 8 KI-VO erfasst KI-Systeme, die „von einer Justizbehörde oder in deren Auftrag“ (sowie von Stellen der alternativen Streitbeilegung) eingesetzt werden. KI in der Anwaltschaft fällt nicht darunter — obwohl Rechtsanwältinnen und Rechtsanwälte als unabhängige Organe der Rechtspflege (§ 1 BRAO) dieselben Rechtsgüter berühren. Eine Begründung für diese Ausnahme lässt sich, so die Analyse von Wöbbeking im Anwaltsblatt, „weder der KI-VO noch den Materialien zum Verfahren oder zur Folgenabschätzung entnehmen“; sie wertet die Lücke als Wertungswiderspruch: Anwälte sichern „entscheidend … die Wahrnehmung wirksamer Rechtsbehelfe und individueller rechtlicher Freiheiten“ ab, und Kanzlei-KI trägt „gleichermaßen das Risiko möglicher Verzerrungen, Fehler und Undurchsichtigkeiten“ (Wöbbeking, Anwaltsblatt).
Erklärungsansätze — die folgenden zwei sind Deutungen, keine belegten Gesetzesmotive: Erstens knüpft der risikobasierte Ansatz der KI-VO erkennbar an die Ausübung hoheitlicher Gewalt an — der Staat bindet zuerst sich selbst; der Anwalt handelt demgegenüber im Parteiinteresse und unter eigener berufsrechtlicher Verantwortung. Zweitens — die These, die im Vortrag zur Diskussion gestellt wurde: Würde man der gesamten Anwaltschaft das Hochrisiko-Pflichtenprogramm auferlegen, läge darin ein erheblicher Eingriff in die Berufsausübungsfreiheit (Art. 12 Abs. 1 GG; unionsrechtlich Art. 15, 16 GRCh), der sich rechtfertigen lassen müsste. Der Preis der Regulierung wäre absehbar ungleich verteilt: Großkanzleien könnten den Compliance-Aufwand tragen, viele kleine und mittlere Kanzleien nicht — es drohte eine Zweiklassen-Anwaltschaft, und damit litte am Ende genau das, was geschützt werden soll: der gleiche Zugang zum Recht.
Die Lage ist nicht statisch: Die Kommission kann den Hochrisiko-Katalog des Anhangs III erweitern (Art. 7 KI-VO) — eine spätere Einbeziehung anwaltlicher KI-Systeme ist möglich (darauf weist auch Wöbbeking hin). Bis dahin gilt für die Anwaltschaft „nur“ Art. 4 plus Berufsrecht — und als professioneller Standard die freiwillige Orientierung an den Maßstäben des Art. 14, wie sie dieses Skript empfiehlt.
Die Regulierungslandschaft sortiert sich am besten in drei Bändern — nach Verbindlichkeit, nicht nach Bekanntheit. Hart und heute geltend: die KI-VO (Art. 4, für Hochrisiko Art. 14/15) und das Berufsrecht (§§ 43a, 43e BRAO; § 203 StGB — Kapitel 3). Hart, aber noch nicht in Kraft: die KI-Rahmenkonvention des Europarats (CETS 225, 2024) und das deutsche Durchführungsgesetz zur KI-VO (Kabinettsbeschluss Februar 2026; vorgesehen ist die Bundesnetzagentur als Aufsicht). Weich, aber einflussreich: die CEPEJ-Ethik-Charta für KI in der Justiz (Europarat 2018), die UNESCO-Empfehlung und die OECD-Grundsätze, der CCBE-Leitfaden für Anwaltschaften, der BRAK-Leitfaden — und die eigene Kanzlei-Policy. Das Bild ist ein Trichter: viele Einläufe, ein Auslauf. Alle Ebenen konvergieren auf denselben Auftrag: prüfen können.
Was „wirksame Aufsicht“ operativ heißt, steht — für das Hochrisiko-Regime — in fünf Buchstaben. Nach Art. 14 Abs. 4 KI-VO müssen die Aufsichtspersonen in der Lage sein: (a) die Fähigkeiten und Grenzen des Systems zu verstehen und seinen Betrieb zu überwachen; (b) dem „Automatisierungsbias“ zu widerstehen — der Begriff steht wörtlich im Gesetz —, also dem Sog, dem Output automatisch zu vertrauen; (c) den Output richtig zu interpretieren; (d) zu entscheiden, das System nicht zu nutzen oder es zu übersteuern; (e) einzugreifen oder den Betrieb anzuhalten — die „Stopptaste“. Adressat der Vorschrift ist der Anbieter: Er muss das System so gestalten, dass die Aufsichtspersonen dazu in die Lage versetzt werden; die Betreiberpflichten (Übertragung der Aufsicht an kompetente natürliche Personen) stehen in Art. 26 Abs. 1 und 2.
Gelesen als Liste ist das nichts anderes als eine Kompetenz-Checkliste für den Menschen — und sie deckt sich auffällig mit dem, was die Materialkunde aus Kapitel 4 nahegelegt hat: Grenzen kennen, Misstrauen kultivieren, übersteuern können. Wenn Praxis-Erfahrung und Gesetzgeber unabhängig voneinander im selben Kern landen, ist das kein Zufall — es ist die Kernkompetenz.
Buchstabe (b) verdient den Rückgriff auf Übung 4-2 (Kapitel 4): Dort habt Ihr erlebt, wie die KI eine offene Streitfrage selbstsicher und einseitig beantwortet — und die Gegenansicht erst auf Nachfrage preisgibt. Der juristische Maßstab dafür, wann eine einzige sichere Antwort überhaupt berechtigt ist, ist streng: Nach der acte-clair-Doktrin des EuGH (CILFIT, Rs. 283/81) darf ein letztinstanzliches Gericht nur dann von einer Vorlage absehen, wenn „kein vernünftiger Zweifel“ besteht — und zwar so offenkundig, dass auch die Gerichte der übrigen Mitgliedstaaten und der Gerichtshof selbst nicht zweifeln würden. Scheinsicherheit zu durchschauen ist also keine Stilfrage: Genau das verlangt Art. 14 Abs. 4 b — der Automatisierungsbias-Widerstand als Rechtsbegriff.
Warum genügt es nicht, auf bessere Tests zu warten? Michèle Finck (Tübingen 2026) hat die existierenden Mess-Instrumente für „Rechts-KI“ durchmustert — mit ernüchterndem Befund: Die verbreiteten Benchmarks messen die Hilfsarbeit (die „Paralegal“-Ebene), nicht das Kerngeschäft — Suchen, Sortieren, Klassifizieren, Examensfragen, nicht das dogmatische Argumentieren selbst. Die fortgeschrittensten Ansätze scheitern an je einer Kerneigenschaft des Rechts: an der Kontestabilität (Rechtsfragen sind ernsthaft strittig — mehrere begründete Antworten können vertretbar sein, ohne beliebig zu sein) — das ist Bruchstelle 1 des Maps-Vergleichs aus Kapitel 1, hier eingelöst — oder an der Kohärenz (eine Auslegung muss zur ganzen Rechtsordnung passen, nicht nur lokal widerspruchsfrei sein). Und fast alles ist für US-Recht und englische Sprache gebaut: EU-Recht ist derzeit schlicht nicht messbar.
Daraus zieht Finck die rechtliche Konsequenz: Art. 15 KI-VO verlangt für Hochrisiko-Systeme ein „angemessenes Maß an Genauigkeit“ — aber was Genauigkeit für ein System juristischen Argumentierens bedeutet, ist alles andere als selbstverständlich, und kein existierendes Maß erfasst es. Ohne einen Maßstab für dogmatisches Schließen bleibt die Pflicht operativ leer: Die Messlücke ist eine Rechtslücke. (Finck ist ein rechtswissenschaftliches Theorie-Papier ohne eigene Empirie — als Argument zu zitieren, nicht als Messbefund; aus Art. 15 Abs. 2 leitet sie eine konstruktive Pflicht der Kommission ab, solche Maßstäbe zu fördern.)
Damit schließt sich der Kreis zur Methodenschicht aus Kapitel 6: M2 (Maßstab setzen) adressiert die Genauigkeits-Anforderung, M4 (Spuren legen) die Dokumentations- und Prüfpflichten der Art. 12 und 13 — diese Zuordnung ist eine didaktische des Verfassers, nicht Fincks; und sie operationalisiert die Anforderungen, erfüllt sie aber nicht abschließend. Der Befund über alle Bindungsstufen hinweg bleibt derselbe: Hartes Recht, kommendes Völkerrecht, Soft Law und Berufsrecht konvergieren unabhängig voneinander auf die eigenverantwortliche, kritische Prüfung des KI-Outputs. Was das für Eure Ausbildung heißt, bündelt das letzte Kapitel.
Teil III — Verantwortung: fahren mit Karte
Fünf Brillen für die Studienzeit, das dritte Handwerk, die Synthese aus These und Antithese — und die Antwort auf beide Fragen der Einleitung.
Fünf Brillen, die Ihr ab jetzt aufsetzen könnt — je eine Frage an jedes KI-Werkzeug, das Euch begegnet: 1. Die methodische Brille: Welche alte Methode ist im Spiel — und welche neue Strukturfrage käme mit KI hinzu? 2. Die Tool-Brille: Wo wirkt Struktur, wo Brute Force — Karte oder Blindflug? Und wessen Erlösmodell bedient das Tool? 3. Die Berufs-Brille: Wer besitzt die Karte (Datenhoheit, Auditierbarkeit) — und behalte ich die Prüffähigkeit? 4. Die Regulatorik-Brille: Welche Bindungsebene ist berührt, und welche Kompetenz verlangt sie? 5. Die Skill-Brille: Was wird aus Euren Fähigkeiten? — die Frage der folgenden Synthese.
Kapitel 7 hat gezeigt: Das Gesetz verlangt KI-Kompetenz. Die gute Nachricht: Wie man Kompetenz baut, ist ebenfalls ein etabliertes Handwerk — bis hin zur Weltnorm. Fünf Bausteine:
Der Kreis zu Teil I schließt sich — als sprachliche Vignette, nicht als Argument: Der Kompetenzweg ist wörtlich ein Weg, 道 — dasselbe Zeichen wie im japanischen Wort für Werkzeug, 道具, „Gerät des Weges“. Shu habt Ihr mit diesem Skript getan: Raster anwenden. Ha ist der nächste Schritt: eigene Maßstäbe bauen. Und Ri ist die eigene Werkstatt: die Prüf-Richtlinien selbst schreiben.
These — McKinsey (Europa-Report 2026): Rund 75 % der von Arbeitgebern nachgefragten Fähigkeiten werden in Tätigkeiten eingesetzt, die teils automatisierbar, teils nicht automatisierbar sind — sie laufen auf Mensch-KI-Kollaboration hinaus, nicht auf Ersatz. Und der Report benennt die Schlüsselfähigkeit fast wörtlich wie der Kernsatz dieses Skripts: „recognizing when results may be wrong and knowing when to escalate to human review, especially for higher-stakes decisions“.
Antithese — aus dem Fach-Diskurs (Hoffmann, Debattenbeitrag): Solche Skill-Taxonomien seien „Hyper-Taylorismus“ — die Zerlegung von Können in Häppchen perpetuiere alte Kontrollillusionen; es komme auf psychologische Zustände an, nicht auf Skill-Listen. Synthese: Die Kernkompetenz ist die Beurteilungs- und Prüffähigkeit — zu erkennen, wann ein Ergebnis nicht trägt: Maßstab setzen (M2, M3), Spuren prüfen (M4). Das ist weder ein atomisierter Einzel-Skill noch ein diffuser Zustand, sondern eine lehr-, üb- und prüfbare Methode — deckungsgleich mit der Konvergenz aller Regulierungs-Ebenen aus Kapitel 7.
Und die Nachfrageseite bestätigt es: In den europäischen Stellenanzeigen 2023–25 wuchs die Zahl der Berufe, die „Critical thinking and problem solving“ verlangen, um 109, die Zahl der Berufe mit „Regulation and legal compliance“ um 118 (McKinsey, Exhibit 11 — gezählt werden Berufe mit entsprechenden Skill-Nennungen, nicht Prozente). Euer Kern wird nicht ersetzt — er wird geschützt und gefragt. Selbst das amtliche Ausbildungsgremium formuliert es so: Kritisch bewerten und methodisch einordnen werde „noch wichtiger“ — und lässt die KI-Frage offen (Kapitel 1, Exkurs). Diese Lücke schließt Ihr: Ihr werdet zum Architekten der Struktur.
Der greifbare Studien-Nutzen, bewusst mit frei zugänglichen Werkzeugen: Einstieg und Überblick — Thema umreißen, Gliederung entwerfen, Gegenpositionen sammeln lassen; schnell breit werden, dann selbst verdichten. Recherche mit freien Quellen — gesetze-im-internet.de für Normtexte, „Rechtsprechung im Internet“ und openJur für Entscheidungen, EUR-Lex für EU-Recht, Google Scholar für Literatur; die KI schlägt Suchpfade vor, Ihr verifiziert jede Fundstelle im Original. Der Prüf-Reflex aus Kapitel 4: Jede von der KI genannte Norm oder Entscheidung im Original nachschlagen — citation ist nicht proposition; nichts zitieren, was Ihr nicht selbst gesehen habt. Die Struktur aus Kapitel 6: Erst den Plan verlangen (Vorgehen, Quellen, Prüfschritte), dann die Ausführung — Ihr seid der Architekt, die KI der Navigator. Und ehrlich bleiben: Eigenständigkeits- und Zitierregeln der Prüfungsordnung beachten, KI-Nutzung transparent machen.
Drei fertige Werkstücke zum Mitnehmen, alle frei zugänglich: die Methodenlehre-Taxonomie (Nachschlagewerk mit Ankerbeispielen und Fundstellen), die Gesetzesanalyse-Strukturtaxonomie (Struktur-Taxonomie mit Legaldefinitionen-Suche) und das Struktur-Labor BGB & StGB (die Karte zweier Gesetze zum Selbst-Erkunden, § für §) — direkt nutzbar für die Seminararbeit.
Warum lohnt die Struktur-Arbeit, selbst wenn das einzelne Modell verschwindet? Weil Strukturen modell-unabhängig sind: Aus unstrukturierten Daten werden strukturierte Daten-Bestände — und damit Datenautonomie. Modelle wechseln; die Struktur-Schicht bleibt. Eure Methoden-Kompetenz ist generationenunabhängig — was nach dem LLM kommt, skizziert der folgende Exkurs.
Zwei Forschungsrichtungen zeichnen sich ab. Neurosymbolische / hybride KI kombiniert neuronales Lernen mit symbolischem Wissen — Regeln, Wissensgraphen, Ontologien (Garcez/Lamb sprechen von der „dritten Welle“; für das Recht zählt vor allem die Erklärbarkeit). Diese Richtung braucht die kuratierte Struktur-Schicht definitorisch — sie ist ihr symbolischer Teil. Weltmodelle (Ha/Schmidhuber 2018; LeCuns JEPA 2022; DreamerV3 2023) lernen ein inneres Modell ihrer Umgebung statt bloßer Wortstatistik — eine zweite Richtung jenseits des reinen LLM; ob sie kuratierte Wissensschichten nutzen werden, ist offen. Für das Recht spricht der Erklärbarkeits- und Auditierbarkeitsbedarf jedenfalls für den hybriden Weg — und damit für genau die Struktur-Arbeit dieses Skripts. Keine dieser Richtungen ist als Rechts-Anwendung belegt; beide sind als Richtung zu nennen, nicht als Versprechen.
Eine letzte Zahl, die Euch direkt betrifft — aus den Länder-Dashboards des McKinsey-Reports, mit offener Methodik-Flagge: Gemessen wird der Anteil der Beschäftigten der Berufsgruppe „Legal“, die in Berufen arbeiten, für die KI-Kenntnisse in mindestens 5 % der Stellenanzeigen verlangt werden — also Arbeitgeber-Nachfrage, nicht tatsächliche Nutzung, und bei kleinen Grundgesamtheiten grob. Der Kontrast ist dennoch real: Dänemark 86 % der Legal-Beschäftigten — Deutschland 1 % (rund 620 Personen). Zugleich verzeichnet Deutschland den stärksten Anstieg der Nachfrage nach „Regulation and legal compliance“ überhaupt (Rang 1 im Skill-Zuwachs) — allerdings überwiegend in Nicht-Juristen-Berufen. Nachholdruck und Gestaltungsraum zugleich: Das First-Mover-Fenster ist offen — und genau hier setzt die Methodenfrage dieses Skripts an.
Zurück zum Anfang — beide Fragen der Einleitung, jetzt mit Antwort. „Was ist die Karte des Rechts?“ Es gibt sie nicht fertig zu kaufen. Sie besteht aus der explizit gemachten Struktur des Rechts — Ebenen, Typen, Marker, Wertungsstellen (NT × SF × EK, Kapitel 5) — und der Methodenschicht darauf (V1/V2, M1–M4, Kapitel 6). Gebaut wird sie nicht vom Markt (Kapitel 3), sondern von der Fachseite: von Euch.
„Wann darf man blind fahren — und wer haftet?“ Blind fahren: nie. Die Pflichtenlage aus Kapitel 7 — Grenzen verstehen, dem Automatisierungsbias widerstehen, übersteuern und anhalten können — ist das Gegenteil des Blindflugs; und die Verschwiegenheit setzt der Datenweitergabe harte Grenzen (Kapitel 3). Und haften? Die Verantwortung bleibt bei dem, der das Werkzeug führt: beim Juristen. Sie ist nicht delegierbar — nicht an ein Tool, nicht an einen „Agenten“, egal wie die Technik sich nennt (Kapitel 2).
Ja — gerade weil die Methode der Kern bleibt. Eure Kernkompetenz — beurteilen, prüfen — ist geschützt und vom Recht gefordert (Art. 4 KI-VO). Die Werkzeuge werden kommen und gehen; die Struktur, die sie brauchen, und das Urteil, das sie nicht ersetzen, bleiben Eure.
Das Schlussbild dieses Skripts, in einem Satz: Ihr seid der Architekt der Struktur — die KI ist nur der Navigator darauf.
Anhang
Typischer Verlauf: Runde 1 (aus dem „Gedächtnis“ des Modells) liefert eine flüssige, plausibel aussehende Liste — in der regelmäßig beides steckt: Erfundenes (Definitionen, die im Gesetz nicht stehen oder dem falschen Paragraphen zugeordnet sind) und Übersehenes (echte Legaldefinitionen, die fehlen — häufig die unscheinbaren, etwa § 90 BGB („Sachen … sind nur körperliche Gegenstände“) oder § 121 Abs. 1 BGB („unverzüglich“)). Runde 2 (am echten Text) ist deutlich besser — aber auch sie garantiert keine Vollständigkeit.
Die zwei Lehren: Erstens: „Alle“ kann ein Sprachmodell aus sich heraus nicht garantieren — Vollständigkeit braucht eine kuratierte, strukturierte Quelle (genau das leistet die Entitäten-Basis aus Kapitel 5; als Referenzliste: Gesetzesanalyse-Viewer). Zweitens: Schon die Frage, was überhaupt als Legaldefinition zählt, ist eine Strukturfrage — erkennbar an Markern wie „ist“, „im Sinne dieses Gesetzes“, „gilt als“ (Abschnitt 5.3). Das ist M1 (Strukturieren) zum Anfassen.
Aha 1 — Überkonfidenz: Die erste Antwort kommt fast immer selbstsicher und einseitig — obwohl die Frage offen ist. Aha 2 — verschwiegener Streit: Erst auf Nachfrage taucht die Gegenansicht auf. Sie war die ganze Zeit „da“ — im Modell verfügbar, aber nicht gekennzeichnet. Das ist exakt Fincks Fehlertyp Nr. 16 („Failure to flag contestation“ — Meinungsstreit wird nicht gekennzeichnet); die notorische Überkonfidenz der Modelle benennt Finck dabei ausdrücklich mit — und in der Sache ist es „viele Wege nach Rom“ (Kapitel 1, Bruchstelle 1) in der Praxis: Mehrere vertretbare Antworten sind im Recht normal; die Scheinsicherheit ist der Fehler. Der rechtliche Maßstab — acte clair und Art. 14 Abs. 4 b KI-VO — steht in Kapitel 7 (Rn. 86).
| ① Faktisch — was muss vorliegen? | ② Normativ — wo wird gewertet? | ③ Dispositional — was kann die Norm auslösen? |
|---|---|---|
| Verletzung eines der genannten Rechtsgüter (Leben, Körper, Gesundheit, Freiheit, Eigentum) · eine zurechenbare Verletzungshandlung · Kausalität zwischen Handlung und Verletzung | „widerrechtlich“ (Rechtfertigungsebene) · „vorsätzlich oder fahrlässig“ (Verschulden — die Fahrlässigkeit verlangt ein Werturteil über die im Verkehr erforderliche Sorgfalt) · „sonstiges Recht“ (wertungsoffene Erweiterung des Rechtsgüterkatalogs) | „ist … zum Ersatz des daraus entstehenden Schadens verpflichtet“ — die Norm kann einen Schadensersatzanspruch auslösen; ob sie es tut, entscheidet erst der subsumierte Fall |
Die Pointe der Alien-Kontrollfrage: Der Inhalt einer einzelnen Fallentscheidung („Schläge sind verboten“) überträgt sich nicht auf den nächsten Fall — die Bauform überträgt sich. Wer die drei Spalten füllen kann, besitzt genau das, was einer Maschine explizit gegeben werden müsste: die Struktur, die sie von allein nicht findet (vgl. Kapitel 4).
Die vollständigen Typsysteme aus Abschnitt 5.3. Der Split deontisch/konstitutiv entspricht der LegalRuleML-Unterscheidung prescriptive/constitutive und dogmatisch den Regelungsnormen gegenüber den unvollständigen Rechtssätzen (Larenz/Canaris).
| Deontisch (Regelungsnormen) | Konstitutiv / strukturell (unvollständige Rechtssätze) |
|---|---|
| NT-01 Gebot · NT-02 Verbot · NT-03 Erlaubnis · NT-04 Ermächtigung · NT-05 Anspruch | NT-06 Legaldefinition · NT-07 Verweisung · NT-08 Einschränkung · NT-09 Ergänzung · NT-10 Rechtsfolgenbestimmung · NT-11 Verfahren · NT-12 Bestand · NT-13 Grundrecht · NT-14 Staatsorganisation · NT-15 Katalog · NT-16 Kriterien · NT-17 Erläuterung |
Dazu die Auffangklasse NT-NEW für noch nicht klassifizierte Fälle (deshalb zählt der Gesetzesanalyse-Viewer 18). Herkunft: 14 Typen aus der Larenz/Canaris-Tradition, drei empirisch aus der Regulierungspraxis gewonnen (Katalog-, Kriterien-, Erläuterungsnorm).
Hauptregel · Konkretisierung · Ausnahme · Verweisung · Begriffsklärung · Rechtsfolge · Qualifikation
Tatbestandsmerkmal · Rechtsfolge · Strukturbegriff · Akteur · Rechtsverhältnis · Schutzgegenstand · Verfahrenshandlung · Zeitstruktur · Modalität (dazu die Sonderklasse EK-HIST für historische Bestände — deshalb zählt der Viewer 10)
Dieses Skript dokumentiert Teil 2 der vierteiligen Reihe „KI in der juristischen Praxis“ an der Universität Potsdam (Sommer 2026): das Werkzeug (Teil 1, F. Weiher, 19.6.) → die Methode und die Kompetenz (dieser Teil, 26.6.) → die Anwendung (T. Brägelmann, 26.6. nachmittags) → Anschluss und Ausblick (Teil 4, 3.7.). An die Vorlesung schloss am 10. Juli eine Werkstatt an, in der die Teilnehmenden eigene Prüf-Richtlinien entwickelten — der „Ri“-Schritt aus Handwerk ③.
Als Diskurs-Anker für die Weiterarbeit: die Potsdamer Forderung nach einer „neuen Methodenlehre für KI-basierte Rechtsprüfungen“ (Steinrötter), Fincks „Measurement Gap“ — und als Gegen- wie Schlussstimme Chien (UC Berkeley): „thinking remains the sine qua non of good lawyering.“
Das Skript wurde aus dem Foliensatz (98 Folien) und den Vortragstexten der Vorlesung erstellt; die empirischen Kernzahlen (ALE, GradeLegal, Stanford, McKinsey) und die zentralen Fundstellen (Möllers, BVerfGE) wurden für diese Fassung am jeweiligen Volltext nachgeprüft. Rückmeldungen gern über das im Kopf verlinkte Profil.