Qualitätskontrolle für Rechts-KI: Die Rolle des Benchmarkings

Wie praxisnahe Benchmarks die Qualität von Legal AI messbar machen

Stellen Sie sich vor, Sie kaufen ein neues Auto. Der Autoverkäufer versichert Ihnen: "Dieses Modell ist absolut sicher." Würden Sie das einfach so glauben? Wahrscheinlich nicht. Sie würden nach konkreten Beweisen fragen: Wie hat das Auto bei den Euro-NCAP-Crashtests abgeschnitten? Welche Sicherheitssysteme sind eingebaut? Gibt es unabhängige Testergebnisse?

Gleiches gilt für Legal AI. Viele Anbieter versprechen "höchst präzise juristische Antworten" oder "KI auf Anwaltsniveau". Aber wie lässt sich das objektiv überprüfen? Wie stellen Sie sicher, dass eine KI nicht einfach nur eloquent formuliert, sondern auch juristisch präzise arbeitet?

Die Antwort liegt in Benchmarks. Das sind standardisierte Tests, die messbar machen, was sonst nur subjektiv bewertbar wäre. Genauso wie Prüfstellen die Verkehrssicherheit eines Autos testen, bewerten Benchmarks die juristische Qualität von KI-Systemen. Sie zeigen auf, ob Quellen stimmen, Gerichtsentscheide aktuell sind und Argumentationen kohärent formuliert werden.

Das Problem: Die meisten heutigen KI-Benchmarks funktionieren nach einem einfachen Prinzip – Multiple-Choice-Fragen, standardisierte Tests, messbare Scores. Für die juristische Arbeit ist das jedoch grundlegend unzureichend. Ein Anwalt beantwortet im Alltag keine Multiple-Choice-Fragen. Er analysiert komplexe Verträge, bewertet Gerichtsentscheide im Kontext unterschiedlicher Meinungen, baut schlüssige Argumentationen auf und entwirft präzise Schriftsätze.

Dieser Artikel zeigt, warum gängige Testszenarien zur Bewertung von Legal AI ungenügend sind, was juristische Intelligenz wirklich bedeutet und wie spezialisierte Legal-AI-Systeme durch praxisnahe Benchmark-Verfahren kontinuierlich an den Massstäben echter Volljuristen gemessen und optimiert werden. 



Warum klassische Tests die juristische Intelligenz nicht messen

In der juristischen Ausbildung gelten standardisierte Prüfungen als Massstab für Kompetenz. Dieses Modell mag für akademische Lernziele funktionieren, für die Qualitätsmessung von Legal AI greift es jedoch zu kurz.

Der Grund: Standardisierte Tests messen vor allem Mustererkennung und systematische Ausschlussverfahren. Das sind genau die Fähigkeiten, in denen Sprachmodelle naturgemäss glänzen. Sie können riesige Datenmengen analysieren, Muster erkennen und statistisch wahrscheinliche Antworten generieren.

Die juristische Arbeit in der Praxis sieht völlig anders aus. Stellen Sie sich ein realistisches Szenario vor: Ein Anwalt muss bewerten, ob eine Kündigungsschutzklage Aussicht auf Erfolg hat. Dafür braucht es:


  • Die Analyse des konkreten Sachverhalts und das Identifizieren der Rechtsfragen 

  • Die Recherche der relevanten Normen (z. B. im Kündigungsschutzgesetz, Betriebsverfassungsgesetz, in Tarifverträgen) und deren Verständnis im Kontext 

  • Die Berücksichtigung der aktuellen Rechtsprechung des Bundesarbeitsgerichts zu betriebsbedingten Kündigungen 

  • Die Abwägung von Literaturmeinungen und die Unterscheidung zwischen herrschender Lehre und Mindermeinungen 

  • Die Einordnung instanzgerichtlicher Rechtsprechung im Vergleich zur höchstrichterlichen Linie 

  • Das transparent Machen von Unsicherheiten und Auslegungsspielräumen 

  • Das Abgeben einer ausgewogenen Einschätzung mit kohärenter Begründung 

Ein System, das eine Multiple-Choice-Frage richtig beantwortet, beweist nichts über seine Fähigkeit, diese Anforderungen zu erfüllen. In der juristischen Praxis ist Präzision essenziell. Ein falsches Aktenzeichen, veraltete Urteile, eine ungenaue Formulierung – solch kleine Fehler können gravierende Folgen haben. 



Fünf Dimensionen echter juristischer Leistungsfähigkeit

Was macht also juristische Intelligenz wirklich aus? Die Erfahrung zeigt: Es geht um ein mehrdimensionales Verständnis, das weit über reines Faktenwissen hinausgeht. Letztlich lässt sich dies zwar nur im jeweiligen Kontext bewerten, doch bestimmte Komponenten sind in den meisten Fällen relevante Faktoren. 


1. Präzision bei Quellen und Zitaten

Juristische Kommunikation folgt strengen Konventionen – das ist kein Formalismus, sondern Voraussetzung für Nachvollziehbarkeit. Ein System, das schreibt "das Bundesgericht hat hierzu entschieden", liefert keine brauchbare Information. Präzision bedeutet: vollständiges Zitat, korrektes Aktenzeichen, Unterscheidung, ob es sich um einen Leitentscheid oder eine neuere Praxisänderung handelt. 


2. Kontextuelles Verständnis der Rechtslage

Rechtsnormen stehen nie isoliert da. Ein OR-Artikel muss im Zusammenspiel mit Gerichtsentscheiden, Kommentarliteratur und Materialien verstanden werden. Ein intelligentes System erkennt: Welche Quelle hat welches Gewicht? Welche Kommentarstellungnahme repräsentiert die herrschende Lehre? Wie hat sich die Rechtsprechung entwickelt? 


3. Argumentation und Kohärenz

Die juristische Arbeit besteht zu einem grossen Teil aus dem Aufbau überzeugender Begründungen. Das ist mehr als das Aneinanderreihen von Rechtssätzen. Es erfordert das Entwickeln eines roten Fadens, das Vorwegnehmen von Gegenargumenten, das Herstellen dogmatischer Bezüge und die nachvollziehbare Begründung des Ergebnisses. 


4. Differenzierungsfähigkeit

Juristische Sachverhalte sind selten eindeutig. Oft entscheiden Nuancen: Wurde die Frist eingehalten oder nicht? Liegt ein Werkvertrag oder ein Auftrag vor? Ein kompetentes System muss in der Lage sein, diese Differenzierungen vorzunehmen und transparent zu machen, wo Auslegungsspielräume bestehen. 


5. Ehrliche Selbstreflexion

Ein juristisch kompetentes System kennt seine Grenzen. Es erkennt, wenn für eine verlässliche Aussage weitere Informationen nötig sind, die Rechtslage lückenhaft ist oder konkurrierende Ansichten existieren. Diese Offenheit über die Grenzen des eigenen Wissens ist keine Schwäche, sondern Professionalität. 



Wie professionelle Legal-AI-Benchmarks funktionieren

Moderne Benchmarking-Ansätze wie LEXam basieren auf umfangreichen Sammlungen von juristischen Prüfungsfragen in verschiedenen Sprachen, einschliesslich Deutsch, mit expliziten Anweisungen für den erwarteten juristischen Argumentationsstil. Aber echte Benchmarks gehen weiter: Sie entstehen nicht aus akademischen Prüfungen, sondern aus der realen Arbeitssituation.

Der Ausgangspunkt sind konkrete juristische Fragestellungen aus der Praxis – keine theoretischen Lehrbuchfälle. Die Analyse einer Vertragsklausel. Die Bewertung einer arbeitsrechtlichen Kündigungsfrage. Die Einordnung aktueller Bundesgerichtsurteile. Zu jeder dieser Aufgaben wird eine Musterantwort erstellt – nicht von der KI, sondern von erfahrenen Volljuristen.

Diese Musterantworten repräsentieren den Qualitätsstandard, den ein kompetenter Jurist liefern würde. Sie sind präzise formuliert, lückenlos mit Quellen belegt, berücksichtigen relevante Rechtsprechung sowie Literatur und wägen differenziert ab. Wo Unsicherheit herrscht, wird dies explizit benannt. Wo unterschiedliche Meinungen existieren, werden diese dargestellt. Die Musterantworten basieren auf hochwertigen Fachinhalten, beispielsweise von beck-online, und stellen sicher, dass der Benchmark den aktuellen Stand der juristischen Diskussion auf höchstem Niveau widerspiegelt.

Nun folgt das eigentliche Benchmarking: Die Legal AI erhält dieselbe Frage und generiert ihre Antwort. Diese wird systematisch mit der Musterantwort verglichen – nicht auf wortwörtliche Übereinstimmung, sondern auf inhaltliche Qualität entlang der fünf genannten Dimensionen. Sind die Quellen korrekt und aktuell? Ist die Argumentation schlüssig? Werden relevante Aspekte berücksichtigt? Ist die Abwägung ausgewogen? Wird Unsicherheit kommuniziert, wo sie besteht?

Dieser Vergleich zeigt präzise auf, wo die Stärken und Schwächen des Systems liegen.

 


Iteratives Training: Von der Theorie zur juristischen Exzellenz

Der entscheidende Unterschied zwischen einem generischen Sprachmodell und einer spezialisierten Legal AI liegt im Training, den Daten und der kontinuierlichen Optimierung.

Juristische Kompetenz entsteht durch gezieltes Training auf hochwertigen Fachinhalten und kontinuierliche Feinabstimmung an praxisnahen Benchmarks. Jede Abweichung zwischen KI-Antwort und der Musterantwort des Volljuristen ist eine Lernchance:


  • Hat das System eine wichtige Norm übersehen? Dann muss die Recherchekomponente nachjustiert werden. 

  • Wurden veraltete Urteile zitiert? Dann braucht es bessere Mechanismen zur Bewertung der Aktualität. 

  • Wurde zu pauschal argumentiert, wo eine Differenzierung nötig gewesen wäre? Dann muss die Argumentationslogik verfeinert werden. 

  • Wurden Unsicherheiten weggelächelt, statt sie zu kommunizieren? Dann muss die Ehrlichkeit des Systems gestärkt werden. 

Dieser iterative Prozess ist anspruchsvoll. Er erfordert nicht nur technisches Know-how, sondern vor allem juristische Expertise. Wer Legal AI auf diesem Niveau entwickeln will, braucht Volljuristen, die verstehen, was juristische Qualität bedeutet, und die bereit sind, diese Standards konsequent anzulegen. Es braucht Zugriff auf hochwertige, kontinuierlich gepflegte Fachinhalte. Und es braucht die Bereitschaft, das System immer wieder an diesen Massstäben zu testen und zu optimieren.

Das Ergebnis ist eine Legal AI, die nicht nur eloquent formuliert, sondern juristisch verlässlich arbeitet. Eine Legal AI, die nachprüfbare Quellen liefert und das Risiko von Halluzinationen technisch so weit wie möglich minimiert. Eine Legal AI, die nicht pauschalisiert, sondern differenziert. Die nicht vorgibt, alles zu wissen, sondern ehrlich kommuniziert, wo Unsicherheiten bestehen. 




Worauf Sie bei der Auswahl von Legal AI achten sollten

Wenn Sie Legal AI in Ihrer Kanzlei oder Rechtsabteilung einsetzen möchten, vertrauen Sie nicht nur auf Marketingversprechen. Stellen Sie konkrete Fragen: 

Qualitätssicherung:

  • Wie wird die juristische Qualität gemessen? Gibt es dokumentierte Benchmarks? 

  • Wurden die Benchmarks von Volljuristen entwickelt oder basieren sie auf generischen Tests? 

  • Wie oft wird das System mit neuen Benchmarks getestet? 

Datenqualität:

  • Auf welche juristischen Quellen greift das System zurück? Sind diese aktuell und vollständig? 

  • Wie wird sichergestellt, dass Rechtsprechung und Literatur auf dem neuesten Stand sind? 

  • Wird zwischen verschiedenen Meinungen (herrschende Lehre vs. Mindermeinung) differenziert? 

Transparenz:

  • Werden Quellen mit vollständigen Zitaten belegt?

  • Macht das System transparent, wo juristische Unsicherheiten bestehen?

  • Kann das System zugeben, wenn es eine Frage nicht sicher beantworten kann? 

KI-Training:

  • Wird das System kontinuierlich von Juristen trainiert und optimiert? 

  • Gibt es einen iterativen Verbesserungsprozess auf Basis von Expertenfeedback? 

  • Wie wird verhindert, dass das System halluziniert oder veraltete Informationen liefert? 

Ein Anbieter, der diese Fragen nicht oder nur ausweichend beantworten kann, sollte kritisch betrachtet werden. Professionelle Legal AI zeichnet sich durch Transparenz über ihre Methoden und Grenzen aus. 



Wie Sie Legal AI selbst testen können

Sie müssen sich nicht blind auf die Angaben der Anbieter verlassen. Mit einem strukturierten Testverfahren können Sie die juristische Qualität einer Legal AI selbst bewerten. So gehen Sie vor: 


1. Rechtsgebiet definieren

Wählen Sie ein Rechtsgebiet, in dem Sie täglich arbeiten. Das kann Arbeitsrecht, Gesellschaftsrecht, Vertragsrecht oder ein anderes Spezialgebiet sein. Je besser Sie das Gebiet kennen, desto präziser können Sie die Qualität der KI-Antworten beurteilen. 


2. Realistische Aufgaben formulieren

Entwickeln Sie konkrete Fragen, die Ihrer täglichen Praxis entsprechen. Keine theoretischen Lehrbuchfälle, sondern praxisnahe Szenarien, wie zum Beispiel:

  • Die Beurteilung einer Kündigungsschutzklage

  • Die Prüfung einer Vertragsklausel auf AGB-Konformität

  • Die Einordnung eines aktuellen Bundesgerichtsurteils

  • Die Prüfung von Verjährungsfristen in einem komplexen Sachverhalt 


3. Einen Fragensatz erstellen

Stellen Sie 15 bis 20 Fragen zusammen. Das klingt wenig, reicht aber völlig aus, um systematische Stärken und Schwächen zu identifizieren. Wichtig: Erstellen Sie zu jeder Frage selbst eine Musterantwort oder lassen Sie diese von einem erfahrenen Kollegen erstellen. Diese Musterantworten sind Ihr Qualitätsmassstab. 

Hängen Sie nach Möglichkeit relevante Dokumente (Verträge, Schriftsätze, Urteile) an, um zu testen, wie die KI mit kontextbezogenen Aufgaben umgeht. 


4. KI-Antworten generieren

Geben Sie jede Frage in die Legal AI ein und dokumentieren Sie die Antworten lückenlos. Achten Sie dabei auf Folgendes:

  • Wie schnell liegt die Antwort vor?

  • Werden Quellen vollständig angegeben?

  • Wie fundiert ist die Begründung? 


5. Bewertungsmatrix festlegen

Definieren Sie klare Kriterien für die Bewertung. Eine einfache Skala könnte so aussehen:

1 = Unbrauchbar (falsche Quellen, ungenaue oder irreführende Antwort)

2 = Unzureichend (Quellen fehlen teilweise, wichtige Aspekte übersehen)

3 = Genügend (im Kern korrekt, aber ohne Tiefe oder mit kleineren Mängeln)

4 = Gut (präzise, gut begründet, mit vollständigen Quellen)

5 = Hervorragend (auf dem Niveau eines Volljuristen, differenziert, mit Berücksichtigung von Lehre und Rechtsprechung)

Alternativ können Sie eine binäre Skala (gut/schlecht) nutzen oder jede der fünf Dimensionen (Präzision, Kontextverständnis, Argumentation, Differenzierung, Selbstreflexion) einzeln bewerten. 


6. Ergebnisse dokumentieren und vergleichen

Halten Sie alle Ergebnisse systematisch fest, am besten in einer Tabelle mit Datum, Frage, KI-Antwort, Ihrer Bewertung und Anmerkungen. Nur so können Sie:

  • Die Leistung verschiedener Legal-AI-Systeme vergleichen

  • Verbesserungen über die Zeit hinweg verfolgen (wenn der Anbieter Updates einspielt)

  • Intern dokumentieren, für welche Aufgaben die KI geeignet ist und wo menschliche Expertise unverzichtbar bleibt 


7. Kritische Kontrollpunkte

Achten Sie bei Ihrer Bewertung besonders auf folgende Warnsignale:

  • Halluzinationen: Erfindet die KI Zitate oder Urteile?

  • Überholte Rechtsprechung: Werden veraltete Quellen zitiert, obwohl es eine neuere Rechtsprechung gibt?

  • Mangelnde Differenzierung: Werden Antworten verallgemeinert, wo Nuancen entscheidend sind?

  • Sicherheit vortäuschen: Stellt die KI umstrittene Rechtsfragen als eindeutig geklärt dar?

  • Unvollständige Quellen: Fehlen Aktenzeichen, Fundstellen oder Daten? 



Fazit: Legal-AI-Qualität ist messbar – wenn man richtig misst

Benchmarks für Legal AI sind das Fundament für das Vertrauen in ein Werkzeug, das zunehmend Einzug in die juristische Arbeit hält. Doch nicht jeder Benchmark ist gleich wertvoll. Nur praxisnahe, von Volljuristen entwickelte Tests, die die fünf Dimensionen rechtlicher Intelligenz abbilden, können wirklich messen, ob eine KI auf juristischem Niveau arbeitet.

Für Kanzleien und Rechtsabteilungen bedeutet das: Verlassen Sie sich nicht auf Marketingversprechen. Fordern Sie Transparenz bezüglich der Benchmark-Methoden. Testen Sie selbst. Und setzen Sie nur auf Legal AI, die nachweislich juristisch verlässlich arbeitet. 


 

Maximilian Detken

Inhaltsverzeichnis

Alle Rechte vorbehalten Noxtua AG ©

Alle Rechte vorbehalten Noxtua AG ©