Construct-Methodik

Eine plausible Antwort beweist noch kein zuverlässiges Verhalten.

Wir prüfen KI im tatsächlichen Nutzungskontext: mit einer konkreten Aufgabe, Umgebung, Nutzergruppe, Vorgeschichte und klaren Grenzen für Entscheidungen.

Methodik

Sechs Aspekte, die wir in jeder Prüfung untersuchen.

01

Messen wir wirklich die behauptete Fähigkeit? (Konstruktvalidität)

Prüfen Aufgaben und Rubriken tatsächlich die behauptete Fähigkeit statt eines leicht messbaren Ersatzwerts?

02

Zuverlässigkeit und Konsistenz

Wiederholte Tests zeigen die Verteilung, die Streuung und zufällige Schwankungen – nicht nur einen günstigen Lauf.

03

Faire Vergleichbarkeit zwischen Gruppen (Messinvarianz/DIF)

Vergleiche über Sprachen, Gruppen oder Kontexte benötigen äquivalente Fälle. Ein DIF-Signal ist ein Prüfhinweis, kein automatischer Diskriminierungsnachweis.

04

Kontextsensitivität

Relevanter Kontext sollte zu nachvollziehbaren Veränderungen führen; irrelevante Formulierungen sollten Entscheidungen nicht systematisch verschieben.

05

Gedächtnis und Anpassung

Kontinuität, Korrekturfähigkeit und Pfadabhängigkeit werden über mehrere Interaktionen geprüft.

06

Fachlicher Referenzabgleich

Theorie, Daten sowie fachlich erarbeitete Bewertungsraster oder ein Delphi-Verfahren begrenzen die Interpretation; Uneinigkeit bleibt sichtbar.

Vorgehen

10 kontrollierte Schritte.

01

Testanfrage

Wir grenzen ein lauffähiges System, eine konkrete Entscheidung und den kleinsten sinnvoll prüfbaren Umfang ab.

02

Kurzgespräch

Verwendungszweck, Frist, Verantwortliche, Fälle und Testablauf werden bestätigt.

03

NDA, DPA und Auftrag

Umfang, Preis, Umsatzsteuer, Zugang, Datenrollen und Zeitplan werden schriftlich vereinbart.

04

Evidenzprotokoll

Version, Umgebung, Konstrukt, Populationen, Kriterien und ausgeschlossene Schlussfolgerungen werden dokumentiert.

05

Fälle und Referenzen

Repräsentative, grenzwertige und gezielt schwierige Fälle werden mit Bewertungskriterien verknüpft.

06

Ausgangsmessung

Testprogramm, Konfiguration und Evidenzerfassung werden versioniert; die Tests werden unter denselben Bedingungen wiederholt.

07

Belastungstest

Werkzeuge, Sprache, Gruppen, Ressourcen, Reihenfolge, Gedächtnis und Feedback werden gezielt variiert.

08

Befunde

Jeder Befund enthält Bedingung, Reproduktion, Schwere, Unsicherheit und nächste Maßnahme.

09

Korrektur und erneuter Test

Sofern vereinbart, werden gezielte Änderungen vorgenommen und alle Tests wiederholt.

10

Übergabe

Testprotokoll, Evidenzbericht, Aussagegrenzen und Empfehlung zur nächsten Entscheidung werden gemeinsam geprüft.

Agentenbasierte Modellierung (ABM)

Akteur · Interaktion · Umwelt · Zeit

Wir prüfen KI im tatsächlichen Nutzungskontext: mit einer konkreten Aufgabe, Umgebung, Nutzergruppe, Vorgeschichte und klaren Grenzen für Entscheidungen.

KontextPopulation · Umwelt · AufgabeAkteurModell · Regeln · GedächtnisInteraktionFeedback · KonfliktAnpassungLernen · VerlaufBewertungTheorie · Fachleute · Metriken

Was die Evidenz stützen kann

  • Beobachtung in einer definierten Version und Umgebung
  • Reproduzierbare Fehler
  • Unterschiede zwischen vereinbarten Bedingungen
  • Erfüllung vereinbarter Kriterien
  • Entscheidungsrelevante Unsicherheit

Was die Evidenz nicht belegt

  • Gleichsetzung synthetischer und realer Menschen
  • Psychologische oder pädagogische Diagnose
  • Vollständige Vorhersage menschlichen Verhaltens
  • Zertifizierung oder Rechtskonformität
  • Ausschluss aller künftigen Fehler

Machen Sie aus einer behaupteten Fähigkeit ein reproduzierbares Prüfprotokoll.

Test anfragen