Messen wir wirklich die behauptete Fähigkeit? (Konstruktvalidität)
Prüfen Aufgaben und Rubriken tatsächlich die behauptete Fähigkeit statt eines leicht messbaren Ersatzwerts?
Construct-Methodik
Wir prüfen KI im tatsächlichen Nutzungskontext: mit einer konkreten Aufgabe, Umgebung, Nutzergruppe, Vorgeschichte und klaren Grenzen für Entscheidungen.
Methodik
Prüfen Aufgaben und Rubriken tatsächlich die behauptete Fähigkeit statt eines leicht messbaren Ersatzwerts?
Wiederholte Tests zeigen die Verteilung, die Streuung und zufällige Schwankungen – nicht nur einen günstigen Lauf.
Vergleiche über Sprachen, Gruppen oder Kontexte benötigen äquivalente Fälle. Ein DIF-Signal ist ein Prüfhinweis, kein automatischer Diskriminierungsnachweis.
Relevanter Kontext sollte zu nachvollziehbaren Veränderungen führen; irrelevante Formulierungen sollten Entscheidungen nicht systematisch verschieben.
Kontinuität, Korrekturfähigkeit und Pfadabhängigkeit werden über mehrere Interaktionen geprüft.
Theorie, Daten sowie fachlich erarbeitete Bewertungsraster oder ein Delphi-Verfahren begrenzen die Interpretation; Uneinigkeit bleibt sichtbar.
Vorgehen
Wir grenzen ein lauffähiges System, eine konkrete Entscheidung und den kleinsten sinnvoll prüfbaren Umfang ab.
Verwendungszweck, Frist, Verantwortliche, Fälle und Testablauf werden bestätigt.
Umfang, Preis, Umsatzsteuer, Zugang, Datenrollen und Zeitplan werden schriftlich vereinbart.
Version, Umgebung, Konstrukt, Populationen, Kriterien und ausgeschlossene Schlussfolgerungen werden dokumentiert.
Repräsentative, grenzwertige und gezielt schwierige Fälle werden mit Bewertungskriterien verknüpft.
Testprogramm, Konfiguration und Evidenzerfassung werden versioniert; die Tests werden unter denselben Bedingungen wiederholt.
Werkzeuge, Sprache, Gruppen, Ressourcen, Reihenfolge, Gedächtnis und Feedback werden gezielt variiert.
Jeder Befund enthält Bedingung, Reproduktion, Schwere, Unsicherheit und nächste Maßnahme.
Sofern vereinbart, werden gezielte Änderungen vorgenommen und alle Tests wiederholt.
Testprotokoll, Evidenzbericht, Aussagegrenzen und Empfehlung zur nächsten Entscheidung werden gemeinsam geprüft.
Agentenbasierte Modellierung (ABM)
Wir prüfen KI im tatsächlichen Nutzungskontext: mit einer konkreten Aufgabe, Umgebung, Nutzergruppe, Vorgeschichte und klaren Grenzen für Entscheidungen.