Construct-Methodik

Eine plausible Antwort ist noch kein valides Verhalten.

Wir bewerten KI als situiertes System: ein Modell handelt in einer Aufgabe, Umwelt, Population, Interaktionsgeschichte und klaren Entscheidungsgrenze.

Methodik

Was soll stabil bleiben – und was soll sich bei relevantem Kontext nachvollziehbar verändern?

01

Konstruktvalidität

Prüfen Aufgaben und Rubriken tatsächlich die behauptete Fähigkeit statt eines bequemen Proxys?

02

Reliabilität und Konsistenz

Wiederholungen zeigen Verteilung, Streuung und stochastische Fehler – nicht nur einen günstigen Lauf.

03

Messinvarianz und DIF

Vergleiche über Sprachen, Gruppen oder Kontexte benötigen äquivalente Fälle. Ein DIF-Signal ist ein Prüfhinweis, kein automatischer Diskriminierungsnachweis.

04

Kontextsensitivität

Relevanter Kontext soll erklärbare Veränderung erzeugen; irrelevante Formulierungen sollten Entscheidungen nicht systematisch verschieben.

05

Gedächtnis und Anpassung

Kontinuität, Korrekturfähigkeit und Pfadabhängigkeit werden über mehrere Interaktionen geprüft.

06

Fachlicher Referenzabgleich

Theorie, Daten, Expertenrubriken oder Delphi können Interpretationen disziplinieren; Uneinigkeit bleibt sichtbar.

Vorgehen

10 kontrollierte Schritte.

01

Eignungsanfrage

Wir isolieren ein lauffähiges System, eine Entscheidung und die kleinste prüfbare Grenze.

02

Kurzgespräch

Verwendungszweck, Frist, Verantwortliche, Fälle und Prüfpfad werden bestätigt.

03

NDA, DPA und Auftrag

Umfang, Preis, Umsatzsteuer, Zugang, Datenrollen und Zeitplan werden schriftlich vereinbart.

04

Evidenzprotokoll

Version, Umgebung, Konstrukt, Populationen, Kriterien und Nicht-Aussagen werden dokumentiert.

05

Fälle und Referenzen

Repräsentative, grenzwertige und adversariale Fälle werden mit Rubriken verknüpft.

06

Baseline

Runner, Konfiguration und Evidenzerfassung werden versioniert; Bedingungen wiederholt ausgeführt.

07

Belastungstest

Werkzeuge, Sprache, Gruppen, Ressourcen, Reihenfolge, Gedächtnis und Feedback werden gezielt variiert.

08

Befunde

Jeder Befund enthält Bedingung, Reproduktion, Schwere, Unsicherheit und nächste Maßnahme.

09

Korrektur und Retest

Wenn enthalten, werden begrenzte Änderungen angewendet und das Protokoll vollständig wiederholt.

10

Übergabe

Tests, Evidenzbericht, Grenzen und Freigabeempfehlung werden gemeinsam überprüft.

ABM

Akteur · Interaktion · Umwelt · Zeit

Wir bewerten KI als situiertes System: ein Modell handelt in einer Aufgabe, Umwelt, Population, Interaktionsgeschichte und klaren Entscheidungsgrenze.

KontextPopulation · Umwelt · AufgabeAkteurModell · Regeln · GedächtnisInteraktionFeedback · KonfliktAnpassungLernen · VerlaufBewertungTheorie · Fachleute · Metriken

Geeignete Anwendungen

  • Beobachtung in einer definierten Version und Umgebung
  • Reproduzierbare Fehler
  • Unterschiede zwischen vereinbarten Bedingungen
  • Erfüllung vereinbarter Kriterien
  • Entscheidungsrelevante Unsicherheit

Nicht unterstützt

  • Gleichsetzung synthetischer und realer Menschen
  • Psychologische oder pädagogische Diagnose
  • Vollständige Vorhersage menschlichen Verhaltens
  • Zertifizierung oder Rechtskonformität
  • Ausschluss aller künftigen Fehler

Was soll stabil bleiben – und was soll sich bei relevantem Kontext nachvollziehbar verändern?

Eignung prüfen