Validité de construit
Les tâches et rubriques représentent-elles la capacité revendiquée plutôt qu’un proxy facile ?
Méthode Construct
Nous évaluons l’IA comme un système situé : un modèle agit dans une tâche, un environnement, une population, une histoire d’interaction et une frontière de décision.
Méthode
Les tâches et rubriques représentent-elles la capacité revendiquée plutôt qu’un proxy facile ?
Les répétitions montrent distribution, variance et défaillances stochastiques, pas un seul cas favorable.
Comparer langues, groupes ou contextes exige des cas équivalents. Un signal DIF ne prouve pas seul une discrimination.
Un contexte pertinent doit produire une variation explicable ; un changement sans pertinence ne devrait pas déplacer la décision.
Nous testons continuité, correction et dépendance de trajectoire entre interactions.
Théorie, données, rubriques expertes ou Delphi disciplinent l’interprétation sans masquer les désaccords.
Processus
Nous isolons un système exécutable, une décision et la plus petite frontière évaluable.
Usage, délai, responsables, cas et parcours sont confirmés.
Périmètre, prix, TVA, accès, rôles et calendrier sont écrits.
Version, environnement, construit, populations, critères et non-affirmations sont consignés.
Cas représentatifs, limites et adversariaux sont liés aux rubriques.
Exécuteur, configuration et capture sont versionnés ; les conditions sont répétées.
Outils, langue, groupes, ressources, séquence, mémoire et feedback varient.
Chaque constat comprend condition, reproduction, gravité, incertitude et action.
Si incluse, la correction limitée est appliquée et tout le protocole est rejoué.
Tests, dossier, limites et recommandation sont examinés ensemble.
ABM
Nous évaluons l’IA comme un système situé : un modèle agit dans une tâche, un environnement, une population, une histoire d’interaction et une frontière de décision.