Mesurons-nous bien la capacité annoncée ? (validité de construit)
Les tâches et les grilles d’évaluation représentent-elles bien la capacité revendiquée, plutôt qu’un indicateur facile à obtenir mais inadéquat ?
Méthode Construct
Nous évaluons l’IA dans son contexte réel d’utilisation : le modèle agit dans une tâche, un environnement, un groupe d’utilisateurs, un historique d’interactions et des limites de décision définies.
Méthode
Les tâches et les grilles d’évaluation représentent-elles bien la capacité revendiquée, plutôt qu’un indicateur facile à obtenir mais inadéquat ?
Les répétitions révèlent la distribution, la variabilité et les échecs aléatoires, au lieu de ne montrer qu’un cas favorable.
Comparer des langues, des groupes ou des contextes exige des cas équivalents. Un écart DIF ne suffit pas, à lui seul, à prouver une discrimination.
Un contexte pertinent doit produire une variation explicable ; un changement sans pertinence ne devrait pas déplacer la décision.
Nous vérifions la continuité, la correction des erreurs et l’influence des interactions passées sur les suivantes.
La théorie, les données, les grilles d’experts ou une consultation Delphi encadrent l’interprétation sans masquer les désaccords.
Processus
Nous délimitons un système exécutable, une décision concrète et le plus petit périmètre utile à tester.
L’usage, le calendrier, les responsables, les cas et les parcours d’action sont confirmés.
Le périmètre, le prix, la TVA, les accès, les rôles et le calendrier sont définis par écrit.
La version, l’environnement, la capacité mesurée, les groupes concernés, les critères et les conclusions exclues sont définis par écrit.
Des cas représentatifs, des cas limites et des cas adverses sont reliés aux grilles d’évaluation.
L’exécuteur, la configuration et les données recueillies sont versionnés ; les tests sont répétés dans les mêmes conditions.
Nous faisons varier de façon contrôlée les outils, la langue, les groupes, les ressources, la séquence, la mémoire et les retours du système.
Chaque constat précise la condition, la procédure de reproduction, la gravité, l’incertitude et l’action recommandée.
Si elle est prévue, une modification ciblée est appliquée et l’ensemble du protocole est réexécuté.
Les tests, le dossier de preuves, les limites et la recommandation sont examinés ensemble.
Modélisation à base d’agents (ABM)
Nous évaluons l’IA dans son contexte réel d’utilisation : le modèle agit dans une tâche, un environnement, un groupe d’utilisateurs, un historique d’interactions et des limites de décision définies.