Méthode Construct

Une réponse plausible n’est pas encore un comportement valide.

Nous évaluons l’IA comme un système situé : un modèle agit dans une tâche, un environnement, une population, une histoire d’interaction et une frontière de décision.

Méthode

Qu’est-ce qui doit rester stable et qu’est-ce qui doit changer de manière justifiée avec le contexte ?

01

Validité de construit

Les tâches et rubriques représentent-elles la capacité revendiquée plutôt qu’un proxy facile ?

02

Fidélité et cohérence

Les répétitions montrent distribution, variance et défaillances stochastiques, pas un seul cas favorable.

03

Invariance et DIF

Comparer langues, groupes ou contextes exige des cas équivalents. Un signal DIF ne prouve pas seul une discrimination.

04

Sensibilité au contexte

Un contexte pertinent doit produire une variation explicable ; un changement sans pertinence ne devrait pas déplacer la décision.

05

Mémoire et adaptation

Nous testons continuité, correction et dépendance de trajectoire entre interactions.

06

Référence indépendante

Théorie, données, rubriques expertes ou Delphi disciplinent l’interprétation sans masquer les désaccords.

Processus

10 étapes contrôlées.

01

Demande d’adéquation

Nous isolons un système exécutable, une décision et la plus petite frontière évaluable.

02

Échange bref

Usage, délai, responsables, cas et parcours sont confirmés.

03

NDA, DPA et commande

Périmètre, prix, TVA, accès, rôles et calendrier sont écrits.

04

Protocole

Version, environnement, construit, populations, critères et non-affirmations sont consignés.

05

Cas et références

Cas représentatifs, limites et adversariaux sont liés aux rubriques.

06

Baseline

Exécuteur, configuration et capture sont versionnés ; les conditions sont répétées.

07

Stress

Outils, langue, groupes, ressources, séquence, mémoire et feedback varient.

08

Constats

Chaque constat comprend condition, reproduction, gravité, incertitude et action.

09

Correction et nouvelle exécution

Si incluse, la correction limitée est appliquée et tout le protocole est rejoué.

10

Remise

Tests, dossier, limites et recommandation sont examinés ensemble.

ABM

Agent · interaction · environnement · temps

Nous évaluons l’IA comme un système situé : un modèle agit dans une tâche, un environnement, une population, une histoire d’interaction et une frontière de décision.

ContextePopulation · environnement · tâcheAgentModèle · règles · mémoireInteractionRetour · conflitAdaptationApprentissage · trajectoireÉvaluationThéorie · spécialistes · métriques

Usages appropriés

  • Ce qui a été observé dans une version définie
  • Les défaillances reproductibles
  • Les différences entre conditions convenues
  • Le respect des critères
  • L’incertitude qui affecte la décision

Non établi

  • Équivalence entre personas et personnes réelles
  • Diagnostic psychologique ou éducatif
  • Prédiction exhaustive du comportement humain
  • Certification ou conformité juridique
  • Absence de toute future défaillance

Qu’est-ce qui doit rester stable et qu’est-ce qui doit changer de manière justifiée avec le contexte ?

Demander une revue