Validez de constructo
¿Las tareas y rúbricas representan la capacidad declarada o un proxy fácil?
Método Construct
Evaluamos la IA como sistema situado: un modelo actúa dentro de una tarea, entorno, población, historia de interacción y límite de decisión definido.
Método
¿Las tareas y rúbricas representan la capacidad declarada o un proxy fácil?
Las repeticiones muestran distribución, dispersión y fallos estocásticos, no un caso conveniente.
Comparar lenguas, grupos o contextos exige casos equivalentes. Una señal DIF no prueba discriminación por sí sola.
El contexto relevante debe producir cambios explicables; cambios irrelevantes no deberían desplazar la decisión.
Probamos continuidad, corrección y dependencia de trayectoria entre interacciones.
Teoría, datos, rúbricas expertas o Delphi disciplinan la interpretación sin ocultar desacuerdos.
Proceso
Aislamos un sistema ejecutable, una decisión y el límite mínimo evaluable.
Confirmamos uso, plazo, responsables, casos y línea de evaluación.
Alcance, precio, IVA, acceso, roles de datos y calendario quedan por escrito.
Registramos versión, entorno, constructo, poblaciones, criterios y no-afirmaciones.
Vinculamos casos representativos, limítrofes y adversariales a rúbricas.
Versionamos runner, configuración y captura; repetimos condiciones.
Variamos herramientas, lengua, grupos, recursos, secuencia, memoria y feedback.
Cada hallazgo incluye condición, reproducción, gravedad, incertidumbre y acción.
Cuando se incluye, aplicamos cambios acotados y repetimos todo el protocolo.
Revisamos pruebas, informe, límites y recomendación de decisión.
ABM
Evaluamos la IA como sistema situado: un modelo actúa dentro de una tarea, entorno, población, historia de interacción y límite de decisión definido.