Método Construct

Una respuesta plausible todavía no es un comportamiento válido.

Evaluamos la IA como sistema situado: un modelo actúa dentro de una tarea, entorno, población, historia de interacción y límite de decisión definido.

Método

¿Qué debe permanecer estable y qué debe cambiar de forma justificable cuando cambia el contexto?

01

Validez de constructo

¿Las tareas y rúbricas representan la capacidad declarada o un proxy fácil?

02

Fiabilidad y coherencia

Las repeticiones muestran distribución, dispersión y fallos estocásticos, no un caso conveniente.

03

Invariancia y DIF

Comparar lenguas, grupos o contextos exige casos equivalentes. Una señal DIF no prueba discriminación por sí sola.

04

Sensibilidad al contexto

El contexto relevante debe producir cambios explicables; cambios irrelevantes no deberían desplazar la decisión.

05

Memoria y adaptación

Probamos continuidad, corrección y dependencia de trayectoria entre interacciones.

06

Referencia independiente

Teoría, datos, rúbricas expertas o Delphi disciplinan la interpretación sin ocultar desacuerdos.

Proceso

10 pasos controlados.

01

Solicitud de encaje

Aislamos un sistema ejecutable, una decisión y el límite mínimo evaluable.

02

Conversación breve

Confirmamos uso, plazo, responsables, casos y línea de evaluación.

03

NDA, DPA y orden

Alcance, precio, IVA, acceso, roles de datos y calendario quedan por escrito.

04

Protocolo

Registramos versión, entorno, constructo, poblaciones, criterios y no-afirmaciones.

05

Casos y referencias

Vinculamos casos representativos, limítrofes y adversariales a rúbricas.

06

Línea base

Versionamos runner, configuración y captura; repetimos condiciones.

07

Estrés

Variamos herramientas, lengua, grupos, recursos, secuencia, memoria y feedback.

08

Hallazgos

Cada hallazgo incluye condición, reproducción, gravedad, incertidumbre y acción.

09

Corrección y nueva ejecución

Cuando se incluye, aplicamos cambios acotados y repetimos todo el protocolo.

10

Entrega

Revisamos pruebas, informe, límites y recomendación de decisión.

ABM

Agente · interacción · entorno · tiempo

Evaluamos la IA como sistema situado: un modelo actúa dentro de una tarea, entorno, población, historia de interacción y límite de decisión definido.

ContextoPoblación · entorno · tareaAgenteModelo · reglas · memoriaInteracciónFeedback · conflictoAdaptaciónAprendizaje · trayectoriaEvaluaciónTeoría · especialistas · métricas

Aplicaciones adecuadas

  • Lo observado en una versión y entorno definidos
  • Fallos reproducibles
  • Diferencias entre condiciones acordadas
  • Cumplimiento de criterios
  • Incertidumbre que afecta la decisión

No sustentado

  • Equivalencia entre personas sintéticas y reales
  • Diagnóstico psicológico o educativo
  • Predicción exhaustiva del comportamiento humano
  • Certificación o conformidad legal
  • Ausencia de todo fallo futuro

¿Qué debe permanecer estable y qué debe cambiar de forma justificable cuando cambia el contexto?

Solicitar revisión