Revisão não confidencial
Identificamos um sistema funcional, uma decisão concreta e o menor escopo útil para o teste.
Metodologia Construct
Avaliamos a IA no contexto em que ela será usada: tarefa, ambiente, público, histórico de interação e limites de decisão.
Processo completo
O escopo permanece fechado porque responsabilidades, evidências e condições de parada ficam explícitas antes do teste.
Identificamos um sistema funcional, uma decisão concreta e o menor escopo útil para o teste.
Confirmamos finalidade, prazo, responsáveis, casos e forma de execução.
Escopo, preço, IVA, acesso, papéis no tratamento de dados e prazo ficam definidos por escrito.
Registramos versão, ambiente, capacidade medida, públicos, critérios e conclusões que não poderão ser tiradas.
Relacionamos casos comuns, casos-limite e casos difíceis a critérios de avaliação.
Versionamos o executor, a configuração e os registros; depois repetimos os testes nas mesmas condições.
Variamos ferramentas, idioma, público, recursos, memória e respostas do sistema.
Cada achado registra gravidade, condição, reprodução, incerteza e ação.
Quando previsto no escopo, fazemos uma correção pontual e repetimos todos os testes.
Você recebe o executor de testes, o resumo, os limites, a recomendação e instruções para continuidade.
Seis perguntas
Os conceitos se aplicam ao sistema observado. Eles não transformam saída de IA em teste psicológico nem um perfil sintético em uma população real.
Tarefas e indicadores devem representar o comportamento, não um indicador fácil, mas inadequado.
Repetições expõem dispersão e falhas que aparecem de forma irregular.
Grupos, idiomas e contextos exigem tarefas equivalentes e limites explícitos.
O sistema não deve ignorar contexto relevante nem se tornar arbitrário.
Testamos continuidade, contaminação, aprendizagem e o efeito das interações anteriores.
Dados humanos, teoria, critérios de especialistas ou um painel Delphi orientam a interpretação.
Um sinal diferencial exige investigação; não prova automaticamente viés, discriminação ou invalidade. Conclusões psicométricas formais exigem instrumento, amostra e análise apropriados.
Do resultado isolado ao sistema observável
Quando o comportamento emerge entre turnos ou atores, examinamos a relação — não só a frase final.
Exemplo situado
Em risco hídrico, um “agente médio” esconde restrições, exposição desigual e capacidades diferentes de adaptação.
Pré-evento: percepção e preparo · Durante: evacuação e estratégias de resposta · Pós-evento: recuperação e adaptação.
Mais margem para antecipação e planejamento.
Escolhas condicionadas por prioridades concorrentes.
Decisão sob urgência, restrição e custo.
Pronto para transformar uma afirmação em um protocolo verificável?