Métricas de Gobernanza de IA Más Allá de la Adopción y la Capacitación

Qué Medir Cuando la Actividad No es Evidencia

por Sam Rogers
8 min de lectura
analysis
governance
measurement
executive
risk-management
Métricas de Gobernanza de IA Más Allá de la Adopción y la Capacitación

Cada métrica en el catálogo estándar de gobernanza de IA mide el sistema o el proceso. Casi ninguna mide a la persona.

Dos números dominan la mayoría de los informes de gobernanza de IA

Si le pregunta a un responsable de gobernanza cómo va su programa de IA, primero llegan dos números. ¿Cuántas personas tienen acceso? ¿Cuántos completaron la formación?

Ambos son datos de entrada. Ninguno les dice a nadie si el trabajo asistido por IA que sale de la empresa es fiable.

Esto no es una crítica a las personas que producen esos informes. Esos dos números son los fáciles de recopilar, y la presión por informar mensualmente es real. El problema es lo que sucede cuando son los únicos números en la página durante dos años y llega un incidente.

Douglas Hubbard tiene un nombre para ese reflejo. Cuando se le pide medir la colaboración, la gente recurre al volumen de mensajes, lo primero que se puede observar, en lugar de a la calidad y velocidad de lo que realmente produce el grupo. Él hizo este punto en Signals & Subtractions episodio 7, junto con la definición funcional que realmente funciona: una medición es una reducción de la incertidumbre sobre algo en lo que depende una decisión. Los puestos asignados reducen la incertidumbre sobre la adquisición. No reducen ninguna sobre si el trabajo que sale de la empresa es fiable.

Lo que realmente exigen los estándares que usted mida

Los principales marcos son más exigentes de lo que sugiere el panel de adopción.

La función MEASURE del Marco de Gestión de Riesgos de IA NIST pide a las organizaciones que identifiquen y apliquen métodos y métricas adecuados para los riesgos enumerados anteriormente en el ciclo de vida, que evalúen regularmente si esas métricas siguen siendo apropiadas y si los controles existentes siguen siendo efectivos, y que documenten los conjuntos de pruebas, métricas y herramientas utilizados en las pruebas y la evaluación. Se supone que los riesgos que no se pueden medir deben documentarse como tales, junto con la razón. El Manual complementario convierte cada subcategoría en acciones y documentación sugeridas.

La Cláusula 9 de ISO/IEC 42001 requiere que una organización determine qué necesita ser monitoreado y medido, por qué método, cuándo, por quién y cómo se evaluarán los resultados. Exige lo mismo del propio sistema de gestión, no solo de los sistemas de IA internos.

Ninguno de los dos marcos queda satisfecho solo con contar puestos.

Ambos también son voluntarios. El lado vinculante plantea una versión más estrecha de la misma pregunta, con menos margen para interpretarla. La supervisión humana aparece como un deber en más de dos docenas de regulaciones de IA rastreadas, y el índice de lo que satisface ese deber es explícito sobre lo que no: la aprobación formal sin una revisión genuina, y la participación humana que carece de la autoridad para anular. Ninguna de estas exclusiones es detectable en una métrica que cuenta aprobaciones. EveryAILaw es un índice gratuito de las regulaciones de IA y forma parte del Portafolio PAICE.

El catálogo es casi enteramente del lado del sistema

Si se trabaja con lo que las organizaciones construyen realmente una vez que se toman esos requisitos en serio, aparece un conjunto coherente.

Inventario y cobertura de propiedad. La parte de los usos de IA con un propietario designado y un nivel de riesgo asignado. Cobertura de pruebas y evaluación frente a las características de fiabilidad. Desviación del modelo y alertas de anomalías, con tiempo de respuesta. Temas de riesgo abiertos y su envejecimiento. Cobertura de firma de riesgo residual. Cobertura de evaluación de equidad. Conteo de incidentes por categoría, con finalización de la causa raíz. No conformidades encontradas en auditoría y la parte cerrada a tiempo. Tiempo del ciclo de gobernanza desde la propuesta hasta la decisión.

Cada uno de estos vale la pena. Varios son estructurales para la evidencia regulatoria. Y cada uno mide un sistema, un artefacto o un flujo de trabajo.

Vuelva a leer la lista buscando una medida de lo que hizo una persona cuando el modelo estaba equivocado. No está ahí.

Lo más cercano que llega el catálogo estándar es la tasa de anulación: la parte de los resultados de IA que un revisor humano cambió o rechazó. Ese número es genuinamente útil y rutinariamente malinterpretado. Una alta tasa de anulación puede significar un revisor vigilante que detecta errores reales, o un revisor que reescribe todo por costumbre y no notaría uno sutil. Una baja tasa de anulación puede significar un sistema preciso, o un revisor que dejó de leer en marzo. El conteo por sí solo no separa esos casos, y los casos tienen perfiles de riesgo opuestos.

Siete medidas que analizan al operador

Estas son las preguntas que responde una capa de medición del vector Persona. Cada una se presenta con lo que observa y lo que no puede decirle por sí misma.

Detección de errores bajo presión. Si el operador identifica un error plausible y bien formado en la salida de la IA mientras trabaja a un ritmo realista. Esta es la única medida en la que dependen las demás. No indica con qué frecuencia ocurren los errores en producción.

Rechazo contextualizado. Si los rechazos reflejan la calidad de la salida específica, en lugar de un hábito generalizado en cualquiera de las direcciones. Distingue la vigilancia del reflejo. Requiere saber qué estaba realmente mal con la salida que se está juzgando.

Integridad de la verificación. Si el operador comprueba las afirmaciones que sustentan la decisión, en lugar de aquellas que son fáciles de comprobar. No dice nada sobre si las fuentes de verificación eran buenas.

Latencia de escalamiento. Tiempo entre reconocer un problema y decirle a alguien con autoridad que actúe. Una latencia corta sin escalamientos en absoluto no es una buena señal; es una señal ausente.

Patrones de fallo repetidos. Si la misma categoría de fallo se repite para el mismo operador o rol después de recibir retroalimentación. Distingue un mal día de una brecha no abordada. Necesita suficientes observaciones para ser significativo.

Frecuencia de excepción de política. Con qué frecuencia se omite el flujo de trabajo documentado y si la omisión fue razonada. Las excepciones de alta frecuencia suelen indicar un problema de flujo de trabajo más que un problema del operador.

La brecha de confianza. La distancia entre cuán fiable cree un operador que es su trabajo asistido por IA y cuán fiable es demostrablemente. La investigación de calibración de Hubbard encontró que las personas que informan una confianza del noventa por ciento están en lo correcto sustancialmente menos veces, y que la descalibración es entrenable una vez que se mide. Aquí es donde se concentra el riesgo de IA organizacional, porque un operador seguro con una brecha no medida es aquel que nadie revisa dos veces.

Lo que aporta y lo que no aporta esta capa

PAICE (People + AI Collaboration Effectiveness) mide el vector Persona. Observa lo que hace un operador cuando la salida de la IA es incierta, incompleta o incorrecta, y devuelve puntuaciones en lugar de transcripciones o registros de actividad.

No reemplaza la telemetría del sistema. No produce alertas de deriva, conteos de incidentes, resultados de evaluación del modelo ni cobertura de inventario. No vigila el trabajo en producción, y no sabe qué herramientas abrió un empleado. Una organización que adopta la medición conductual y descarta la medición del sistema ha cambiado un punto ciego por otro.

El planteamiento honesto es que el catálogo estándar y la capa conductual responden a preguntas diferentes. Si el sistema se está comportando correctamente es una pregunta del sistema con una práctica de medición madura detrás. Si las personas lo detectan cuando el sistema está equivocado ha sido la mitad no medida, y es la mitad que aparece en el informe del incidente.

Los paneles muestran actividad. No muestran fiabilidad.


¿Listo para ver cómo es la medición del lado de las personas? Realice la evaluación PAICE o establezca la línea de base de su organización.


Lecturas recomendadas

¿Curioso pero con poco tiempo?

Realiza el PAICE Pulse de 3 minutos — una verificación rápida de confianza que muestra cómo percibes tu propia postura de colaboración con IA. No requiere inicio de sesión.