Tras Bambalinas en PAICE.work

El trabajo invisible que mejora las evaluaciones

por Sam Rogers
9 min de lectura
announcement
implementation
technical
transparency
assessment
Tras Bambalinas en PAICE.work

La mayor parte de lo que construimos en PAICE nunca lo verás. La interfaz de evaluación es mayormente la misma. La página de resultados muestra tu puntuación y algunos puntos destacados valiosos. Pero debajo, las últimas seis semanas han aportado mejoras significativas en cómo ofrecemos evaluaciones fiables y precisas a escala.

Esta publicación trata sobre ese trabajo invisible, las mejoras en la infraestructura que hacen posible todo lo demás.

El problema de que "la IA no se equivoca"

El desafío

PAICE mide cómo colaboras con la IA, incluida tu respuesta cuando la IA comete errores. Pero aquí está el problema: los sistemas de IA modernos están entrenados para ser serviciales, precisos y complacientes. No quieren equivocarse.

Al principio del desarrollo, intentamos el enfoque obvio: pedirle a la IA que interpretara cometer errores. "Simula que cometiste un error aquí." "Actúa como si estuvieras inseguro sobre esto."

Eso funcionó en gran medida cuando lanzamos nuestra vista previa de investigación en octubre. Luego, en noviembre, de repente no funcionó. Los "errores" de la IA parecían guionizados, y los usuarios podían notar que algo andaba mal. El problema empeoró a medida que nuestro proveedor principal de modelos conversacionales (Anthropic) cambiaba sus barreras de seguridad. Finalmente, la IA a menudo rompía el personaje, incapaz de mantener la pretensión de incompetencia. Ocasionalmente, incluso se negaba a participar en la evaluación. A medida que continuamos examinando los datos, nos dimos cuenta de que nuestro caso de uso estaba siendo tratado como si fuera fraudulento, un falso positivo para riesgos de seguridad conocidos. Sabíamos que necesitábamos una estrategia fundamentalmente diferente.

La solución elegante

En lugar de pedirle a la IA que fingiera estar equivocada, nos dimos cuenta de que podíamos crear condiciones donde la incertidumbre genuina surgiera naturalmente.

Piénsalo: los sistemas de IA no son omniscientes. Tienen limitaciones reales: lagunas de conocimiento, interpretaciones ambiguas, información contradictoria. En lugar de escribir errores falsos, podíamos crear condiciones de evaluación que hicieran aflorar estas limitaciones auténticamente.

El resultado es lo que llamamos nuestro enfoque de Manipulación de Contexto. Sin revelar la metodología completa, aquí está la idea clave: no le pedimos a la IA que actúe incompetente, creamos situaciones donde sus limitaciones genuinas y su inteligencia compleja se vuelven más visibles.

Esto significa que cuando encuentras incertidumbre o errores durante tu evaluación, estás respondiendo al comportamiento real de la IA, no a un teatro. Tus reacciones son auténticas porque la situación es auténtica.

Por qué es importante

La validez de la evaluación depende de medir el comportamiento real, no el rendimiento. Cuando verificas una salida de la IA durante tu evaluación, estás verificando algo que genuinamente necesitaba verificación, no un error plantado que podrías haber detectado inconscientemente como falso.

Este enfoque llevó meses de desarrollo y refinamiento. Es una de las cosas que hacen que PAICE sea diferente de las evaluaciones que se basan en escenarios guionizados y comportamientos demasiado predefinidos.

Lo que aprendimos sobre la entrega de comentarios difíciles

El problema con las puntuaciones

Aquí hay una verdad incómoda: la mayoría de las personas que realizan la evaluación PAICE obtienen una puntuación más baja de lo que esperan.

Esto no es porque la evaluación sea dura, sino porque la colaboración con la IA es una habilidad genuinamente nueva que la mayoría de las personas no han desarrollado deliberadamente. Una puntuación del 30% no significa que seas malo en tu trabajo. Significa que tienes un gran margen de mejora en esta capacidad específica.

Pero así no se siente cuando ves el número.

Tres enfoques para los resultados

Rediseñamos la visualización de la puntuación en una escala de 1000 puntos y realizamos grandes cambios en la experiencia de resultados. También comenzamos a probar tres enfoques diferentes para entregar tu puntuación. Es posible que veas cualquiera de estos al completar una evaluación:

Enfoque A: El medidor Collaboration Una visualización tipo velocímetro que muestra tu posición en la puntuación en todos los niveles. Contexto visual inmediato: puedes ver exactamente dónde te encuentras y qué tan lejos queda del siguiente nivel.

Enfoque B: La barra de nivel Una barra horizontal que muestra tu posición exacta dentro del espectro de niveles. Cada nivel está codificado por colores, con un marcador que indica precisamente dónde cae tu puntuación de manera lineal con colores más neutros.

Enfoque C: El radar gráfico Tu desempeño en las cinco dimensiones de PAICE mostrado como una forma. Esto enfatiza tus fortalezas y debilidades relativas de las puntuaciones dimensionales en lugar de un único número.

Estamos probando qué enfoque ayuda mejor a las personas a comprender y actuar sobre sus resultados.

Los principios detrás de los tres

Independientemente de la página de resultados que veas, hemos incorporado varios principios basados en lo que hemos aprendido sobre la entrega de comentarios:

El contexto de calibración es lo primero. Antes de ver tu puntuación, ves el contexto: las puntuaciones típicas de primera vez oscilan entre 200 y 400 (de 1000); estas habilidades son aprendibles; este es un punto de partida, no un juicio. Queremos que interpretes tu puntuación con precisión, no emocionalmente.

Fortalezas antes que áreas de mejora. Tus fortalezas demostradas aparecen antes que tus oportunidades de desarrollo. No se trata de suavizar el golpe, sino de precisión. Todos tienen fortalezas, y comprender lo que haces bien es tan importante como saber dónde mejorar.

Compartir condicional. Si tu puntuación está por debajo de la mitad, no ofrecemos opciones de compartir en redes sociales. No porque las puntuaciones bajas sean vergonzosas, sino porque compartir una puntuación base rara vez sirve a tus intereses. En cambio, enfatizamos guardar tus resultados para hacer un seguimiento del progreso a lo largo del tiempo. Cuando has mejorado, eso merece ser compartido.

Por qué es importante

El objetivo de PAICE no es darte un único número maestro de evaluación, sino ayudarte a desarrollar una genuina capacidad de colaboración con la IA. Una experiencia de resultados que te pone a la defensiva o desalentada va en contra de ese objetivo.

Todavía estamos aprendiendo. Las pruebas A/B/C nos ayudarán a comprender qué enfoque sirve mejor a esa misión. Pero el principio subyacente es claro: la retroalimentación debe ayudar, no solo informar.

La escala de 1000 puntos

Como se mencionó anteriormente, recientemente pasamos de una escala de 0 a 100 a una escala de 0 a 1000. Esto no fue simplemente multiplicar por 10; refleja un cambio fundamental en cómo pensamos sobre la comunicación de puntuaciones.

Por qué cambiamos:

  • La puntuación basada en porcentajes invitaba a malas interpretaciones ("52% significa que reprobé").
  • Las organizaciones necesitaban más granularidad para comparaciones significativas por cohortes.
  • La nueva escala hace que el progreso sea más visible (mejorar de 420 a 465 se siente más tangible que de 42.0 a 46.5).

La evaluación subyacente no ha cambiado, solo cómo comunicamos los resultados.

Fiabilidad multimodelo

Hemos construido sistemas que garantizan que tu evaluación se complete de manera fiable, independientemente del modelo de IA que procese tu sesión.

Los diferentes modelos de IA tienen fortalezas diferentes y peculiaridades ocasionales. A veces, un modelo puede tener dificultades inesperadas con contenido que es completamente apropiado. Cuando esto sucede, nuestro sistema cambia automáticamente a un modelo alternativo sin interrumpir tu evaluación. Tu experiencia debe ser consistente y fiable, independientemente de lo que suceda tras bambalinas o bajo el capó.

Seguimiento del historial de evaluaciones

Ahora puedes hacer seguimiento del desarrollo de tu habilidad de colaboración con IA a lo largo del tiempo. El panel de historial de evaluaciones muestra:

  • Puntuaciones históricas: Todas tus evaluaciones pasadas con fechas
  • Visualización de tendencias: Si tus habilidades están mejorando
  • Progreso dimensional: Cómo han cambiado dimensiones específicas

El botón "Mostrar historial" aparece en la página principal cuando tienes un historial de evaluaciones válido. Esto hace que las repeticiones sean más valiosas porque no solo obtienes una nueva puntuación, sino que construyes una imagen de tu viaje de desarrollo.

Mejoras en la base de datos y Performance

Tras bambalinas, hemos optimizado cómo PAICE almacena y recupera datos:

  • Consultas más rápidas: Se agregaron índices compuestos que redujeron significativamente los tiempos de consulta.
  • Mejor manejo de conexiones: Se configuró el connection pooling para escenarios de alta concurrencia.
  • Arquitectura más limpia: Se eliminaron componentes no utilizados y se optimizó la base de código.
  • Almacenamiento en caché mejorado: Se agregó almacenamiento en caché para datos de acceso frecuente.
  • Prompts optimizados: Se reescribieron los prompts basados en XML para ser más eficientes y proporcionar resultados más consistentes entre modelos.

Estas mejoras son más importantes para los despliegues organizacionales donde muchas personas realizan evaluaciones simultáneamente.

La base invisible

Estas mejoras se informan incrementalmente en nuestra actualización semanal cada lunes a medida que suceden, pero no exactamente acaparan titulares. A veces no hay una nueva característica que anunciar, ni un cambio en la interfaz que mostrar. Pero representan cientos de horas de trabajo que hacen posible todo lo demás.

Cuando realizas una evaluación, no notarás nada de esto. Ese es el punto. Una buena infraestructura es invisible, simplemente funciona.

Pero sabe que detrás de cada evaluación:

  • Los sistemas de contexto crean situaciones auténticas en lugar de escenarios guionizados.
  • La entrega de resultados está diseñada para ayudar, no solo informar, y nunca para frustrar.
  • Múltiples modelos de IA trabajan juntos para garantizar una finalización fiable.
  • Las bases de datos optimizadas manejan la escala organizacional.

Esta es la base que nos permite centrarnos en lo que importa: ayudarte a comprender y desarrollar tus capacidades de colaboración con IA. Al igual que nuestro enfoque hacia la accesibilidad, la privacidad o los usuarios agenticos, estamos construyendo sistemas desde cero que están cuidadosamente alineados para funcionar para los resultados previstos, no solo para las características visibles.

¿Qué sigue?

Nos estamos centrando en:

  • Capacidades por cohortes: Herramientas mejoradas para despliegues organizacionales.
  • Soporte multilingüe: Ampliando la accesibilidad de la evaluación a los hispanohablantes primero, con otros idiomas después.
  • Aprendizaje continuo: Analizando los resultados de nuestras pruebas A/B/C para mejorar la entrega de comentarios.

Las características visibles acaparan la atención, pero es el trabajo invisible lo que las hace posibles.


Experimenta las mejoras tú mismo:


Lectura relacionada

¿Curioso pero con poco tiempo?

Realiza el PAICE Pulse de 3 minutos — una verificación rápida de confianza que muestra cómo percibes tu propia postura de colaboración con IA. No requiere inicio de sesión.