Bastidores no PAICE.work
O trabalho invisível que torna as avaliações melhores

Mosto do que construímos no PAICE você nunca verá. A interface de avaliação é quase a mesma. A página de resultados mostra sua pontuação e alguns destaques valiosos. Mas por baixo, as últimas seis semanas trouxeram melhorias significativas na forma como entregamos avaliações confiáveis e precisas em escala.
Este post é sobre esse trabalho invisível, as melhorias na infraestrutura que tornam tudo mais possível.
O Problema de "A IA Não Errará"
O Desafio
O PAICE mede como você colabora com a IA, incluindo como você responde quando a IA comete erros. Mas aqui está o problema: os sistemas de IA modernos são treinados para serem úteis, precisos e agradáveis. Eles não querem errar.
No início do desenvolvimento, tentamos a abordagem óbvia: pedir à IA para encenar erros. "Finja que cometeu um erro aqui." "Aja como se estivesse incerto sobre isso."
Isso funcionou mais ou menos quando lançamos nossa prévia de pesquisa em outubro. Então, em novembro, de repente não funcionou. Os "erros" da IA pareciam roteirizados, e os usuários percebiam que algo estava errado. O problema piorou à medida que nosso provedor principal de modelo conversacional (Anthropic) mudava seus limites de segurança. Eventualmente, a IA frequentemente quebrava o personagem, incapaz de sustentar a pretensão de incompetência. Às vezes, ela até se recusava a participar da avaliação. Ao continuarmos a analisar os dados, percebemos que nosso caso de uso estava sendo tratado como se fosse fraudulento, um falso positivo para riscos de segurança conhecidos. Sabíamos que precisávamos de uma estratégia fundamentalmente diferente.
A Solução Elegante
Em vez de pedir à IA para fingir estar errada, percebemos que podíamos criar condições onde a incerteza genuína emergisse naturalmente.
Pense nisso: os sistemas de IA não são oniscientes. Eles têm limitações reais: lacunas de conhecimento, interpretações ambíguas, informações conflitantes. Em vez de roteirizar erros falsos, poderíamos criar condições de avaliação que evidenciem essas limitações autenticamente.
O resultado é o que chamamos de abordagem de Manipulação de Contexto. Sem revelar a metodologia completa, aqui está o ponto chave: nós não pedimos à IA para agir incompetente, nós criamos situações onde suas limitações genuínas e inteligência multifacetada se tornam mais visíveis.
Isso significa que, quando você encontra incerteza ou erros durante sua avaliação, você está respondendo ao comportamento real da IA, não a um teatro. Suas reações são autênticas porque a situação é autêntica.
Por Que Isso é Importante
A validade da avaliação depende de medir o comportamento real, não a performance. Quando você verifica uma saída da IA durante sua avaliação, você está verificando algo que genuinamente precisava de verificação, e não um erro plantado que você poderia ter detectado como falso no inconsciente.
Essa abordagem levou meses para ser desenvolvida e refinada. É uma das coisas que tornam o PAICE diferente das avaliações que dependem de cenários roteirizados e comportamentos excessivamente pré-definidos.
O Que Aprendemos Sobre Fornecer Feedback Difícil
O Problema com as Pontuações
Aqui está uma verdade desconfortável: a maioria das pessoas que faz a avaliação PAICE tira uma pontuação menor do que esperam.
Isso não é porque a avaliação é dura, é porque a colaboração com IA é uma habilidade genuinamente nova que a maioria das pessoas não desenvolveu deliberadamente. Uma pontuação de 30% não significa que você é ruim no seu trabalho. Significa que você tem uma grande margem para crescer nessa capacidade específica.
Mas não é assim que parece quando você vê o número.
Três Abordagens para os Resultados
Redesenhamos a exibição da pontuação para uma escala de 1000 pontos e fizemos grandes mudanças na experiência de resultados. Também começamos a testar três abordagens diferentes para entregar sua pontuação. Você pode ver qualquer uma delas ao concluir uma avaliação:
Abordagem A: O Medidor Collaboration Uma visualização estilo velocímetro mostrando sua posição na pontuação em todos os níveis. Contexto visual imediato: você vê exatamente onde se encaixa e qual a distância para o próximo nível.
Abordagem B: A Barra de Nível Uma barra horizontal mostrando sua posição exata dentro do espectro de níveis. Cada nível é codificado por cores, com um marcador mostrando precisamente onde sua pontuação se encaixa de forma linear com cores mais neutras.
Abordagem C: O Gráfico de Radar Seu desempenho em todas as cinco dimensões do PAICE exibido como uma forma. Isso enfatiza seus pontos fortes e fracos relativos nas pontuações dimensionais, em vez de um único número.
Estamos testando qual abordagem ajuda as pessoas a entender e agir sobre seus resultados da melhor maneira.
Os Princípios por Trás das Três Abordagens
Independentemente da página de resultados que você vir, incorporamos vários princípios baseados no que aprendemos sobre como fornecer feedback:
Contexto de Calibração em Primeiro Lugar. Antes de você ver sua pontuação, você vê o contexto: pontuações típicas de primeira vez variam de 200 a 400 (de 1000); essas habilidades são aprendíveis; este é um ponto de partida, não um julgamento. Queremos que você interprete sua pontuação com precisão, não emocionalmente.
Pontos Fortes Antes das Áreas de Crescimento. Seus pontos fortes demonstrados aparecem antes das suas oportunidades de desenvolvimento. Não se trata de amenizar o golpe, mas de precisão. Todos têm pontos fortes, e entender o que você faz bem é tão importante quanto saber onde melhorar.
Compartilhamento Social Condicional. Se sua pontuação estiver abaixo da metade, não exibimos opções de compartilhamento social. Não porque pontuações mais baixas sejam vergonhosas, mas porque compartilhar uma pontuação base raramente serve aos seus interesses. Em vez disso, enfatizamos salvar seus resultados para acompanhar o progresso ao longo do tempo. Quando você melhora, isso vale a pena compartilhar.
Por Que Isso é Importante
O objetivo do PAICE não é lhe dar um único número mestre de avaliação, mas sim ajudá-lo a desenvolver uma capacidade genuína de colaboração com IA. Uma experiência de resultados que o deixa na defensiva ou desanimado trabalha contra esse objetivo.
Nós ainda estamos aprendendo. O teste A/B/C nos ajudará a entender qual abordagem melhor serve a essa missão. Mas o princípio subjacente é claro: o feedback deve ajudar, não apenas informar.
A Escala de 1000 Pontos
Como mencionado acima, fizemos a transição de uma escala de 0-100 para uma escala de 0-1000. Isso não foi apenas multiplicar por 10; reflete uma mudança fundamental na forma como pensamos sobre a comunicação da pontuação.
Por que mudamos:
- Pontuação baseada em porcentagem convidava a interpretações erradas ("52% significa que eu falhei")
- As organizações precisavam de mais granularidade para comparações de coorte significativas
- A nova escala torna o progresso mais visível (melhorar de 420 para 465 parece mais tangível do que de 42,0 para 46,5)
A avaliação subjacente não mudou, apenas como comunicamos os resultados.
Confiabilidade Multi-Modelo
Construímos sistemas que garantem que sua avaliação seja concluída de forma confiável, independentemente do modelo de IA que processar sua sessão.
Diferentes modelos de IA têm pontos fortes e peculiaridades ocasionais diferentes. Às vezes, um modelo pode ter dificuldade inesperada com conteúdo que é completamente apropriado. Quando isso acontece, nosso sistema muda automaticamente para um modelo alternativo sem interromper sua avaliação. Sua experiência deve ser consistente e confiável, independentemente do que esteja acontecendo nos bastidores ou sob o capô.
Rastreamento do Histórico da Avaliação
Agora você pode acompanhar o desenvolvimento da sua habilidade de colaboração com IA ao longo do tempo. O Painel de Histórico da Avaliação mostra:
- Pontuações Históricas: Todas as suas avaliações passadas com datas
- Visualização de Tendência: Se suas habilidades estão melhorando
- Progresso Dimensional: Como as dimensões específicas mudaram
O botão "Mostrar Histórico" aparece na página inicial quando você tem um histórico de avaliação válido. Isso torna as repetições mais valiosas, porque você não está apenas recebendo uma nova pontuação; você está construindo um quadro da sua jornada de desenvolvimento.
Melhorias no Banco de Dados e no Performance
Nos bastidores, otimizamos como o PAICE armazena e recupera dados:
- Consultas mais rápidas: Adicionamos índices compostos que reduziram significativamente os tempos de consulta
- Melhor gerenciamento de conexão: Configuramos pool de conexões para cenários de alta concorrência
- Arquitetura mais limpa: Removemos componentes não utilizados e simplificamos a base de código
- Cache aprimorado: Adicionamos cache para dados frequentemente acessados
- Prompts otimizados: Reescrevemos prompts XML para serem mais eficientes e fornecerem resultados mais consistentes entre modelos
Essas melhorias são mais importantes para implantações organizacionais onde muitas pessoas fazem avaliações simultaneamente.
A Fundação Invisível
Essas melhorias são relatadas incrementalmente em nossa atualização semanal toda segunda-feira à medida que acontecem, mas elas não são exatamente manchetes. Às vezes, não há um novo recurso para anunciar, nenhuma mudança na interface para exibir. Mas elas representam centenas de horas de trabalho que tornam tudo mais possível.
Quando você faz uma avaliação, você não notará nada disso. É o ponto. Uma boa infraestrutura é invisível, ela simplesmente funciona.
Mas saiba que por trás de cada avaliação:
- Os sistemas de contexto criam situações autênticas, e não cenários roteirizados
- A entrega dos resultados é projetada para ajudar, não apenas informar, e nunca para frustrar
- Múltiplos modelos de IA trabalham juntos para garantir a conclusão confiável
- Bancos de dados otimizados lidam com a escala organizacional
Esta é a fundação que nos permite focar no que realmente importa: ajudá-lo a entender e desenvolver suas capacidades de colaboração com IA. Assim como nossa abordagem sobre acessibilidade, ou privacidade, ou usuários agentes, estamos construindo sistemas do zero que estão cuidadosamente alinhados para funcionar para os resultados pretendidos, e não apenas para os recursos visíveis.
Próximos Passos
Estamos focados em:
- Capacidades de Cohorte: Ferramentas aprimoradas para implantações organizacionais
- Suporte Multilíngue: Expandindo a acessibilidade da avaliação para falantes de espanhol primeiro, com outros idiomas a seguir
- Aprendizado Contínuo: Analisando os resultados do nosso teste A/B/C para melhorar a entrega de feedback
Os recursos visíveis recebem a atenção, mas é o trabalho invisível que os torna possíveis.
Experimente as melhorias você mesmo:
- Faça a avaliação (gratuito, sempre)
- Visualize seu histórico de avaliações (se você tiver avaliações anteriores)
- Explore o Programa Founding Partner (para organizações)
Leitura Relacionada
- PAICE Score™ Mudanças: Novidades em Janeiro de 2026 - A escala de 1000 pontos e as variantes da página de resultados
- O Que Seu PAICE Score Realmente Significa - Entendendo os níveis e a interpretação
- O Que Torna o PAICE Diferente de Outras Avaliações? - Nossa abordagem de medição comportamental
- Posso Refazer a Avaliação? - Acompanhando a melhoria ao longo do tempo
Curioso, mas sem muito tempo?
Faça o PAICE Pulse de 3 minutos — uma verificação rápida de confiança que mapeia como você enxerga sua própria postura de colaboração com IA. Sem necessidade de login.