Coulisses chez PAICE.work
Le travail invisible qui améliore les évaluations

La majeure partie de ce que nous construisons chez PAICE, vous ne le verrez jamais. L'interface d'évaluation reste en grande partie identique. La page de résultats affiche votre score et quelques points saillants utiles. Mais en coulisses, les six dernières semaines ont apporté des améliorations significatives à la façon dont nous délivrons des évaluations fiables et précises à grande échelle.
Cet article porte sur ce travail invisible — les améliorations d'infrastructure qui rendent tout le reste possible.
Le problème du « l'IA ne peut pas se tromper »
Le défi
PAICE mesure la façon dont vous collaborez avec l'IA, notamment votre réaction face aux erreurs qu'elle commet. Mais voilà le problème : les systèmes d'IA modernes sont entraînés à être utiles, précis et accommodants. Ils ne souhaitent pas avoir tort.
Au début du développement, nous avons essayé l'approche évidente : demander à l'IA de jouer le rôle d'un système comettant des erreurs. « Faites comme si vous aviez commis une erreur ici. » « Comportez-vous comme si vous étiez incertain à ce sujet. »
Cette méthode a globalement fonctionné lors du lancement de notre aperçu de recherche en octobre. Puis, en novembre, elle a soudainement cessé de fonctionner. Les « erreurs » de l'IA semblaient scriptées, et les utilisateurs percevaient que quelque chose clochait. Le problème s'est aggravé à mesure que notre principal fournisseur de modèle conversationnel (Anthropic) modifiait ses garde-fous. Finalement, l'IA sortait souvent du personnage, incapable de maintenir l'apparence d'incompétence. Il lui arrivait même parfois de refuser de participer à l'évaluation. En continuant d'analyser les données, nous avons réalisé que notre cas d'usage était traité comme frauduleux — un faux positif pour des risques de sécurité connus. Nous savions qu'il nous fallait une stratégie fondamentalement différente.
La solution élégante
Plutôt que de demander à l'IA de feindre de se tromper, nous avons réalisé que nous pouvions créer des conditions dans lesquelles une véritable incertitude émerge naturellement.
Réfléchissez-y : les systèmes d'IA ne sont pas omniscients. Ils ont de réelles limites : des lacunes dans leurs connaissances, des interprétations ambiguës, des informations contradictoires. Plutôt que de scénariser de fausses erreurs, nous pouvions créer des conditions d'évaluation qui font apparaître ces limites de façon authentique.
Le résultat est ce que nous appelons notre approche de Manipulation du Contexte. Sans en révéler la méthodologie complète, voici l'idée centrale : nous ne demandons pas à l'IA d'agir de manière incompétente — nous créons des situations où ses véritables limites et son intelligence irrégulière deviennent plus visibles.
Ainsi, lorsque vous rencontrez une incertitude ou des erreurs au cours de votre évaluation, vous réagissez à un comportement réel de l'IA, et non à une mise en scène. Vos réactions sont authentiques parce que la situation l'est.
Pourquoi cela compte
La validité d'une évaluation dépend de la mesure de comportements réels, et non de performances simulées. Lorsque vous vérifiez un résultat produit par l'IA au cours de votre évaluation, vous vérifiez quelque chose qui nécessitait genuinement vérification — et non une erreur délibérément plantée que vous auriez pu intuitivement détecter comme artificielle.
Cette approche a demandé des mois de développement et de perfectionnement. C'est l'une des caractéristiques qui distingue PAICE des évaluations reposant sur des scénarios scriptés et des comportements trop prédéfinis.
Ce que nous avons appris sur la délivrance de retours difficiles
Le problème avec les scores
Voici une vérité inconfortable : la plupart des personnes qui passent l'évaluation PAICE obtiennent un score inférieur à leurs attentes.
Ce n'est pas parce que l'évaluation est sévère — c'est parce que la collaboration avec l'IA est une compétence véritablement nouvelle que la plupart des gens n'ont pas développée délibérément. Un score de 30 % ne signifie pas que vous êtes mauvais dans votre travail. Il signifie que vous disposez d'une marge de progression significative dans cette capacité spécifique.
Mais ce n'est pas ainsi que l'on ressent les choses en voyant le chiffre.
Trois approches de présentation des résultats
Nous avons revu l'affichage des scores en adoptant une échelle de 1 000 points, et avons apporté des modifications importantes à l'expérience de résultats. Nous avons également commencé à tester trois approches différentes pour vous présenter votre score. Vous pourrez voir l'une d'entre elles à la fin de votre évaluation :
Approche A : La jauge Collaboration Une visualisation en forme de compteur de vitesse indiquant la position de votre score sur l'ensemble des niveaux. Contexte visuel immédiat : vous voyez exactement où vous vous situez et à quelle distance se trouve le niveau suivant.
Approche B : La barre de niveau Une barre horizontale indiquant votre position exacte dans le spectre des niveaux. Chaque niveau est codé par couleur, avec un marqueur indiquant précisément où se situe votre score, de façon linéaire et avec des couleurs plus neutres.
Approche C : Le graphique radar Votre performance sur l'ensemble des cinq dimensions PAICE, représentée sous forme de polygone. Cette approche met davantage en valeur vos points forts et vos axes de développement relatifs aux scores dimensionnels, plutôt qu'un chiffre unique.
Nous testons quelle approche aide le mieux les utilisateurs à comprendre leurs résultats et à agir en conséquence.
Les principes communs aux trois approches
Quelle que soit la page de résultats que vous consultez, nous avons intégré plusieurs principes issus de ce que nous avons appris sur la délivrance de retours :
Le contexte de calibration vient en premier. Avant de voir votre score, vous prenez connaissance du contexte : les scores habituels lors d'une première passation se situent entre 200 et 400 (sur 1 000), ces compétences sont acquérables, et ce résultat est un point de départ, non un jugement définitif. Nous souhaitons que vous interprétiez votre score avec précision, et non sous le coup de l'émotion.
Les points forts avant les axes de développement. Vos points forts démontrés apparaissent avant vos opportunités de progression. Il ne s'agit pas d'atténuer le choc — il s'agit d'exactitude. Chacun possède des points forts, et comprendre ce que vous faites bien est aussi important que de savoir où vous améliorer.
Partage social conditionnel. Si votre score est inférieur à la moitié du barème, nous ne mettons pas en avant les options de partage sur les réseaux sociaux. Non pas parce que les scores plus bas seraient honteux, mais parce que partager un score de référence sert rarement vos intérêts. Nous mettons plutôt l'accent sur la sauvegarde de vos résultats afin de suivre votre progression dans le temps. C'est votre amélioration qui mérite d'être partagée.
Pourquoi cela compte
L'objectif de PAICE n'est pas de vous attribuer un score de référence unique — c'est de vous aider à développer une véritable capacité de collaboration avec l'IA. Une expérience de résultats qui vous met sur la défensive ou vous décourage va à l'encontre de cet objectif.
Nous continuons d'apprendre. Les tests A/B/C nous permettront de déterminer quelle approche sert le mieux cette mission. Mais le principe sous-jacent est clair : un retour doit aider, pas seulement informer.
L'échelle de 1 000 points
Comme indiqué précédemment, nous avons récemment abandonné l'échelle de 0 à 100 au profit d'une échelle de 0 à 1 000. Il ne s'agissait pas simplement de multiplier par 10 — cela reflète un changement fondamental dans notre façon de communiquer les scores.
Pourquoi nous avons changé :
- La notation en pourcentage prêtait à une mauvaise interprétation (« 52 % signifie que j'ai échoué »)
- Les organisations avaient besoin d'une granularité plus fine pour des comparaisons de cohortes significatives
- La nouvelle échelle rend la progression plus visible (passer de 420 à 465 est plus tangible que de 42,0 à 46,5)
L'évaluation sous-jacente n'a pas changé, seule la façon dont nous communiquons les résultats a évolué.
Fiabilité multi-modèles
Nous avons développé des systèmes garantissant que votre évaluation se déroule de manière fiable, quel que soit le modèle d'IA qui traite votre session.
Différents modèles d'IA ont des points forts différents et des particularités occasionnelles. Il peut arriver qu'un modèle rencontre des difficultés inattendues avec un contenu tout à fait approprié. Le cas échéant, notre système bascule automatiquement vers un modèle alternatif de façon transparente, sans interrompre votre évaluation. Votre expérience se doit d'être cohérente et fiable, indépendamment de ce qui se passe en coulisses.
Suivi de l'historique des évaluations
Vous pouvez désormais suivre le développement de vos compétences en collaboration avec l'IA au fil du temps. Le tableau de bord Historique des évaluations affiche :
- Les scores historiques : toutes vos évaluations passées avec leurs dates
- La visualisation des tendances : l'évolution de vos compétences
- La progression dimensionnelle : l'évolution de dimensions spécifiques
Le bouton « Afficher l'historique » apparaît sur la page d'accueil lorsque vous disposez d'un historique d'évaluations valide. Cela rend les réévaluations plus utiles, car vous n'obtenez pas simplement un nouveau score — vous construisez une image de votre parcours de développement.
Améliorations de la base de données et de Performance
En coulisses, nous avons optimisé la façon dont PAICE stocke et récupère les données :
- Des requêtes plus rapides : ajout d'index composites ayant significativement réduit les temps de requête
- Une meilleure gestion des connexions : configuration du pooling de connexions pour les scénarios à forte concurrence
- Une architecture plus propre : suppression des composants inutilisés et simplification du code
- Un cache amélioré : mise en cache des données fréquemment consultées
- Des prompts optimisés : réécriture des prompts au format XML pour plus d'efficacité et des résultats plus cohérents entre les modèles
Ces améliorations sont particulièrement importantes pour les déploiements organisationnels où de nombreuses personnes passent des évaluations simultanément.
La fondation invisible
Ces améliorations sont consignées de façon progressive dans notre mise à jour hebdomadaire chaque lundi au fil de leur déploiement, mais elles ne font pas vraiment la une. Parfois, il n'y a pas de nouvelle fonctionnalité à annoncer, pas de changement d'interface à montrer. Pourtant, elles représentent des centaines d'heures de travail qui rendent tout le reste possible.
Lorsque vous passez une évaluation, vous ne remarquerez rien de tout cela. C'est précisément l'objectif. Une bonne infrastructure est invisible — elle fonctionne, tout simplement.
Mais sachez que derrière chaque évaluation :
- Des systèmes de contexte créent des situations authentiques plutôt que des scénarios scriptés
- La présentation des résultats est conçue pour aider, pas seulement informer, et en aucun cas pour frustrer
- Plusieurs modèles d'IA collaborent pour garantir une réalisation fiable
- Des bases de données optimisées gèrent la charge organisationnelle
Voilà la fondation qui nous permet de nous concentrer sur ce qui compte : vous aider à comprendre et à développer vos capacités de collaboration avec l'IA. Tout comme notre approche de l'accessibilité, de la confidentialité ou des utilisateurs agentiques, nous construisons des systèmes depuis la base qui sont soigneusement alignés sur les résultats visés, et pas seulement sur les fonctionnalités visibles.
La suite
Nous nous concentrons sur :
- Les capacités de cohorte : des outils renforcés pour les déploiements organisationnels
- Le support multilingue : l'extension de l'accessibilité de l'évaluation aux hispanophones en premier, suivi d'autres langues
- L'apprentissage continu : l'analyse des résultats de nos tests A/B/C pour améliorer la délivrance des retours
Les fonctionnalités visibles retiennent l'attention, mais c'est le travail invisible qui les rend possibles.
Découvrez les améliorations par vous-même :
- Passer l'évaluation (gratuit, toujours)
- Consulter votre historique d'évaluations (si vous avez des évaluations antérieures)
- Explorer le programme Founding Partner (pour les organisations)
Lectures complémentaires
- Modifications de PAICE Score™ : les nouveautés de janvier 2026 — L'échelle de 1 000 points et les variantes de la page de résultats
- Ce que votre PAICE Score signifie vraiment — Comprendre les niveaux et leur interprétation
- En quoi PAICE diffère-t-il des autres évaluations ? — Notre approche de mesure comportementale
- Puis-je repasser l'évaluation ? — Suivre sa progression dans le temps
Curieux mais pressé ?
Faites le PAICE Pulse en 3 minutes — une vérification rapide qui cartographie votre perception de votre posture de collaboration IA. Aucune connexion requise.