En bref
L’enquête VentureBeat met en évidence un décalage entre validation interne et comportement réel: 50 % des organisations pratiquant des évaluations déclarent avoir déjà connu un incident client après la réussite des tests internes d’une fonctionnalité agent ou LLM. Parallèlement, 66 % autorisent déjà ou préparent certains déploiements sans validation humaine. Le signal invite à mesurer la valeur des evals par leur relation avec les résultats de production.
Ce qui change
Le contrôle pré-production ne peut plus être considéré comme une validation suffisante à lui seul lorsque les agents gagnent en autonomie. Les incidents réels doivent alimenter les jeux d’évaluation, et la décision de déployer doit intégrer la capacité des tests à anticiper les comportements observés en production.
Pourquoi ça compte
Un décalage entre evals et réalité peut conduire à des erreurs face aux clients, des actions automatisées incorrectes, des coûts d’incident et une dégradation de l’expérience utilisateur. Pour les acheteurs d’outils, cela déplace aussi le critère de sélection: la couverture et les scores de tests comptent moins s’ils ne permettent pas d’anticiper les résultats en production.
Qui est concerné
Directions IA et tech, équipes engineering et produit, opérations, sécurité, responsables de services numériques exploitant des agents en production et acheteurs de plateformes d’évaluation ou d’observabilité IA.
Action à faire
- 1Comparer les résultats d’eval des agents autonomes déjà en production avec les incidents et erreurs réellement observés.
- 2Réintégrer les cas d’échec constatés en production dans les jeux de tests.
- 3Maintenir une validation humaine pour les actions à impact significatif.
- 4Évaluer les plateformes d’eval sur leur capacité à correspondre aux résultats de production plutôt que sur le seul volume de tests ou leurs taux de réussite.
Risques et limites
Le signal repose sur une enquête non probabiliste de 157 répondants auto-sélectionnés, avec une surreprésentation du mid-market. Les réponses sont déclaratives et aucune tendance temporelle n’est fournie. Les pourcentages doivent donc être considérés comme directionnels et non comme représentatifs de toutes les entreprises.
Verdict Radar
ACT_NOW: les entreprises qui exploitent des agents en production ont intérêt à vérifier immédiatement si leurs evals anticipent réellement leurs propres incidents. La montée des déploiements sans validation humaine rend cette vérification plus importante, même si l’ampleur générale du phénomène reste à confirmer.
Sources
Sources
Signal d’origine utilisé pour l’analyse Radar.
Recevoir la newsletter Radar
Un email par semaine. Les signaux triés, notés, prêts à décider.



