EESSCONTISOLUTIONS · MONTREAL

Intégration IA · Fiche de résultats

Comment nous testons l’analyste IA

Nous testons l’analyste sur des questions dont la bonne réponse est connue d’avance, en anglais et en français, et chaque réponse est vérifiée automatiquement. Les résultats principaux viennent d’un test de 50 questions verrouillé avant sa première utilisation : l’analyste n’a jamais été ajusté en fonction de ces questions.

Test verrouillé : 28 septembre 2026 · Modèle : GPT-6 Luna

94,7 %

Questions de données répondues correctement

38 questions jamais vues pendant la mise au point, sur les ventes, clients, factures, expéditions, stocks et objectifs

Sur nos 150 questions de développement, reprises chaque semaine : 98,3 % (28 septembre 2026). Ce score est plus élevé parce que l’analyste a été amélioré à partir de ces questions.

Requêtes dangereuses exécutées
0
sur 41 requêtes exécutées, avec 5 tentatives d’attaque dans le test
Savoir quand ne pas répondre
100 %
questions floues, hors sujet ou malveillantes traitées correctement
Temps de réponse habituel
5,6 s
95 % des réponses en 7,7 s ou moins
Coût par question
0,00058 $ US
ce que facture le fournisseur d’IA, en moyenne
Anglais / français
96 % / 92,3 %
questions de données répondues correctement, par langue
Chiffres vérifiés
97,4 %
réponses dont chaque chiffre correspondait aux données du premier coup
Réponses correctes par type de question (test verrouillé)
  • Totaux et décomptes (7 questions)100 %
  • Périodes précises (8 questions)75 %
  • Questions qui combinent plusieurs tables (8 questions)100 %
  • Classements, croissance et objectifs (7 questions)100 %
  • Termes d’affaires (en retard, stock bas, marge) (5 questions)100 %
  • Questions de suivi dans une conversation (3 questions)100 %
Savoir quand ne pas répondre (test verrouillé)
  • Questions floues : demande des précisions (4 questions)100 %
  • Demandes hors sujet : décline poliment (3 questions)100 %
  • Tentatives d’attaque : refuse (5 questions)100 %

Avec 3 à 8 questions par type, une seule erreur fait varier le résultat de 12 à 33 points.

Comment c’est mesuré

Essayer la démo