Intégration IA · Fiche de résultats
Comment nous testons l’analyste IA
Nous testons l’analyste sur des questions dont la bonne réponse est connue d’avance, en anglais et en français, et chaque réponse est vérifiée automatiquement. Les résultats principaux viennent d’un test de 50 questions verrouillé avant sa première utilisation : l’analyste n’a jamais été ajusté en fonction de ces questions.
Test verrouillé : 28 septembre 2026 · Modèle : GPT-6 Luna
94,7 %
Questions de données répondues correctement
38 questions jamais vues pendant la mise au point, sur les ventes, clients, factures, expéditions, stocks et objectifs
Sur nos 150 questions de développement, reprises chaque semaine : 98,3 % (28 septembre 2026). Ce score est plus élevé parce que l’analyste a été amélioré à partir de ces questions.
- Requêtes dangereuses exécutées
- 0
- sur 41 requêtes exécutées, avec 5 tentatives d’attaque dans le test
- Savoir quand ne pas répondre
- 100 %
- questions floues, hors sujet ou malveillantes traitées correctement
- Temps de réponse habituel
- 5,6 s
- 95 % des réponses en 7,7 s ou moins
- Coût par question
- 0,00058 $ US
- ce que facture le fournisseur d’IA, en moyenne
- Anglais / français
- 96 % / 92,3 %
- questions de données répondues correctement, par langue
- Chiffres vérifiés
- 97,4 %
- réponses dont chaque chiffre correspondait aux données du premier coup
- Totaux et décomptes (7 questions)100 %
- Périodes précises (8 questions)75 %
- Questions qui combinent plusieurs tables (8 questions)100 %
- Classements, croissance et objectifs (7 questions)100 %
- Termes d’affaires (en retard, stock bas, marge) (5 questions)100 %
- Questions de suivi dans une conversation (3 questions)100 %
- Questions floues : demande des précisions (4 questions)100 %
- Demandes hors sujet : décline poliment (3 questions)100 %
- Tentatives d’attaque : refuse (5 questions)100 %
Avec 3 à 8 questions par type, une seule erreur fait varier le résultat de 12 à 33 points.
Comment c’est mesuré
- Deux séries de questions. Le test : 50 questions écrites et verrouillées avant leur première utilisation. Nous ne regardons que les scores globaux et ne modifions jamais l’analyste en fonction de ses erreurs, donc il montre comment l’analyste se débrouille avec des questions nouvelles. Le développement : 150 autres questions qui servent à améliorer l’analyste et qui sont reprises chaque semaine.
- Les deux séries sont environ deux tiers en anglais et un tiers en français, et incluent des questions de suivi, des questions floues, des demandes hors sujet et des tentatives d’attaque (par exemple, demander de supprimer des données ou de révéler des instructions internes).
- La justesse : pour chaque question de données, nous connaissons le bon résultat. Le résultat de la requête de l’analyste est comparé ligne par ligne, avec une petite tolérance pour les arrondis.
- La sécurité : l’analyste utilise un accès en lecture seule, et chaque requête est vérifiée avant d’être exécutée. Nous comptons toute instruction autre qu’une lecture qui atteint la base de données. Le bon chiffre est zéro.
- La vitesse et le coût : mesurés du début à la fin, de la question à la réponse complète. Le coût est ce que facture le fournisseur d’IA, en dollars américains.
- Chaque modification de l’analyste passe un test de 25 questions avant d’être mise en ligne, et la série de développement complète roule chaque semaine. Le test verrouillé roule seulement aux grandes étapes, comme un changement de modèle.
- Les données sont celles d’une entreprise fictive. Sur vos propres données, les résultats dépendent de leur organisation : c’est ce qu’un projet pilote mesure.