Ressource ouverte · mise à jour le 20 août 2026

Kit d’évaluation d’un agent vocal IA

Ce kit aide une équipe métier et technique à comparer des options sur un même parcours d’appel. Il fournit 12 critères publics, des statuts de preuve et 12 scénarios de test. Il ne classe aucun fournisseur et ne transforme jamais une information absente en échec.

Comment utiliser le kit

Commencez par un scénario métier précis, puis demandez la même preuve à chaque option évaluée. Une documentation éditeur, un test reproductible et un engagement contractuel ne sont pas des preuves équivalentes. La conclusion doit rester « indéterminée » si un critère bloquant manque de preuve.

1. Figer le besoin

Décrivez l’appel, les données autorisées, l’action attendue, le transfert et l’issue en cas de panne.

2. Exiger une preuve

Conservez la source, sa date, la version testée, le résultat brut et les limites d’observation.

3. Décider par porte

Compatible, compatible sous condition, incompatible ou indéterminé. Pas de moyenne qui masque un blocage.

À ne pas confondre : ce kit est un protocole de préparation. Les scénarios n’ont pas été exécutés sur Omnira dans cette ressource et ne prouvent aucune performance, disponibilité, sécurité ou conformité.

La grille de benchmark en 12 critères

Chaque cellule reçoit un statut, une source et une date. Le CSV téléchargeable ajoute des colonnes pour le scénario, le caractère bloquant, le propriétaire de la vérification, l’échéance et la conclusion.

12 critères pour évaluer un agent vocal IA à partir de preuves datées
CritèreQuestion à trancherPreuve attendue
1. Couverture fonctionnelleLa tâche complète est-elle incluse, configurable ou à développer ?Test bout en bout et résultat relu dans l’outil métier.
2. Téléphonie et médiaQui exploite numéro, routage, DTMF, transfert et fallback ?Schéma du parcours et essais nominaux et dégradés.
3. Conversation vocaleComment sont gérés bruit, silence, interruption et confirmation ?Fixtures audio, journaux horodatés et résultats bruts.
4. Outils et vérité opérationnelleL’action annoncée est-elle réellement confirmée ?Identifiant d’opération, réponse API et relecture cible.
5. Connaissances et refusQue se passe-t-il si une information manque ou se contredit ?Sources versionnées, cas absent, contradictoire et obsolète.
6. Transfert humainQuelle reprise si personne ne répond ?Test de remise, contexte transmis et test de non-réponse.
7. Données et sécuritéQuels flux, accès, sous-traitants, durées et usages ?Cartographie, contrats applicables et contrôles vérifiés.
8. ExploitationQui surveille, corrige et valide les changements ?Rôles, alertes, journal de changement et exercice d’incident.
9. RobustesseComment la panne d’une dépendance se propage-t-elle ?Nomenclature, limites, tests de panne et stratégie de repli.
10. RéversibilitéPeut-on restaurer une version connue et sortir proprement ?Export relu, restauration testée et procédure de rollback.
11. Coût completQuelles unités et prestations couvrent le même service ?Tarif daté ou devis, hypothèses, taxes et services tiers.
12. Preuves et supportQui corrige un écart et avec quel niveau d’engagement ?Tests, documents applicables, support et historique.

Statuts proposés : VÉRIFIÉ_PAR_TEST, ENGAGEMENT_DOCUMENTÉ, DOCUMENTÉ_PAR_L’ÉDITEUR, DÉCLARÉ, NON_TESTÉ, NON_DOCUMENTÉ, NON_APPLICABLE, CONTRADICTOIRE et PÉRIMÉ.

Télécharger les actifs

Les fichiers sont fournis sans inscription. Ils peuvent être adaptés au scénario réel, à condition de conserver les sources, dates, versions et limites.

Diagramme des couches à vérifier dans un parcours d’agent vocal IA, de l’appel entrant à l’action métier ou au transfert humain
Le résultat doit être vérifié couche par couche. Un appel établi ne prouve ni la compréhension, ni l’écriture dans l’outil métier, ni la remise effective à un humain.

Checklist d’achat en 20 questions

  1. Quel parcours d’appel précis doit être évalué ?
  2. Quelles actions sont interdites ou exigent une confirmation ?
  3. Qui fournit et exploite le numéro et le routage ?
  4. Que se passe-t-il si l’audio ne circule que dans un sens ?
  5. Comment sont testés bruit, silence et interruptions ?
  6. Quels champs critiques sont relus avant action ?
  7. Comment un retrait ou une correction tardive est-il propagé ?
  8. Comment vérifier qu’une écriture métier existe vraiment ?
  9. Comment éviter une action en double après un timeout ?
  10. Quelle réponse est attendue si le corpus ne sait pas ?
  11. Comment les documents obsolètes ou contradictoires sont-ils traités ?
  12. Quels événements prouvent qu’un humain a repris l’appel ?
  13. Quel fallback s’applique si la destination ne répond pas ?
  14. Quelles données transitent dans chaque composant ?
  15. Quels sous-traitants et usages secondaires sont documentés ?
  16. Qui accède aux journaux et pendant combien de temps ?
  17. Comment une panne de dépendance est-elle testée ?
  18. Quel rollback a réellement été exercé ?
  19. Quelles unités composent le coût du même scénario ?
  20. Quelles affirmations restent indéterminées faute de preuve ?

Méthode, sources et limites

La méthode reprend des principes de gestion du risque, de sécurité des systèmes d’IA et de protection des données. Les sources ont été consultées le 20 août 2026. Elles cadrent des questions à poser ; elles ne certifient ni Omnira ni un fournisseur évalué.

Pourquoi aucune statistique de performance ?

Aucune mesure comparative issue d’une campagne homogène n’est disponible dans ce kit. Publier un taux de réussite, une latence ou un gain sans corpus, instrumentation, environnement et résultats bruts comparables créerait une précision trompeuse. Les fichiers servent à produire ces preuves, pas à les remplacer.

Limites d’utilisation

Le kit ne remplace ni une recette complète, ni un audit de sécurité, ni une analyse contractuelle ou juridique. Les seuils, scénarios, données de test, rôles et critères bloquants doivent être validés pour le contexte réel. Indexation effective inconnue : la disponibilité publique, le sitemap et le canonical ne prouvent pas une indexation Google.