- IA vocale
- Temps réel
- Architecture
- Téléphonie
Au téléphone, une seconde de silence est un gouffre. Décomposition du budget de latence d'un agent vocal, poste par poste, et les trois arbitrages qui le font tenir.
Un chatbot qui répond en trois secondes passe inaperçu. Un agent vocal qui met trois secondes à répondre au téléphone donne l'impression d'avoir raccroché. Le canal change tout : à l'écrit, l'attente est visible et tolérée ; à l'oral, elle est interprétée.
La cible utile est en dessous de la seconde entre la fin de la phrase de l'appelant et le début de la réponse. Voici comment ce budget se dépense.
La chaîne, poste par poste
Un agent vocal enchaîne quatre étapes, et chacune consomme du budget :
- Détection de fin de tour — savoir que l'humain a fini de parler.
- Transcription — de l'audio au texte.
- Génération — le modèle de langage produit la réponse.
- Synthèse vocale — du texte à l'audio.
Additionnées naïvement, en attendant que chaque étape se termine avant de lancer la suivante, ces quatre étapes dépassent largement la seconde. La tenue du budget ne vient pas d'étapes plus rapides : elle vient du fait qu'elles ne s'attendent pas.
Le poste le plus coûteux n'est pas celui qu'on croit
Intuitivement, on soupçonne le modèle de langage. En pratique, le poste le plus dangereux est le premier : la détection de fin de tour.
La méthode naïve consiste à attendre un silence d'une durée fixe. Trop court, l'agent coupe la parole à chaque respiration — ce qui est bien pire que la lenteur, parce que c'est ressenti comme de l'impolitesse. Trop long, on ajoute mécaniquement ce délai à chaque tour de parole.
La sortie par le haut consiste à ne pas décider sur le seul silence : la prosodie et l'incomplétude syntaxique de la phrase en cours renseignent bien mieux sur l'intention de continuer. « Je voudrais un rendez-vous pour... » et « Je voudrais un rendez-vous. » n'appellent pas la même patience, même avec un silence identique.
Trois arbitrages qui font tenir le budget
1. Tout streamer, de bout en bout
C'est l'arbitrage structurant. Chaque étape doit commencer à travailler sur le début de la sortie de la précédente, sans attendre qu'elle soit complète.
Concrètement : la transcription est incrémentale ; le modèle est appelé en streaming ; et surtout, la synthèse vocale démarre sur la première phrase produite, pendant que le modèle rédige encore la suite. Puisque la lecture audio d'une phrase prend plusieurs secondes, le reste de la génération se déroule intégralement pendant que l'appelant écoute déjà. La latence perçue s'effondre à celle du premier fragment.
2. Court par construction, pas par instruction
Demander « sois bref » dans le prompt fonctionne mal et de manière irrégulière. Ce qui fonctionne, c'est de contraindre la forme de la sortie : une réponse structurée, avec un champ de parole court et distinct des données métier extraites.
Cela sert deux buts à la fois. Le premier fragment audio arrive plus vite, et la partie exploitable — le créneau retenu, le nom, le numéro rappelé — est directement lisible par le programme, sans avoir à la réextraire d'un paragraphe.
3. Une phrase d'accroche pendant que le reste se prépare
La technique la plus rentable est aussi la moins technique. Une amorce très courte — « Bien sûr, je regarde ça » — jouée immédiatement pendant que la vraie réponse se construit fait disparaître le silence.
Elle ne réduit aucune latence réelle. Elle supprime la seule qui compte : celle que l'appelant perçoit. À condition d'être variée et de rester crédible, faute de quoi elle devient un tic reconnaissable au bout de trois appels.
Les contraintes qui n'ont rien à voir avec la latence
Deux exigences dominent en réalité la conception, et aucune n'est technique.
L'appelant doit savoir qu'il parle à une machine. Ce n'est pas une option de confort : c'est une obligation, et c'est aussi la seule posture tenable. Un interlocuteur informé pardonne une erreur de compréhension ; un interlocuteur trompé qui découvre la supercherie ne pardonne rien.
L'échappatoire vers un humain doit exister et être atteignable. Un agent qui ne sait pas dire « je vous passe quelqu'un » transforme chaque cas non prévu en client perdu. Le taux de transfert n'est pas un indicateur d'échec : c'est un indicateur de sécurité.
Ce qui se mesure
Trois indicateurs suffisent à piloter, et un seul est une latence :
- Le délai avant le premier son — mesuré de bout en bout, sur la ligne téléphonique réelle, pas en laboratoire.
- Le taux de coupure de parole — combien de fois l'agent a démarré alors que l'humain n'avait pas fini.
- Le taux d'aboutissement — la part d'appels terminés par un résultat exploitable : rendez-vous pris, message qualifié, transfert réussi.
Le troisième est le seul qui compte vraiment pour l'entreprise qui installe l'agent. Les deux premiers expliquent pourquoi il monte ou descend.