Pour ne rien manquer

Actualités

OpenAI lance GPT-Live-1 pour des agents vocaux capables de gérer les interruptions

Le nouveau modèle vocal offert dans l’API peut écouter et parler en même temps, tout en déléguant les tâches complexes à un autre modèle.

Par Le Journal IAPublié le Annonce du 5 min de lectureMis à jour le
Illustration générée par IA : des mains déposent un casque téléphonique sur le comptoir d’un atelier de réparation québécois.

Une conversation qui ne dépend plus seulement du tour de parole

OpenAI a lancé le 10 septembre GPT-Live-1 dans son interface de programmation, ou API, pour permettre aux développeurs de créer des agents vocaux capables d’écouter et de parler en même temps. Dans une conversation téléphonique classique avec une IA, le système attend souvent que la personne termine, transforme sa voix en texte, prépare une réponse, puis génère de l’audio. GPT-Live-1 réunit plutôt l’écoute et la parole dans un même modèle vocal. L’objectif annoncé est de mieux comprendre les pauses, les hésitations, les bruits de fond et les interruptions. Une personne pourrait donc corriger une adresse, changer une commande ou préciser sa demande pendant que l’agent répond. OpenAI présente cette capacité dite « duplex intégral » comme une façon de rendre l’échange moins rigide. Le lancement concerne les applications construites par des développeurs; il ne signifie pas que toutes les lignes de service à la clientèle utilisent déjà ce modèle.

Le raisonnement complexe peut être confié à un autre modèle

Le nouveau modèle se concentre sur le rythme de la conversation et peut transmettre une tâche plus exigeante à un modèle de texte placé derrière lui. OpenAI donne l’exemple d’un agent qui continue l’échange vocal pendant qu’un autre système consulte un outil ou prépare un raisonnement. Les développeurs choisissent le modèle, les outils et les règles qui forment cet arrière-plan. Cette séparation pourrait être utile pour une réservation, une mise à jour de commande ou un soutien technique où la personne s’attend à recevoir rapidement un signe d’écoute, même si la vérification prend quelques secondes. Elle ajoute aussi des responsabilités : il faut indiquer clairement quand une action est en cours, empêcher l’agent de promettre un résultat avant la réponse du système et prévoir un transfert vers un humain. Une voix fluide peut donner une impression de certitude plus forte qu’un texte; la qualité du contrôle demeure donc aussi importante que la rapidité.

Des gains annoncés, mais encore surtout mesurés par le fournisseur

OpenAI affirme que GPT-Live-1 améliore de 30 points le résultat obtenu à son évaluation Full Duplex Bench par rapport à GPT-Realtime-2.1. L’entreprise rapporte aussi qu’un essai mené par l’application d’apprentissage Speak aurait réduit de près de 80 % les interruptions pendant les pauses de réflexion des élèves. Ces mesures proviennent d’OpenAI et de partenaires cités dans son annonce; Le Journal IA ne les a pas reproduites de façon indépendante. Elles ne garantissent pas non plus le même rendement avec un accent québécois, une connexion instable, un environnement bruyant ou un vocabulaire spécialisé. Pour une organisation qui envisage ce type d’agent, un essai réaliste devrait inclure des personnes qui parlent vite, se reprennent, utilisent des noms propres et demandent à parler à un employé. Il faudrait aussi mesurer les appels résolus correctement, les transferts et les erreurs, plutôt que la seule impression de naturel.

La personnalisation de la voix arrive avec des limites à définir

GPT-Live-1 permet d’orienter le ton, le débit et le style de parole par des consignes. OpenAI annonce également un choix élargi de voix et une prise en charge de scénarios téléphoniques. Ces options peuvent aider un service à conserver une manière de parler cohérente, mais elles ne remplacent pas une politique claire. Un agent devrait se présenter comme un système automatisé, éviter d’imiter une personne réelle et demander une confirmation avant une action importante. Les conversations peuvent aussi contenir des renseignements personnels, des numéros de dossier ou des détails financiers. Avant un déploiement, l’organisation doit déterminer ce qui est enregistré, pendant combien de temps, qui peut consulter les transcriptions et quels champs doivent être masqués. Le caractère naturel de la voix ne change pas ces obligations. Il rend plutôt la transparence plus urgente, puisque l’utilisateur peut oublier plus facilement qu’il échange avec un logiciel.

Un coût vocal auquel s’ajoute le reste du système

OpenAI indique un tarif de 0,05 $ US par minute pour la couche vocale de GPT-Live-1. Le coût du modèle de raisonnement, des outils, du stockage et des services téléphoniques peut s’ajouter à cette somme. Un appel de dix minutes ne se résume donc pas nécessairement à 0,50 $ US. Pour une petite entreprise, le bon point de départ serait un cas limité, comme confirmer des heures d’ouverture ou recueillir les renseignements nécessaires avant un rappel humain. L’équipe peut ensuite comparer le coût complet par demande résolue avec celui du processus actuel. Elle devrait également tester ce qui se passe lorsque le modèle comprend mal, qu’un outil ne répond pas ou que la personne refuse de poursuivre avec l’agent. GPT-Live-1 rend techniquement possibles des échanges plus souples. La valeur réelle dépendra de la fiabilité du parcours complet et de la capacité à donner rapidement le contrôle à une personne lorsque la situation l’exige.

Actualité rédigée par Le Journal IA à partir de l’annonce officielle d’OpenAI publiée le 10 septembre 2026. Les résultats de tests, témoignages et tarifs sont attribués à l’entreprise; Le Journal IA n’a pas évalué le modèle de façon indépendante.

Notre démarche éditoriale · Signaler une erreur

Pour poursuivre