En résumé:
- PCWorld rapporte que Thinking Machines, fondée par Mira Murati, ancienne cadre d’OpenAI, a développé de nouveaux modèles d’interaction vocale IA qui permettent des conversations en temps réel avec interruptions et reconnaissance de repères visuels.
- La technologie utilise un système à double IA avec un modèle d’interaction rapide et un modèle d’arrière-plan pour les tâches complexes, en utilisant une approche multi-flux et micro-tours.
- Cette avancée pourrait transformer le chat vocal IA du mode radio CB actuel en conversations naturelles de type humain, bien que la technologie reste en phase de recherche.
Le chat vocal avec l’IA d’aujourd’hui peut sembler aussi guindé qu’un échange de radio CB à l’ancienne, où vous êtes obligé de parler à tour de rôle.
« Hey ChatGPT, parlons des films ! Terminé. »
« Bien sûr Ben, de quel film aimerais-tu parler ? Terminé. »
OK, vous n’avez donc pas littéralement besoin de dire « terminé » et « terminé » pendant les conversations vocales avec ChatGPT ou Gemini, mais c’est essentiellement ce qui se passe dans les coulisses.
À certains égards, les modes vocaux de l’IA sont encore plus limités que les discussions radio CB. Non seulement l’IA doit attendre pendant que vous parlez, mais elle n’a aucune perception de quoi que ce soit d’autre qui se passe pendant que vous parlez, y compris le passage du temps. De même, lorsque l’IA parle, elle est trop occupée à générer sa réponse pour « penser » à autre chose. En d’autres termes, le mode vocal AI n’est qu’un chat texte AI standard avec des voix ajoutées. Du coup, je ne l’utilise quasiment jamais.
Cela pourrait changer grâce à une nouvelle génération de modèles d’IA « d’interaction » qui peuvent réellement suivre le flux et le reflux d’une conversation, voire l’interrompre tout en vous écoutant en temps réel.
Développés par Thinking Machines, une startup d’IA fondée par Mira Murati, ex-directrice d’OpenAI, ces modèles « d’interaction » ne ressemblent pas aux modèles d’IA monothread d’aujourd’hui, qui ne peuvent ni penser pendant qu’ils vous écoutent, ni réagir pendant qu’ils parlent. Au lieu de cela, ces nouveaux modèles utilisent une configuration « multi-flux, micro-tours » qui leur permet de continuer à traiter les entrées, y compris les images et les sons, pendant qu’ils vous écoutent, et peuvent ensuite même interrompre en fonction de ce que vous dites.
Dans une série de démos, Thinking Machines montre ses modèles (qui sont encore en avant-première) réagissant à ses participants humains en temps réel lors de chats vidéo, identifiant les produits qu’ils brandissent et gardant un compte courant des mots « animaux » (comme « cerf » et « mouton ») pendant qu’un utilisateur humain continue de parler. Les modèles Thinking Machines font également preuve d’une retenue impressionnante lors d’une autre interaction, attendant patiemment plutôt que de se lancer pendant que son partenaire humain prend une gorgée de café au milieu d’une phrase.
Dans une autre démo, le modèle fait interrompre (comme indiqué), corrigeant une locutrice humaine en temps réel alors qu’elle prononce mal le mot « açaï » et corrigeant sa déclaration intentionnellement inexacte selon laquelle les bols d’açai sont originaires d’Argentine. Oui, cela semble ennuyeux, mais la démo montre que l’IA de Thinking Machine peut réagir pendant qu’elle écoute, plutôt que de rester bloquée en attendant son tour.
Alors, quelle est l’astuce de Thinking Machine ? La société utilise en fait deux modèles d’IA : un modèle « d’interaction » qui est continuellement « présent » avec l’utilisateur, traitant les entrées et les sorties par tranches rapides de 200 ms, tandis qu’un deuxième modèle « d’arrière-plan » fait le gros du travail pour des tâches plus complexes, en transmettant les résultats au modèle d’interaction plus rapide lorsqu’ils sont prêts.
Les nouveaux modèles d’IA interactifs de Thinking Machine sont toujours en cours de développement (je ne les ai pas encore vus ou entendus en action.) La startup admet que ses modèles ont du mal avec des conversations « très longues » et qu’ils dépendent d’une « connectivité fiable » pour fonctionner correctement. Le modèle « d’interaction » actuel de l’entreprise est également plutôt petit, car les modèles plus grands sont « trop lents pour fonctionner dans ce contexte ».
Néanmoins, le nouveau paradigme « full-duplex » de Thinking Machine pourrait changer la donne pour le chat vocal IA, le rendant fluide et naturel plutôt que tendu. Smokey et le bandit-ère d’avant en arrière.











