Pocket TTS : le laboratoire français Kyutai fait tenir une voix de qualité dans un simple processeur
Le laboratoire parisien Kyutai a mis en open source un modèle de synthèse vocale tenant en 100 millions de paramètres : assez léger pour cloner une voix et parler en temps réel sur un simple processeur, sans carte graphique ni cloud.
Kyutai, laboratoire de recherche parisien à but non lucratif, a mis en open source Pocket TTS : un modèle de synthèse vocale tenant en seulement 100 millions de paramètres, sous licence MIT, capable de cloner une voix à partir d’un simple fichier audio et de parler plus vite que le temps réel sur un processeur ordinaire — sans carte graphique ni passage par un serveur distant.
Le code d’entraînement du modèle a été publié le 25 août 2026, complétant une première sortie en janvier puis une extension multilingue en mai. Sur le processeur d’un MacBook Air M4, Kyutai annonce une génération à environ six fois la vitesse réelle, en n’utilisant que deux cœurs. Aucun data center n’est nécessaire : la voix se calcule directement sur l’appareil de l’utilisateur.
Qu’est-ce que Pocket TTS ?
Pocket TTS (« text-to-speech de poche ») est un modèle de synthèse vocale conçu pour être aussi léger que performant. Ses caractéristiques, documentées sur le dépôt GitHub du projet :
- 100 millions de paramètres, contre plusieurs milliards pour la plupart des modèles vocaux concurrents.
- Licence MIT et poids du modèle publiés sur Hugging Face, librement réutilisables.
- Clonage de voix à partir d’un simple fichier audio passé en argument, sans réentraînement.
- Six langues nativement prises en charge — anglais, français, allemand, portugais, italien et espagnol — et huit langues supplémentaires entraînées par la communauté (tchèque, hindi, coréen, persan, indonésien, estonien, gallois, polonais).
- Performances mesurées : environ 6 fois le temps réel sur le CPU d’un MacBook Air M4 avec deux cœurs seulement, et 2,3 à 2,5 fois le temps réel sur une machine cloud x86 à quatre vCPU.
Pourquoi faire tenir une IA vocale dans un simple processeur ?
La quasi-totalité des voix de synthèse grand public — celles d’ElevenLabs ou d’OpenAI par exemple — tournent sur des serveurs distants équipés de puissants processeurs graphiques. Cela impose une connexion internet, une latence, et un coût par minute générée. Un modèle qui tient sur un simple processeur change la donne pour trois usages précis : les objets connectés et l’embarqué (voitures, jouets, assistants domestiques) qui n’ont ni GPU ni connexion permanente ; les outils d’accessibilité, où la voix doit rester disponible hors ligne et sans latence ; et la confidentialité, puisque rien ne transite vers un serveur tiers.
Kyutai a d’ailleurs déjà appliqué cette logique à un projet d’accessibilité : Invincible Voice, un outil open source destiné aux personnes atteintes de la maladie de Charcot (SLA), qui permet de continuer à s’exprimer avec sa propre voix de synthèse à mesure que la parole s’éteint.
Qui est Kyutai, le laboratoire derrière ce modèle ?
Fondé à Paris en 2023, Kyutai est un laboratoire de recherche en intelligence artificielle à but non lucratif, financé à hauteur d’environ 300 millions d’euros par le groupe Iliad de Xavier Niel, le groupe CMA CGM de Rodolphe Saadé, et la fondation d’Eric Schmidt, ex-patron de Google. Sa direction a été confiée à Patrick Pérez, ancien directeur scientifique de valeo.ai, qui a recruté une équipe passée par les meilleurs laboratoires du secteur — dont plusieurs anciens de Meta FAIR Paris et de Google DeepMind. Le chercheur Yann LeCun, chef scientifique de Meta AI, siège à son comité scientifique.
« La science ouverte partage le processus de création des modèles, y compris l’expertise en algorithmique et le code. » — Patrick Pérez, directeur général de Kyutai.
Depuis sa création, le laboratoire a publié Moshi (2024), premier système de dialogue vocal en temps réel capable de s’interrompre naturellement, puis Hibiki (traduction voix-à-voix), Helium 1 (grand modèle de langage multilingue) et, en 2026, une série de modèles plus spécialisés : MoshiRAG, Muscriptor, MIRA et Pocket TTS.
Comment un laboratoire non lucratif finance-t-il une recherche entièrement ouverte ?
Contrairement à Mistral AI, l’autre grand nom français de l’IA, qui commercialise ses modèles, Kyutai ne vend ni API ni abonnement : tout son travail est publié gratuitement. Mais la publication de code et de poids ne rapporte rien. En 2026, le laboratoire a créé une filiale commerciale, Kyutai Transfer, chargée de proposer conseil, expertise, formation et assistance aux entreprises qui veulent déployer ses technologies — une manière de financer la recherche par des partenariats commerciaux sans faire payer l’accès aux modèles eux-mêmes, qui restent en libre accès.
Questions fréquentes
Qu’est-ce que Pocket TTS de Kyutai ?
C’est un modèle open source de synthèse vocale de 100 millions de paramètres, publié sous licence MIT, capable de cloner une voix et de fonctionner en temps réel sur un simple processeur, sans carte graphique.
Pocket TTS peut-il cloner n’importe quelle voix ?
Oui : il suffit de fournir un fichier audio de la voix à imiter en argument, sans réentraînement du modèle. Le projet est publié sur GitHub (kyutai-labs/pocket-tts) et les poids sont hébergés sur Hugging Face.
Qui a fondé Kyutai et qui le finance ?
Kyutai a été fondé à Paris en 2023 et financé à hauteur d’environ 300 millions d’euros par Xavier Niel (Iliad), Rodolphe Saadé (CMA CGM) et la fondation d’Eric Schmidt. Sa direction générale est assurée par le chercheur Patrick Pérez.
Le Radar Tech — la rédaction. Sources : kyutai.org, GitHub (kyutai-labs/pocket-tts), itforbusiness.fr, Monde Numérique (2024-2026).