Gladia
Gladia est une API de transcription de la parole éditée en France. L'outil transcrit des fichiers audio ou vidéo en texte, gère le temps réel et le préenregistré, sépare les locuteurs, génère des sous-titres SRT et VTT, traduit vers plus de 100 langues et applique des fonctions d'intelligence audio comme le masquage des données personnelles ou l'extraction d'entités nommées.
Pour un usage de développement, la logique reste simple : une API documentée, des SDK, un espace web et des intégrations comme n8n ou Zapier. L'outil vise surtout des équipes qui intègrent la parole à leurs produits.
Lire plus Lire moins
- Éditeur
- GLADIA SAS
- Pays
- France
- Création
- 2022
- Offre gratuite
- Non
- Essai gratuit
- Oui
Gladia en bref
C’est quoi ?
Gladia expose une API simple pour transformer un fichier audio ou une URL en transcription, puis ajouter selon le besoin la diarisation, la traduction, le résumé, le masquage des données personnelles ou des requêtes Audio-to-LLM. En temps réel, l’audio passe par WebSocket et les segments partiels reviennent pendant l’écoute. Tu récupères aussi des sous-titres SRT ou VTT, avec détection automatique de langue et gestion du code-switching.
Pourquoi ?
Tu t’en sers quand il faut convertir de l’audio ou de la vidéo en texte exploitable sans traitement manuel. L’outil réduit aussi le travail de séparation des locuteurs, de génération de sous-titres, de traduction et d’extraction d’éléments utiles comme les entités nommées ou les actions à suivre. Il sert donc à passer d’un enregistrement brut à un contenu prêt pour la recherche, la diffusion ou l’intégration dans un produit. Les équipes qui gèrent du son en continu y trouvent un flux direct.
Pour qui ?
Développeurs et équipes d’ingénierie qui construisent des fonctions vocales, créateurs d’assistants de réunion, plateformes de support client, équipes commerciales et produits média en ont l’usage le plus direct. Ces profils branchent l’API, traitent des enregistrements ou du direct, puis réinjectent le texte dans leur propre service. L’intégration se fait aussi avec des outils comme n8n, Zapier ou Make. Le même flux couvre le live et l’async.
Avantages et inconvénients
Les plus
- API de transcription en temps réel et en asynchrone Gladia couvre la transcription en direct et sur enregistrement, avec un flux basse latence et une API simple à intégrer.
- Traitement audio avancé Diarisation des locuteurs, détection automatique de la langue, code-switching et masquage des données personnelles s’enchaînent dans le même flux.
- Sorties exploitables pour la publication Tu obtiens des sous-titres en SRT ou VTT, mais aussi des transcriptions traduites dans plus de 100 langues cibles.
- Audio-to-LLM intégré La plateforme permet d’exécuter des prompts personnalisés sur les transcriptions avec plus de 400 modèles LLM.
- Crédit offert à l’inscription Un crédit d’accueil unique, sans remise à zéro mensuelle, couvre plusieurs dizaines d’heures de transcription : de quoi juger le moteur avant de payer.
Les moins
- Le crédit gratuit ne revient pas chaque mois Une fois le crédit d’accueil consommé, chaque heure transcrite se paie : il faut recharger le portefeuille prépayé ou passer à un palier supérieur.
- Le palier gratuit reste borné par la transcription Les usages intensifs, notamment sur des enregistrements longs ou des flux continus, épuisent vite le crédit offert.
- Les fonctions avancées ne réduisent pas le volume traité Diarisation, traduction, résumé ou masquage des données personnelles ajoutent des capacités, mais chaque heure d’audio traitée reste facturée au tarif du palier.
Tableau des prix
Gladia se paie à l’usage, depuis un portefeuille prépayé : Starter facture l’heure d’audio, en asynchrone ou en temps réel, après un crédit d’accueil offert à l’inscription ; Growth applique des remises au volume contre un engagement initial, sur devis, et Enterprise se négocie en contrat annuel. Toutes les fonctions et toutes les langues sont incluses dans chaque palier ; le passage de l’un à l’autre change surtout le tarif horaire, la concurrence des requêtes et l’accompagnement.
| Palier | Prix au 23 septembre 2026 | Quota | Pour qui |
|---|---|---|---|
| Starter | $0,61 par heure | temps réel à $0,75 par heure ; 50 € de crédits offerts à l’inscription ; 30 requêtes simultanées en temps réel, 25 en asynchrone | volumes audio modérés, démarrage immédiat |
| Growth | Sur devis | dès $0,20 par heure en asynchrone et $0,25 en temps réel ; requêtes simultanées ajustables | équipes en forte croissance, engagement initial contre remise |
| Enterprise | Sur devis | requêtes simultanées illimitées ; engagement de disponibilité de 99,9 % annoncé par l’éditeur | contrat annuel : modèles personnalisés, fine-tuning, hébergement dédié |
Tarifs officiels de Gladia, relevés le 23/09/2026
Ce que permet la formule gratuite
Gladia n’a pas de palier gratuit permanent : la page de prix offre 50 € de crédits à l’inscription, un don unique qui ne se renouvelle pas chaque mois. Ce crédit s’impute sur les tarifs horaires de Starter, en asynchrone comme en temps réel.
Au tarif du jour, ce crédit couvre environ 80 heures de transcription préenregistrée ou 60 heures en temps réel, selon la FAQ de la page de prix. Tu peux donc essayer les deux modes, la diarisation et la détection de langue avant tout paiement.
Une fois ce crédit épuisé, Gladia demande de recharger son portefeuille prépayé, à la main ou par recharge automatique sous un seuil que tu choisis, ou de passer à un palier supérieur. Les conditions de l’offre gratuite autorisent l’éditeur à exploiter les fichiers importés pour améliorer son service.
Ce que fait Gladia
Gladia passe par une API : tu envoies un fichier audio ou une URL, puis tu lances un job de transcription avec Solaria-1 ou Solaria-3 selon le niveau de précision recherché.
Sur l’asynchrone, l’envoi accepte aussi la vidéo, puis le résultat revient via result_url, webhook ou callback ; en direct, le flux part en WebSocket et les segments partiels arrivent pendant l’écoute.
Solaria-3 vise l’audio européen, avec EN, FR, DE, ES et IT ; le choix du modèle change donc surtout l’étendue linguistique et la spécialisation de la reconnaissance.
Audio-to-LLM ajoute une couche de prompts sur la transcription, au-dessus de 400 modèles LLM. La chaîne ne change pas, mais le traitement gagne en richesse dès l’activation de ces fonctions, incluses dans chaque palier de Gladia.
Comment utiliser Gladia
Prise en main initiale
Gladia se prend en main depuis l’API ou le playground, avec un compte et un accès au tableau de bord web. Le flux temps réel part ensuite en WebSocket, et le crédit d’accueil suffit pour tester les deux modes de transcription avant de recharger le portefeuille.
Navigation dans l’interface
Dans l’interface web, l’accès principal passe par app.gladia.io et par le playground fourni avec la documentation. Autour du job créé, tu retrouves les réglages utiles et les options audio intelligence activables selon le besoin. Pour l’usage courant, le support documentaire sert de point d’appui pour les SDK Python et JavaScript, puis pour les intégrations comme n8n ou Zapier.
Utilisation et gestion de projets
Tu récupères le résultat de chaque transcription dans result_url, ou bien via webhook et callback si tu automatises le traitement. Ensuite, l’API permet d’enchaîner la diarisation, la traduction, le résumé, le masquage des données personnelles ou un prompt Audio-to-LLM sur le même contenu. Pour gérer plusieurs travaux, le plus simple consiste à distinguer les jobs asynchrones des flux WebSocket en temps réel. Chaque sortie peut aussi prendre la forme de sous-titres SRT ou VTT. Le traitement couvre aussi le multi-canal.
Fonctionnalités principales
Gladia expose une API de transcription audio en temps réel et en différé. Chaque palier inclut toutes les fonctions et toutes les langues : traduction, résumé, analyse du contenu et traitements audio avancés.
Transcription en temps réel et en différé
Transforme un flux audio live ou un fichier enregistré en texte exploitable. Le mode temps réel passe par WebSocket, et le mode asynchrone accepte aussi une URL audio ou vidéo.
Diarisation des locuteurs
Sépare les interventions de plusieurs voix et attribue les segments aux locuteurs. Gladia annonce moins d’erreurs que d’autres fournisseurs sur cette tâche.
Traduction vers plus de 100 langues cibles
Traduit les transcriptions vers un grand nombre de langues de sortie. La détection automatique de la langue et le code-switching accompagnent la fonction.
Résumé du contenu audio
Produit un résumé général, concis ou en puces à partir d’une transcription. Le résultat sert à condenser une réunion, un appel ou un contenu long.
Reconnaissance d’entités nommées
Repère des personnes, organisations et dates dans une transcription. La fonction aide à extraire des éléments précis d’un échange long ou d’un enregistrement de réunion, sans relire tout le texte.
Analyse du sentiment et des émotions
Évalue le ton d’une phrase ou d’un locuteur et remonte jusqu’à 25 émotions. La sortie sert à suivre l’orientation émotionnelle d’un appel, d’un entretien ou d’un message vocal.
Chapitrage automatique
Découpe une transcription en chapitres pour rendre un enregistrement plus facile à parcourir. La fonction convient aux contenus longs comme les réunions, les podcasts ou les vidéos de support.
Masquage des données personnelles
Supprime ou anonymise les informations personnelles identifiables dans le texte produit. La fonction répond à des besoins de conformité, notamment pour des flux soumis au RGPD.
Audio vers LLM (Audio-to-LLM)
Envoie une transcription vers des prompts personnalisés pour interroger le contenu audio. Gladia s’appuie pour cela sur plus de 400 modèles LLM via OpenRouter.
Vocabulaire personnalisé
Ajoute des mots-clés ou des termes métiers pour améliorer la reconnaissance sur des noms propres, acronymes ou jargon. La fonction est utile quand un domaine impose des termes récurrents que la transcription brute rate souvent.
Génération de sous-titres
Produit des sous-titres aux formats SRT et VTT à partir d’un audio ou d’une vidéo. Le résultat sert directement au montage, à la publication ou à l’accessibilité.
Détection automatique de la langue et code-switching
Détecte la langue parlée et gère les changements de langue au sein d’un même enregistrement. La fonction évite de forcer une seule langue quand plusieurs langues se croisent dans le même flux.
Streaming à faible latence et transcription multicanale
Retourne des segments partiels en environ 103 ms pendant l’écoute d’un flux. La transcription multicanale passe aussi par WebSocket et traite plusieurs canaux audio en parallèle.
Usages et métiers
Gladia sert d’API audio pour des équipes qui transforment de la voix en texte, puis réutilisent ce texte dans leurs produits ou leurs opérations. Les usages listés ci-dessous viennent des profils et des tâches que l’éditeur nomme lui-même.
Développeurs de fonctionnalités vocales
Ils intègrent la transcription audio et les fonctions associées dans un produit ou un service. L’API remplace une brique maison de speech-to-text et évite de reconstruire la chaîne de traitement.
Équipes d’applications de prise de notes
Elles convertissent des réunions ou des échanges enregistrés en texte exploitable, puis en comptes rendus. L’outil remplace la retranscription manuelle et la reprise de notes à la main.
Centres de contact
Ils exploitent la transcription et l’analyse audio pour suivre les échanges clients. L’API remplace une transcription interne et facilite le traitement des conversations à grande échelle.
Plateformes de support client
Elles transforment des appels ou des messages vocaux en texte pour le suivi et l’indexation. L’outil remplace des traitements manuels de saisie et de résumé.
Équipes commerciales
Elles s’appuient sur la transcription et la synthèse des appels pour relire les échanges et extraire les points utiles. L’outil remplace la prise de notes après coup et la relecture intégrale des appels.
Équipes d’analyse des conversations
Elles convertissent l’audio en texte, puis exploitent la transcription pour repérer les thèmes, les entités et le sentiment. Cette API remplace un marquage manuel des échanges.
Plateformes média et contenu
Elles produisent des sous-titres, transforment des épisodes ou des vidéos en texte, et automatisent la préparation des contenus audio. L’outil remplace une transcription et un sous-titrage faits à la main.
Équipes de montage vidéo
Elles génèrent des sous-titres SRT ou VTT à partir de pistes audio ou vidéo. L’API remplace un sous-titrage manuel dans l’éditeur de montage.
Producteurs de podcasts
Ils transcrivent les épisodes, puis réutilisent le texte pour la recherche, les extraits et les résumés. L’outil remplace la transcription externe et le découpage artisanal des épisodes.
Équipes produit de voix conversationnelle
Elles branchent la transcription en temps réel dans des assistants vocaux et des agents conversationnels. L’outil remplace une couche ASR développée en interne.
Conseils d’utilisation
Conseils pour une utilisation efficace
Gladia donne de meilleurs résultats quand tu choisis le bon modèle dès le départ : Solaria-1 pour couvrir davantage de langues, Solaria-3 quand l’audio européen demande plus de précision. Garde le WebSocket stable sur un flux en direct et évite les coupures, car les segments partiels arrivent en continu. Pour un fichier long, ajoute d’un seul coup les options utiles : diarisation, résumé, traduction ou masquage des données personnelles selon le besoin. L’API accepte aussi l’audio vidéo en asynchrone ; l’import initial compte plus que le format de travail.
Erreurs communes à éviter
Texte haché, locuteurs mélangés : la diarisation n’a pas été activée. Sortie incomplète sur un enregistrement long : tu as lancé la transcription avec le mauvais mode ou sans attendre le result_url. Résumé trop pauvre : les options de synthèse ou de traduction n’ont pas été demandées au moment du job. Chaque essai séparé consomme du crédit : regroupe les paramètres dans un seul job.
Modèles et droits sur les créations
Gladia s’appuie sur deux modèles, et le choix dépend d’abord de l’étendue linguistique ou de la précision visée. Solaria-1 couvre plus de 100 langues avec le code-switching, tandis que Solaria-3 est optimisé pour l’audio réel européen, en anglais, français, allemand, espagnol et italien.
Côté droits, les conditions générales d’utilisation de Gladia SAS rangent les sorties (transcriptions, traductions, analyses) parmi les contenus dont l’éditeur reste propriétaire, et n’accordent à l’utilisateur qu’une licence limitée, non exclusive et révocable, pour les besoins du service. Relis-les avant de republier une transcription.
Tu peux supprimer à tout moment l’audio stocké, sauf sur l’offre gratuite, dont les données servent à améliorer le service ; la suppression efface aussi les sorties. La page de prix promet l’exclusion des données de l’entraînement sur chaque palier payant, automatique sur Growth, par défaut sur Enterprise, qui ajoute la rétention zéro.
Accès
Gladia s’atteint depuis le navigateur, avec une interface web, une API REST et l’application de dictée Gladiaflow pour Windows et macOS, publiée en open source par l’éditeur. Sur mobile, aucun canal n’est publié. Le support passe par le centre d’aide et un serveur Discord, puis par un Slack dédié et un gestionnaire de compte sur Enterprise.
Appareils, applications et systèmes compatibles
Accès réel : l’interface web, les applications de bureau Gladiaflow et l’API couvrent les usages principaux. Les intégrations déclarées passent par des services d’orchestration et de voix déjà nommés. Le produit s’appuie aussi sur des SDK, et Discord sert de canal d’échange avec l’équipe et la communauté.
Disponible sur
Accès & intégrations
IntégrationsOui
Pipecat, LiveKit, Vapi, Recall, Meeting Baas, Attendee, Twilio, VideoSDK, Composio, Zapier, Make, n8n
API publiqueOui
L’accès se fait par API REST pour envoyer l’audio, lancer une transcription et récupérer le résultat.
Langues disponibles
Gladia prend en charge des langues détectées automatiquement et plusieurs langues nommées dans sa documentation. La liste ci-dessous reprend uniquement ces entrées.
Avis et notes par Aikiwi
Note Globale de Gladia 4,4
Gladia transcrit l’audio en direct ou en différé, sépare les locuteurs, traduit, résume et masque les données personnelles depuis une seule API. L’éditeur ajoute aussi l’Audio-to-LLM, la détection automatique de langue, le code-switching et un mode streaming à faible latence. La chaîne d’usage reste directe : import d’un fichier ou d’une URL, lancement du traitement, puis récupération du résultat par polling ou webhook.
Gladia convient aux équipes qui construisent des fonctions vocales dans des produits de réunion, des centres de contact, des outils de conversation intelligence, des plateformes médias ou des agents vocaux. Le service parle aussi aux équipes qui ont besoin de sous-titrage, de transcription multilingue, de redaction pour la conformité RGPD ou d’extraction de connaissances depuis de l’audio. La présence d’une API, de SDK, d’intégrations avec des outils comme Zapier, Make et n8n, ainsi que d’une version web, réduit la part d’assemblage technique.
Le point d’entrée sert donc à tester le flux complet, du dépôt d’un fichier à la récupération du résultat, avant de passer à un usage payé si le volume ou les besoins dépassent ce crédit unique.
Avis détaillé sur Gladia
Design et Ergonomie 4,0
Gladia publie une interface web, un playground et des SDK, mais aucun élément de ses pages publiques ne décrit l’ergonomie de l’écran, la hiérarchie visuelle ou l’accessibilité. La présence d’une API et d’outils d’intégration montre surtout une logique de produit orientée développeurs. L’évaluation du design reste donc limitée à ce périmètre fonctionnel. Pour un utilisateur technique, cela suffit souvent si l’objectif est d’intégrer une brique de transcription plutôt que de manipuler une application lourde. Pour un profil non technique, l’absence d’indications sur l’expérience d’interface laisse attendre un produit pensé d’abord pour l’intégration, pas pour un usage autonome très guidé.
Facilité d’Utilisation 4,4
Gladia se prend en main par une API REST documentée pas à pas ; la documentation fournit aussi des SDK et un playground. L’ensemble réduit la mise en route pour une équipe de développement qui veut obtenir un premier résultat sans monter une architecture complète. Cette logique convient bien aux équipes qui veulent brancher vite une transcription dans un produit ou un flux interne. En revanche, l’usage reste plus naturel pour un public technique que pour un utilisateur qui cherche une application prête à l’emploi avec un minimum de configuration.
Fonctionnalités et Outils 4,8
Gladia couvre un périmètre très large autour de la parole : transcription en direct et asynchrone, diarisation, traduction vers plus de 100 langues, synthèse, reconnaissance d’entités, analyse d’émotion, chapitrage, masquage des données personnelles, sous-titres SRT et VTT, détection automatique de langue, code-switching et Audio-to-LLM sur plus de 400 modèles. L’outil ajoute aussi des intégrations et un plugin n8n. Pour un produit centré sur la voix, la profondeur fonctionnelle est remarquable. Un même flux peut servir à transcrire, nettoyer, structurer, traduire et réutiliser un audio, ce qui évite d’assembler plusieurs services. Le produit convient ainsi à des cas d’usage de production où la couverture fonctionnelle compte autant que la transcription brute.
Performance et Fiabilité 4,3
Gladia publie une page de statut (status.gladia.io), et sa page de prix annonce un engagement de disponibilité de 99,9 % sur Growth et Enterprise, avec une file de traitement prioritaire ; Starter n’a pas d’engagement de disponibilité. Les pages publiques annoncent aussi un flux temps réel à faible latence. Aucun historique d’incidents n’a été mesuré ici, et la régularité du service sur la durée reste à constater par l’usage. Pour un usage critique en production, le palier compte donc autant que le moteur : sans engagement contractuel, Starter se valide d’abord en conditions réelles.
Innovation et Singularité 4,7
Gladia assemble transcription, analyse et Audio-to-LLM dans une même API. L’offre met aussi en avant Solaria-3 pour l’audio européen et un mode temps réel à faible latence. Cette combinaison donne au produit une identité plus large qu’un simple moteur de transcription. L’intérêt pour l’utilisateur tient à la continuité du flux. Un audio peut être transcrit, enrichi, réécrit et exploité sans changer d’outil, ce qui réduit les ruptures entre étapes. Le produit se distingue surtout pour les équipes qui veulent transformer la parole en matière exploitable, pas seulement en texte brut.
Support et Ressources Disponibles 4,5
Gladia publie une documentation structurée, un centre d’aide, des SDK, un playground, un canal Discord, un email de support et un numéro de téléphone. Les intégrations sont également documentées, avec des chapitres dédiés et un écosystème qui couvre notamment n8n, Zapier et Make. Le support visible dépasse donc la simple FAQ. Pour une équipe technique, cette combinaison facilite l’adoption et limite les blocages d’intégration. Le produit convient bien à un environnement où l’on attend des exemples, des guides et des points de contact concrets plutôt qu’un support uniquement formulaire. La présence de plusieurs canaux est utile quand un flux audio doit rester opérationnel.
Rapport Qualité-Prix 4,3
Gladia fonctionne à l’usage, avec un crédit unique offert à l’inscription, un tarif horaire sur Starter et toutes les fonctions incluses. Le produit donne donc accès à un essai réel du moteur, mais la profondeur d’usage dépend vite d’un passage au payant dès que le volume augmente ou que l’intégration devient durable. Le rapport qualité-prix est solide pour une équipe qui veut tester un moteur riche avant d’engager des coûts récurrents. La valeur vient surtout de l’étendue fonctionnelle et de l’accès API, pas d’un gratuit destiné à durer. Pour un usage sérieux, la question n’est pas le prix absolu, mais ce que le palier finance en automatisation et en couverture de cas d’usage.
Questions fréquentes
Gladia propose-t-il un essai gratuit ?
Oui : Gladia offre un crédit à l’inscription, unique et sans remise à zéro mensuelle, qui permet de tester la transcription préenregistrée et en temps réel avec toutes les fonctions. Une fois ce crédit utilisé, tu recharges le portefeuille prépayé ou tu passes à un palier supérieur.
Qui est Gladia ?
Gladia est édité par GLADIA SAS, une société française fondée en 2022 et immatriculée à Roubaix selon ses mentions légales. Elle édite une API de transcription de la parole pour l’audio en temps réel et les enregistrements, et vise notamment les équipes produit, les centres de contact, les outils de prise de notes, les plateformes médias et les agents vocaux.
Que peut faire Gladia ?
Gladia transcrit l’audio et la vidéo en texte, génère des sous-titres SRT et VTT, sépare les locuteurs, résume des réunions et extrait des actions. La plateforme traduit dans plus de 100 langues, masque des données personnelles, détecte les entités nommées, analyse sentiment et émotions, et permet des prompts LLM sur les transcriptions.