AssemblyAI
AssemblyAI est une API de transcription et d'intelligence vocale conçue pour les équipes produit et les développeurs. Elle prend en charge l'audio préenregistré, le flux en temps réel, les agents vocaux, la diarisation, la détection automatique de langue, les horodatages au mot, la redaction de données personnelles, les filtres de propos et le mode médical.
Le service fonctionne en freemium : 50 $ de crédits offerts à l'inscription, sans carte bancaire, avec un palier gratuit qui couvre plusieurs usages de transcription et d'analyse vocale. L'outil expose aussi des SDKs, une API, une documentation et des intégrations avec Zapier, n8n, Make, Zoom RTMS, Twilio ou LangChain. Les usages visés vont de la transcription à grande échelle aux notes de réunion, en passant par les centres d'appels et la documentation clinique.
Lire plus Lire moins
- Éditeur
- AssemblyAI, Inc.
- Pays
- États-Unis
- Création
- 2017
- Offre gratuite
- Oui
- Essai gratuit
- Oui
- Sans carte bancaire
- Oui
AssemblyAI en bref
C’est quoi ?
AssemblyAI transforme un fichier audio ou un flux live en transcription, puis enrichit le résultat avec des éléments comme les locuteurs, les horodatages au niveau du mot, les entités, les chapitres et les résumés. Tu envoies l’audio via REST ou WebSocket, et tu récupères un JSON exploitable par une application ou une équipe produit. La plateforme sert aussi la voix en temps réel, avec un pipeline voix-à-voix sur un seul WebSocket. Le flux est asynchrone sur l’audio enregistré.
Pourquoi ?
L’outil règle le passage d’un enregistrement brut à un texte structuré, exploitable à l’échelle dans des usages comme les comptes rendus de réunion, la transcription médicale, le support client ou les sous-titres vidéo. Tu gagnes une sortie plus riche qu’une simple retranscription, avec des champs prêts à être réutilisés dans un produit ou un flux métier. Les garde-fous ajoutent aussi la censure des données sensibles, des propos injurieux et de certains contenus.
Pour qui ?
Il vise des équipes logicielles, des startups, des entreprises en croissance et des entreprises qui construisent des produits de transcription, d’intelligence conversationnelle, de centre de contact, de santé ou d’outils pour développeurs. Une équipe produit qui veut intégrer la voix dans son service y trouve une API, des SDK et des intégrations déjà prêtes. Les usages couverts vont du suivi d’appels à la prise de notes de réunion.
Avantages et inconvénients
Les plus
- API de transcription et d’analyse vocale large AssemblyAI couvre la transcription asynchrone des fichiers audio, la transcription en temps réel par WebSocket et une API d’analyse vocale avec identification du locuteur, sentiment, entités, résumés, chapitres automatiques, expressions clés et détection de sujets.
- Usage gratuit sans carte bancaire Sur le palier gratuit, l’inscription donne 50 $ de crédits sans carte bancaire, et les crédits non utilisés sont conservés lors du passage à une offre payante. Tu peux donc tester la chaîne complète avant d’engager un budget.
- Couverture fonctionnelle orientée voix Guardrails ajoute le masquage de données personnelles, le filtrage de grossièretés et la modération de contenu, tandis que Medical Mode cible la terminologie de santé. La plateforme vise aussi les voix et les agents vocaux avec Voice Agent API, LLM Gateway et SDKs.
- Déploiement en mode auto-hébergé L’accès ne se limite pas au service cloud : un déploiement auto-hébergé est disponible, avec API et SDKs. Pour des contraintes d’hébergement ou d’intégration, cette option réduit la dépendance au seul environnement web.
- Langues nombreuses sur la transcription Universal-2 prend en charge plusieurs langues selon l’éditeur pour la transcription préenregistrée, et la liste publiée inclut aussi le français.
Les moins
- Les crédits gratuits restent bornés Les 50 $ de crédits initiaux couvrent des usages précis, mais le LLM Gateway n’est pas inclus dans le palier gratuit. Dès que tu sors de ce périmètre, le passage au payant s’impose.
- Le temps réel a une limite de débit Sur le niveau gratuit, la concurrence en streaming est limitée à plusieurs nouveaux flux par minute. Pour un usage live plus intense, cette limite oblige à monter de palier.
- Le prix varie selon le moteur La tarification Pay-As-You-Go n’aligne pas tous les services au même niveau : Universal-2, Universal-Streaming et Voice Agent API n’ont pas le même coût horaire. Pour un projet mixant transcription, agents vocaux et enrichissement, le budget grimpe vite.
- Le catalogue n’est pas homogène selon les langues Universal-3.5 Pro couvre plusieurs langues en préenregistré selon l’éditeur, tandis qu’Universal-Streaming Multilingual se limite à plusieurs langues en temps réel. Si ton flux alterne entre batch et live, le choix du modèle pèse sur la couverture linguistique.
Tableau des prix
AssemblyAI suit un modèle freemium. Les paliers nommés sont Free tier, Pay-As-You-Go et Enterprise (volume discounts). Le passage du gratuit au payant enlève les crédits d’accueil et ouvre une facturation à l’usage : Pay-As-You-Go se paie à l’heure d’audio, $0,15 (Universal-2) ou $0,21 (Universal-3.5 Pro) pour le pré-enregistré et $4,50 pour le Voice Agent API (lien « Tarifs officiels » sous le tableau). Le palier Pay-As-You-Go ne porte pas de tarif sur la page de tarification de l’éditeur.
| Palier | Prix au 16 septembre 2026 | Quota | Inclus | Non inclus | Pour qui |
|---|---|---|---|---|---|
| Free tier | Gratuit | 50 $ de crédits offerts à l’inscription ; 5 nouveaux flux par minute | Pre-recorded STT ; Real-time STT ; Voice Agent API ; Compréhension de la parole ; Guardrails | LLM Gateway ; carte bancaire | Développeur qui teste l’API |
| Pay-As-You-Go | Facturation à l’heure d’audio ; 100 sessions par minute au départ | Universal-2 ; Universal-3.5 Pro ; Universal-3.5 Pro Realtime ; Universal-Streaming ; Voice Agent API | Remises sur volume | Équipe qui paie selon l’usage | |
| Enterprise (volume discounts) | sur devis | Remises sur volume | Entreprise avec volume élevé |
Tarifs officiels d'AssemblyAI, relevés le 16/09/2026
Ce que permet la formule gratuite
AssemblyAI couvre la transcription différée, la transcription en temps réel, Voice Agent API, Speech Understanding et Guardrails dans ce palier gratuit. L’activation reste possible sans engagement financier initial.
Sur ce palier, les crédits ne expirent pas. En revanche, LLM Gateway n’y figure pas. La concurrence temps réel autorise 5 nouveaux flux par minute. Au passage vers une offre payante, ils restent conservés.
Tu peux tester l’API avec cette enveloppe d’accueil avant de passer au facturé à l’usage. Le gratuit s’arrête au volume offert et aux fonctions exclues du palier.
Ce que fait AssemblyAI
AssemblyAI transforme un envoi audio ou un flux WebSocket en transcription exploitable, puis ajoute des couches d’analyse quand tu les actives. Sur les fichiers préenregistrés, le parcours passe par une requête REST asynchrone ; en direct, il bascule sur le streaming temps réel. Les paliers supérieurs ouvrent des modèles plus récents et des variantes adaptées au live.
Dès l’envoi, tu choisis entre Universal-2, Universal-3.5 Pro et les variantes Streaming ou Realtime selon le cas d’usage. Selon l’éditeur, Universal-2 couvre 99 langues sur le préenregistré, tandis qu’Universal-3.5 Pro se limite à 18 langues mais sert aussi de base à la voix en direct. Cette différence change surtout la portée linguistique et le mode d’exécution.
Voice Agent API ajoute une chaîne complète sur un seul WebSocket, avec détection de tour de parole et appel d’outils gérés par le service. LLLM Gateway relie des modèles frontier aux flux vocaux quand tu construis des workflows de voix. Le studio visuel est absent ici.
Côté production, les sorties restent structurées pour un traitement applicatif : texte, horodatages au niveau du mot, locuteurs, entités, chapitres, sentiments ou résumés selon l’API activée. Guardrails ajoute la rédaction des données sensibles, le filtrage de la vulgarité et la modération de contenu. Le niveau choisi fixe donc moins l’interface que la profondeur des enrichissements disponibles.
Comment utiliser AssemblyAI
Créer un compte et envoyer un premier fichier
Crée un compte sur le tableau de bord web, puis ouvre l’API ou les SDK pour envoyer un fichier audio par REST ou un flux live par WebSocket. Pour un fichier préenregistré, tu importes l’audio ou tu fournis une URL, puis tu lances une transcription asynchrone. L’attente se termine quand le statut passe à completed.
Brancher le flux en temps réel
Le WebSocket de streaming sert au temps réel ; l’URL de connexion publique est distincte de l’espace compte. Chaque résultat se récupère côté application, pas dans un éditeur visuel.
Choisir le mode selon le projet
Tu choisis ensuite le mode utile au projet : transcription différée, flux en direct, Voice Agent API, Speech Understanding ou Guardrails.
Fonctionnalités principales
AssemblyAI expose d’abord une API de transcription asynchrone pour les fichiers audio préenregistrés. La même base sert aussi au flux temps réel, aux agents vocaux et aux fonctions d’enrichissement de transcription.
Transcription préenregistrée via API
Cette API traite un fichier audio après envoi ou via une URL, puis renvoie le résultat en JSON. Tu récupères le texte, la confiance, les horodatages au mot et les répliques par locuteur quand l’option de séparation des locuteurs est activée.
Disponible sur l’API et couvert par le palier gratuit pour la transcription préenregistrée.
Transcription temps réel via WebSocket
Ce flux lit l’audio en direct et renvoie des transcriptions pendant l’émission. Il sert aux usages où la latence compte, comme la prise de notes en réunion ou l’affichage de sous-titres en continu.
Disponible via WebSocket ; la concurrence du flux gratuit est limitée à 5 nouveaux streams par minute.
Voice Agent API
Cette API fait passer la voix par transcription, compréhension et synthèse sur une seule connexion WebSocket. AssemblyAI y ajoute l’appel d’outils pour piloter un agent vocal, avec la détection de tour de parole.
Incluse dans le palier gratuit avec des crédits de démarrage ; tarif payant à l’heure d’usage sur la page prix.
API de compréhension de la parole
Cette couche enrichit une transcription avec l’identification des locuteurs, le sentiment, les entités, les résumés, les chapitres automatiques, les expressions clés, la détection de sujets et la traduction. Elle transforme un flux brut en compte rendu exploitable sans étape manuelle de post-traitement.
Guardrails
Les gardrails ajoutent la suppression des données personnelles, le filtrage de propos grossiers et la modération de contenu. Ils s’appliquent quand il faut nettoyer une sortie avant sa diffusion ou son archivage.
Medical Mode
Ce module ajoute une spécialisation pour la terminologie médicale. Il sert aux enregistrements cliniques et aux dictées de santé où le vocabulaire spécialisé compte autant que la transcription elle-même.
Add-on payant pour la terminologie médicale.
LLM Gateway
Ce module donne accès à plusieurs modèles de premier plan pour des workflows vocaux. Il sert quand la transcription doit enchaîner avec un raisonnement ou une génération de texte, dans le même environnement.
Non inclus dans le palier gratuit.
Usages et métiers
AssemblyAI sert aux équipes qui transcrivent de l’audio ou de la vidéo à grande échelle, qui bâtissent des agents vocaux et qui exploitent des enregistrements pour en tirer du texte exploitable. La même plateforme couvre aussi la dictée médicale, les comptes rendus de réunion et la réutilisation de contenus audio ou vidéo en extraits, résumés ou articles. Son modèle regroupe ces usages autour d’une API et d’outils SDK.
Équipes de développement logiciel
Elles envoient des fichiers audio ou vidéo à l’API, récupèrent une transcription asynchrone, puis réutilisent les horodatages, les locuteurs et les métadonnées dans leurs produits. Cela remplace une chaîne de transcription maison et des scripts de post-traitement.
Jeunes entreprises technologiques
Elles branchent AssemblyAI sur un produit naissant pour transcrire, analyser ou structurer la voix sans construire l’infrastructure de reconnaissance vocale. Le service remplace un moteur STT interne et une partie de la maintenance qui va avec.
Entreprises en phase de croissance
Elles industrialisent la transcription de fichiers, les notes de réunion et l’analyse d’appels avec un seul backend vocal. Cela évite de multiplier les outils spécialisés pour chaque équipe ou chaque flux de travail.
Disponible sur les paliers payants et Enterprise.
Entreprises
Elles exploitent l’API, l’auto-hébergement et les intégrations pour intégrer la voix dans des produits ou des processus internes à plus grande échelle. La plateforme remplace plusieurs briques séparées de transcription, d’analyse et d’orchestration vocale.
Équipes produit
Elles ajoutent de la transcription, des notes de réunion ou un agent vocal à un produit sans monter un pipeline audio complet en interne. Le service remplace des développements spécifiques sur l’ingestion, la segmentation et l’annotation du discours.
Équipes commerciales
Elles analysent des enregistrements d’appels pour en extraire les points clés, les sujets et les éléments de suivi. Cela remplace la relecture manuelle de longues conversations et la prise de notes à la main.
Équipes de support client
Elles transcrivent les échanges téléphoniques ou conversationnels pour les exploiter dans des workflows de suivi et d’analyse. La plateforme remplace la transcription manuelle des appels et la reprise ligne par ligne des échanges.
Fonctionne avec les intégrations téléphonie et centre de contact.
Équipes médicales
Elles utilisent le mode médical pour la dictée et la documentation clinique avec un vocabulaire adapté aux termes de santé. Le produit remplace une prise de notes médicale plus lente et une transcription générale moins spécialisée.
Équipes médias
Elles transcrivent des fichiers audio ou vidéo pour générer des sous-titres, des légendes ou des résumés de contenu. Cela remplace la transcription externe et une partie du travail de repérage éditorial.
Équipes chargées des réunions
Elles transforment des réunions enregistrées en comptes rendus, en notes et en résumés consultables. Le service remplace la saisie manuelle et le découpage manuel des échanges.
Conseils d’utilisation
Conseils pour une utilisation efficace
AssemblyAI donne de meilleurs résultats quand tu envoies un fichier propre ou un flux stable, puis quand tu choisis le bon mode dès le départ : transcription préenregistrée, temps réel ou Voice Agent API. Sur l’audio préenregistré, privilégie un envoi direct par REST, ou une URL si le fichier est déjà hébergé. Pour le live, WebSocket réduit les frictions.
Erreurs communes à éviter
Transcription qui manque des segments : le flux utilisé n’est pas le bon pour le besoin, ou l’audio arrive trop tôt avant la fin de l’envoi. Réponses pauvres sur le locuteur, les résumés ou les chapitres : Speech Understanding n’est pas activé.
Modèles et droits sur les créations
AssemblyAI utilise une base freemium : le palier gratuit donne 50 $ de crédits à l’inscription, sans carte bancaire, et garde les crédits non consommés lors du passage au payant.
Sur le plan des modèles, L’éditeur annonce Universal-3.5 Pro en plusieurs langues, Universal-2 en plusieurs langues et Universal-Streaming Multilingual en 6 langues en temps réel. Trois chemins distincts, trois usages distincts. Le bon modèle dépend d’abord du mode, puis de la couverture linguistique.
Tu n’achètes pas des sorties créatives ici : tu achètes des capacités d’API. Transcription et analyse produisent du texte exploitable, des horodatages, des locuteurs et des enrichissements, mais elles ne transfèrent pas un droit d’exploitation élargi par défaut. Tes propres obligations sur les données envoyées et sur leur usage s’appliquent aux sorties.
Cette limite ne décrit pas tout le service, mais elle borne déjà l’usage en test ou en démonstration. Pour des charges plus soutenues, le passage au payant change surtout le volume, pas la logique d’accès.
Accès
Accès web
AssemblyAI s’utilise depuis le navigateur, avec le tableau de bord web pour piloter les transcriptions et les réglages du compte.
API et SDK
Les développeurs passent par l’API et les SDK pour brancher l’import, la transcription et les flux temps réel dans une application.
Postes compatibles
Windows, macOS et Linux figurent parmi les environnements pris en charge pour les outils en ligne de commande.
Pas de mobile natif
Les versions iOS et Android ne sont pas proposées comme canaux d’accès directs.
Langues prises en charge
Le service répond dans les langues listées plus bas, dont le français.
Appareils, applications et systèmes compatibles
AssemblyAI s’atteint par le navigateur, par API et par intégrations tierces. Les usages passent aussi par des clients de bureau sur Windows, macOS et Linux.
Disponible sur
Accès & intégrations
IntégrationsOui
Zapier, n8n, Make, Postman, LiveKit, Pipecat, Recall.ai, Zoom RTMS, Telnyx, Twilio, Amazon Connect, Genesys Cloud, LangChain, Vercel AI SDK, Power Automate, Semantic Kernel, Activepieces, Haystack, Cloudflare, Relay.app, Bubble, Pipedream, Drupal
API publiqueOui
L’accès est ouvert par API REST et WebSocket.
Langues disponibles
AssemblyAI prend en charge ces langues (l’éditeur en annonce plus de 99 avec Universal-2). La liste ci-dessous reprend uniquement les langues nommées dans les faits vérifiés, sans ajout ni reformulation.
Avis et notes par Aikiwi
Note Globale d’AssemblyAI 4,3
AssemblyAI réunit une API de transcription asynchrone, du temps réel par WebSocket, une API Voice Agent et des fonctions de Speech Understanding dans une même offre.
AssemblyAI convient à des équipes produit, à des startups, à des entreprises et à des équipes techniques qui transcrivent de l’audio et de la vidéo à l’échelle. L’outil cible aussi les centres de contact, la santé, le juridique, les médias, l’éducation, les services financiers, le retail et les usages de notes de réunion, de sous-titrage et d’analyse de conversations.
Le palier gratuit couvre la transcription préenregistrée, le temps réel, la Voice Agent API, la Speech Understanding et Guardrails, tandis que l’offre gratuite ne comprend pas LLM Gateway.
Avis détaillé sur AssemblyAI
Design et Ergonomie 4,0
AssemblyAI expose surtout une couche API et une interface web de compte, avec des SDKs et un tableau de bord pour suivre l’usage. La documentation et l’espace web cadrent bien l’accès au service, mais aucun élément fourni ne décrit la hiérarchie visuelle, l’architecture des écrans ou les choix d’accessibilité de l’interface. Pour un profil technique, cette structure suffit à travailler vite une fois les réglages connus. Pour un utilisateur qui cherche une application très guidée, l’expérience repose davantage sur la lecture de la documentation que sur une interface pensée comme un produit grand public.
Facilité d’Utilisation 4,2
AssemblyAI permet de démarrer sans carte bancaire, avec 50 crédits offerts à l’inscription, et propose des SDKs, une API et des intégrations comme Zapier, n8n ou Make. Le parcours va donc droit à l’usage, surtout pour des équipes qui savent déjà manipuler une API ou un WebSocket. Cette approche réduit la barrière d’entrée pour un premier test technique. En revanche, l’outil s’adresse d’abord à des développeurs et à des équipes produit ; un utilisateur qui attend un éditeur no-code ou une prise en main visuelle très progressive aura plus d’étapes à franchir.
Fonctionnalités et Outils 4,8
L’ensemble va bien au-delà d’une simple API de transcription. La palette convient aux usages qui vont de la transcription brute aux workflows vocaux plus complets, avec une vraie profondeur sur le traitement des contenus audio. Un studio de production, une équipe support ou un produit conversationnel y trouvent des briques utilisables sans empiler plusieurs services distincts.
Performance et Fiabilité 4,0
AssemblyAI ne publie ni page de statut, ni historique d’incidents, ni engagement de disponibilité dans les faits fournis. Les éléments accessibles décrivent le fonctionnement de l’API et ses modes d’échange, pas la régularité du service ni ses garanties d’exploitation. Pour un acheteur technique, cela laisse le service jugé surtout sur son architecture et sur la documentation. Pour une équipe qui doit contractualiser un niveau de service, l’absence de garanties publiques impose de vérifier les engagements directement avec l’éditeur.
Innovation et Singularité 4,6
AssemblyAI se distingue par l’association d’une API de transcription, d’une API Voice Agent et d’un LLM Gateway dans une même offre. Le point singulier tient aussi au Speech Understanding, qui ajoute identification du locuteur, sentiments, entités, chapitres, sujets et traduction sur la même base audio. Cette combinaison intéresse les équipes qui veulent construire des produits vocaux plutôt que seulement transcrire des fichiers. L’outil est plus pertinent quand la valeur vient de l’orchestration entre transcription, compréhension et agents, et moins quand le besoin se limite à un traitement simple et isolé.
Support et Ressources Disponibles 4,5
AssemblyAI fournit une documentation, une aide dédiée, un support par e-mail, un chat dans le tableau de bord, un formulaire de ticket et une communauté Discord. L’éditeur ajoute aussi des SDKs et un catalogue d’intégrations, ce qui donne un environnement d’apprentissage et d’implémentation bien fourni. Cette combinaison soutient bien les équipes qui construisent en production et qui ont besoin de réponses rapides sans dépendre d’un seul canal. Un développeur autonome y trouve de quoi avancer seul, tandis qu’une équipe plus large bénéficie d’un accompagnement réparti entre documentation, support et communauté.
Rapport Qualité-Prix 4,3
La logique tarifaire colle à un service technique utilisé de façon incrémentale, avec une entrée gratuite réelle mais bornée. Pour un projet qui teste la transcription, la compréhension vocale ou les agents avant industrialisation, l’accès initial est lisible et peu risqué. Pour un usage intensif, la valeur dépend surtout de la profondeur des fonctions activées, donc du volume traité et du périmètre réellement consommé.
Questions fréquentes
Comment utiliser AssemblyAI gratuitement ?
AssemblyAI propose un palier gratuit et un essai gratuit. Le service fonctionne sans carte bancaire, avec un modèle freemium. Les usages d’entrée passent par l’API, en transcription préenregistrée ou en flux temps réel, puis par les SDK et les intégrations disponibles. Les montants figurent dans le tableau des prix.
Quel est le prix d’AssemblyAI ?
AssemblyAI fonctionne sur un modèle freemium, avec un palier gratuit, un palier à l’usage et une offre Entreprise avec remises selon le volume. Le palier gratuit inclut des crédits offerts à l’inscription, sans carte bancaire, et des crédits non expirables. Pour les montants, consulte le tableau des prix.
Quelles langues AssemblyAI prend-il en charge ?
AssemblyAI nomme des langues prises en charge, et la liste affichée comprend notamment l’anglais, l’espagnol, le français, l’allemand, l’italien, le portugais, le néerlandais, le japonais, le coréen, le mandarin, le russe, le polonais, le turc, l’ukrainien, le suédois, le norvégien, le danois, le finnois, le vietnamien, l’arabe, l’hébreu, l’hindi, l’indonésien, le thaï, l’ourdou et le catalan. L’éditeur annonce aussi des modèles pour 99, 18 et 6 langues selon les cas d’usage. La liste affichée est celle des langues nommées par l’éditeur.