Fiche créée le

Unreal Speech

4,3 Freemium

Unreal Speech convertit du texte en voix de synthèse avec une API, un studio web et des SDK Python et Node.js. L'outil propose un palier gratuit sans carte bancaire, un flux audio en temps réel, des horodatages mot à mot et un catalogue de voix naturelles dans plusieurs langues, dont le français.

Le palier gratuit impose un lien d'attribution à afficher lors de la publication. Les formules payantes vont de 49 $ par mois à une offre Enterprise à 4 999 $ par mois, avec un palier Custom sur demande. La version web sert surtout les équipes produit, les créateurs audio, les plateformes d'apprentissage et les usages de téléphonie ou de chatbot.

Lire plus Lire moins
La fiche en bref
Éditeur
Unreal Speech
Pays
États-Unis
Création
2022
Offre gratuite
Oui
Essai gratuit
Non
Sans carte bancaire
Oui
Plateformes
Web

Unreal Speech en bref

C’est quoi ?

Unreal Speech transforme un texte en parole naturelle via une API. Tu envoies une requête HTTP vers /stream, /speech, /synthesisTasks ou /streamWithTimestamps, puis tu récupères un flux audio, un fichier MP3 ou des horodatages mot par mot. Le service sert aussi à régler la vitesse, la hauteur et le débit. Le palier gratuit se teste sans carte. Il convient aux équipes qui ont besoin d’une voix synthétique à bas coût pour des articles, des assistants vocaux, des livres audio ou des notifications.

Pourquoi ?

Tu évites ainsi les allers-retours manuels entre texte, enregistrement et montage. Le service sert aussi à générer une voix en temps réel pour un chatbot, à synchroniser un texte affiché avec la parole, ou à produire de longs contenus audio sans gérer un studio. La sortie reste exploitable en MP3 ou en PCM selon l’usage. Les équipes qui publient souvent gagnent surtout sur le volume et sur le coût par requête.

Pour qui ?

Il vise les développeurs, les équipes d’ingénierie, les startups SaaS, les plateformes d’e-learning, les créateurs de contenu, les podcasteurs, les producteurs de livres audio et les entreprises qui synthétisent beaucoup de voix. Tu l’emploies quand l’audio doit sortir d’un flux applicatif plutôt que d’un outil de montage. L’API et les SDK Python et Node.js parlent surtout à des équipes techniques. Le web sert de point d’essai.

Avantages et inconvénients

Les plus

  • Génération en continu rapide L’endpoint /stream renvoie un flux audio en temps réel, ce qui sert les usages interactifs comme les chatbots vocaux.
  • Sorties longues par requête L’endpoint /synthesisTasks produit jusqu’à 10 heures d’audio par requête, avec jusqu’à 500 000 caractères.
  • Repérage mot à mot Les horodatages par mot facilitent la mise en évidence du texte parlé à l’écran.
  • Large choix vocal et langues Le catalogue de voix naturelles couvre plusieurs langues, dont le français, avec réglage de la vitesse et de la hauteur.
  • Formats audio souples Les sorties incluent MP3, PCM mu-law et PCM s16le, avec des débits de 16k à 320k.
  • API et exemples prêts à l’emploi L’accès passe par une API, avec des SDK et exemples de code en Python, Node.js, React Native et Bash.

Les moins

  • Quota gratuit mensuel Le palier gratuit plafonne le volume mensuel de caractères ; au-delà, il faut passer à un palier payant.
  • Attribution requise sur les publications Quand tu publies l’audio, un lien d’attribution vers unrealspeech.com est exigé.
  • Pas de sortie illimitée sur un seul appel Chaque endpoint fixe sa propre limite de longueur : /stream reste le plus court, /speech accepte 3 000 caractères.
  • Pas de version native pour bureau ou mobile L’accès déclaré passe par le navigateur, sans application Windows, macOS, iOS ou Android.
  • Pas de prix en euros Les paliers affichés sont en dollars, ce qui oblige à raisonner dans la devise publiée par l’éditeur.

Tableau des prix

Unreal Speech suit un modèle freemium. Les paliers nommés sont Free, Basic, Plus, Pro, Enterprise et Custom. Le passage du gratuit au payant ajoute des volumes de caractères plus élevés, puis un traitement sur devis pour les usages à forte charge. Au 17 septembre 2026, le palier Basic affiche une remise sur les six premiers mois ; le tableau porte le tarif régulier.

PalierPrix au 17 septembre 2026InclusPour qui
Free0 $250 000 caractères, soit environ 6 heures d’audio ; lien d’attribution requis à la publicationEssai d’usage
Basic$49 par mois3 millions de caractères, soit environ 67 heures d’audioUsage individuel
Plus$499 par mois42 millions de caractères, soit environ 933 heures d’audioUsage soutenu
Pro$1 499 par mois150 millions de caractères, soit environ 3 000 heures d’audioUsage intensif
Enterprise$4 999 par mois625 millions de caractères, soit environ 14 000 heures d’audioÉquipes
CustomSur devisPlus d’un milliard de caractères, remises de volumeTrès gros volumes

Tarifs officiels d'Unreal Speech, relevés le 17/09/2026

Ce que permet la formule gratuite

Unreal Speech propose un palier gratuit sans carte bancaire demandée. Tu y obtiens 250 000 caractères par mois, soit environ 6 heures d’audio, avec remise à zéro le 1er de chaque mois.

Sur ce palier, la limite est nette et mensuelle. Cela suffit pour tester des voix, mais pas pour un usage suivi à gros volume. Une minute d’audio représente environ 750 caractères, selon la page de prix de l’éditeur. Tu peux donc valider le rendu sans payer.

Le volume gratuit s’arrête aussi au moment de la diffusion publique. Si tu publies l’audio généré, un lien d’attribution devient alors requis. Cette contrainte compte autant que le quota lui-même, car elle encadre l’usage du résultat hors de l’interface. Sa présence s’impose dès la diffusion publique.

Aucun essai n’accompagne cette offre gratuite. La formule donne un accès permanent au service, pas une démonstration temporaire. Son intérêt tient surtout au test du flux audio avant un palier payant. C’est un vrai accès continu.

Ce que fait Unreal Speech

Unreal Speech transforme un texte en parole via une API, puis renvoie un flux audio, un fichier MP3 ou des horodatages mot par mot. Tu passes de la génération en continu à des sorties longues par requête selon l’endpoint choisi ; le palier gratuit sert surtout à tester le débit et le rendu, tandis que les paliers payants ajoutent des volumes plus élevés et des usages à forte charge.

Sur le palier gratuit, un quota mensuel de caractères cadre l’essai. Au-dessus, chaque palier payant multiplie le volume de caractères disponible, jusqu’à l’offre Custom pour les très gros volumes. Ici, le volume fait le prix. La différence entre les paliers tient moins à la forme qu’au volume disponible.

L’API accepte aussi des réglages de vitesse, de hauteur et de débit. Elle propose un catalogue de voix naturelles en plusieurs langues. Tu gardes la même chaîne de création, puis tu changes le format de sortie et l’échelle d’usage sans changer d’outil.

Comment utiliser Unreal Speech

Prise en main initiale

Unreal Speech s’utilise d’abord depuis le navigateur ou par API. Tu crées un compte, récupères une clé API gratuite, puis tu envoies du texte vers /stream, /speech, /synthesisTasks ou /streamWithTimestamps selon le rendu voulu. L’accès web passe par le Studio, utile pour tester le moteur sans écrire de code. La clé gratuite suffit pour démarrer.

Navigation dans l’interface

Côté interface, le Studio sert surtout à choisir une voix, puis à régler la vitesse, la hauteur et le débit avant l’envoi. Tu peux aussi passer directement par la documentation pour voir les points de terminaison, les exemples en Python et en Node.js, et les formats audio disponibles. Le parcours reste centré sur le web et les appels API.

Utilisation et gestion de projets

Pour les longues sorties, /synthesisTasks génère jusqu’à 500 000 caractères et renvoie des URL publiques à surveiller avec l’identifiant de tâche. Les SDKs Python et Node.js aident à réutiliser les mêmes réglages dans plusieurs projets.

Fonctionnalités principales

Unreal Speech expose une API de synthèse vocale avec plusieurs voies d’envoi selon le volume et la latence visés. Les paliers d’accès séparent le gratuit, les offres payantes et l’offre sur mesure. Les différences portent surtout sur le volume, les options de diffusion et les usages à l’échelle.

Diffusion audio en temps réel via /stream

Le point de terminaison /stream renvoie un flux audio annoncé autour de 300 ms pour des cas où la réponse doit arriver vite. Il accepte jusqu’à 1 000 caractères par requête et convient aux échanges interactifs.

Synthèse par tâche via /synthesisTasks

Le point de terminaison /synthesisTasks traite des textes plus longs et retourne des URL publiques pour l’audio et les horodatages.

Horodatage mot à mot

L’API fournit des horodatages mot à mot pour synchroniser le texte affiché avec la voix. Cette fonction sert au surlignage à l’écran et aux usages où l’alignement lecture-audio compte.

Accessible avec les sorties de synthèse prises en charge.

Flux audio avec métadonnées de temps via WebSocket

Le point de terminaison /streamWithTimestamps diffuse l’audio avec les métadonnées de temps en direct. Il sert quand la synchronisation doit arriver au fil de l’eau, sans attendre la fin complète du rendu.

Réglage de la vitesse et de la hauteur

L’API laisse ajuster la vitesse et la hauteur de la voix avant génération. Ces paramètres modifient le rendu sans changer la structure du texte envoyé.

Accessible sur les voix et sorties compatibles de l’API.

Catalogue de voix naturelles

Un catalogue de 48 voix naturelles couvre les langues listées plus bas, dont le français. Le choix de la voix influe sur le timbre, la langue et le type de sortie obtenu.

Formats audio flexibles

Les sorties se génèrent en MP3, PCM mu-law ou PCM s16le. Les débits vont de 16k à 320k. Le format choisi dépend du canal de diffusion ou du traitement prévu ensuite.

SDK et exemples de code

Des SDK Python et Node.js et des exemples de code sont disponibles pour intégrer plus vite quand le texte part d’une application ou d’un script plutôt que du Studio.

Déploiement à grande échelle avec remises volume

L’offre prévoit des remises de volume et des plans entreprise pour les usages intensifs. La logique tarifaire change alors du palier individuel vers l’échelle.

Usages et métiers

L’outil couvre aussi des usages de contenu, de lecture longue et d’accessibilité, avec une sortie audio que l’on réemploie dans des applications, des notifications ou des supports narrés.

Équipes d’ingénierie

Elles transforment du texte en parole dans une application, puis remplacent une intégration vocale maison par l’API et les SDK Python ou Node.js.

Équipes produit de startups et de SaaS

Elles ajoutent une voix à un parcours utilisateur, à un chatbot ou à une notification, puis évitent de monter un service de synthèse audio interne.

Plateformes d’e-learning et d’edtech

Elles produisent des voix pour des cours, des leçons et des guides, puis remplacent un enregistrement manuel morceau par morceau.

Créateurs de contenu

Ils génèrent des voix off pour des articles, des blogs et des vidéos, puis s’appuient sur la synthèse plutôt que sur un studio d’enregistrement.

Podcasteurs et producteurs de livres audio

Ils créent des narrations longues pour des épisodes, des rapports ou des livres audio, puis remplacent la prise de voix classique par une génération à la demande.

Entreprises à fort volume

Elles convertissent de grands lots de texte en audio à coût réduit, puis remplacent un flux vocal plus lourd à exploiter en interne.

Conseils d’utilisation

Conseils pour une utilisation efficace

Unreal Speech donne de meilleurs résultats quand tu choisis l’endpoint selon le volume visé. Pour une réponse immédiate, /stream convient aux cas en temps réel.

Erreurs communes à éviter

Tu envoies trop de texte d’un coup vers /stream, dont la limite par requête est la plus basse des endpoints. Cause : cet endpoint sert la diffusion synchrone et les cas rapides. Horodatage absent : tu passes par /speech au lieu de /streamWithTimestamps. Cause : seul ce flux ajoute les métadonnées mot par mot. Audio non publiable : tu oublies le lien d’attribution sur le palier gratuit.

Modèles et droits sur les créations

Unreal Speech associe le modèle Kokoro à un usage gratuit encadré par un lien d’attribution. Le cadre est simple : tu testes la synthèse, mais tu ne publies pas sans cette mention. Dès que l’usage dépasse le quota mensuel, tu passes aux paliers payants ou à l’offre Custom.

Le modèle publié est Kokoro-82M. Ce TTS open source compte 82 millions de paramètres. Cette base sert le Studio et l’API sans changer le droit attaché aux sorties : le quota gratuit reste mensuel, et l’attribution reste obligatoire pour la publication.

Au-delà du plafond, l’accès glisse vers les paliers payants ou l’offre Custom. Ce gratuit sert à valider la voix et le flux, pas à couvrir une diffusion soutenue.

Accès

Unreal Speech s’atteint par le navigateur et par API, avec un usage web sur ordinateur et un accès applicatif pour intégrer la synthèse dans un produit. Sur mobile, la prise en charge annoncée ne passe pas par une application dédiée, et l’outil répond dans plusieurs langues, dont le français. Côté interface, le Studio sert au test visuel. Les requêtes et les réglages avancés passent par les points d’entrée documentés.

Appareils, applications et systèmes compatibles

Unreal Speech donne accès à son API depuis le navigateur, avec le Studio web pour préparer et tester les voix. Les intégrations déclarées côté documentation couvrent Python et Node.js.

Disponible sur

WebOui
iOSNon
AndroidNon
WindowsNon
macOSNon
LinuxNon

Accès & intégrations

Extension navigateurNon
IntégrationsOui

Python, Node.js

Plug-inNon
API publiqueOui

Elle permet d’envoyer du texte aux points de terminaison de synthèse depuis une application.

SDKOui
Open sourceNon
Auto-hébergeableNon

Langues disponibles

Unreal Speech prend en charge neuf langues, dont le français et deux variantes de l’anglais (États-Unis et Royaume-Uni). La liste ci-dessous reprend uniquement les langues publiées par l’éditeur.

anglais mandarin hindi espagnol portugais japonais français italien

Avis et notes par Aikiwi

Note Globale d’Unreal Speech 4,3

  • Design et Ergonomie4,0
  • Facilité d’Utilisation4,2
  • Fonctionnalités et Outils4,8
  • Performance et Fiabilité4,0
  • Innovation et Singularité4,5
  • Support et Ressources Disponibles4,2
  • Rapport Qualité-Prix4,7

Unreal Speech combine une API de synthèse vocale, un studio web et plusieurs modes de sortie. L’outil génère du flux en direct, des tâches asynchrones pour de très gros volumes et des horodatages mot par mot pour l’affichage du texte en synchronisation avec l’audio.

Unreal Speech convient à des équipes qui ont besoin de voix de synthèse dans un produit ou un flux de publication. Le positionnement vise aussi les usages à fort volume et les besoins de voix en temps réel.

Le palier gratuit permet de vérifier le rendu, le flux en direct et la sortie synchronisée sans carte bancaire. Passer ensuite à un palier payant devient possible.

Avis détaillé sur Unreal Speech

Design et Ergonomie 4,0

Unreal Speech expose surtout une logique d’API et un studio web, avec des endpoints clairs pour la synthèse, le flux en direct et les tâches asynchrones. Des réglages de débit, de vitesse, de hauteur et des formats audio variés structurent l’environnement. Rien ne décrit l’interface elle-même ni sa hiérarchie visuelle. Pour un profil technique, la lecture reste directe, car les actions principales sont nommées sans détour. Face à un utilisateur qui attend un environnement très guidé, la fiche laisse plutôt voir un outil centré sur l’intégration que sur l’assistance visuelle.

Facilité d’Utilisation 4,2

Unreal Speech demande de passer par une clé API gratuite puis d’envoyer du texte vers des endpoints distincts selon le besoin. L’outil propose cependant des repères concrets, avec des limites de longueur par flux, un mode synchrone pour les cas simples et des SDK en Python et Node.js. Le démarrage convient bien à un développeur ou à une équipe produit qui veut tester vite une voix de synthèse dans un flux applicatif. Pour un créateur sans bagage technique, la logique par requêtes HTTP et paramètres audio demande davantage de prise en main qu’une interface de montage clé en main.

Fonctionnalités et Outils 4,8

Unreal Speech couvre un périmètre large pour la synthèse vocale : flux en temps réel, traitement asynchrone de gros volumes, horodatage mot à mot, plusieurs formats audio, réglages de vitesse et de hauteur, et prise en charge de plusieurs langues affichées. Le service ajoute aussi des SDK, des exemples de code et un modèle vocal open source utilisé dans le studio. L’ensemble vise des usages de production, pas une simple démonstration. Un éditeur de contenu, une équipe d’audiobooks ou un service client peuvent y trouver de quoi industrialiser la voix, avec des briques techniques réutilisables. La couverture fonctionnelle dépasse nettement une synthèse vocale basique.

Performance et Fiabilité 4,0

Unreal Speech ne publie ni page de statut, ni historique d’incidents, ni engagement de disponibilité. La documentation décrit des modes de génération et un flux en temps réel pour certains cas, mais elle ne donne pas d’élément public sur la régularité du service ni sur la stabilité d’ensemble. Pour un usage ponctuel, les modalités techniques sont lisibles et montrent une architecture pensée pour des réponses rapides. Pour une équipe qui doit engager un service critique, l’absence d’indicateurs publics sur la continuité de fonctionnement oblige à s’appuyer sur ses propres tests avant d’en faire une brique de production.

Innovation et Singularité 4,5

Unreal Speech combine une synthèse vocale à bas coût avec un flux en temps réel, des horodatages par mot et un traitement asynchrone de très gros textes. L’outil met aussi en avant un modèle vocal open source dans son studio, ce qui lui donne une base technique identifiable au lieu d’une simple intégration générique. Cette combinaison intéresse surtout les équipes qui veulent relier voix, synchronisation de texte et diffusion à grande échelle dans un même flux. Le positionnement est moins centré sur la démonstration créative que sur une mécanique de production réutilisable, ce qui le distingue des interfaces TTS plus classiques.

Support et Ressources Disponibles 4,2

Unreal Speech fournit une documentation dédiée, une page d’aide, un contact par email et un chat intégré dans l’application. La présence de SDK, de guides de démarrage et d’exemples de code complète un socle de ressources utile pour l’intégration et le dépannage courant. Un développeur gagne surtout en autonomie au moment de brancher l’API ou de tester les SDK. Un utilisateur non technique dispose aussi d’un canal d’aide, mais l’essentiel du support semble pensé pour accompagner la mise en œuvre plutôt que pour offrir un parcours d’assistance très guidé.

Rapport Qualité-Prix 4,7

Unreal Speech affiche un modèle freemium avec un palier gratuit plafonné chaque mois et plusieurs paliers payants ensuite, jusqu’à une formule Custom. Le service se positionne sur un coût annoncé comme très inférieur à plusieurs moteurs TTS connus, tout en ajoutant des volumes élevés, des formats variés et des fonctions de temps réel. Le rapport qualité-prix est fort pour un usage qui consomme beaucoup de voix générée ou qui doit synchroniser texte et audio. Le palier gratuit donne déjà de quoi tester sérieusement, puis les formules supérieures s’adressent à des besoins de volume. Pour un petit usage occasionnel, les paliers avancés paraissent disproportionnés.

Questions fréquentes

Quel est le prix d’un abonnement à Unreal Speech ?

Unreal Speech fonctionne sur un modèle freemium avec six paliers : Free, Basic, Plus, Pro, Enterprise et Custom. Le palier gratuit existe, sans carte bancaire. Les formules payantes vont de 49 $ par mois pour Basic à 4 999 $ par mois pour Enterprise, avec Plus à 499 $ et Pro à 1 499 $ par mois ; Custom se traite sur devis.

Existe-t-il une version gratuite d’Unreal Speech ?

Oui, Unreal Speech propose un palier gratuit, sans carte bancaire. Il est plafonné par un quota mensuel de caractères, détaillé dans la section sur la formule gratuite. Un lien d’attribution vers unrealspeech.com est requis lors de la publication de l’audio.

Quelles langues Unreal Speech prend-il en charge ?

Unreal Speech publie une liste de langues prises en charge : l’anglais des États-Unis, l’anglais du Royaume-Uni, le mandarin, l’hindi, l’espagnol, le portugais, le japonais, le français et l’italien. Le détail figure dans la section consacrée aux langues.

La fiche en bref
Éditeur
Unreal Speech
Pays
États-Unis
Création
2022
Offre gratuite
Oui
Essai gratuit
Non
Sans carte bancaire
Oui
Plateformes
Web

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.