Fiche créée le

Harmonai

3,6 Gratuit

Harmonai est le laboratoire audio de Stability AI : il publie en open source des outils pour entraîner un modèle génératif sur tes propres sons, puis en tirer des échantillons et des bibliothèques sonores sans fin. Tout est gratuit et publié sous licence MIT, mais rien ne s'utilise en ligne : il faut installer le code sur ta machine, avec une carte graphique pour l'entraînement.

Le projet se présente comme une IA faite par des musiciens pour des musiciens, mais il parle surtout aux développeurs et aux chercheurs à l'aise avec GitHub. Ses deux briques sont sample-generator, qui entraîne Dance Diffusion, et stable-audio-tools, qui fait tourner Stable Audio Open.

Lire plus Lire moins
La fiche en bref
Éditeur
Stability AI
Pays
Royaume-Uni
Offre gratuite
Oui
Essai gratuit
Non
Plateformes
Web

Harmonai en bref

C’est quoi ?

Harmonai est un laboratoire de Stability AI qui publie des outils audio génératifs open source. Son premier outil, sample-generator, entraîne un modèle Dance Diffusion sur n’importe quel ensemble d’échantillons, puis en génère de nouveaux ; stable-audio-tools, repris depuis par la maison mère, fournit le code d’entraînement et d’inférence des modèles Stable Audio. Il n’y a ni application ni compte : tout se lance depuis le code.

Pourquoi ?

Harmonai sert à produire une matière sonore neuve à partir de tes propres sons, sans dépendre d’un service fermé. Tu entraînes le modèle sur tes échantillons, puis tu génères des variations ou une banque de sons dans le même style. Le site résume l’ambition en une formule : rendre la production musicale plus accessible, et redonner la main aux artistes.

Pour qui ?

Harmonai vise les musiciens, les producteurs et les artistes, mais son usage réel demande de savoir installer un environnement Python, faire tourner une carte graphique et lire un dépôt GitHub. Il convient donc d’abord aux développeurs et aux chercheurs en IA audio, ou aux musiciens prêts à mettre les mains dans le code. La communauté se retrouve sur Discord.

Avantages et inconvénients

Les plus

  • Code ouvert sous licence MIT Harmonai publie ses outils sous licence MIT : tu peux les installer, les modifier et les redistribuer, y compris dans un projet commercial, sans rien payer ni créer de compte.
  • Entraînement sur tes propres sons Harmonai te laisse nourrir le modèle avec tes propres enregistrements, puis en tirer des sons inédits dans la même couleur. Ta matière reste chez toi, sur ta machine, sans passer par un serveur tiers.
  • Des bibliothèques sonores sans fin Harmonai génère autant d’échantillons que tu veux une fois le modèle prêt. Tu constitues ainsi une banque de sons personnelle plutôt que d’acheter des packs génériques.
  • Un code suivi par Stability AI Harmonai a confié stable-audio-tools à Stability AI, qui continue de le faire évoluer et s’en sert pour Stable Audio Open. Tu travailles sur un code suivi, pas sur un prototype figé.

Les moins

  • Aucun usage sans installation Harmonai ne propose ni application ni démo en ligne : il faut cloner un dépôt, installer ses dépendances en Python et, pour l’entraînement, prévoir un GPU puissant et un compte Weights & Biases.
  • Une interface réduite au test Harmonai ne fournit qu’une interface Gradio locale, pensée pour essayer un modèle entraîné. Il n’y a ni éditeur audio, ni gestion de projets, ni export guidé vers un logiciel de musique.
  • Des poids sous une autre licence Harmonai publie son code sous MIT, mais les poids Stable Audio Open que charge stable-audio-tools obéissent aux règles fixées par la maison mère, qui réserve la gratuité aux petites structures.
  • Pas de support formel Harmonai n’offre aucun service d’assistance. L’entraide passe par les tickets GitHub des dépôts et par le serveur Discord de la communauté.

Un outil entièrement gratuit

Aucun palier payant chez Harmonai (vérifié le 24 septembre 2026) : l’outil est entièrement gratuit, sans grille tarifaire. Harmonai est un laboratoire de Stability AI qui publie des outils audio open source sous licence MIT : ni le site harmonai.org, ni les dépôts GitHub n’affichent de formule, de montant ou de devise.

relevés le 24/09/2026

Ce que permet la formule gratuite

Harmonai n’a pas de formule à proprement parler : tout ce que le laboratoire publie est gratuit. Le dépôt sample-generator fournit les carnets Dance Diffusion et le code d’entraînement sur tes propres échantillons ; stable-audio-tools y ajoute la génération conditionnelle et une interface Gradio locale.

Harmonai reporte le coût sur ton matériel de calcul. D’après la documentation d’installation, il faut un environnement Python 3.10 et une bibliothèque de calcul récente ; l’entraînement réclame des GPU et un compte Weights & Biases pour journaliser chaque essai. Rien ne tourne sur un serveur du laboratoire.

Sur Hugging Face, les poids du modèle Stable Audio Open se téléchargent après acceptation d’une licence dite communautaire, propre à Stability AI. Cette licence est gratuite pour les chercheurs, les créateurs et les petites structures ; au-delà d’un million de revenus annuels, Stability AI exige une licence entreprise.

Ce que fait Harmonai

Harmonai repose sur des modèles de diffusion audio. Avec sample-generator, tu rassembles un corpus d’échantillons, tu entraînes un modèle Dance Diffusion dessus, puis tu génères de nouveaux sons qui en reprennent le style, sans consigne écrite : le modèle apprend seulement la matière qu’on lui donne.

Côté stable-audio-tools, passé sous le giron de Stability AI, on va plus loin : le dépôt entraîne et fait tourner des modèles de génération audio conditionnelle, dont Stable Audio Open 1.0, et fournit une interface Gradio pour les tester. Chaque entraînement se répartit sur plusieurs cartes graphiques et se suit dans Weights & Biases.

Pas de morceau fini à la sortie. Harmonai livre des échantillons ou des extraits audio, que tu reprends ensuite dans ton logiciel de production : le laboratoire fournit les briques, pas la chaîne de création complète.

Comment utiliser Harmonai

Prise en main initiale

Harmonai commence sur GitHub : tu clones sample-generator ou stable-audio-tools, puis tu installes les dépendances indiquées dans le README, avec pip pour le premier, uv ou pip pour le second. Les carnets Dance Diffusion du dépôt sample-generator permettent aussi de démarrer sans écrire de script.

Navigation dans l’interface

Pour tester un modèle, tu lances le script run_gradio.py de stable-audio-tools avec le nom d’un modèle publié sur Hugging Face, par exemple Stable Audio Open 1.0 une fois sa licence acceptée. Une interface web locale s’ouvre ; une option crée un lien de partage public, et un identifiant avec mot de passe peut la protéger.

Utilisation et gestion de projets

Pour entraîner, tu prépares un fichier de configuration du modèle et un autre pour le jeu de données, tu te connectes à Weights & Biases, puis tu lances train.py. Le modèle entraîné se « déballe » ensuite pour l’inférence, et tu peux le recharger dans l’interface Gradio avec son propre fichier de configuration.

Fonctionnalités principales

Harmonai réunit des outils de recherche plutôt qu’un produit fini : entraînement de modèles audio, génération d’échantillons et interface de test locale. Tout est publié sur GitHub, sous licence MIT.

Générer des bibliothèques sonores sur mesure

Produit à volonté de nouveaux sons pour constituer une banque personnelle, déclinée dans le style du corpus d’origine. C’est la promesse mise en avant sur la page d’accueil du laboratoire.

Gratuit, sur ta propre machine.

Entraîner Dance Diffusion sur tes échantillons

Le dépôt sample-generator apprend la couleur d’un corpus de sons, puis en tire des variations dans le même style. Un carnet dédié couvre aussi l’affinage d’un modèle existant.

Gratuit, sous licence MIT.

Entraîner et faire tourner des modèles Stable Audio

Le dépôt stable-audio-tools entraîne et exécute des modèles audio guidés par une consigne, en répartissant le calcul sur plusieurs GPU. C’est la base de Stable Audio Open 1.0.

Poids réservés aux structures sous le seuil de revenus de la licence communautaire.

Interface Gradio locale

Ouvre une page web sur ta machine pour essayer un modèle, le tien ou l’un de ceux que Stability AI met en ligne. L’interface peut être partagée par lien et protégée par identifiant.

Accès protégé par identifiant en option.

Suivi des entraînements dans Weights & Biases

Journalise chaque entraînement, ses courbes et ses démos audio dans un projet Weights & Biases, ce qui aide à comparer les essais entre eux.

Compte Weights & Biases requis.

Laboratoire communautaire

Réunit musiciens et chercheurs autour du projet, avec un serveur Discord ouvert à tous et des dépôts publics où proposer des corrections.

Usages et métiers

Harmonai cite les musiciens et les artistes comme premier public, mais ses outils demandent un vrai bagage technique. Les usages ci-dessous tiennent compte de cette réalité.

Musiciens

Ils s’en servent pour entraîner un modèle sur leurs propres enregistrements et en tirer des variations inédites. Cela remplace une recherche d’échantillons dans des packs, à condition d’accepter l’installation.

Producteurs de musique

Ils l’emploient pour fabriquer une bibliothèque de sons courts dans une couleur donnée, puis la reprendre dans leur logiciel de production. Cela remplace l’achat de banques de sons génériques.

Artistes

Ils l’utilisent pour explorer une matière sonore née de leur propre corpus. La démarche remplace des manipulations manuelles longues quand il s’agit de décliner un univers.

Amateurs de musique

Ceux qui savent installer un environnement Python génèrent des sons à partir de modèles publiés, sans rien payer. Cela remplace un abonnement à un générateur en ligne, au prix d’une mise en place plus lourde.

Développeurs

Ils intègrent Dance Diffusion via la bibliothèque diffusers, ou reprennent stable-audio-tools dans leurs propres projets. Cela remplace l’écriture d’un pipeline audio à partir de zéro.

Chercheurs en IA

Ils entraînent et comparent des modèles audio génératifs avec un code maintenu, réparti sur plusieurs GPU et journalisé. Cela remplace une infrastructure montée à la main pour chaque expérience.

Conseils d’utilisation

Conseils pour une utilisation efficace

Harmonai donne de meilleurs résultats avec un corpus d’entraînement homogène : des échantillons de même nature, percussions, textures ou voix, donnent un modèle plus cohérent qu’un mélange. Commence par essayer un modèle publié dans l’interface Gradio avant de lancer ton propre entraînement, qui occupe une carte graphique longtemps. Surveille les courbes dans Weights & Biases pour arrêter un essai qui dérive.

Erreurs communes à éviter

Échec d’installation : la version de Python ou de la bibliothèque de calcul ne correspond pas à celle du README. Entraînement bloqué au démarrage : aucun compte Weights & Biases n’est connecté. Modèle Stable Audio Open introuvable : sa licence n’a pas été acceptée sur Hugging Face avec le compte utilisé.

Modèles et droits sur les créations

Harmonai publie son code sous licence MIT : sample-generator, oobleck et stable-audio-tools peuvent être utilisés, modifiés et redistribués, y compris commercialement, à condition de conserver la mention de licence et de copyright.

Pour les modèles, d’autres règles s’appliquent. Stable Audio Open 1.0 est distribué sous la licence communautaire de Stability AI, révocable, qui interdit notamment d’en tirer un modèle de fondation concurrent. Son jeu d’entraînement provient de Freesound et du Free Music Archive, sous licences CC0, CC BY ou CC Sampling+.

Pour un modèle que tu entraînes toi-même avec sample-generator, c’est à toi de t’assurer que tu détiens les droits sur le corpus de départ. Côté sons générés, le laboratoire ne publie pas de conditions propres : son site renvoie aux conditions générales de Stability AI.

Accès

Harmonai ne s’utilise ni dans un navigateur ni dans une application : le site harmonai.org présente le laboratoire et renvoie vers GitHub et Discord. Tu installes les outils sur ta propre machine ou sur un serveur, à partir du code publié, et c’est là qu’ils tournent.

Pour un développeur, le paquet stable-audio-tools s’installe aussi avec pip, et Dance Diffusion existe comme pipeline dans diffusers, chez Hugging Face. Il n’existe pas d’API hébergée par le laboratoire.

Côté langue, le site, les README et la communauté fonctionnent en anglais. Aucun support commercial n’existe : les questions se posent en public, dans les tickets ou sur le serveur de discussion.

Appareils, applications et systèmes compatibles

Disponible sur

WebOui
iOSNon
AndroidNon
WindowsNon
macOSNon
LinuxNon

Accès & intégrations

Extension navigateurNon
IntégrationsOui

Hugging Face diffusers (DanceDiffusionPipeline), Weights & Biases (wandb)

Plug-inNon
API publiqueNon
SDKOui
Open sourceOui
Auto-hébergeableOui

Langues disponibles

Harmonai fonctionne en anglais : site, README et échanges de la communauté.

anglais

Avis et notes par Aikiwi

Note Globale d’Harmonai 3,6

  • Design et Ergonomie3,0
  • Facilité d’Utilisation2,8
  • Fonctionnalités et Outils3,8
  • Performance et Fiabilité3,5
  • Innovation et Singularité4,2
  • Support et Ressources Disponibles3,2
  • Rapport Qualité-Prix4,5

Harmonai est moins un outil qu’un laboratoire : des briques open source sérieuses, adossées à Stability AI, pour entraîner et faire tourner des modèles audio génératifs. Le code est gratuit et réutilisable, mais rien ne s’utilise sans installation.

Harmonai convient aux développeurs, aux chercheurs et aux musiciens à l’aise avec le code qui veulent un modèle nourri de leurs propres sons. Un musicien qui cherche un générateur prêt à l’emploi sera mieux servi par un service en ligne.

Harmonai ne coûte rien, mais demande du temps, du matériel et une vraie aisance avec le code. Avant tout usage commercial, vérifie la licence des poids que tu charges : le code est libre, les modèles ne le sont pas tous.

Avis détaillé sur Harmonai

Design et Ergonomie 3,0

Harmonai n’a pas d’interface à proprement parler : le site est une page de présentation, et l’outil se pilote par des scripts et des carnets. La seule surface visuelle est l’interface Gradio de stable-audio-tools, un formulaire de test générique sans travail d’ergonomie propre. Pour l’utilisateur, l’expérience est celle d’un dépôt de code, pas d’un logiciel conçu pour guider un musicien.

Facilité d’Utilisation 2,8

Harmonai demande de cloner un dépôt, d’installer un environnement Python précis, d’avoir accès à un GPU et, pour l’entraînement, un compte Weights & Biases. Les README sont clairs pour un développeur, mais aucun parcours ne guide un débutant. Pour un musicien sans bagage technique, la marche d’entrée est haute ; pour un chercheur, elle est habituelle.

Fonctionnalités et Outils 3,8

Harmonai couvre l’entraînement sur ses propres échantillons, la génération de sons et de banques, l’exécution de Stable Audio Open et le suivi des essais dans Weights & Biases, avec une intégration à diffusers. Le périmètre s’arrête là : ni édition, ni séparation de pistes, ni export vers un logiciel de musique. C’est une base solide pour construire, pas un outil de production complet.

Performance et Fiabilité 3,5

Harmonai ne publie ni page de statut ni engagement de service, et pour cause : rien ne tourne sur ses serveurs. La tenue dépend de ta machine, de ton GPU et de la compatibilité des dépendances, que la documentation précise version par version. Le dépôt sample-generator, lui, garde des tâches ouvertes dans son README, signe d’un outil de recherche plus que d’un produit fini.

Innovation et Singularité 4,2

Harmonai publie avec Dance Diffusion un modèle de diffusion audio que chaque musicien peut entraîner sur sa propre matière. Sa logique, une IA faite par des musiciens pour des musiciens, et son code ouvert le distinguent des générateurs fermés. Pour l’utilisateur, la singularité tient à la liberté de réentraîner et de réutiliser les modèles.

Support et Ressources Disponibles 3,2

Harmonai s’appuie sur les README des dépôts, la documentation de stable-audio-tools, les tickets GitHub et un serveur Discord communautaire. Aucune réponse n’est garantie, et aucun canal privé n’est proposé. Pour un profil technique, ces ressources suffisent souvent ; pour un débutant bloqué à l’installation, l’appui reste mince.

Rapport Qualité-Prix 4,5

Harmonai ne coûte rien : le code est sous licence MIT, sans compte ni abonnement. Le vrai coût est ailleurs, dans le matériel de calcul et le temps de mise en place. Les poids Stable Audio Open restent gratuits pour les petites structures, mais une entreprise plus grande doit négocier une licence avec Stability AI.

Questions fréquentes

Quels sont les avis sur Harmonai ?

Harmonai est apprécié pour son code ouvert et la possibilité d’entraîner un modèle sur ses propres sons, avec Dance Diffusion puis stable-audio-tools. En contrepartie, il réclame une installation en Python, une carte graphique pour l’entraînement et une vraie aisance technique : ce n’est pas un générateur prêt à l’emploi.

Harmonai propose-t-il une application en ligne ?

Harmonai ne propose ni application en ligne, ni application mobile ou de bureau. Le site harmonai.org présente le laboratoire et renvoie vers ses dépôts GitHub : les outils s’installent en local, et leur interface Gradio s’ouvre ensuite dans ton navigateur.

Quel est le prix d’Harmonai ?

Harmonai est entièrement gratuit : le laboratoire publie son code sous licence MIT, sans compte ni abonnement. Seuls les poids Stable Audio Open, chargés par stable-audio-tools, dépendent de la licence communautaire de Stability AI, qui devient payante pour les plus grandes entreprises.

La fiche en bref
Éditeur
Stability AI
Pays
Royaume-Uni
Offre gratuite
Oui
Essai gratuit
Non
Plateformes
Web

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.