Fiche créée le

MiniGPT-4

3,8 Gratuit

MiniGPT-4 est un modèle de recherche open source qui décrit des images, répond à des questions sur leur contenu et écrit des textes à partir de ce qu'il voit. Publié en 2023 par une équipe de KAUST, il relie un encodeur visuel figé au modèle de langage Vicuna par une seule couche de projection.

Son code, ses poids et son jeu de données se téléchargent gratuitement sous licence BSD 3-Clause, à faire tourner sur ta propre carte graphique ; la démo en ligne, hébergée sur Hugging Face, était en veille fin septembre 2026. Il répond en anglais, sans API publique ni application.

Lire plus Lire moins
La fiche en bref
Éditeur
King Abdullah University of Science and Technology (KAUST)
Pays
Arabie saoudite
Création
2023
Offre gratuite
Oui
Plateformes
Web

MiniGPT-4 en bref

C’est quoi ?

MiniGPT-4 est un modèle vision-langage issu d’un article de recherche : il reçoit une image et une consigne en anglais, puis rédige une réponse. Un encodeur d’images figé, repris de BLIP-2, extrait les caractéristiques visuelles, qu’une seule couche linéaire projette vers Vicuna, un grand modèle de langage lui aussi figé. Tu peux lui demander une description détaillée, poser une question sur la photo ou obtenir un texte inspiré d’elle.

Pourquoi ?

MiniGPT-4 a été conçu pour vérifier qu’un modèle de langage avancé suffit à faire apparaître des capacités proches de celles de GPT-4 en vision : décrire finement une image, créer un site web à partir d’un brouillon manuscrit, expliquer une scène insolite. Pour toi, il sert à transformer une photo en texte exploitable, ou à étudier et adapter un modèle multimodal ouvert.

Pour qui ?

MiniGPT-4 vise d’abord les chercheurs en vision-langage et les développeurs qui bâtissent des applications multimodales, capables d’installer un environnement Python sur une machine dotée d’une carte graphique. Les passionnés d’IA peuvent l’essayer par la démo en ligne quand elle est active, ou par un notebook Colab proposé par la communauté.

Avantages et inconvénients

Les plus

  • Descriptions visuelles détaillées MiniGPT-4 produit des descriptions d’image fines, avec des éléments riches sur la scène, les objets et leur contexte.
  • Réponses à partir d’images MiniGPT-4 répond aux questions posées sur une photo et poursuit l’échange comme un chatbot, à partir du seul contenu visuel de l’image.
  • Production de textes créatifs L’outil écrit des histoires, des poèmes, des recettes ou des publicités inspirés par une image.
  • Aide à partir de photos problématiques Il identifie un problème visible sur une photo et propose une solution correspondante.
  • Code ouvert et réutilisable Sous licence BSD 3-Clause, le code autorise l’usage commercial, la modification et la redistribution, à condition de garder la mention de copyright.

Les moins

  • Sortie centrée sur l’image Le produit reste pensé pour ce qui se voit à l’écran ; dès qu’il faut travailler sur un sujet sans support visuel, il ne couvre plus le besoin.
  • Une carte graphique exigeante Faire tourner le modèle chez soi demande un GPU doté de beaucoup de mémoire, détaillée dans le README du dépôt, et une installation manuelle en Python.
  • Interface en anglais L’outil répond en anglais, ce qui oblige à passer par cette langue pour l’échange et pour la formulation des consignes.
  • Un projet peu actif La dernière nouvelle du dépôt date du 31 octobre 2023, avec MiniGPT-v2, et la démo en ligne s’arrête dès que personne ne l’utilise.

Un outil entièrement gratuit

Aucun palier payant chez MiniGPT-4 (vérifié le 24 septembre 2026) : l’outil est entièrement gratuit, sans grille tarifaire. Projet de recherche de KAUST, il publie son code, ses poids et son jeu de données sans contrepartie, et ni la page du projet, ni le dépôt GitHub, ni la démo Hugging Face n’affichent de formule ou de montant.

relevés le 24/09/2026

Ce que permet la formule gratuite

MiniGPT-4 n’a pas de formule à proprement parler : tout ce que l’équipe publie est gratuit. Le dépôt GitHub donne le code d’entraînement et de démonstration, les poids des versions Vicuna 13B, Vicuna 7B et Llama 2 Chat 7B, ainsi que le jeu de données d’alignement.

Côté matériel, MiniGPT-4 réclame une vraie carte graphique. Chargé en 8 bits, réglage par défaut, le modèle demande environ 23 Go de mémoire GPU avec un modèle de langage de 13 milliards de paramètres et 11,5 Go avec un modèle de 7 milliards, selon le README ; le mode 16 bits vise des cartes plus puissantes.

Sans GPU, deux portes restent ouvertes : la démo hébergée sur Hugging Face, qui dormait faute de visites le 24 septembre 2026, et un notebook Colab que le README signale, proposé par un membre de la communauté. Aucune des deux ne demande d’installation.

Ce que fait MiniGPT-4

MiniGPT-4 aligne des caractéristiques visuelles extraites par un encodeur d’images figé avec un grand modèle de langage figé, Vicuna, grâce à une projection linéaire unique : seule cette couche est entraînée. Tu pars d’une image et d’une consigne textuelle ; la réponse en anglais décrit, explique ou commente ce qui apparaît.

Deux étapes d’entraînement se sont succédé. D’abord environ 5 millions de paires image-texte (LAION, Conceptual Captions, SBU) pour aligner la vision sur le modèle de langage ; ensuite environ 3 500 paires de haute qualité, mises en forme de conversation, pour rendre les réponses plus fiables et moins répétitives.

Côté briques, le système s’appuie sur Vicuna, lui-même construit sur LLaMA, et sur l’encodeur de BLIP-2 (ViT-G/14 d’EVA-CLIP et Q-Former). Une version bâtie sur Llama 2 Chat 7B existe aussi depuis août 2023, et le même dépôt héberge MiniGPT-v2, son successeur publié par une équipe élargie.

Comment utiliser MiniGPT-4

Prise en main initiale

MiniGPT-4 s’installe depuis son dépôt GitHub : tu clones le code, crées l’environnement Python fourni, télécharges les poids du modèle de langage et le point de contrôle de MiniGPT-4, puis indiques leurs chemins dans les fichiers de configuration. Un script de démonstration lance ensuite l’interface en local, sur ta carte graphique.

Navigation dans l’interface

MiniGPT-4 se présente, dans sa démo locale comme dans celle de Hugging Face, sous forme de conversation : tu charges une image, écris ta consigne en anglais et la réponse s’affiche comme un message. Chaque nouvelle demande repart de l’image chargée, sans mode séparé à mémoriser.

Utilisation et gestion de projets

MiniGPT-4 ne propose ni compte ni espace projet : tu enchaînes les images et les questions dans la session de démonstration. Pour aller plus loin, le dépôt fournit les scripts d’entraînement et de réglage fin, et le code s’intègre dans ton propre programme Python, faute d’API publique.

Fonctionnalités principales

MiniGPT-4 se télécharge depuis son dépôt open source et s’essaie, quand elle est active, par une démo en ligne. Le modèle répond en anglais, sans API publique ; ses capacités sont celles que décrit l’article de recherche de l’équipe.

Description détaillée d’images

MiniGPT-4 produit des descriptions riches et précises à partir d’une image. Tu lui envoies une photo, puis il renvoie un texte descriptif en anglais, bien plus détaillé qu’une légende courte.

Conversation visuelle naturelle

MiniGPT-4 permet un échange de type chatbot autour d’une image. Pose des questions sur ce que montre le visuel et poursuis l’échange dans le même fil de conversation.

Questions-réponses sur une image

L’outil répond à des questions portant sur le contenu visuel d’une photo. Il sert à identifier des éléments, des objets ou une scène directement depuis l’image, sans description préalable.

Création de récits et de poèmes à partir d’images

MiniGPT-4 écrit des histoires ou des poèmes inspirés par un visuel. L’image sert de point d’entrée, puis le modèle génère un texte créatif qui reprend ce qu’il y voit.

Rédaction de recettes depuis des photos d’aliments

L’outil peut proposer des recettes détaillées à partir d’une photo de nourriture. Tu pars d’un plat visible, puis le modèle explique comment le cuisiner, étape par étape.

Rédaction d’annonces produit depuis une image

MiniGPT-4 génère des textes publicitaires à partir d’un produit visible sur une image. Le visuel sert de base, puis l’outil rédige une accroche ou une annonce complète.

Diagnostic visuel avec solution associée

L’outil repère un problème montré sur une photo et propose une réponse correspondante. Tu montres le défaut, puis le modèle formule une explication ou une piste de correction.

Recherche de faits depuis une image

MiniGPT-4 extrait des faits sur une personne, un film ou une œuvre d’art à partir de l’image. Le visuel devient le point d’entrée de la requête, et la réponse reste textuelle.

Sites web à partir d’un brouillon manuscrit

Le modèle peut suivre des instructions rédigées à la main pour produire un site web. Tu fournis la photo d’un croquis ou d’un texte manuscrit, puis il interprète la consigne.

Explication de scènes insolites

MiniGPT-4 explique ce qui rend une image étrange ou drôle, comme un élément humoristique ou un phénomène visuel inhabituel, à la manière des démonstrations de GPT-4.

Usages et métiers

MiniGPT-4 sert à des chercheurs en vision et langage, à des développeurs qui conçoivent des applications multimodales, et à des passionnés d’IA. Les usages recensés vont de la description détaillée d’images à la réponse à des questions visuelles, avec des sorties plus créatives quand le contexte s’y prête.

Chercheurs en vision et langage

Ils s’en servent pour décrire des images en détail, tester la conversation visuelle et comparer des réponses sur des scènes complexes. L’outil remplace des prototypes séparés de légendage et de question-réponse visuelle.

Développeurs d’applications multimodales

Ils l’emploient pour intégrer de la description d’image, des réponses visuelles et des contenus générés à partir d’images dans un produit. Il remplace une chaîne qui assemblerait plusieurs briques de vision et de langage.

Passionnés d’IA

Ils l’utilisent pour explorer la conversation visuelle, faire commenter une photo ou obtenir des textes inspirés par une image. L’outil remplace des essais manuels entre un modèle de vision et un modèle de texte.

Description d’images détaillée

Tu lui donnes une image, et il génère une légende riche plutôt qu’une description courte et générique. Ce cas d’usage remplace le légendage manuel.

Questions sur des images

Tu lui poses une question sur une photo et il répond à partir du contenu visuel. Cela remplace une lecture humaine de l’image pour un premier tri.

Histoires, poèmes, recettes et publicités à partir d’images

À partir d’une image, il rédige un texte créatif adapté au sujet visible. Il remplace une rédaction qui partait du visuel pour être faite à la main.

Sites web à partir d’instructions écrites à la main

Il interprète des consignes manuscrites pour produire un site web. Le travail remplace la reprise manuelle d’un brief papier avant intégration.

Diagnostic de problèmes sur photo

Il repère un défaut visible sur une photo et suggère une réponse correspondante. L’outil remplace un premier examen visuel qui serait fait à la main.

Conseils d’utilisation

Conseils pour une utilisation efficace

MiniGPT-4 donne de meilleurs retours avec une image nette, un sujet central bien visible et une question précise plutôt qu’une formulation vague. Écris ta consigne en anglais. En local, garde le chargement en 8 bits proposé par défaut si ta carte manque de mémoire, et passe en 16 bits seulement sur un GPU plus puissant.

Erreurs communes à éviter

Symptôme : les réponses se répètent ou se coupent en phrases décousues. Cause : un modèle seulement pré-entraîné sur des paires brutes, défaut que l’équipe a corrigé par la seconde étape d’affinage ; charge bien le point de contrôle final publié. Symptôme : la démo en ligne ne répond pas. Cause : le Space Hugging Face se met en veille faute de visites ; passe alors par l’installation locale ou le notebook Colab.

Modèles et droits sur les créations

MiniGPT-4 tourne avec Vicuna V0, en version 13B ou 7B, ou avec Llama 2 Chat 7B, à télécharger séparément avant de charger le point de contrôle de l’équipe. L’encodeur visuel vient de BLIP-2, et une bonne partie du code s’appuie sur la bibliothèque Lavis.

Côté droits, le dépôt est publié sous licence BSD 3-Clause, avec un copyright de 2023 au nom de Deyao Zhu : usage commercial, modification et redistribution sont permis, à condition de conserver la mention de copyright et de ne pas utiliser le nom des auteurs pour promouvoir un produit dérivé.

Aucune clause ne vise les sorties de MiniGPT-4. L’équipe ne publie aucune condition d’utilisation propre aux textes générés ni à la démo en ligne : seule la licence du code est écrite. Tu restes donc seul juge de l’usage que tu fais des réponses produites à partir de tes images.

Accès

MiniGPT-4 s’utilise de deux façons : en local, après installation depuis le dépôt GitHub sur une machine dotée d’une carte graphique, ou en ligne par la démo de Hugging Face, quand elle n’est pas en veille.

Aucune application Windows, macOS, iOS ou Android, ni extension de navigateur, n’est proposée par l’équipe de KAUST. Le code s’intègre à un programme Python, mais aucune API publique n’est fournie pour appeler le modèle à distance.

Seule langue annoncée : l’anglais, pour les consignes comme pour les réponses. Pour un usage francophone, cela compte dès la première question posée à MiniGPT-4, qui ne propose aucune traduction.

Appareils, applications et systèmes compatibles

Démo dans le navigateur, installation locale depuis le code source.

Disponible sur

WebOui
iOSNon
AndroidNon
WindowsNon
macOSNon
LinuxNon

Accès & intégrations

Extension navigateurNon
IntégrationsNon
Plug-inNon
API publiqueNon
SDKNon
Open sourceOui
Auto-hébergeableOui

Langues disponibles

anglais

Avis et notes par Aikiwi

Note Globale de MiniGPT-4 3,8

  • Design et Ergonomie4,0
  • Facilité d’Utilisation3,2
  • Fonctionnalités et Outils4,2
  • Performance et Fiabilité3,5
  • Innovation et Singularité4,3
  • Support et Ressources Disponibles3,2
  • Rapport Qualité-Prix4,3

MiniGPT-4 relie une image à une réponse textuelle en détail. Il sait décrire une scène, répondre à des questions sur le contenu visuel, générer des recettes, des histoires ou des publicités à partir d’une image, et proposer des solutions à des problèmes visibles sur une photo.

MiniGPT-4 convient à des profils qui travaillent déjà avec l’image comme point d’entrée et savent installer un modèle : chercheurs en vision-langage, équipes qui construisent des applications multimodales, enseignants qui veulent montrer le fonctionnement d’un modèle ouvert. L’anglais suffit pour l’utiliser.

MiniGPT-4 est gratuit et ouvert, mais son usage réel suppose une carte graphique bien dotée ou une démo en ligne qui dépend du réveil d’un Space Hugging Face. Faute de nouveauté publiée depuis MiniGPT-v2, il se lit aujourd’hui comme une référence de recherche plus que comme un outil maintenu.

Avis détaillé sur MiniGPT-4

Design et Ergonomie 4,0

MiniGPT-4 ne publie aucune description de son interface de démonstration, ni de ses choix d’accessibilité. Rien ne permet donc de juger la hiérarchie des écrans ou la clarté du parcours sur des bases publiques, d’autant que la démo en ligne peut rester en veille. Pour un lecteur qui veut une porte d’entrée simple vers la compréhension d’images, un échange image-consigne-réponse peut suffire ; pour qui attend un environnement guidé, avec des repères explicites et une aide visible, le projet n’offre rien de tel.

Facilité d’Utilisation 3,2

MiniGPT-4 demande un vrai effort de mise en route. En local, il faut cloner le dépôt, créer l’environnement Python, récupérer séparément deux jeux de poids, puis modifier les fichiers de configuration, le tout sur une carte graphique bien dotée. La démo en ligne évite ces étapes, mais elle peut être en veille. Une fois lancé, l’échange reste simple : une image, une consigne en anglais, une réponse. L’outil convient à un profil technique, pas à un utilisateur qui cherche un service prêt à l’emploi.

Fonctionnalités et Outils 4,2

MiniGPT-4 combine la description d’images, la question-réponse visuelle, la génération de textes créatifs à partir d’images et la création de sites web depuis des instructions manuscrites. Il ajoute l’explication de phénomènes visuels inhabituels, l’identification de problèmes sur photos avec solutions, et la récupération de faits sur des personnes, des films ou des œuvres directement depuis les images. Le dépôt livre aussi de quoi réentraîner et affiner le modèle. En revanche, rien au-delà du modèle : ni API, ni gestion de projets, ni fonction ajoutée depuis MiniGPT-v2. L’ensemble sert l’exploration et la recherche plus que la production.

Performance et Fiabilité 3,5

MiniGPT-4 ne publie ni page de statut, ni engagement de disponibilité, ni mesure de débit. Sa démo en ligne s’endort dès qu’elle n’a plus d’utilisateurs, signe qu’aucun service n’est tenu en continu. En local, la performance dépend entièrement de ta carte graphique : le README ne donne que la mémoire nécessaire. L’article reconnaît enfin qu’un modèle seulement pré-entraîné produisait des phrases répétitives ou décousues, défaut que l’affinage final a réglé.

Innovation et Singularité 4,3

MiniGPT-4 a montré qu’un encodeur visuel figé et le modèle Vicuna, reliés par une seule couche de projection entraînée, suffisaient à faire apparaître des capacités proches de celles de GPT-4 en vision : description fine, site web tiré d’un croquis, explication d’une image humoristique. L’approche, très économe en calcul, a nourri de nombreux travaux dérivés que le README recense, d’InstructionGPT-4 à SkinGPT-4. Elle reste une référence de recherche, mais l’équipe n’a plus rien annoncé depuis MiniGPT-v2.

Support et Ressources Disponibles 3,2

MiniGPT-4 renvoie vers son dépôt GitHub, où les issues servent de canal de support, et vers un serveur Discord signalé par le README. La documentation se limite au README et aux guides d’entraînement du dépôt, suffisants pour installer et tester le modèle. Plus de 350 issues restent ouvertes, et aucune nouveauté n’a été annoncée depuis MiniGPT-v2 : un profil à l’aise avec GitHub trouvera de quoi avancer seul, pas un accompagnement suivi.

Rapport Qualité-Prix 4,3

MiniGPT-4 est gratuit en licence : code, poids et jeu de données sont publiés sans contrepartie, sous une licence BSD 3-Clause qui autorise aussi l’usage commercial. La vraie dépense est matérielle, puisqu’il faut une carte graphique à forte mémoire pour le faire tourner chez soi, ou compter sur une démo en ligne qui n’est pas toujours active. Pour la recherche ou l’expérimentation, le rapport reste très favorable ; pour un besoin de production, l’absence de service maintenu pèse davantage.

Questions fréquentes

Quels sont les avis sur MiniGPT-4 ?

MiniGPT-4 n’a pas d’avis clients au sens commercial : c’est un projet de recherche. Son dépôt GitHub affiche plus de 25 000 étoiles, et le README recense plusieurs travaux bâtis sur le modèle, comme ArtGPT-4 ou PatFig. L’évaluation d’Aikiwi figure dans le bloc Avis et notes.

Est-ce que MiniGPT-4 est gratuit ?

Oui. MiniGPT-4 est un projet open source : code, poids et jeu de données se téléchargent gratuitement depuis le dépôt GitHub de l’équipe, sous licence BSD 3-Clause. Il faut seulement disposer d’une carte graphique assez puissante, ou passer par la démo en ligne quand elle est active.

Qu’est-ce que MiniGPT-4 ?

MiniGPT-4 est un modèle de vision-langage qui relie des images à un modèle de langage pour décrire, expliquer et converser à partir de visuels. Il produit des descriptions détaillées, répond à des questions sur des images, écrit des recettes ou des histoires inspirées d’images, et peut aussi créer des sites à partir d’instructions manuscrites. Le projet, publié par une équipe de KAUST, est open source.

Quel est le prix de MiniGPT-4 ?

MiniGPT-4 n’a pas de prix : aucune formule, aucun abonnement ni aucun montant n’apparaît chez l’équipe. La seule dépense éventuelle est le matériel nécessaire pour faire tourner le modèle en local, ou le recours à un service de calcul en ligne comme Colab.

La fiche en bref
Éditeur
King Abdullah University of Science and Technology (KAUST)
Pays
Arabie saoudite
Création
2023
Offre gratuite
Oui
Plateformes
Web

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.