Meta Segment Anything Model 2 (SAM 2)
Meta Segment Anything Model 2 (SAM 2) est le modèle de segmentation visuelle de Meta pour les images et les vidéos. Il prend une sélection par clic, cadre ou masque, puis suit l'objet à travers les images avec une mémoire de session qui conserve les repères utiles pendant le traitement.
L'outil sert surtout à segmenter un objet en temps réel, à corriger un masque au fil des frames et à produire des masklets réutilisables dans des chaînes d'annotation, d'édition vidéo ou d'autres systèmes d'IA. Meta l'a présenté le 29 juillet 2024 et en publie le code, les poids et une démo web gratuite.
Lire plus Lire moins
- Éditeur
- Meta Platforms, Inc.
- Pays
- États-Unis
- Création
- 2024
- Offre gratuite
- Oui
- Essai gratuit
- Non
Meta Segment Anything Model 2 (SAM 2) en bref
C’est quoi ?
SAM 2, le modèle de Meta, découpe un objet dans une image ou dans une vidéo à partir d’un clic, d’une boîte ou d’un masque. Tu peux corriger la prédiction frame par frame, puis suivre le même objet sur toute la séquence grâce à une mémoire par session. Appliqué à une image seule, SAM 2 se comporte comme le premier SAM.
Pourquoi ?
SAM 2 règle le suivi d’un objet quand il disparaît, réapparaît ou change de cadre. Grâce à sa mémoire par session, le modèle garde la continuité entre les images, ce qui permet de produire des masques exploitables pour l’annotation, le montage vidéo ou d’autres systèmes d’IA. Le résultat sert aussi d’entrée à des outils en aval.
Pour qui ?
SAM 2 vise les chercheurs en vision par ordinateur, les développeurs et les ingénieurs IA qui construisent des applications de segmentation. Il convient aussi aux équipes qui font de l’édition vidéo, des effets créatifs ou du prétraitement pour des modèles de génération vidéo. L’outil sert quand il faut segmenter vite, puis reprendre le contrôle sur le masque.
Avantages et inconvénients
Les plus
- Segmentation unifiée des images et des vidéos Le modèle segmente les objets dans une image comme dans une vidéo avec le même modèle. Tu gardes un seul flux de travail pour les deux formats, au lieu de jongler entre plusieurs outils.
- Sélection au clic, au cadre ou au masque L’entrée accepte un clic positif ou négatif, un cadre ou un masque, sur une photo comme sur une frame de vidéo. Cette souplesse facilite le départ rapide quand tu n’as pas encore un contour propre.
- Correction itérative sur n’importe quelle image Tu peux affiner les prédictions avec d’autres invites sur une image donnée. Le résultat se corrige sans repartir de zéro, ce qui aide quand un bord reste imparfait.
- Suivi temporel avec mémoire de session Le modèle conserve la cible d’une image à l’autre dans une mémoire de session. L’objet reste suivi même s’il disparaît temporairement, ce qui réduit les reprises manuelles sur les séquences mouvantes.
- Sorties utiles pour d’autres systèmes d’IA Les masques et masklets produits peuvent servir d’entrée à d’autres systèmes, notamment pour l’édition vidéo ou la génération vidéo. L’outil s’insère donc bien dans une chaîne de production plus large.
Les moins
- Pas de traitement autonome hors environnement technique Le code demande Python 3.10 ou plus, PyTorch 2.5.1 ou plus, et un noyau CUDA à compiler pour la carte graphique. Sans cet environnement, l’usage local devient vite moins pratique que la démonstration web.
- Une démo web bornée aux courtes vidéos et à l’usage privé Sur le web, SAM 2 se teste sur de courtes vidéos, et ses conditions excluent toute exploitation commerciale. Un usage professionnel passe par le code, à installer soi-même.
- Des détails fins manqués sur les objets rapides Meta le dit dans les limites du modèle : sur un objet complexe qui bouge vite, SAM 2 peut manquer des détails fins, et la prédiction peut varier d’une frame à l’autre. D’autres invites ne corrigent le problème qu’en partie.
- L’outil demande un minimum d’interaction humaine Le modèle fonctionne par invites successives et ne produit pas une segmentation entièrement automatique. Tu dois guider la cible, puis corriger quand la prédiction s’écarte.
Un outil entièrement gratuit
Aucun palier payant chez Meta Segment Anything Model 2 (SAM 2) (vérifié le 23 septembre 2026) : l’outil est entièrement gratuit, sans grille tarifaire. Ce modèle de recherche est publié gratuitement par Meta : le code et les poids sont sous licence Apache 2.0, la démo web est gratuite et réservée à un usage personnel et non commercial, et aucune page de Meta n’affiche de prix, de palier ni de devise.
| Palier | Inclus | Pour qui |
|---|---|---|
| Démo web (gratuit) | Segmentation et suivi interactifs de courtes vidéos au clic, au cadre ou au masque, effets vidéo appliqués aux prédictions | Adultes, pour un usage personnel et non commercial |
| Code et poids (gratuit) | Code sous licence Apache 2.0, points de contrôle SAM 2.1 en quatre tailles, jeu de données SA-V | Chercheurs et développeurs qui exécutent le modèle dans leur propre environnement |
relevés le 23/09/2026
Ce que permet la formule gratuite
Meta Segment Anything Model 2 (SAM 2) s’utilise sans frais par deux portes : la démo web de Meta, dans le navigateur, et le dépôt GitHub facebookresearch/sam2, qui fournit le code et les points de contrôle à télécharger.
La démo de Meta a ses conditions propres. Il faut avoir 18 ans, ne pas s’en servir depuis l’Illinois ou le Texas, et ne pas soumettre de vidéo où figurent d’autres personnes que toi sans leur accord.
L’exécution locale n’a pas ces bornes, mais elle suppose une installation Python et une carte graphique pour aller vite. Meta mesure ses vitesses sur une carte A100, un matériel de centre de calcul plutôt qu’un poste de bureau.
SAM 2 n’a pas d’essai gratuit. Meta ne vend aucune offre payante. En pratique, la démo suffit pour juger le suivi d’un objet sur une courte séquence ; l’intégration dans une chaîne de production passe par le code.
Ce que fait Meta Segment Anything Model 2 (SAM 2)
Meta Segment Anything Model 2 (SAM 2) traite les images et les vidéos avec le même moteur, donc le flux reste unifié jusqu’à la correction finale. La démo web sert surtout à cet aller-retour court. Au-delà, le code open source ouvre un usage plus large, avec intégration dans des chaînes d’annotation ou de montage.
En arrière-plan, SAM 2 garde le contexte de la cible dans un module de mémoire et ajuste le masque au fil de la séquence, même quand l’objet disparaît brièvement. SAM 2 lit la vidéo frame par frame. Côté accès, la démo montre l’interactif, et le dépôt donne l’autonomie technique avec une interface Python pour les images et les vidéos.
Comment utiliser Meta Segment Anything Model 2 (SAM 2)
Prise en main initiale
Sur la démo de SAM 2, tu charges une courte vidéo, puis tu cliques sur l’objet, tu traces une boîte ou tu poses un masque pour lancer la segmentation interactive. La démo te demande d’accepter ses conditions d’usage avant de traiter ta vidéo. Si tu pars du code, prépare un environnement Python compatible et une carte graphique.
Navigation dans l’interface
Dans la démo web, l’action démarre sur une scène visuelle unique, avec un objet à pointer plutôt qu’un projet à paramétrer longuement. Tu ajoutes ensuite des prompts positifs ou négatifs pour affiner le masque frame par frame. La correction reste immédiate, car le modèle traite la vidéo en flux. Ici, un seul clic peut relancer le suivi de l’objet.
Utilisation et gestion de projets
Tu peux reprendre une prédiction sur n’importe quelle frame, corriger le contour, puis récupérer un masque suivi dans le temps (masklet) exploitable dans un pipeline d’annotation, d’édition vidéo ou de génération. Pour les longues séquences, passe par le code installé chez toi. Le suivi mémoire conserve l’objet même quand il disparaît brièvement.
Fonctionnalités principales
SAM 2 réunit les fonctions décrites par Meta sur la page du projet et dans le billet de lancement ; toutes sont gratuites, dans la démo comme dans le code.
Segmentation unifiée pour images et vidéos
Le modèle segmente un objet dans une image comme dans une vidéo avec une même logique de promptable segmentation. Il sert les cas où le même pipeline doit traiter des images fixes et des séquences sans changer d’outil.
Accessible avec le modèle SAM 2 et ses variantes open source.
Saisie par clic, boîte ou masque
Tu peux lancer la segmentation d’un clic, avec une boîte ou un masque, sur une image fixe ou une image de vidéo. L’entrée reste interactive et s’ajuste au niveau de précision recherché.
Traitement vidéo interactif en temps réel
Le traitement vidéo passe en streaming inference, frame par frame. Le résultat permet de corriger et d’affiner les prédictions pendant la lecture.
La démo web limite cet usage à de courtes vidéos.
Généralisation zero-shot sur des objets non vus
SAM 2 généralise à des objets, images et vidéos absents de l’entraînement. Tu gardes le même flux de segmentation sans phase d’adaptation spécifique.
Mémoire par session pour le suivi d’objets
Un module de mémoire suit l’objet sur toutes les images de la séquence, même s’il disparaît temporairement. Cette mémoire aide à conserver la cohérence des masques d’une frame à l’autre.
Correction itérative des masques
Tu peux ajouter de nouveaux prompts positifs ou négatifs sur n’importe quelle frame pour corriger une prédiction. Une nouvelle interaction suffit à relancer la propagation du masque ajusté.
Poids du modèle et code open source
Le dépôt facebookresearch/sam2 publie le code d’inférence et d’entraînement avec les points de contrôle SAM 2.1 : Hiera tiny, small, base_plus et large.
Accessible sur le dépôt GitHub du projet.
Sorties réutilisables en entrée d’autres systèmes
Les masques produits peuvent ensuite alimenter des chaînes plus larges dédiées à l’édition vidéo ou à la génération vidéo. Brique de prétraitement pour d’autres systèmes d’IA.
Usages et métiers
Les usages cités par Meta couvrent la recherche en vision, les équipes de développement qui construisent des applications de segmentation, la création d’effets vidéo et les systèmes qui consomment des masques en aval.
Recherche en vision par ordinateur
Découper un objet dans une image ou une vidéo pour mesurer, comparer ou annoter un comportement visuel. Le travail remplace souvent une segmentation manuelle image par image, surtout quand il faut suivre le même objet sur toute une séquence.
Équipes de développement d’applications de segmentation
Construire des outils interactifs où l’utilisateur pointe l’objet puis retouche le masque proposé. Le modèle remplace un assemblage plus lourd de briques séparées pour l’image et la vidéo.
Création d’effets vidéo
Isoler un sujet dans une séquence pour produire des effets visuels précis ou accélérer une retouche. Cela remplace des détourages répétés à la main sur chaque image du montage.
Outils de montage vidéo
Suivre un objet au fil des images pour préparer des coupes propres, des masques cohérents et des retouches ciblées. Le recours à SAM 2 remplace un suivi manuel du sujet quand l’objet disparaît puis réapparaît.
Équipes produit
Tester une segmentation interactive directement dans un flux de travail produit, puis corriger le masque sur n’importe quelle image. La pratique remplace des aller-retour avec une annotation plus lente quand il faut ajuster un résultat en temps réel.
Équipes d’ingénierie IA et ML
Réutiliser des masques et des masklets comme entrée pour d’autres systèmes d’IA, notamment en aval. Le modèle remplace un prétraitement artisanal quand il faut fournir des données de segmentation exploitables.
Conseils d’utilisation
Conseils pour une utilisation efficace
Un masque initial bien posé réduit les corrections en cascade. Sur la vidéo, garde le même objet en tête et ajoute un nouveau prompt dès qu’une occlusion ou une sortie du cadre fait décrocher la segmentation. Tu gagnes aussi à travailler frame par frame quand la scène change vite, parce que la mémoire par session suit mieux un objet stable qu’un fond trop agité. Dès l’import, isole une séquence courte si tu veux tester un réglage, puis élargis seulement quand le masque tient. C’est plus fiable qu’un long passage d’emblée. La démo de SAM 2 reste bornée aux courtes vidéos.
Erreurs communes à éviter
Le masque dérive sur les contours fins : le prompt de départ était trop vague. Une boîte qui englobe plusieurs objets pousse le modèle à hésiter, puis la correction se répercute mal d’une frame à l’autre. Tu obtiens aussi un résultat instable quand tu changes d’objet sans réinitialiser la logique de suivi. La mémoire de session garde l’historique du précédent objet ; un nouveau clic sur une autre cible dans la même séquence peut brouiller la propagation. Sur le code local, le lancement échoue vite si l’environnement Python n’est pas préparé. Le modèle demande Python >= 3.10 et PyTorch >= 2.5.1, avec un GPU de préférence.
Modèles et droits sur les créations
Licence du code et des poids
Meta Segment Anything Model 2 (SAM 2) est publié sous licence Apache 2.0, une licence permissive : chacun peut s’en servir pour bâtir ses propres expériences, selon Meta.
Mise à jour SAM 2.1
SAM 2.1, publié à l’automne 2024, garde l’architecture de SAM 2 et apporte des points de contrôle plus performants sur les objets semblables et les occlusions.
Jeu de données SA-V
Le jeu de données SA-V, qui a servi à entraîner SAM 2, est publié sous licence CC BY 4.0 : environ 51 000 vidéos et plus de 600 000 masklets.
Droits sur les sorties de la démo
Dans la démo web, Meta accorde un droit d’usage personnel, sans exploitation commerciale ; les sorties ne se diffusent que sous ces conditions, et Meta peut réutiliser tes vidéos et leurs sorties pour entraîner ses technologies.
Conservation des vidéos
Les vidéos soumises à la démo et leurs sorties sont supprimées au plus tard trois ans après leur création ; une demande d’accès ou d’effacement passe par l’adresse de Meta indiquée dans les conditions, avec le numéro de session.
Accès
Accès web
Meta Segment Anything Model 2 (SAM 2) s’atteint depuis une démonstration web, avec un accès direct dans le navigateur pour lancer la segmentation interactive sans installation.
Appareils compatibles
En local, le code s’installe dans un environnement Python ; Meta recommande WSL avec Ubuntu aux utilisateurs de Windows. Aucune application de bureau ni mobile n’est publiée.
Langues
La page du projet, la démo et la documentation du dépôt sont en anglais ; Meta ne publie aucune version française de SAM 2.
Appareils, applications et systèmes compatibles
SAM 2 s’utilise aussi en local, par le paquet Python du dépôt GitHub ; les points de contrôle se chargent aussi depuis Hugging Face.
Disponible sur
Accès & intégrations
IntégrationsOui
Hugging Face
API publiqueOui
Interface Python du dépôt (prédicteurs d’image et de vidéo), sans API web hébergée par Meta.
Avis et notes par Aikiwi
Note Globale de Meta Segment Anything Model 2 (SAM 2) 4,4
Le modèle conserve un état par session pour suivre l’objet sur toutes les images d’une vidéo, y compris lorsqu’il disparaît temporairement, puis permet de corriger les prédictions au fil des prompts. Meta le présente aussi comme un modèle ouvert, avec des poids publiés et un jeu de données SA-V pour l’entraînement.
Le modèle sert aussi aux systèmes IA en aval, par exemple pour fournir des masques à des modèles de génération vidéo ou à des chaînes d’annotation. Son usage se lit donc mieux comme un composant de travail que comme une interface tout-en-un.
Accès gratuit, sans offre payante : la démo web pour un usage privé, le code à installer pour tout le reste. Pour un premier test, ce cadre suffit pour vérifier le comportement sur une image ou une courte séquence avant d’aller plus loin.
Avis détaillé sur Meta Segment Anything Model 2 (SAM 2)
Design et Ergonomie 4,0
SAM 2 ne publie pas d’éléments sur l’organisation de son interface web, ni sur une hiérarchie d’écran, ni sur des réglages d’affichage. La démonstration montre un usage centré sur la sélection d’objets par clic, boîte ou masque, mais rien n’est décrit sur la présentation des commandes ou la lisibilité de l’ensemble. Pour un utilisateur, le produit semble pensé autour d’un geste simple plutôt que d’un environnement riche en écrans. Ce format convient à un besoin de segmentation ciblé, surtout en démonstration ou en intégration technique. Il laisse toutefois sans réponse la question du confort d’usage sur une interface complète de production.
Facilité d’Utilisation 4,4
SAM 2 réduit l’entrée en matière à des prompts visuels simples, avec clic, boîte ou masque, puis correction itérative. Le modèle fonctionne aussi en zéro-shot et sur une image unique, avec un comportement proche de SAM, ce qui abaisse la barrière de démarrage pour un premier résultat. Pour un utilisateur, l’essai initial demande peu de paramétrage conceptuel et convient bien à un flux de travail guidé par l’objet à isoler. Le produit reste cependant orienté vers des usages de segmentation, de suivi et de raffinage de masques, donc plus naturel pour un profil technique ou créatif que pour un usage généraliste.
Fonctionnalités et Outils 4,8
SAM 2 couvre une segmentation unifiée des images et des vidéos, avec saisie par clic, boîte ou masque, traitement vidéo en temps réel, mémoire par session et correction itérative des prédictions. Le modèle est aussi fourni en code, poids ouverts et API, avec auto-hébergement possible et intégration Hugging Face, ce qui lui donne une profondeur rare pour un outil de vision. Pour un utilisateur, l’intérêt dépasse la simple annotation ponctuelle. Le produit sert à construire des applications interactives, à produire des masques réutilisables et à alimenter des systèmes en aval, y compris des chaînes de montage vidéo ou de génération vidéo. La palette d’usage reste spécialisée, mais elle est solide et cohérente de bout en bout.
Performance et Fiabilité 4,0
SAM 2 ne publie ni page de statut, ni historique d’incidents, ni engagement de disponibilité. Le site présente des résultats de segmentation et une démonstration interactive, mais rien ne permet de juger la régularité du service, la stabilité d’exécution ou la continuité de l’accès sur des données publiées. Pour un utilisateur, cela suffit pour tester la logique du modèle, pas pour évaluer la tenue opérationnelle d’un service de production. Le produit peut être intéressant en auto-hébergement ou dans un environnement contrôlé, mais le niveau de service n’est pas documenté publiquement de manière exploitable.
Innovation et Singularité 4,9
SAM 2 réunit dans un même modèle la segmentation d’images et de vidéos, avec mémoire par session, streaming inference et propagation des masques sur des frames successives. Le fait de récupérer un objet après disparition temporaire, puis de corriger le résultat par de nouveaux prompts, distingue nettement l’approche de la segmentation classique. Pour un utilisateur, la singularité tient surtout à la continuité temporelle du masque et au contrôle interactif sur des vidéos entières. Le produit n’est pas seulement un modèle de vision de plus ; il propose un cadre de travail que les systèmes d’édition, d’annotation ou de génération peuvent réutiliser directement.
Support et Ressources Disponibles 4,1
SAM 2 s’appuie sur une documentation GitHub, un dépôt de code, des poids ouverts et un canal GitHub Issues. L’écosystème de ressources est donc concret pour un produit de recherche diffusé en open source, avec un point d’entrée technique clair et des éléments directement exploitables par des développeurs. Pour un utilisateur technique, le support est surtout documentaire et communautaire. Le produit convient bien à une équipe capable de lire un dépôt, de tester un modèle et de suivre les échanges sur GitHub. En revanche, l’accompagnement ressemble davantage à celui d’un projet open source qu’à celui d’une suite commerciale avec support structuré.
Rapport Qualité-Prix 4,7
SAM 2 ne coûte rien : code et poids sous licence ouverte, démo web gratuite pour un usage privé. Le rapport qualité-prix est donc favorable pour qui cherche une base de segmentation avancée sans coût d’entrée, surtout dans un cadre technique ou de recherche. Pour un utilisateur, la valeur est forte tant que le besoin reste dans le périmètre de la démo ou de l’auto-hébergement. Le coût réel se déplace alors vers l’infrastructure, l’intégration et le temps d’ingénierie, ce qui convient mieux à une équipe qu’à un usage occasionnel sans compétence technique.
Questions fréquentes
Comment utiliser Meta Segment Anything Model 2 (SAM 2) gratuitement ?
Meta Segment Anything Model 2 (SAM 2) est gratuit de bout en bout : ouvre la démo de Meta pour un essai dans le navigateur, ou télécharge le code et les points de contrôle depuis le dépôt GitHub de Meta pour l’exécuter chez toi.
Sur quelles plateformes Meta Segment Anything Model 2 (SAM 2) est-il disponible ?
Meta Segment Anything Model 2 (SAM 2) fonctionne dans le navigateur, par la démo web de Meta, et en local sur ta machine par le code Python du dépôt GitHub. Meta ne publie aucune application de bureau ou mobile, ni extension.
Meta Segment Anything Model 2 (SAM 2) propose-t-il une API ?
Pas d’API web hébergée par Meta : Meta Segment Anything Model 2 (SAM 2) s’intègre par l’interface Python de son dépôt GitHub, avec des prédicteurs pour l’image et la vidéo, et ses poids se chargent aussi depuis Hugging Face. Le support passe par les tickets GitHub.