Qwen2.5 VL 72B Instruct, publié par Qwen le 28 janvier 2025, accepte du texte et des images sur OpenRouter. Selon Qwen, il s’utilise comme modèle de chat avec la bibliothèque transformers ; l’exemple de sa carte lui envoie une image avec la consigne de la décrire.
Qwen2.5-VL-72B-Instruct s’utilise comme modèle de chat avec la bibliothèque transformers, selon la carte de modèle de Qwen. Dans l’exemple de code, il reçoit une image accompagnée d’une consigne lui demandant de la décrire. À sa sortie, la série Qwen2.5-VL joue aussi le rôle d’agent visuel qui raisonne et dirige des outils de façon dynamique, selon Qwen. Elle est « capable » d’utiliser un ordinateur et un téléphone, selon Qwen.
Vision et compréhension
Qwen2.5-VL, la série à laquelle appartient ce modèle, est présentée à sa sortie par Qwen comme « compétente » pour reconnaître des objets courants : fleurs, oiseaux, poissons et insectes. Selon Qwen, elle est également « hautement capable » d’analyser les textes, les graphiques, les icônes, les illustrations et les mises en page des images.
À sa sortie, la série Qwen2.5-VL localise les objets dans une image « avec précision », selon Qwen, en produisant des boîtes englobantes ou des points. Pour les coordonnées et les attributs, elle fournit des sorties JSON qualifiées de « stables » par Qwen. Selon Qwen, elle prend aussi en charge, à sa sortie, des sorties structurées issues de scans de factures, de formulaires et de tableaux, avec des usages en finance et dans le commerce.
À sa sortie, la série Qwen2.5-VL dispose de QwenVL HTML, son format d’analyse de documents qui extrait la mise en page à partir du HTML, selon Qwen. Parmi les documents concernés figurent les magazines, les articles de recherche, les pages web et les captures d’écran de mobile. Selon Qwen, à sa sortie, la série comprend aussi des vidéos de plus d’une heure et repère un événement en désignant les passages qui le contiennent.
Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.
Les performances de Qwen2.5 VL 72B Instruct
Qwen2.5-VL-72B-Instruct obtient, selon Qwen à sa sortie, des performances « compétitives » sur des tests couvrant les problèmes de niveau universitaire, les mathématiques, la compréhension de documents, les questions générales, la compréhension vidéo et les tâches d’agent visuel. Dans son billet d’annonce, Qwen attribue aussi à la famille Qwen2.5-VL des avantages « significatifs » pour comprendre les documents et les diagrammes, ainsi que la capacité à jouer le rôle d’agent visuel sans ajustement propre à la tâche.
Sur MMMU (val), Qwen2.5-VL-72B obtient 70,2 contre 64,5 pour Qwen2-VL-72B, selon Qwen. Pour MathVista (mini), le score atteint 74,8 contre 70,5 pour le modèle comparé, selon Qwen. En compréhension de documents, il obtient 96,4 sur DocVQA (val), contre 96,1 pour le même modèle, selon Qwen. Sur CC-OCR, il atteint 79,8 contre 68,7 pour ce modèle, selon Qwen.
En compréhension vidéo, Qwen2.5-VL-72B obtient 47,3 sur LVBench contre 41,3 pour Qwen2-VL-72B, selon Qwen. Sur VideoMME sans sous-titres, il atteint 73,3 contre 71,2 pour le modèle comparé, selon Qwen. Pour les tâches d’agent visuel, il obtient 43,6 sur ScreenSpot Pro contre 1,6 pour le même modèle, selon Qwen. Sur Android Control Low_EM, son score atteint 93,7 contre 59,2 pour ce modèle, selon Qwen.
Caractéristiques techniques de Qwen2.5 VL 72B Instruct
Qwen2.5 VL 72B Instruct est sorti le 28 janvier 2025. Le bloc des caractéristiques reprend les données techniques d’OpenRouter.
Sur OpenRouter, le modèle accepte du texte et des images en entrée, avec une fenêtre de contexte de 128 000 tokens. Selon la carte du modèle publiée par Qwen sur Hugging Face, le fichier config.json est réglé pour un contexte de 32 768 tokens au plus. Pour traiter les entrées plus longues, Qwen utilise YaRN, selon cette même carte du modèle.
Selon Qwen, à sa sortie, l’encodeur visuel ViT est entraîné depuis zéro : quatre couches utilisent l’attention complète, les autres l’attention par fenêtre, avec une fenêtre de 8 × 8 au plus. Toujours selon Qwen, à sa sortie, l’entraînement à fréquence d’images dynamique et l’encodage du temps absolu permettent au modèle d’apprendre le rythme du temps dans une vidéo.
Selon Qwen, les poids sont publiés sous Qwen License, dont les conditions figurent dans le fichier LICENSE sur Hugging Face. Pour un usage commercial dans un produit de plus de 100 millions d’utilisateurs actifs par mois, cette licence impose une demande de licence à Alibaba Cloud, selon le fichier LICENSE publié par Qwen.
Éditeur
Qwen
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
128 k tokens
Réponse maximale (selon OpenRouter)
115 k tokens
Réflexion (selon OpenRouter)
Non prise en charge
Connaissances jusqu'à (selon OpenRouter)
juin 2024
Tâches
Vision et compréhension
Entrées (selon OpenRouter)
Texte, Image
Licence
Qwen License
Paramètres pris en charge (noms techniques de l'API OpenRouter)
Qwen2.5 VL 72B Instruct pouvait être essayé sur Qwen Chat à sa sortie, selon Qwen. La carte d’accès indique les derniers prix relevés.
Selon Qwen, les modèles de base et Instruct de la série Qwen2.5-VL étaient ouverts sur Hugging Face et ModelScope à sa sortie, dans les tailles 3B, 7B et 72B. Une version quantifiée AWQ dans ces mêmes tailles a été publiée le 20 février 2025 avec le rapport technique de Qwen2.5-VL, selon Qwen.
L'API chez des hébergeurs
Servi par d'autres hébergeurs que Qwen, selon OpenRouter
Chez OpenRouter (relevé du 05/10/2026) : 0,80 $ / M tokens en entrée, 1 $ / M tokens en sortie.
Tarification0,80 $ en entrée, 1 $ en sortie, par million de tokens
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
Qwen2.5 VL 72B Instruct parmi les versions de Qwen VL
Qwen2.5 VL 72B Instruct est la version de 72 milliards de paramètres ajustée aux instructions de la série Qwen2.5-VL, publiée le 28 janvier 2025 selon Qwen. À sa sortie, Qwen présente cette série comme son nouveau modèle vision-langage phare et comme « un bond important » par rapport à la génération précédente, Qwen2-VL : cette appréciation est celle de l’éditeur.
À sa sortie, selon Qwen, la série Qwen2.5-VL était publiée en trois tailles, de 3, 7 et 72 milliards de paramètres. Qwen3 VL 235B A22B Instruct, sorti le 23 septembre 2025, appartient à la génération Qwen3 VL, sortie après elle. La frise des versions situe Qwen2.5 VL 72B Instruct parmi les versions de Qwen VL, avec leur mois de sortie.
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.
Comparaison rapide
Les versions sélectionnées
Repères
Qwen2.5 VL 72B InstructVous êtes ici
Qwen3 VL 235B A22B Thinking
Qwen3 VL 235B A22B Instruct
Qwen3 VL 30B A3B Thinking
Qwen3 VL 30B A3B Instruct
Qwen3 VL 8B Thinking
Qwen3 VL 8B Instruct
Qwen3 VL 32B Instruct
Score
1395
1413
Sortie
Contexte
128 k tokens
131 k tokens
262 k tokens
262 k tokens
262 k tokens
131 k tokens
262 k tokens
131 k tokens
Prix d'entrée
0,80 $ / M tokens
0,40 $ / M tokens
0,21 $ / M tokens
0,20 $ / M tokens
0,15 $ / M tokens
0,18 $ / M tokens
0,12 $ / M tokens
0,10 $ / M tokens
Prix de sortie
1 $ / M tokens
4 $ / M tokens
1,90 $ / M tokens
2,40 $ / M tokens
0,60 $ / M tokens
2,10 $ / M tokens
0,46 $ / M tokens
0,42 $ / M tokens
Entrées
Texte, Image
Texte, Image
Texte, Image
Texte, Image
Texte, Image
Texte, Image
Texte, Image
Texte, Image
Réflexion
Non prise en charge
Toujours active
Non prise en charge
Toujours active
Non prise en charge
Toujours active
Non prise en charge
Non prise en charge
Tâches
Vision et compréhension
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes, Vision et compréhension
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes, Vision et compréhension
Ce qui le distingue
Qwen2.5 VL 72B Instruct, publié par Qwen le 28 janvier 2025, accepte du texte et des images sur OpenRouter. Selon Qwen, il s’utilise comme modèle de chat avec la bibliothèque transformers ; l’exemple de sa carte lui envoie une image avec la consigne de la décrire.
Qwen3 VL 235B A22B Thinking, publié par Qwen le 23 septembre 2025, est spécialement optimisé à sa sortie pour le raisonnement scientifique et mathématique selon Qwen. Au relevé du 8 octobre 2026, sur OpenRouter, il accepte le texte et les images en entrée et peut produire des sorties structurées.
Qwen3 VL 235B A22B Instruct, publié par Qwen et sorti le 23 septembre 2025, accepte du texte et des images sur OpenRouter. Selon Qwen, il s’utilise comme modèle de chat avec la bibliothèque transformers ; sur OpenRouter, il peut appeler des outils et produire des sorties structurées.
Qwen a publié Qwen3 VL 30B A3B Thinking le 4 octobre 2025, en même temps que l’édition Instruct de la même taille. Selon la carte du modèle de Qwen, il s’utilise comme modèle de chat avec transformers et appartient à la génération Qwen3-VL, qui lit le texte dans les images.
Qwen3 VL 30B A3B Instruct, publié par Qwen, est sorti le 4 octobre 2025. Sur OpenRouter, il accepte du texte et des images et produit des sorties structurées ; selon Qwen, il s’utilise comme modèle de chat avec la bibliothèque transformers.
Qwen publie Qwen3 VL 8B Thinking, sorti le 15 octobre 2025 et utilisable comme modèle de chat avec la bibliothèque transformers selon Qwen. Au relevé du 08/10/2026, sur OpenRouter, il accepte des images et du texte en entrée et produit des sorties structurées.
Qwen3 VL 8B Instruct, de Qwen, est sorti le 15 octobre 2025 et lit l’image et le texte en entrée. Selon Qwen, c’est un modèle de chat, utilisable avec la bibliothèque transformers, dont les poids sont publiés sur Hugging Face sous licence Apache 2.0.
Qwen3 VL 32B Instruct est un modèle publié par Qwen le 21 octobre 2025. Selon Qwen, il s’utilise comme modèle de chat avec la bibliothèque transformers ; l’exemple de sa carte lui envoie une image avec la consigne de la décrire.
Les repères sont ceux renseignés dans l'annuaire ; un repère absent de toutes les versions sélectionnées n'est pas affiché. Comparaison complète dans le comparateur
FAQ
Quand Qwen2.5 VL 72B Instruct est-il sorti ?
Qwen2.5 VL 72B Instruct est sorti le 28 janvier 2025. Selon Qwen, cette publication concerne la série Qwen2.5-VL.
Que peut lire Qwen2.5 VL 72B Instruct ?
Qwen2.5 VL 72B Instruct accepte du texte et des images en entrée sur OpenRouter. Selon Qwen, à sa sortie, la série Qwen2.5-VL est compétente pour reconnaître des objets courants comme les fleurs, les oiseaux, les poissons et les insectes. Toujours selon Qwen, à sa sortie, la série est hautement capable d’analyser les textes, les graphiques, les icônes, les illustrations et les mises en page dans les images.
Quelle est la fenêtre de contexte de Qwen2.5 VL 72B Instruct ?
Qwen2.5 VL 72B Instruct dispose d’une fenêtre de contexte de 128 000 tokens sur OpenRouter. Selon Qwen, le fichier config.json de Qwen2.5-VL-72B-Instruct est réglé pour un contexte maximal de 32 768 tokens. Pour traiter les entrées plus longues, Qwen utilise YaRN, selon sa documentation.
Quelle génération précède Qwen2.5 VL 72B Instruct ?
Qwen2.5 VL 72B Instruct appartient à la série Qwen2.5-VL, présentée à sa sortie par Qwen comme succédant à la génération Qwen2-VL. Selon Qwen, Qwen2.5-VL-72B obtient 70,2 au test MMMU (val), contre 64,5 pour Qwen2-VL-72B. Au test MathVista (mini), Qwen2.5-VL-72B obtient 74,8, contre 70,5 pour Qwen2-VL-72B, selon Qwen.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.