Revue publiée le Scores mis à jour le
Comparer

Qwen3 32B

Qwen publie Qwen3 32B, sorti le 29 avril 2025. Sur OpenRouter, le modèle lit du texte ; selon Qwen, il produit des réponses pour le dialogue, le raisonnement logique, les mathématiques et le code.

Qwen3 32B, Qwen3 14B ou Qwen3 30B A3B : lequel choisir ?

Qwen3 32B appartenait, à sa sortie, aux six modèles denses sous licence Apache 2.0 de la génération Qwen3, selon Qwen : Qwen3-32B, Qwen3-14B, Qwen3-8B, Qwen3-4B, Qwen3-1.7B et Qwen3-0.6B. Selon Qwen, cette génération comprenait aussi, à sa sortie, deux modèles MoE, une architecture à mélange d’experts : Qwen3-235B-A22B et Qwen3-30B-A3B.

À sa sortie, selon Qwen, Qwen3-30B-A3B comptait 30 milliards de paramètres au total, dont 3 milliards activés. Selon le tableau de Qwen publié à la sortie, Qwen3-32B avait 64 couches, contre 40 pour Qwen3-14B et 48 pour Qwen3-30B-A3B. Pour son architecture MoE, Qwen3-30B-A3B comptait à sa sortie 128 experts, dont 8 activés, selon Qwen. Selon Qwen, les trois versions partageaient à leur sortie une longueur de contexte de 128K.

À quoi sert Qwen3 32B

Chat et agents

Qwen3 32B peut passer d’un mode avec réflexion à un mode sans réflexion destiné au dialogue généraliste, selon Qwen. Pour les agents, les modèles Qwen3 excellent dans l’appel d’outils selon Qwen, qui recommande Qwen-Agent pour exploiter cette capacité. Selon Qwen, l’exemple d’agent proposé dans la carte du modèle utilise la configuration Qwen3-32B.

Mathématiques

Qwen3 32B utilise son mode de réflexion pour le raisonnement logique complexe, les mathématiques et le code, selon Qwen. En mathématiques, en génération de code et en raisonnement logique de sens commun, les modèles Qwen3 dépassent QwQ en mode réflexion et les modèles Qwen2.5 Instruct en mode sans réflexion, selon Qwen.

Suivi de consignes

Les modèles Qwen3 excellent en suivi de consignes, en écriture créative, en jeu de rôle et en dialogue à plusieurs tours, selon Qwen. Pour les échanges multilingues, les modèles Qwen3 prennent en charge le suivi de consignes dans plusieurs langues ainsi que la traduction, selon Qwen.

  • Chat1347
  • Suivi de consignes1331
  • Mathématiques1399
Comment lire ces scores

Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.

Bien utiliser Qwen3 32B : réflexion et paramètres

Qwen3 32B permet de désactiver la réflexion sur OpenRouter. Selon Qwen, enable_thinking=True l’active par défaut : le modèle écrit sa réflexion dans un bloc séparé, avant la réponse finale. Avec enable_thinking=False, la réflexion est strictement coupée, selon Qwen, comme sur les modèles Qwen2.5-Instruct. Quand elle est activée, les commandes /think et /no_think permettent, selon Qwen, de changer de mode tour par tour, en les ajoutant au message de l’utilisateur ou au message système.

En mode réflexion, Qwen conseille les paramètres d’échantillonnage Temperature=0.6, TopP=0.95, TopK=20 et MinP=0. Sans réflexion, Qwen suggère Temperature=0.7, TopP=0.8, TopK=20 et MinP=0. Pour le mode réflexion, Qwen proscrit le décodage glouton, qui consiste à choisir systématiquement le token le plus probable : selon Qwen, cette méthode peut dégrader les performances et provoquer des répétitions sans fin.

Pour la plupart des requêtes, Qwen recommande une longueur de sortie de 32 768 tokens. Lors des évaluations sur des problèmes très complexes, Qwen suggère une longueur de sortie de 38 912 tokens, notamment lorsqu’il s’agit de résoudre des problèmes issus de compétitions de mathématiques et de programmation.

Caractéristiques techniques de Qwen3 32B

Qwen3 32B est sorti le 29 avril 2025. Selon Qwen, ce modèle de langage causal compte 32,8 milliards de paramètres, dont 31,2 milliards hors embeddings, les représentations numériques des éléments du vocabulaire, et comporte 64 couches. Sur OpenRouter, il accepte le texte en entrée. Il est distribué sous licence Apache 2.0.

Selon Qwen, le contexte natif atteint 32 768 tokens, les unités de texte traitées par le modèle. Avec la méthode YaRN, cette capacité passe à 131 072 tokens selon Qwen. Sur OpenRouter, la fenêtre de contexte est de 131 072 tokens. Sur OpenRouter, chaque réponse peut atteindre au plus 16 384 tokens. La liste des caractéristiques rassemble les repères techniques du modèle.

Éditeur
Qwen
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
131 k tokens
Réponse maximale (selon OpenRouter)
16 k tokens
Réflexion (selon OpenRouter)
Facultative
Connaissances jusqu'à (selon OpenRouter)
mars 2025
Tâches
Aide au codeAffaires et financeJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesRédaction créativeSanté et bien-êtreSuivi de consignes
Entrées (selon OpenRouter)
Texte
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolsstructured_outputstemperaturetop_preasoningseedstoplogprobsresponse_formatmax_tokens
Hébergeurs via OpenRouter
DeepInfra, SiliconFlow, Tenstorrent

Où utiliser Qwen3 32B, et comment il se facture

Qwen3 32B dispose de poids à télécharger pour l’héberger soi-même, sous licence Apache 2.0, selon la carte de modèle publiée par Qwen sur Hugging Face.

  • Distribution des poids : à la sortie de Qwen3, selon Qwen, les modèles post-entraînés de la génération et leurs versions préentraînées étaient disponibles sur Hugging Face, ModelScope et Kaggle.
  • Déploiement sur son serveur : à la sortie de Qwen3, Qwen recommandait les frameworks SGLang et vLLM pour le déploiement.
  • Usage en local : à la sortie de Qwen3, Qwen recommandait vivement Ollama, LMStudio, MLX, llama.cpp et KTransformers pour l’exécution en local.

La carte d’accès donne les derniers prix relevés.

L'API chez des hébergeurs

Servi par d'autres hébergeurs que Qwen, selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,080 $ / M tokens en entrée, 0,28 $ / M tokens en sortie.

Tarification0,080 $ en entrée, 0,28 $ en sortie, par million de tokens
Hébergé via OpenRouter chezDeepInfra, SiliconFlow, Tenstorrent

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

Qwen3 32B parmi les versions de Qwen

Qwen3 32B appartient à la génération qui suit Qwen2.5, représentée notamment par Qwen2.5 7B Instruct, un modèle d’une autre taille. La frise des versions situe ces générations dans la famille Qwen avec leurs dates de sortie.

Selon Qwen, à sa sortie, la génération Qwen3 avait été préentraînée sur environ 36 billions de tokens, des unités de texte, contre 18 billions pour Qwen2.5. Son préentraînement couvrait un ensemble de langues et de dialectes. Plus tard dans la famille apparaissent Qwen3.5 397B A17B, puis Qwen3.8 2.4T A95B, deux modèles de tailles différentes de celle du modèle 32B.

  1. Qwen3 8B
  2. Qwen3 14B
  3. Qwen3.5-9B
  4. Qwen3.6 27B
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.

FAQ

Quand Qwen3 32B est-il sorti ?

Qwen3 32B est sorti le 29 avril 2025.

Quelle est la fenêtre de contexte de Qwen3 32B ?

Qwen3 32B accepte nativement 32 768 tokens de contexte, selon Qwen. Avec la méthode YaRN, cette fenêtre atteint 131 072 tokens, selon Qwen.

Qwen3 32B est-il open source ?

Qwen3 32B est distribué sous licence Apache 2.0 pour ses poids, selon Qwen.

Comment désactiver la réflexion de Qwen3 32B ?

Qwen3 32B permet de désactiver la réflexion, selon Qwen. Le réglage à employer est enable_thinking=False, selon Qwen.

Qwen3 32B fonctionne-t-il avec Ollama ?

Qwen3 32B pouvait être utilisé avec Ollama à sa sortie, selon Qwen, qui recommandait alors vivement cet outil pour l’usage en local. Ollama faisait partie des outils recommandés, sans être le seul.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.