Revue publiée le Scores mis à jour le
Comparer

Qwen3 8B

Qwen3 8B, publié par Qwen le 29 avril 2025, reçoit du texte en entrée sur OpenRouter et génère des réponses textuelles, au relevé du 8 octobre 2026. Selon Qwen, son mode de réflexion sert au raisonnement logique, aux mathématiques et au code, tandis que le mode sans réflexion sert au dialogue généraliste.

Qwen3 8B, Qwen3 14B ou Qwen3 32B : lequel choisir ?

Qwen3 8B figurait à sa sortie parmi les six modèles denses de la génération Qwen3 sous licence Apache 2.0, selon Qwen : Qwen3-32B, Qwen3-14B, Qwen3-8B, Qwen3-4B, Qwen3-1.7B et Qwen3-0.6B. Selon Qwen, cette génération comprenait également deux modèles MoE, à mélange d’experts : Qwen3-235B-A22B et Qwen3-30B-A3B.

À la sortie du modèle, le tableau de Qwen attribuait 36 couches à Qwen3-8B, 40 à Qwen3-14B et 64 à Qwen3-32B, selon Qwen. Pour ces trois tailles, la longueur de contexte était de 128K tokens, contre une longueur de contexte de 32K tokens pour Qwen3-4B, Qwen3-1.7B et Qwen3-0.6B, selon Qwen.

À quoi sert Qwen3 8B

Chat et agents

Qwen3 8B permet le dialogue généraliste en mode sans réflexion et peut passer au mode réflexion dans le même modèle, selon Qwen. Pour les agents, les modèles Qwen3 excellent dans l’appel d’outils, selon Qwen, qui recommande Qwen-Agent pour exploiter cette capacité. Selon Qwen, l’exemple d’agent proposé utilise Qwen3-8B comme modèle.

Mathématiques

Qwen3 8B utilise le mode réflexion pour le raisonnement logique complexe, les mathématiques et le code, selon Qwen. En mathématiques, en génération de code et en raisonnement logique de sens commun, les modèles Qwen3 dépassent QwQ en mode réflexion et les modèles Qwen2.5 Instruct en mode sans réflexion, selon Qwen.

Suivi de consignes

Les modèles Qwen3 excellent en suivi de consignes, en écriture créative, en jeu de rôle et en dialogue à plusieurs tours, selon Qwen. Pour les échanges multilingues, les modèles Qwen3 prennent en charge plusieurs langues et dialectes, avec des capacités de suivi de consignes dans plusieurs langues et de traduction, selon Qwen.

  • Chat
  • Suivi de consignes
  • Mathématiques

Bien utiliser Qwen3 8B : réflexion et paramètres

Au relevé du 8 octobre 2026, sur OpenRouter, Qwen3 8B active la réflexion par défaut, mais elle peut être désactivée. Selon Qwen, le réglage par défaut enable_thinking=True active également la réflexion : le modèle l’écrit dans un bloc séparé, avant sa réponse finale.

Avec enable_thinking=False, la réflexion est strictement coupée, comme sur les modèles Qwen2.5-Instruct, selon Qwen. Lorsque la réflexion est activée, les commandes /think et /no_think permettent de passer d’un mode à l’autre, tour par tour, selon Qwen : elles s’ajoutent au message de l’utilisateur ou au message système.

En mode réflexion, les paramètres recommandés sont Temperature=0.6, TopP=0.95, TopK=20 et MinP=0, selon Qwen. Sans réflexion, les réglages conseillés deviennent Temperature=0.7, TopP=0.8, TopK=20 et MinP=0, selon Qwen. Selon Qwen, le décodage glouton est à éviter en mode réflexion, car il peut dégrader les performances et provoquer des répétitions sans fin.

Selon Qwen, une longueur de sortie de 32 768 tokens convient à la plupart des requêtes adressées au modèle. Pour les évaluations portant sur des problèmes très complexes, notamment ceux des compétitions de mathématiques et de programmation, une longueur de sortie de 38 912 tokens est conseillée selon Qwen.

Caractéristiques techniques de Qwen3 8B

Qwen3 8B est sorti le 29 avril 2025. Il est distribué sous licence Apache 2.0.

Selon Qwen, le modèle de langage causal compte 8,2 milliards de paramètres, dont 6,95 milliards hors embeddings, les représentations numériques des tokens, répartis sur 36 couches. Pour la fenêtre de contexte, selon Qwen, sa capacité native atteint 32 768 tokens et passe à 131 072 tokens avec la méthode d’extension du contexte YaRN.

Au relevé du 8 octobre 2026, sur OpenRouter, le modèle lit du texte en entrée. Au relevé du 8 octobre 2026, sur OpenRouter, sa fenêtre de contexte atteint 131 072 tokens. Au relevé du 8 octobre 2026, sur OpenRouter, il produit au plus 8 192 tokens pour chaque réponse. Selon OpenRouter, la fin de vie de Qwen3 8B sur OpenRouter est fixée au 9 octobre 2026. La liste des caractéristiques rassemble les repères techniques du modèle.

Éditeur
Qwen
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
131 k tokens
Réponse maximale (selon OpenRouter)
8 k tokens
Réflexion (selon OpenRouter)
Activée par défaut
Connaissances jusqu'à (selon OpenRouter)
mars 2025
Retrait annoncé (selon OpenRouter)
Entrées (selon OpenRouter)
Texte
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolstemperaturetop_preasoningseedstopresponse_formatmax_tokens
Hébergeurs via OpenRouter
Alibaba

Où utiliser Qwen3 8B, et comment il se facture

  • Poids à télécharger : Qwen3 8B était proposé à sa sortie sur Hugging Face sous licence Apache 2.0, selon Qwen, avec des poids à télécharger pour l’héberger soi-même.
  • Déploiement sur serveur : selon Qwen, à sa sortie, le modèle pouvait être déployé avec SGLang ou vLLM. Ces logiciels créent un point d’accès compatible avec l’API d’OpenAI, une interface permettant aux applications de communiquer avec le modèle.
  • Usage en local : selon Qwen, à sa sortie, Qwen3 était pris en charge par Ollama, LMStudio, MLX-LM, llama.cpp et KTransformers.

La carte d’accès donne les derniers prix relevés.

L'API Qwen

Retrait annoncé le 09/10/2026 selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,12 $ / M tokens en entrée, 0,46 $ / M tokens en sortie. Son retrait est annoncé le 09/10/2026 selon OpenRouter.

Tarification0,12 $ en entrée, 0,46 $ en sortie, par million de tokens
Hébergé via OpenRouter chezAlibaba

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

Qwen3 8B parmi les versions de Qwen

Qwen3 8B s’inscrit dans la génération qui suit Qwen2.5, dont fait partie Qwen2.5 7B Instruct, un modèle d’une autre taille. La frise des versions situe les modèles de la famille avec leurs dates de sortie.

Selon Qwen, la génération Qwen3 a été préentraînée sur environ 36 billions de tokens, près de deux fois les 18 billions de Qwen2.5. Ce préentraînement couvre des langues et des dialectes variés, selon Qwen. Plus tard dans la famille apparaissent Qwen3.5 397B A17B, puis Qwen3.8 2.4T A95B, qui appartiennent à des générations suivantes et présentent chacun une autre taille.

  1. Qwen3 14B
  2. Qwen3.5-9B
  3. Qwen3.6 27B
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.

FAQ

Quand Qwen3 8B est-il sorti ?

Qwen3 8B est sorti le 29 avril 2025. Cette date concerne la version 8B.

Quelle est la fenêtre de contexte de Qwen3 8B ?

Qwen3 8B lit nativement 32 768 tokens de contexte, selon Qwen. Avec la méthode YaRN, cette fenêtre atteint 131 072 tokens, selon Qwen.

Qwen3 8B est-il open source ?

Qwen3 8B dispose de poids publiés par Qwen sur Hugging Face sous licence Apache 2.0.

Comment désactiver la réflexion de Qwen3 8B ?

Qwen3 8B permet de désactiver la réflexion, selon Qwen. Le paramètre correspondant est enable_thinking=False, selon Qwen.

Qwen3 8B fonctionne-t-il avec Ollama ?

Qwen3 8B appartient à la gamme Qwen3 prise en charge par Ollama, selon Qwen. Cette prise en charge permet une exécution locale, selon Qwen.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.