Revue publiée le Scores mis à jour le
Comparer

Qwen3.5-9B

Qwen3.5-9B est publié par Qwen le 2 mars 2026 sous licence Apache 2.0. Au relevé du 8 octobre 2026, sur OpenRouter, le modèle accepte du texte, des images et des vidéos, produit des sorties structurées et sait appeler des outils.

Qwen3.5-9B, Qwen3.5-27B ou Qwen3.5-35B-A3B : lequel choisir ?

Qwen3.5-9B est sorti après Qwen3.5-122B-A10B, Qwen3.5-35B-A3B et Qwen3.5-27B, selon Qwen. À sa sortie, il arrive avec Qwen3.5-4B, Qwen3.5-2B et Qwen3.5-0.8B, selon Qwen.

Selon Qwen, Qwen3.5-9B compte 9 milliards de paramètres répartis sur 32 couches. Avec 27 milliards de paramètres répartis sur 64 couches, Qwen3.5-27B correspond à une autre taille de la génération, selon Qwen. Quant à Qwen3.5-35B-A3B, il repose sur un mélange d’experts comprenant 256 experts et 35 milliards de paramètres au total, dont 3 milliards activés, répartis sur 40 couches, selon Qwen.

À quoi sert Qwen3.5-9B

Chat et agents

Au relevé du 8 octobre 2026, sur OpenRouter, Qwen3.5-9B sait appeler des outils et produire des sorties structurées. Selon Qwen, les modèles Qwen3.5 excellent dans l’appel d’outils ; pour construire rapidement des agents avec ces modèles, Qwen conseille Qwen-Agent. Toujours selon Qwen, la génération Qwen3.5 prend en charge plusieurs langues et dialectes.

Vision et compréhension

Qwen3.5-9B est, selon Qwen, un modèle de langage causal doté d’un encodeur de vision. Pour les échanges associant texte et contenu visuel, Qwen documente l’envoi d’une image ou d’une vidéo avec le texte.

Code

Qwen3.5-9B peut servir à des tâches de code précises, comme le développement web, selon Qwen. Pour cet usage en mode réflexion, Qwen prévoit des réglages d’échantillonnage spécifiques.

  • Chat
  • Vision et compréhension
  • Code

Les performances de Qwen3.5-9B

Qwen3.5-9B obtient, à sa sortie selon Qwen, 81,7 sur GPQA Diamond, contre 80,1 pour GPT-OSS-120B et 71,5 pour GPT-OSS-20B. Pour l’appel de fonctions et les agents, Qwen annonce à sa sortie 66,1 sur BFCL-V4 et 79,1 sur TAU2-Bench, contre respectivement 42,4 et 41,9 pour Qwen3-30B-A3B-Thinking-2507. En vision, selon Qwen à sa sortie, il atteint 78,4 sur MMMU et 78,9 sur MathVision, contre respectivement 75,8 et 62,2 pour GPT-5-Nano.

Bien utiliser Qwen3.5-9B : réflexion et paramètres

Au relevé du 8 octobre 2026, sur OpenRouter, Qwen3.5-9B permet de désactiver la réflexion. Selon Qwen, les modèles Qwen3.5 réfléchissent par défaut et écrivent leur réflexion avant la réponse finale.

Pour obtenir une réponse directe sans réflexion, Qwen indique de régler enable_thinking sur False dans les paramètres de l’API. En mode réflexion, pour les tâches générales, Qwen conseille temperature=1.0, top_p=0.95, top_k=20, min_p=0.0 et presence_penalty=1.5. Sans réflexion, les réglages conseillés par Qwen sont temperature=0.7, top_p=0.8, top_k=20, min_p=0.0 et presence_penalty=1.5.

Pour préserver les capacités de réflexion des modèles Qwen3.5, Qwen recommande de garder une fenêtre de contexte d’au moins 128K tokens. Selon Qwen, une longueur de réponse de 32 768 tokens convient à la plupart des requêtes, tandis que 81 920 tokens conviennent aux problèmes de compétition en mathématiques ou en programmation.

Caractéristiques techniques de Qwen3.5-9B

Qwen3.5-9B est sorti le 2 mars 2026. Selon Qwen, il compte 9 milliards de paramètres répartis sur 32 couches.

Selon Qwen, la fenêtre de contexte native du modèle atteint 262 144 tokens, les unités utilisées pour mesurer la longueur du contexte. Selon Qwen, cette capacité peut être étendue jusqu’à 1 010 000 tokens. Au relevé du 8 octobre 2026, sur OpenRouter, la fenêtre de contexte du modèle est de 262 144 tokens.

Au relevé du 8 octobre 2026, sur OpenRouter, le modèle accepte en entrée le texte, l’image et la vidéo. Il est distribué sous licence Apache 2.0. Au relevé du 8 octobre 2026, sur OpenRouter, une réponse peut contenir au maximum 32 768 tokens. La liste des caractéristiques rassemble les repères techniques du modèle, notamment ses formats d’entrée et ses limites de contexte et de sortie.

Éditeur
Qwen
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
262 k tokens
Réponse maximale (selon OpenRouter)
33 k tokens
Réflexion (selon OpenRouter)
Facultative
Entrées (selon OpenRouter)
Texte, Image, Vidéo
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolsstructured_outputstemperaturetop_preasoningseedstoplogprobsresponse_formatmax_tokens
Hébergeurs via OpenRouter
Darkbloom, DeepInfra, Parasail, SiliconFlow, Together, Venice

Où utiliser Qwen3.5-9B, et comment il se facture

  • Poids à télécharger : Qwen3.5-9B est publié par Qwen sur Hugging Face sous licence Apache 2.0.
  • Cadres de déploiement : selon Qwen, les poids sont compatibles avec Transformers, vLLM, SGLang et KTransformers.
  • Exécution locale avec llama.cpp : selon le dépôt GitHub de Qwen, llama.cpp prend en charge la série ouverte Qwen3.5 pour le texte et la vision, avec les fichiers GGUF disponibles sur Hugging Face.
  • Exécution sur Apple Silicon : selon le dépôt GitHub de Qwen, mlx-lm prend en charge la série pour le texte seul, tandis que mlx-vlm prend en charge la vision et le texte.

La carte d’accès donne les derniers prix relevés.

L'API chez des hébergeurs

Servi par d'autres hébergeurs que Qwen, selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,10 $ / M tokens en entrée, 0,15 $ / M tokens en sortie.

Tarification0,10 $ en entrée, 0,15 $ en sortie, par million de tokens
Hébergé via OpenRouter chezDarkbloom, DeepInfra, Parasail, SiliconFlow, Together, Venice

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

Qwen3.5-9B parmi les versions de Qwen

Qwen3.5-9B appartient à une génération postérieure à celle de Qwen3 8B, un modèle d’une autre taille. Selon Qwen, la génération Qwen3.5 débute avec Qwen3.5-397B-A17B, un modèle MoE, une architecture à mélange d’experts. Selon Qwen, Qwen3.5-9B a été mis à disposition le 2 mars 2026 sur Hugging Face et ModelScope, avec Qwen3.5-4B, Qwen3.5-2B et Qwen3.5-0.8B.

Qwen3.6 27B puis Qwen3.8 27B appartiennent aux générations suivantes de la famille, avec une taille différente de celle du modèle à neuf milliards de paramètres. La frise des versions situe chaque modèle dans cette chronologie et donne les dates de sortie.

  1. Qwen3 8B
  2. Qwen3 14B
  3. Qwen3.6 27B
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.

FAQ

Quand Qwen3.5-9B est-il sorti ?

Qwen3.5-9B est sorti en mars 2026. Son lancement a eu lieu le 2 mars.

Quelle est la fenêtre de contexte de Qwen3.5-9B ?

Qwen3.5-9B lit nativement 262 144 tokens de contexte, selon Qwen. Selon Qwen, cette fenêtre peut être étendue jusqu’à 1 010 000 tokens.

Qwen3.5-9B est-il open source ?

Qwen3.5-9B est un modèle à poids ouverts : Qwen publie ses poids sur Hugging Face. Ces poids sont distribués sous licence Apache 2.0.

Comment désactiver la réflexion de Qwen3.5-9B ?

Qwen3.5-9B permet de désactiver la réflexion en réglant enable_thinking sur False dans les paramètres de l’API, selon Qwen. Selon Qwen, ce réglage produit une réponse directe, sans réflexion.

Peut-on faire tourner Qwen3.5-9B en local ?

Qwen3.5-9B peut être exécuté en local avec llama.cpp : selon le dépôt GitHub de Qwen, cet outil prend en charge la série ouverte Qwen3.5 en texte et en vision. Cette prise en charge utilise les fichiers GGUF disponibles sur Hugging Face, selon le dépôt GitHub de Qwen.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.