Qwen3.8 Flash est un modèle de Qwen sorti le 26 août 2026 selon OpenRouter : selon Qwen, c’est la version de production de Qwen3.8-Flash-Next, un modèle que Qwen juge à sa sortie bien adapté aux applications à fort volume et aux flux de travail pilotés par des outils. Selon la page de QwenCloud, il lit du texte, des images et de la vidéo, et produit du texte.
Ce que Qwen3.8 Flash change par rapport à Qwen3.7 Flash
Qwen3.8 Flash porte la sortie maximale sur OpenRouter de 65 536 tokens pour Qwen3.7 Flash à 131 072 tokens. Sur OpenRouter, la fenêtre de contexte de 1 000 000 tokens était déjà celle du modèle précédent. Le tableau d’écart compare la fenêtre de contexte, les formats d’entrée et la réflexion relevés sur OpenRouter.
Selon Qwen, à sa sortie, la version de production de Qwen3.8-Flash-Next est servie sur QwenCloud sous le nom Qwen3.8-Flash, avec par défaut un contexte d’un million de tokens et les outils intégrés officiels. Dans son annonce de sortie, Qwen présente aussi Qwen3.8-Flash-Next comme un modèle multimodal à mélange d’experts, ou MoE, et un aperçu précoce de l’architecture de Qwen4.
Selon Qwen, à sa sortie, Qwen3.8-Flash-Next remplace la conception hybride Gated DeltaNet et Gated Attention par une combinaison de Gated DeltaNet et Qwen Sparse Attention, abrégée QSA. Dans cette annonce, Qwen décrit la première conception comme reprise dans les séries Qwen3.5, Qwen3.6, Qwen3.7 et Qwen3.8. Selon Qwen, la nouvelle architecture réduit nettement le coût de l’attention sur les longues séquences.
Réflexion (selon OpenRouter)Activée par défaut→Activée par défaut
Prix d'entrée (OpenRouter, relevé du 05/10/2026)0,030 $ / M tokens→0,15 $ / M tokens
Prix de sortie (OpenRouter, relevé du 05/10/2026)0,13 $ / M tokens→0,47 $ / M tokens
Qwen3.8 Flash, Qwen3.8 27B ou Qwen3.7 Plus : lequel choisir ?
Qwen3.8 Flash était, à sa sortie, facturé en dessous de Qwen3.8 27B et de Qwen3.7 Plus sur OpenRouter. Selon Qwen, à sa sortie, Qwen3.8-Flash-Next active 6 milliards de paramètres, contre 27 milliards pour Qwen3.8-27B et 17 milliards, sur 397 milliards au total, pour Qwen3.7-Plus.
À quoi sert Qwen3.8 Flash
Chat
Qwen3.8 Flash peut appeler des outils et produire des sorties structurées sur OpenRouter. Selon Qwen, à sa sortie, Qwen3.8-Flash-Next est conçu pour équilibrer capacités, latence et coût, avec une appréciation favorable pour les applications à fort volume et les flux de travail pilotés par des outils. QwenWork, la plateforme de productivité d’Alibaba, l’a intégré à son mode Standard à sa sortie, selon Qwen.
Vision et compréhension
Selon la page de QwenCloud, le modèle brille en compréhension visuelle, un jugement que la plateforme associe à l’analyse de graphiques et de longues vidéos. Selon la page de QwenCloud, il brille aussi dans les flux de travail d’agent, comme le pilotage d’applications de bureau.
Code
Selon Qwen, à sa sortie, qwen3.8-flash peut s’utiliser directement dans Claude Code grâce à la prise en charge du protocole d’Anthropic par l’API de Qwen. Avec Codex, cette compatibilité passe par le protocole Responses d’OpenAI, selon Qwen à sa sortie. QwenCloud juge également le modèle performant en aide au code et cite la correction autonome de code parmi ses usages.
Les performances de Qwen3.8 Flash
Qwen3.8 Flash est, selon Qwen, la version de production de Qwen3.8-Flash-Next, auquel se rapportent les scores annoncés. Selon Qwen, à sa sortie, Qwen3.8-Flash-Next obtient 62,5 sur SWE-bench Pro, un test de code en agent, contre 61,7 pour Qwen3.8-27B et 55,8 pour Qwen3.7-Plus.
Sur LVBench, un test de compréhension de longues vidéos, Qwen3.8-Flash-Next obtient à sa sortie 76,6 selon Qwen, contre 72,4 pour Qwen3.8-27B et 76,2 pour Qwen3.7-Plus. Selon Qwen, à sa sortie, l’entraînement de Qwen3.8-Flash-Next coûte environ un neuvième de celui de Qwen3.7-Plus, avec de meilleures capacités en code et en tâches de bureau.
Bien utiliser Qwen3.8 Flash : réflexion et effort
Qwen3.8 Flash utilise une réflexion activée par défaut sur OpenRouter. Sur OpenRouter, la réflexion reste optionnelle et peut être désactivée. Selon Qwen, à sa sortie, l’API de QwenCloud propose pour qwen3.8-flash le paramètre enable_thinking pour activer la réflexion, ainsi que trois niveaux d’effort de réflexion : xhigh, medium et low.
Caractéristiques techniques de Qwen3.8 Flash
Qwen3.8 Flash, sorti le 26 août 2026, dispose sur OpenRouter d’une fenêtre de contexte de 1 000 000 tokens. Sur OpenRouter, sa sortie maximale atteint 131 072 tokens par réponse. Selon la page de QwenCloud, le modèle accepte du texte, des images et de la vidéo en entrée, et produit du texte. Le tableau des caractéristiques reprend les données d’OpenRouter.
Qwen3.8-Flash-Next compte, selon Qwen à sa sortie, un modèle principal de 125 milliards de paramètres, auquel s’ajoutent 51 milliards de paramètres d’embedding N-gram. Selon Qwen, à sa sortie, il active 6 milliards de paramètres par token, plutôt que l’ensemble des paramètres du modèle. Ses poids sont publiés sous licence qwen-community-1.0, selon la carte de Qwen3.8-Flash-Next sur Hugging Face.
Éditeur
Qwen
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
1 M tokens
Réponse maximale (selon OpenRouter)
131 k tokens
Réflexion (selon OpenRouter)
Activée par défaut
Entrées (selon OpenRouter)
Texte, Image, Vidéo
Paramètres pris en charge (noms techniques de l'API OpenRouter)
Qwen3.8 Flash était servi à sa sortie sur QwenCloud sous le nom qwen3.8-flash, selon Qwen, avec des API, interfaces de programmation, compatibles avec Chat Completions et Responses d’OpenAI et une interface compatible avec Anthropic. Selon Qwen, les poids de Qwen3.8-Flash-Next étaient également disponibles à sa sortie sur Hugging Face et ModelScope. Son identifiant sur OpenRouter est qwen/qwen3.8-flash. La carte d’accès donne les derniers prix relevés.
L'API Qwen
Pour relier le modèle à votre application
Chez OpenRouter (relevé du 05/10/2026) : 0,15 $ / M tokens en entrée, 0,47 $ / M tokens en sortie.
Tarification0,15 $ en entrée, 0,47 $ en sortie, par million de tokens
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
Qwen3.8 Flash parmi les versions de Qwen Flash
Qwen3.8 Flash vient après plusieurs versions de la famille Qwen Flash. Qwen3.5-Flash est sorti le 25 février 2026, puis Qwen3.6 Flash le 27 avril 2026. Qwen3.7 Flash, la version qui le précède, est sorti le 27 juillet 2026. La frise des versions situe Qwen3.8 Flash après Qwen3.7 Flash.
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.
Comparaison rapide
Les versions sélectionnées
Repères
Qwen3.8 FlashVous êtes ici
Qwen3.7 Flash
Score
Sortie
Contexte
1 M tokens
1 M tokens
Prix d'entrée
0,15 $ / M tokens
0,030 $ / M tokens
Prix de sortie
0,47 $ / M tokens
0,13 $ / M tokens
Entrées
Texte, Image, Vidéo
Texte, Image, Vidéo
Réflexion
Activée par défaut
Activée par défaut
Tâches
Ce qui le distingue
Qwen3.8 Flash est un modèle de Qwen sorti le 26 août 2026 selon OpenRouter : selon Qwen, c’est la version de production de Qwen3.8-Flash-Next, un modèle que Qwen juge à sa sortie bien adapté aux applications à fort volume et aux flux de travail pilotés par des outils. Selon la page de QwenCloud, il lit du texte, des images et de la vidéo, et produit du texte.
Qwen3.7 Flash, publié par Alibaba Cloud, est sorti le 21 juillet 2026. Selon QwenCloud, il lit du texte, des images et de la vidéo, produit du texte et prend en charge l’appel de fonctions pour relier le modèle à des outils et systèmes externes.
Les repères sont ceux renseignés dans l'annuaire ; un repère absent de toutes les versions sélectionnées n'est pas affiché. Comparaison complète dans le comparateur
FAQ
Quand Qwen3.8 Flash est-il sorti ?
Qwen3.8 Flash est sorti le 26 août 2026. Il fait suite à Qwen3.7 Flash dans la gamme.
Que peut lire Qwen3.8 Flash ?
Qwen3.8 Flash accepte du texte et des images en entrée sur OpenRouter. Il peut également lire des vidéos sur OpenRouter.
Quelle est la fenêtre de contexte de Qwen3.8 Flash ?
Qwen3.8 Flash dispose d’une fenêtre de contexte de 1 000 000 tokens sur OpenRouter. Ses entrées sur OpenRouter comprennent le texte, les images et les vidéos.
Quelle version précède Qwen3.8 Flash ?
Qwen3.7 Flash précède Qwen3.8 Flash dans la gamme. À la sortie de Qwen3.8 Flash, Qwen proposait aussi Qwen3.7 Plus, facturé au-dessus de lui.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.