GLM 5.3 Flash, publié par Z.ai le 26 août 2026, prend en charge, selon Z.ai, la programmation, la bureautique, la recherche financière et le traitement de documents. Selon la documentation de Z.ai, il lit le texte, les images, les vidéos et les fichiers, et produit du texte.
Ce que GLM 5.3 Flash change par rapport à GLM 4.7 Flash
GLM 5.3 Flash est, à sa sortie, le premier modèle nativement multimodal de la série GLM-5, selon Z.ai. Il compte 320 milliards de paramètres au total, dont 18 milliards actifs, selon Z.ai. En comparaison, GLM 4.7 Flash est un modèle MoE, c’est-à-dire un mélange d’experts, de type 30B-A3B selon sa fiche Hugging Face.
Selon Z.ai, son modèle de base est entraîné à neuf et son architecture hybride associe attention clairsemée et attention linéaire pour réduire le coût de service des longs contextes. Sur OpenRouter, l’entrée passe du texte seul au texte, à l’image et à la vidéo, et la fenêtre de contexte passe de 200 000 tokens pour GLM 4.7 Flash à 1 048 576 tokens pour GLM 5.3 Flash. Le tableau d’écart compare, sur OpenRouter, la fenêtre de contexte, les formats d’entrée et la réflexion entre les deux versions.
Par rapport à la version précédente
GLM 4.7 FlashGLM 5.3 Flash
Score1365→1544+179
Contexte maximal (selon OpenRouter)200 k→1,05 M+849 k
Réflexion (selon OpenRouter)Activée par défaut→Toujours activeModifié
Prix d'entrée (OpenRouter, relevé du 05/10/2026)0,061 $ / M tokens→0,15 $ / M tokens
Prix de sortie (OpenRouter, relevé du 05/10/2026)0,40 $ / M tokens→0,50 $ / M tokens
GLM 5.3 Flash ou GLM 5.3 : lequel choisir ?
GLM 5.3 Flash rejoint, à sa sortie, une gamme où Z.ai proposait déjà GLM 5.3, sorti le 18 août 2026. Selon Z.ai, il divise le calcul d’attention par 3,0 et la taille du cache de clés et valeurs (KV) par 4,4 face à ce modèle. Selon l’annonce de Z.ai du 26 août 2026, il est déployé auprès de tous les abonnés du GLM Coding Plan, avec trois fois le quota utilisable de GLM 5.3.
À quoi sert GLM 5.3 Flash
Chat
GLM 5.3 Flash prend en charge l’appel de fonctions vers des outils externes, selon la documentation de Z.ai. Il peut aussi produire des sorties structurées, notamment en JSON, selon la documentation de Z.ai.
Vision et compréhension
GLM 5.3 Flash lit nativement des images, des vidéos et des fichiers en entrée, selon la documentation de Z.ai.
Business et finance
GLM 5.3 Flash prend en charge la bureautique, la recherche financière et le traitement de documents, selon Z.ai. Pour ces tâches, il découpe les objectifs, appelle des outils et relit ses sorties, selon Z.ai. Ses livrables peuvent prendre les formats PPTX, PDF, DOCX et XLSX, selon Z.ai.
Code
GLM 5.3 Flash observe les interfaces, les rendus et les retours d’interaction, selon les notes de version de Z.ai. Il travaille ainsi dans une boucle fermée entre le code, les navigateurs et les interfaces graphiques, selon les notes de version de Z.ai.
Front-end
GLM 5.3 Flash intègre la vision à la boucle de programmation pour tester et améliorer son travail, selon Z.ai. Ses usages couvrent le développement front-end et les jeux, jusqu’aux scènes 3D de Blender, selon Z.ai.
Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.
Les performances de GLM 5.3 Flash
GLM 5.3 Flash devance GLM-5.2 sur les évaluations de code et d’agent présentées par Z.ai à sa sortie, dans son annonce du 26 août 2026. Z.ai le compare à GLM-5.2, DeepSeek-V4-Vision-Exp, Claude Opus 4.8, GPT-5.6 Terra et Gemini 3.7 Flash sur le code, les agents et la vision.
Sur DeepSWE v1.1, il obtient 63,4 contre 46,2 pour GLM-5.2, selon Z.ai. Pour AutomationBench, son score atteint 48,8 contre 26,2 pour GLM-5.2, selon Z.ai. Sur Z.ai Code Bench v1.0, l’évaluation interne de Z.ai, il devance GLM-5.2 à chaque niveau d’effort et obtient 29,0 au niveau max, contre 29,5 pour Claude Opus 4.8, selon Z.ai.
Sur Terminal Bench 2.1, il obtient 84,3, contre 81,0 pour GLM-5.2, 85,0 pour Claude Opus 4.8 et 87,4 pour GPT-5.6 Terra, selon Z.ai. Pour Toolathlon Verified, son score atteint 78,4, contre 59,9 pour GLM-5.2 et 76,2 pour Claude Opus 4.8, selon Z.ai.
En vision, il obtient 59,1 sur OSWorld 2.0, contre 54,8 pour Claude Opus 4.8, 50,2 pour GPT-5.6 Terra et 47,9 pour Gemini 3.7 Flash, selon Z.ai. Sur BabyVision, son score de 53,4 reste inférieur à ceux de GPT-5.6 Terra, à 61,6, et de Gemini 3.7 Flash, à 70,9, selon Z.ai.
Bien utiliser GLM 5.3 Flash : réflexion et effort
GLM 5.3 Flash impose la réflexion sur OpenRouter, où elle est activée par défaut ; selon la documentation de Z.ai, elle ne peut pas être désactivée. Sur OpenRouter et selon la fiche Hugging Face du modèle, les niveaux d’effort sont low, high et max, avec max par défaut ; la fiche Hugging Face nomme ce paramètre reasoning_effort.
Pour reproduire ses évaluations, Z.ai demande de conserver reasoning_effort à max, selon la fiche Hugging Face du modèle. Dans le modèle de conversation, clear_thinking vaut false par défaut et Z.ai recommande clear_thinking=true pour les usages de conversation, selon cette même fiche Hugging Face. Selon la documentation de Z.ai, les réglages recommandés associent une température de 1, un top_p de 0,95 et reasoning_effort à max.
Caractéristiques techniques de GLM 5.3 Flash
GLM 5.3 Flash est sorti le 26 août 2026. Il est distribué sous licence MIT.
Le tableau des caractéristiques présente la fenêtre de contexte, la sortie maximale et les formats du modèle. Selon la documentation de Z.ai, il accepte la vidéo, l’image, le texte et les fichiers, et produit du texte. Sur OpenRouter, sa fenêtre de contexte atteint 1 048 576 tokens. Chaque réponse peut contenir au plus 131 072 tokens sur OpenRouter.
Éditeur
Z.ai
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
1,05 M tokens
Réponse maximale (selon OpenRouter)
944 k tokens
Réflexion (selon OpenRouter)
Toujours active
Tâches
Aide au codeAffaires et financeDesign d'après référenceDonnées et analyseFront-endFullstackHTMLJeuxJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesReactRédaction créativeSanté et bien-êtreSuivi de consignesVision et compréhension
Entrées (selon OpenRouter)
Texte, Image, Vidéo
Licence
MIT
Paramètres pris en charge (noms techniques de l'API OpenRouter)
Où utiliser GLM 5.3 Flash, et comment il se facture
API de Z.ai : GLM 5.3 Flash était utilisable via l’API de la plateforme Z.ai, vers laquelle renvoyait sa fiche Hugging Face.
Poids et déploiement local : selon l’annonce de Z.ai du 26 août 2026, les poids étaient publiés sur Hugging Face. Le déploiement local prenait alors en charge SGLang, vLLM et TokenSpeed, selon cette annonce de Z.ai.
ZCode : à sa sortie, selon Z.ai, le modèle était proposé dans ZCode avec Browser Use et Computer Use. Avec ces fonctions, l’agent parcourait et vérifiait visuellement des pages web, et pilotait des applications de bureau, selon Z.ai.
La carte d’accès donne les derniers prix relevés.
L'API Z.ai
Pour relier le modèle à votre application
Chez OpenRouter (relevé du 05/10/2026) : 0,15 $ / M tokens en entrée, 0,50 $ / M tokens en sortie.
Tarification0,15 $ en entrée, 0,50 $ en sortie, par million de tokens
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
GLM 5.3 Flash parmi les versions de GLM Flash
GLM 5.3 Flash appartient à la famille GLM Flash et suit GLM 4.7 Flash, sorti le 19 janvier 2026. La frise des versions situe les modèles de la famille avec leurs dates de sortie.
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.
Comparaison rapide
Les versions sélectionnées
Repères
GLM 5.3 FlashVous êtes ici
GLM 4.7 Flash
Score
1544
1365
Sortie
Contexte
1,05 M tokens
200 k tokens
Prix d'entrée
0,15 $ / M tokens
0,061 $ / M tokens
Prix de sortie
0,50 $ / M tokens
0,40 $ / M tokens
Entrées
Texte, Image, Vidéo
Texte
Réflexion
Toujours active
Activée par défaut
Tâches
Aide au code, Affaires et finance, Design d'après référence, Données et analyse, Front-end, Fullstack, HTML, Jeux, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, React, Rédaction créative, Santé et bien-être, Suivi de consignes, Vision et compréhension
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes
Ce qui le distingue
GLM 5.3 Flash, publié par Z.ai le 26 août 2026, prend en charge, selon Z.ai, la programmation, la bureautique, la recherche financière et le traitement de documents. Selon la documentation de Z.ai, il lit le texte, les images, les vidéos et les fichiers, et produit du texte.
GLM 4.7 Flash, publié par Z.ai le 19 janvier 2026, lit et produit du texte. Selon Z.ai, il convient à la programmation, à l’écriture en chinois, à la traduction, au traitement de textes longs et aux échanges émotionnels ou de jeu de rôle.
Les repères sont ceux renseignés dans l'annuaire ; un repère absent de toutes les versions sélectionnées n'est pas affiché. Comparaison complète dans le comparateur
FAQ
Quand GLM 5.3 Flash est-il sorti ?
GLM 5.3 Flash est sorti le 26 août 2026, selon les notes de version de Z.ai. Il succède à GLM 4.7 Flash dans la gamme.
Quelle est la fenêtre de contexte de GLM 5.3 Flash ?
GLM 5.3 Flash possède une fenêtre de contexte de 1M de tokens, selon la documentation de Z.ai. Ses poids sont publiés sur Hugging Face à sa sortie, selon l’annonce de Z.ai du 26 août 2026.
Peut-on faire tourner GLM 5.3 Flash en local ?
GLM 5.3 Flash prend en charge le déploiement local avec SGLang, vLLM et TokenSpeed à sa sortie, selon l’annonce de Z.ai du 26 août 2026. Ses poids sont alors publiés sur Hugging Face, selon cette même annonce de Z.ai.
Quelle version précède GLM 5.3 Flash ?
GLM 5.3 Flash est précédé par GLM 4.7 Flash dans la gamme. Sa sortie est datée du 26 août 2026, selon les notes de version de Z.ai.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.