GLM 4.7 Flash, publié par Z.ai le 19 janvier 2026, lit et produit du texte. Selon Z.ai, il convient à la programmation, à l’écriture en chinois, à la traduction, au traitement de textes longs et aux échanges émotionnels ou de jeu de rôle.
GLM 4.7 Flash a été lancé comme la version gratuite de GLM 4.7 le 19 janvier 2026, selon les notes de version de Z.ai. L’éditeur le présentait comme un modèle léger et efficace, conçu pour une faible latence et un débit élevé. À la sortie de GLM 4.7 Flash, GLM 4.7 constituait un autre palier déjà proposé dans la gamme, sorti le 22 décembre 2025. Selon leurs fiches Hugging Face, le modèle Flash compte 31 milliards de paramètres, contre 358 milliards pour GLM 4.7.
À quoi sert GLM 4.7 Flash
Chat
Au relevé du 6 octobre 2026, OpenRouter indiquait que GLM 4.7 Flash prenait en charge l’appel d’outils et la production de sorties structurées. Hors programmation, Z.ai le recommande pour la traduction et le traitement de textes longs.
Rédaction créative
GLM 4.7 Flash est recommandé par Z.ai pour l’écriture en chinois. Cette recommandation couvre aussi les échanges émotionnels et les conversations de jeu de rôle.
Code
GLM 4.7 Flash offrait, à sa sortie, des capacités de code compétitives pour sa taille, selon les notes de version de Z.ai.
Fullstack
GLM 4.7 Flash réussit aussi bien les tâches de front-end que de back-end dans les tests internes de programmation de Z.ai, selon l’éditeur.
Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.
Les performances de GLM 4.7 Flash
GLM 4.7 Flash est comparé à Qwen3-30B-A3B-Thinking-2507 et à GPT-OSS-20B dans les résultats publiés par Z.ai à sa sortie. Le tableau reprend les scores annoncés par l’éditeur dans la fiche Hugging Face du modèle.
Évaluation
GLM 4.7 Flash
Qwen3-30B-A3B-Thinking-2507
GPT-OSS-20B
AIME 25
91,6
85,0
91,7
GPQA
75,2
73,4
71,5
LCB v6
64,0
66,0
61,0
HLE
14,4
9,8
10,9
SWE-bench Verified
59,2
22,0
34,0
τ²-Bench
79,5
49,0
47,7
BrowseComp
42,8
2,29
28,3
Sur AIME 25, GPT-OSS-20B devance le modèle, tandis que Qwen3-30B-A3B-Thinking-2507 obtient un score supérieur sur LCB v6. Z.ai publie ces résultats dans la fiche Hugging Face du modèle à sa sortie. Ces scores sont des annonces de l’éditeur sur les évaluations présentées, pas un classement général des modèles comparés.
Bien utiliser GLM 4.7 Flash : la réflexion et les paramètres
Au relevé du 6 octobre 2026, la réflexion de GLM 4.7 Flash était activée par défaut sur OpenRouter ; elle n’y était pas obligatoire et pouvait être désactivée.
Pour la plupart de ses évaluations, Z.ai utilise une température de 1,0, un top-p de 0,95 et au plus 131 072 nouveaux tokens, selon sa fiche Hugging Face. Ces paramètres décrivent les conditions d’évaluation de l’éditeur, pas une recommandation générale d’utilisation. Pour ses évaluations de tâches d’agent en plusieurs tours, τ²-Bench et Terminal Bench 2, Z.ai demande d’activer la réflexion conservée, appelée Preserved Thinking.
Caractéristiques techniques de GLM 4.7 Flash
GLM 4.7 Flash est sorti le 19 janvier 2026, date de son annonce dans les notes de version de Z.ai. Selon sa fiche Hugging Face, il repose sur une architecture MoE (mélange d’experts) de type 30B-A3B et relève de la licence MIT. Le tableau des caractéristiques présente les formats d’entrée, la fenêtre de contexte et la sortie maximale. Z.ai décrit un modèle qui lit et produit du texte, avec une sortie maximale de 128K tokens, contre 117 964 tokens par réponse sur OpenRouter.
Éditeur
Z.ai
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
200 k tokens
Réponse maximale (selon OpenRouter)
118 k tokens
Réflexion (selon OpenRouter)
Activée par défaut
Tâches
Aide au codeAffaires et financeJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesRédaction créativeSanté et bien-êtreSuivi de consignes
Entrées (selon OpenRouter)
Texte
Licence
MIT
Paramètres pris en charge (noms techniques de l'API OpenRouter)
Où utiliser GLM 4.7 Flash, et comment il se facture
À sa sortie, GLM 4.7 Flash pouvait être utilisé par API ou en local, selon sa fiche Hugging Face.
API : selon la fiche Hugging Face du modèle, l’accès passait par l’API de la plateforme Z.ai.
Poids et déploiement local : Z.ai avait publié les poids sur Hugging Face sous licence MIT. Selon Z.ai, le déploiement local prenait en charge vLLM et SGLang, des moteurs d’inférence servant à exécuter le modèle.
Ollama : au relevé du 6 octobre 2026, la bibliothèque d’Ollama proposait le modèle avec la commande ollama run glm-4.7-flash, en versions de 19 Go (q4_K_M) à 60 Go (bf16).
La carte d’accès présente les derniers prix relevés.
L'API chez des hébergeurs
Servi par d'autres hébergeurs que Z.ai, selon OpenRouter
Chez OpenRouter (relevé du 05/10/2026) : 0,061 $ / M tokens en entrée, 0,40 $ / M tokens en sortie.
Tarification0,061 $ en entrée, 0,40 $ en sortie, par million de tokens
Hébergé via OpenRouter chezCloudflare, Novita, Venice
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
GLM 4.7 Flash parmi les versions de GLM Flash
GLM 4.7 Flash a pour successeur GLM 5.3 Flash, sorti le 26 août 2026. La frise des versions situe ces modèles dans la famille GLM Flash avec leurs dates de sortie.
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.
Comparaison rapide
Les versions sélectionnées
Repères
GLM 4.7 FlashVous êtes ici
GLM 5.3 Flash
Score
1365
1544
Sortie
Contexte
200 k tokens
1,05 M tokens
Prix d'entrée
0,061 $ / M tokens
0,15 $ / M tokens
Prix de sortie
0,40 $ / M tokens
0,50 $ / M tokens
Entrées
Texte
Texte, Image, Vidéo
Réflexion
Activée par défaut
Toujours active
Tâches
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes
Aide au code, Affaires et finance, Design d'après référence, Données et analyse, Front-end, Fullstack, HTML, Jeux, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, React, Rédaction créative, Santé et bien-être, Suivi de consignes, Vision et compréhension
Ce qui le distingue
GLM 4.7 Flash, publié par Z.ai le 19 janvier 2026, lit et produit du texte. Selon Z.ai, il convient à la programmation, à l’écriture en chinois, à la traduction, au traitement de textes longs et aux échanges émotionnels ou de jeu de rôle.
GLM 5.3 Flash, publié par Z.ai le 26 août 2026, prend en charge, selon Z.ai, la programmation, la bureautique, la recherche financière et le traitement de documents. Selon la documentation de Z.ai, il lit le texte, les images, les vidéos et les fichiers, et produit du texte.
Les repères sont ceux renseignés dans l'annuaire ; un repère absent de toutes les versions sélectionnées n'est pas affiché. Comparaison complète dans le comparateur
FAQ
Quand GLM 4.7 Flash est-il sorti ?
GLM 4.7 Flash est sorti le 19 janvier 2026. Z.ai l’a annoncé le même jour dans ses notes de version.
GLM 4.7 Flash est-il un modèle MoE ?
GLM 4.7 Flash est un modèle MoE, c’est-à-dire un mélange d’experts, selon sa fiche Hugging Face. Son architecture est de type 30B-A3B.
Peut-on faire tourner GLM 4.7 Flash en local ?
GLM 4.7 Flash pouvait être déployé en local, selon Z.ai. Pour ce déploiement, les moteurs d’inférence pris en charge étaient vLLM et SGLang.
L’API de GLM 4.7 Flash est-elle gratuite ?
GLM 4.7 Flash a été lancé le 19 janvier 2026 comme la version gratuite de GLM 4.7, selon les notes de version de Z.ai.
Quelle version succède à GLM 4.7 Flash ?
GLM 4.7 Flash a pour successeur GLM 5.3 Flash, sorti le 26 août 2026.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.