Revue publiée le Scores mis à jour le
Comparer

Z.ai : GLM 4.7 Flash

Nouvelle version : GLM 5.3 Flash

GLM 4.7 Flash, publié par Z.ai le 19 janvier 2026, lit et produit du texte. Selon Z.ai, il convient à la programmation, à l’écriture en chinois, à la traduction, au traitement de textes longs et aux échanges émotionnels ou de jeu de rôle.

GLM 4.7 Flash ou GLM 4.7 : lequel choisir ?

GLM 4.7 Flash a été lancé comme la version gratuite de GLM 4.7 le 19 janvier 2026, selon les notes de version de Z.ai. L’éditeur le présentait comme un modèle léger et efficace, conçu pour une faible latence et un débit élevé. À la sortie de GLM 4.7 Flash, GLM 4.7 constituait un autre palier déjà proposé dans la gamme, sorti le 22 décembre 2025. Selon leurs fiches Hugging Face, le modèle Flash compte 31 milliards de paramètres, contre 358 milliards pour GLM 4.7.

À quoi sert GLM 4.7 Flash

Chat

Au relevé du 6 octobre 2026, OpenRouter indiquait que GLM 4.7 Flash prenait en charge l’appel d’outils et la production de sorties structurées. Hors programmation, Z.ai le recommande pour la traduction et le traitement de textes longs.

Rédaction créative

GLM 4.7 Flash est recommandé par Z.ai pour l’écriture en chinois. Cette recommandation couvre aussi les échanges émotionnels et les conversations de jeu de rôle.

Code

GLM 4.7 Flash offrait, à sa sortie, des capacités de code compétitives pour sa taille, selon les notes de version de Z.ai.

Fullstack

GLM 4.7 Flash réussit aussi bien les tâches de front-end que de back-end dans les tests internes de programmation de Z.ai, selon l’éditeur.

  • Chat1365
  • Rédaction créative1306
  • Code
  • Fullstack
Comment lire ces scores

Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.

Les performances de GLM 4.7 Flash

GLM 4.7 Flash est comparé à Qwen3-30B-A3B-Thinking-2507 et à GPT-OSS-20B dans les résultats publiés par Z.ai à sa sortie. Le tableau reprend les scores annoncés par l’éditeur dans la fiche Hugging Face du modèle.

ÉvaluationGLM 4.7 FlashQwen3-30B-A3B-Thinking-2507GPT-OSS-20B
AIME 2591,685,091,7
GPQA75,273,471,5
LCB v664,066,061,0
HLE14,49,810,9
SWE-bench Verified59,222,034,0
τ²-Bench79,549,047,7
BrowseComp42,82,2928,3

Sur AIME 25, GPT-OSS-20B devance le modèle, tandis que Qwen3-30B-A3B-Thinking-2507 obtient un score supérieur sur LCB v6. Z.ai publie ces résultats dans la fiche Hugging Face du modèle à sa sortie. Ces scores sont des annonces de l’éditeur sur les évaluations présentées, pas un classement général des modèles comparés.

Bien utiliser GLM 4.7 Flash : la réflexion et les paramètres

Au relevé du 6 octobre 2026, la réflexion de GLM 4.7 Flash était activée par défaut sur OpenRouter ; elle n’y était pas obligatoire et pouvait être désactivée.

Pour la plupart de ses évaluations, Z.ai utilise une température de 1,0, un top-p de 0,95 et au plus 131 072 nouveaux tokens, selon sa fiche Hugging Face. Ces paramètres décrivent les conditions d’évaluation de l’éditeur, pas une recommandation générale d’utilisation. Pour ses évaluations de tâches d’agent en plusieurs tours, τ²-Bench et Terminal Bench 2, Z.ai demande d’activer la réflexion conservée, appelée Preserved Thinking.

Caractéristiques techniques de GLM 4.7 Flash

GLM 4.7 Flash est sorti le 19 janvier 2026, date de son annonce dans les notes de version de Z.ai. Selon sa fiche Hugging Face, il repose sur une architecture MoE (mélange d’experts) de type 30B-A3B et relève de la licence MIT. Le tableau des caractéristiques présente les formats d’entrée, la fenêtre de contexte et la sortie maximale. Z.ai décrit un modèle qui lit et produit du texte, avec une sortie maximale de 128K tokens, contre 117 964 tokens par réponse sur OpenRouter.

Éditeur
Z.ai
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
200 k tokens
Réponse maximale (selon OpenRouter)
118 k tokens
Réflexion (selon OpenRouter)
Activée par défaut
Tâches
Aide au codeAffaires et financeJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesRédaction créativeSanté et bien-êtreSuivi de consignes
Entrées (selon OpenRouter)
Texte
Licence
MIT
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolsstructured_outputstemperaturetop_preasoningseedstoplogprobsresponse_formatmax_tokens
Hébergeurs via OpenRouter
Cloudflare, Novita, Venice

Où utiliser GLM 4.7 Flash, et comment il se facture

À sa sortie, GLM 4.7 Flash pouvait être utilisé par API ou en local, selon sa fiche Hugging Face.

  • API : selon la fiche Hugging Face du modèle, l’accès passait par l’API de la plateforme Z.ai.
  • Poids et déploiement local : Z.ai avait publié les poids sur Hugging Face sous licence MIT. Selon Z.ai, le déploiement local prenait en charge vLLM et SGLang, des moteurs d’inférence servant à exécuter le modèle.
  • Ollama : au relevé du 6 octobre 2026, la bibliothèque d’Ollama proposait le modèle avec la commande ollama run glm-4.7-flash, en versions de 19 Go (q4_K_M) à 60 Go (bf16).

La carte d’accès présente les derniers prix relevés.

L'API chez des hébergeurs

Servi par d'autres hébergeurs que Z.ai, selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,061 $ / M tokens en entrée, 0,40 $ / M tokens en sortie.

Tarification0,061 $ en entrée, 0,40 $ en sortie, par million de tokens
Hébergé via OpenRouter chezCloudflare, Novita, Venice

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

GLM 4.7 Flash parmi les versions de GLM Flash

GLM 4.7 Flash a pour successeur GLM 5.3 Flash, sorti le 26 août 2026. La frise des versions situe ces modèles dans la famille GLM Flash avec leurs dates de sortie.

1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.

FAQ

Quand GLM 4.7 Flash est-il sorti ?

GLM 4.7 Flash est sorti le 19 janvier 2026. Z.ai l’a annoncé le même jour dans ses notes de version.

GLM 4.7 Flash est-il un modèle MoE ?

GLM 4.7 Flash est un modèle MoE, c’est-à-dire un mélange d’experts, selon sa fiche Hugging Face. Son architecture est de type 30B-A3B.

Peut-on faire tourner GLM 4.7 Flash en local ?

GLM 4.7 Flash pouvait être déployé en local, selon Z.ai. Pour ce déploiement, les moteurs d’inférence pris en charge étaient vLLM et SGLang.

L’API de GLM 4.7 Flash est-elle gratuite ?

GLM 4.7 Flash a été lancé le 19 janvier 2026 comme la version gratuite de GLM 4.7, selon les notes de version de Z.ai.

Quelle version succède à GLM 4.7 Flash ?

GLM 4.7 Flash a pour successeur GLM 5.3 Flash, sorti le 26 août 2026.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.