Les meilleurs modèles d'IA pour le suivi de consignes

Suivi de consignes : la capacité du modèle à respecter à la lettre ce qu'on lui demande (format, longueur, contraintes, interdits). Réussir, c'est livrer exactement ce qui était demandé, sans en faire plus ni moins. Score Elo calculé par Arena. Comment ça marche ?

Mis à jour chaque jour ·100 premiers modèles sur 122 classés ·Octobre 2026
Éditeur
100 MiniMax M2 Sa place en Suivi de consignes MiniMax 1 333 $0.3 / $1.2 205 k
1 Claude Opus 5.5 Anthropic 1 514 $4 / $20 1 M
2 Claude Opus 4.6 Anthropic 1 514 $5 / $25 1 M
3 Claude Fable 5 Anthropic 1 510 $10 / $50 1 M
4 Claude Opus 4.7 Anthropic 1 502 $5 / $25 1 M
5 Claude Fable 5.1 Anthropic 1 498 $10 / $50 1 M
6 Claude Opus 5 Anthropic 1 497 $5 / $25 1 M
7 GPT-5.6 Sol OpenAI 1 491 $2 / $10 1,05 M
8 Claude Opus 4.8 Anthropic 1 490 $5 / $25 1 M
9 Gemini 3.8 Flash Google 1 487 $0.75 / $3.75 1,05 M
10 Kimi K3 Moonshot AI 1 487 $1.29 / $14 1,05 M
11 Muse Spark 1.3 Meta 1 486 $1.25 / $4.25 1,05 M
12 Gemini 3.7 Flash Google 1 486 $0.75 / $3.75 1,05 M
13 Gemini 3.1 Pro Preview Google 1 479 $2 / $12 1,05 M
14 DeepSeek V4.1 Flash DeepSeek 1 478 $0.3 / $1.2 1,05 M
15 GLM 5.3 Z.ai 1 478 $0.06 / $7 1,05 M
16 GPT-5.5 OpenAI 1 478 $5 / $30 1,05 M
17 Muse Spark 1.2 Meta 1 474 $1.25 / $4.25 1,05 M
18 Muse Spark 1.1 Meta 1 474 $1.25 / $4.25 1,05 M
19 Claude Sonnet 4.6 Anthropic 1 474 $3 / $15 1 M
20 MiMo-V2.6-Pro Xiaomi 1 473 $0.44 / $0.87 1,05 M
21 GPT-6 Astra OpenAI 1 473 $10 / $50 1,05 M
22 GLM 5.3 Flash Z.ai 1 473 $0.15 / $0.5 1,05 M
23 Gemini 3.6 Flash Google 1 473 $0.75 / $3.75 1,05 M
24 GPT-5.4 OpenAI 1 471 $2.5 / $15 1,05 M
25 GLM 5.2 Z.ai 1 470 $0.032 / $12 1,05 M
26 MiMo-V2.5-Pro Xiaomi 1 469 $0.44 / $0.87 1,05 M
27 Claude Sonnet 5 Anthropic 1 467 $2 / $10 1 M
28 Gemini 3.5 Flash Google 1 466 $1.5 / $9 1,05 M
29 Qwen3.7 Max Qwen 1 465 $1.48 / $4.43 1 M
30 Grok 4.5 SpaceXAI 1 462 $2 / $6 500 k
31 GPT-5.6 Terra OpenAI 1 461 $2 / $12 1,05 M
32 GLM 5.1 Z.ai 1 460 $1.4 / $4.4 205 k
33 Kimi K2.6 Moonshot AI 1 456 $0.95 / $4 262 k
34 GPT-6 Sol OpenAI 1 453 $2 / $10 1,05 M
35 MiMo-V2.6-Flash Xiaomi 1 453 $0.14 / $0.28 1,05 M
36 DeepSeek V4 Pro Preview DeepSeek 1 452 $0.21 / $0.42 1,05 M
37 Grok 4.6 SpaceXAI 1 450 $2 / $6 500 k
38 GPT-5.1 OpenAI 1 450 $1.25 / $10 400 k
39 GPT-6 Luna OpenAI 1 449 $0.1 / $0.5 1,05 M
40 Qwen3.6 Max Preview Qwen 1 449 $1.03 / $6.16 262 k
41 Tencent Hy3 Tencent 1 447 $0.083 / $0.33 262 k
42 Qwen3.7 Plus Qwen 1 447 $0.32 / $1.28 1 M
43 GLM 5 Z.ai 1 446 $0.6 / $1.92 205 k
44 GPT-5.6 Luna OpenAI 1 445 $0.2 / $1.2 1,05 M
45 Gemini 3.5 Flash Lite Google 1 443 $0.3 / $2.5 1,05 M
46 Grok 4.7 SpaceXAI 1 442 $2 / $6 500 k
47 Kimi K2.5 Moonshot AI 1 439 $0.45 / $2.25 262 k
48 Gemini 2.5 Pro Google 1 438 $1.25 / $10 1,05 M
49 Qwen3.6 Plus Qwen 1 436 $0.33 / $1.95 1 M
50 MiniMax M3 MiniMax 1 435 $0.3 / $1.2 1,05 M
51 DeepSeek V4 Flash 0423 DeepSeek 1 434 $0.03 / $1.28 1,05 M
52 GPT-5.4 Mini OpenAI 1 434 $0.75 / $4.5 400 k
53 Qwen3.5 397B A17B Qwen 1 434 $0.55 / $3.5 262 k
54 MiMo-V2.5 Xiaomi 1 431 $0.14 / $0.28 1,05 M
55 GPT-5.2 OpenAI 1 427 $1.75 / $14 400 k
56 Qwen3.8 27B Qwen 1 426 $0.43 / $2.55 1 M
57 Thinking Machines Inkling Thinking Machines 1 426 $0.95 / $4.05 524 k
58 GLM 4.7 Z.ai 1 425 $0.6 / $2.2 205 k
59 GLM 5V Turbo Z.ai 1 424 $1.2 / $4 203 k
60 Qwen3 Max Qwen 1 424 $0.78 / $3.9 262 k
61 Mistral Medium 3.5 Mistral AI 1 421 $1.5 / $7.5 262 k
62 DeepSeek V3.2 DeepSeek 1 420 $0.26 / $0.42 164 k
63 DeepSeek V3.1 Terminus DeepSeek 1 420 $0.3 / $1 164 k
64 DeepSeek V3.2 Exp DeepSeek 1 416 $0.27 / $0.41 164 k
65 Grok 4.3 SpaceXAI 1 415 $1.25 / $2.5 1 M
66 GLM 4.6 Z.ai 1 412 $0.43 / $1.75 205 k
67 GPT-5 OpenAI 1 410 $1.25 / $10 400 k
68 Qwen3 VL 235B A22B Instruct Qwen 1 409 $0.21 / $1.9 262 k
69 MiniMax M2.7 MiniMax 1 407 $0.21 / $0.84 205 k
70 Qwen3.5-122B-A10B Qwen 1 406 $0.26 / $2.08 262 k
71 GLM 4.5 Z.ai 1 404 $0.6 / $2.2 131 k
72 Qwen3.5-27B Qwen 1 401 $0.2 / $1.56 262 k
73 Gemini 2.5 Flash Google 1 399 $0.3 / $2.5 1,05 M
74 DeepSeek R1 DeepSeek 1 397 $0.7 / $2.5 64 k
75 Inkling Small Thinking Machines 1 393 $0.45 / $1.2 524 k
76 DeepSeek R1 0528 DeepSeek 1 391 $0.5 / $2.15 164 k
77 Kimi K2 0905 Moonshot AI 1 390 $0.6 / $2.5 262 k
78 GPT-5.4 Nano OpenAI 1 387 $0.2 / $1.25 400 k
79 Qwen3.5-35B-A3B Qwen 1 386 $0.15 / $1 262 k
80 MiniMax M2.1 MiniMax 1 385 $0.3 / $1.2 205 k
81 Step 3.5 Flash StepFun 1 384 $0.1 / $0.3 262 k
82 Qwen3 235B A22B Thinking 2507 Qwen 1 384 $0.23 / $2.3 131 k
83 Qwen3 VL 235B A22B Thinking Qwen 1 382 $0.4 / $4 131 k
84 MiniMax M2.5 MiniMax 1 381 $0.27 / $1.08 205 k
85 OpenAI o1 OpenAI 1 381 $15 / $60 200 k
86 Solar Pro 4 Upstage 1 379 $0.09 / $0.36 524 k
87 Qwen3 Next 80B A3B Instruct Qwen 1 376 $0.1 / $1.1 262 k
88 GPT-5 Mini OpenAI 1 373 $0.25 / $2 400 k
89 GLM 4.6V Z.ai 1 367 $0.3 / $0.9 131 k
90 Qwen3 30B A3B Instruct 2507 Qwen 1 367 $0.048 / $0.19 262 k
91 GLM 4.5 Air Z.ai 1 361 $0.13 / $0.85 131 k
92 Qwen3 Next 80B A3B Thinking Qwen 1 359 $0.15 / $1.2 262 k
93 Trinity Large Thinking Arcee AI 1 357 $0.25 / $0.8 262 k
94 Qwen3 235B A22B Qwen 1 357 $0.46 / $1.82 131 k
95 GLM 4.7 Flash Z.ai 1 348 $0.061 / $0.4 200 k
96 MiniMax M1 MiniMax 1 346 $0.55 / $2.2 1 M
97 o3 Mini OpenAI 1 344 $1.1 / $4.4 200 k
98 Gemma 3 27B Google 1 343 $0.08 / $0.45 131 k
99 GLM 4.5V Z.ai 1 339 $0.6 / $1.8 66 k
100 MiniMax M2 MiniMax 1 333 $0.3 / $1.2 205 k

Score Elo calculé par Arena, d'après les préférences des utilisateurs. Le rang suit le score. La colonne de l'éditeur mène à l'outil qui utilise le modèle. Prix en dollars par million de tokens, en entrée puis en sortie. Cliquez sur un en-tête pour trier, sur une pastille pour changer de classement.

Comment le score est-il calculé ?

Le score est un Elo calculé par Arena. Des personnes comparent à l'aveugle les réponses de deux modèles à une même demande et désignent la meilleure. Chaque duel fait monter le gagnant et descendre le perdant, et battre un adversaire fort rapporte davantage.

Le rang suit le score. Chaque classement (général, par modalité, par tâche) a ses propres scores et ses propres rangs, et un modèle qui n'a pas été évalué dans un classement n'y figure pas. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.