Les meilleurs modèles d'IA pour le suivi de consignes
Suivi de consignes : la capacité du modèle à respecter à la lettre ce qu'on lui demande (format, longueur, contraintes, interdits). Réussir, c'est livrer exactement ce qui était demandé, sans en faire plus ni moins. Score Elo calculé par Arena. Comment ça marche ?
| Éditeur | |||||
|---|---|---|---|---|---|
| 104 | gpt-oss-120b Sa place en Suivi de consignes | 1 323 | $0.037 / $0.17 | 131 k | |
| 1 | Claude Opus 5.5 | 1 514 | $4 / $20 | 1 M | |
| 2 | Claude Opus 4.6 | 1 514 | $5 / $25 | 1 M | |
| 3 | Claude Fable 5 | 1 510 | $10 / $50 | 1 M | |
| 4 | Claude Opus 4.7 | 1 502 | $5 / $25 | 1 M | |
| 5 | Claude Fable 5.1 | 1 498 | $10 / $50 | 1 M | |
| 6 | Claude Opus 5 | 1 497 | $5 / $25 | 1 M | |
| 7 | GPT-5.6 Sol | 1 491 | $2 / $10 | 1,05 M | |
| 8 | Claude Opus 4.8 | 1 490 | $5 / $25 | 1 M | |
| 9 | Gemini 3.8 Flash | 1 487 | $0.75 / $3.75 | 1,05 M | |
| 10 | Kimi K3 | 1 487 | $1.29 / $14 | 1,05 M | |
| 11 | Muse Spark 1.3 | 1 486 | $1.25 / $4.25 | 1,05 M | |
| 12 | Gemini 3.7 Flash | 1 486 | $0.75 / $3.75 | 1,05 M | |
| 13 | Gemini 3.1 Pro Preview | 1 479 | $2 / $12 | 1,05 M | |
| 14 | DeepSeek V4.1 Flash | 1 478 | $0.3 / $1.2 | 1,05 M | |
| 15 | GLM 5.3 | 1 478 | $0.06 / $7 | 1,05 M | |
| 16 | GPT-5.5 | 1 478 | $5 / $30 | 1,05 M | |
| 17 | Muse Spark 1.2 | 1 474 | $1.25 / $4.25 | 1,05 M | |
| 18 | Muse Spark 1.1 | 1 474 | $1.25 / $4.25 | 1,05 M | |
| 19 | Claude Sonnet 4.6 | 1 474 | $3 / $15 | 1 M | |
| 20 | MiMo-V2.6-Pro | 1 473 | $0.44 / $0.87 | 1,05 M | |
| 21 | GPT-6 Astra | 1 473 | $10 / $50 | 1,05 M | |
| 22 | GLM 5.3 Flash | 1 473 | $0.15 / $0.5 | 1,05 M | |
| 23 | Gemini 3.6 Flash | 1 473 | $0.75 / $3.75 | 1,05 M | |
| 24 | GPT-5.4 | 1 471 | $2.5 / $15 | 1,05 M | |
| 25 | GLM 5.2 | 1 470 | $0.032 / $12 | 1,05 M | |
| 26 | MiMo-V2.5-Pro | 1 469 | $0.44 / $0.87 | 1,05 M | |
| 27 | Claude Sonnet 5 | 1 467 | $2 / $10 | 1 M | |
| 28 | Gemini 3.5 Flash | 1 466 | $1.5 / $9 | 1,05 M | |
| 29 | Qwen3.7 Max | 1 465 | $1.48 / $4.43 | 1 M | |
| 30 | Grok 4.5 | 1 462 | $2 / $6 | 500 k | |
| 31 | GPT-5.6 Terra | 1 461 | $2 / $12 | 1,05 M | |
| 32 | GLM 5.1 | 1 460 | $1.4 / $4.4 | 205 k | |
| 33 | Kimi K2.6 | 1 456 | $0.95 / $4 | 262 k | |
| 34 | GPT-6 Sol | 1 453 | $2 / $10 | 1,05 M | |
| 35 | MiMo-V2.6-Flash | 1 453 | $0.14 / $0.28 | 1,05 M | |
| 36 | DeepSeek V4 Pro Preview | 1 452 | $0.21 / $0.42 | 1,05 M | |
| 37 | Grok 4.6 | 1 450 | $2 / $6 | 500 k | |
| 38 | GPT-5.1 | 1 450 | $1.25 / $10 | 400 k | |
| 39 | GPT-6 Luna | 1 449 | $0.1 / $0.5 | 1,05 M | |
| 40 | Qwen3.6 Max Preview | 1 449 | $1.03 / $6.16 | 262 k | |
| 41 | Tencent Hy3 | 1 447 | $0.083 / $0.33 | 262 k | |
| 42 | Qwen3.7 Plus | 1 447 | $0.32 / $1.28 | 1 M | |
| 43 | GLM 5 | 1 446 | $0.6 / $1.92 | 205 k | |
| 44 | GPT-5.6 Luna | 1 445 | $0.2 / $1.2 | 1,05 M | |
| 45 | Gemini 3.5 Flash Lite | 1 443 | $0.3 / $2.5 | 1,05 M | |
| 46 | Grok 4.7 | 1 442 | $2 / $6 | 500 k | |
| 47 | Kimi K2.5 | 1 439 | $0.45 / $2.25 | 262 k | |
| 48 | Gemini 2.5 Pro | 1 438 | $1.25 / $10 | 1,05 M | |
| 49 | Qwen3.6 Plus | 1 436 | $0.33 / $1.95 | 1 M | |
| 50 | MiniMax M3 | 1 435 | $0.3 / $1.2 | 1,05 M | |
| 51 | DeepSeek V4 Flash 0423 | 1 434 | $0.03 / $1.28 | 1,05 M | |
| 52 | GPT-5.4 Mini | 1 434 | $0.75 / $4.5 | 400 k | |
| 53 | Qwen3.5 397B A17B | 1 434 | $0.55 / $3.5 | 262 k | |
| 54 | MiMo-V2.5 | 1 431 | $0.14 / $0.28 | 1,05 M | |
| 55 | GPT-5.2 | 1 427 | $1.75 / $14 | 400 k | |
| 56 | Qwen3.8 27B | 1 426 | $0.43 / $2.55 | 1 M | |
| 57 | Thinking Machines Inkling | 1 426 | $0.95 / $4.05 | 524 k | |
| 58 | GLM 4.7 | 1 425 | $0.6 / $2.2 | 205 k | |
| 59 | GLM 5V Turbo | 1 424 | $1.2 / $4 | 203 k | |
| 60 | Qwen3 Max | 1 424 | $0.78 / $3.9 | 262 k | |
| 61 | Mistral Medium 3.5 | 1 421 | $1.5 / $7.5 | 262 k | |
| 62 | DeepSeek V3.2 | 1 420 | $0.26 / $0.42 | 164 k | |
| 63 | DeepSeek V3.1 Terminus | 1 420 | $0.3 / $1 | 164 k | |
| 64 | DeepSeek V3.2 Exp | 1 416 | $0.27 / $0.41 | 164 k | |
| 65 | Grok 4.3 | 1 415 | $1.25 / $2.5 | 1 M | |
| 66 | GLM 4.6 | 1 412 | $0.43 / $1.75 | 205 k | |
| 67 | GPT-5 | 1 410 | $1.25 / $10 | 400 k | |
| 68 | Qwen3 VL 235B A22B Instruct | 1 409 | $0.21 / $1.9 | 262 k | |
| 69 | MiniMax M2.7 | 1 407 | $0.21 / $0.84 | 205 k | |
| 70 | Qwen3.5-122B-A10B | 1 406 | $0.26 / $2.08 | 262 k | |
| 71 | GLM 4.5 | 1 404 | $0.6 / $2.2 | 131 k | |
| 72 | Qwen3.5-27B | 1 401 | $0.2 / $1.56 | 262 k | |
| 73 | Gemini 2.5 Flash | 1 399 | $0.3 / $2.5 | 1,05 M | |
| 74 | DeepSeek R1 | 1 397 | $0.7 / $2.5 | 64 k | |
| 75 | Inkling Small | 1 393 | $0.45 / $1.2 | 524 k | |
| 76 | DeepSeek R1 0528 | 1 391 | $0.5 / $2.15 | 164 k | |
| 77 | Kimi K2 0905 | 1 390 | $0.6 / $2.5 | 262 k | |
| 78 | GPT-5.4 Nano | 1 387 | $0.2 / $1.25 | 400 k | |
| 79 | Qwen3.5-35B-A3B | 1 386 | $0.15 / $1 | 262 k | |
| 80 | MiniMax M2.1 | 1 385 | $0.3 / $1.2 | 205 k | |
| 81 | Step 3.5 Flash | 1 384 | $0.1 / $0.3 | 262 k | |
| 82 | Qwen3 235B A22B Thinking 2507 | 1 384 | $0.23 / $2.3 | 131 k | |
| 83 | Qwen3 VL 235B A22B Thinking | 1 382 | $0.4 / $4 | 131 k | |
| 84 | MiniMax M2.5 | 1 381 | $0.27 / $1.08 | 205 k | |
| 85 | OpenAI o1 | 1 381 | $15 / $60 | 200 k | |
| 86 | Solar Pro 4 | 1 379 | $0.09 / $0.36 | 524 k | |
| 87 | Qwen3 Next 80B A3B Instruct | 1 376 | $0.1 / $1.1 | 262 k | |
| 88 | GPT-5 Mini | 1 373 | $0.25 / $2 | 400 k | |
| 89 | GLM 4.6V | 1 367 | $0.3 / $0.9 | 131 k | |
| 90 | Qwen3 30B A3B Instruct 2507 | 1 367 | $0.048 / $0.19 | 262 k | |
| 91 | GLM 4.5 Air | 1 361 | $0.13 / $0.85 | 131 k | |
| 92 | Qwen3 Next 80B A3B Thinking | 1 359 | $0.15 / $1.2 | 262 k | |
| 93 | Trinity Large Thinking | 1 357 | $0.25 / $0.8 | 262 k | |
| 94 | Qwen3 235B A22B | 1 357 | $0.46 / $1.82 | 131 k | |
| 95 | GLM 4.7 Flash | 1 348 | $0.061 / $0.4 | 200 k | |
| 96 | MiniMax M1 | 1 346 | $0.55 / $2.2 | 1 M | |
| 97 | o3 Mini | 1 344 | $1.1 / $4.4 | 200 k | |
| 98 | Gemma 3 27B | 1 343 | $0.08 / $0.45 | 131 k | |
| 99 | GLM 4.5V | 1 339 | $0.6 / $1.8 | 66 k | |
| 100 | MiniMax M2 | 1 333 | $0.3 / $1.2 | 205 k |
Aucun modèle ne correspond à votre recherche.
Aucun modèle classé en Chat › Suivi de consignes pour le moment.
Score Elo calculé par Arena, d'après les préférences des utilisateurs. Le rang suit le score. La colonne de l'éditeur mène à l'outil qui utilise le modèle. Prix en dollars par million de tokens, en entrée puis en sortie. Cliquez sur un en-tête pour trier, sur une pastille pour changer de classement.
Comment le score est-il calculé ?
Le score est un Elo calculé par Arena. Des personnes comparent à l'aveugle les réponses de deux modèles à une même demande et désignent la meilleure. Chaque duel fait monter le gagnant et descendre le perdant, et battre un adversaire fort rapporte davantage.
Le rang suit le score. Chaque classement (général, par modalité, par tâche) a ses propres scores et ses propres rangs, et un modèle qui n'a pas été évalué dans un classement n'y figure pas. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.