Les meilleurs modèles d'IA pour les prompts difficiles

Prompts difficiles : la capacité du modèle à venir à bout des demandes complexes, précises et exigeantes, celles où la plupart décrochent. Réussir, c'est traiter toute la demande, pas seulement sa partie facile. Score Elo calculé par Arena. Comment ça marche ?

Mis à jour chaque jour ·100 premiers modèles sur 122 classés ·Octobre 2026
Éditeur
87 Qwen3 30B A3B Instruct 2507 Sa place en Prompts difficiles Qwen 1 407 $0.048 / $0.19 262 k
1 Claude Opus 5.5 Anthropic 1 533 $4 / $20 1 M
2 Claude Opus 4.6 Anthropic 1 533 $5 / $25 1 M
3 Claude Fable 5 Anthropic 1 531 $10 / $50 1 M
4 Claude Opus 4.7 Anthropic 1 526 $5 / $25 1 M
5 Claude Fable 5.1 Anthropic 1 522 $10 / $50 1 M
6 Kimi K3 Moonshot AI 1 518 $1.29 / $14 1,05 M
7 Muse Spark 1.3 Meta 1 517 $1.25 / $4.25 1,05 M
8 Claude Opus 5 Anthropic 1 516 $5 / $25 1 M
9 Gemini 3.8 Flash Google 1 515 $0.75 / $3.75 1,05 M
10 Claude Opus 4.8 Anthropic 1 513 $5 / $25 1 M
11 GPT-5.6 Sol OpenAI 1 511 $2 / $10 1,05 M
12 Muse Spark 1.1 Meta 1 511 $1.25 / $4.25 1,05 M
13 Gemini 3.7 Flash Google 1 509 $0.75 / $3.75 1,05 M
14 Muse Spark 1.2 Meta 1 508 $1.25 / $4.25 1,05 M
15 Gemini 3.1 Pro Preview Google 1 507 $2 / $12 1,05 M
16 MiMo-V2.6-Pro Xiaomi 1 505 $0.44 / $0.87 1,05 M
17 GLM 5.3 Z.ai 1 505 $0.06 / $7 1,05 M
18 Claude Sonnet 4.6 Anthropic 1 503 $3 / $15 1 M
19 Gemini 3.6 Flash Google 1 502 $0.75 / $3.75 1,05 M
20 GPT-6 Astra OpenAI 1 501 $10 / $50 1,05 M
21 GPT-5.5 OpenAI 1 501 $5 / $30 1,05 M
22 GLM 5.3 Flash Z.ai 1 499 $0.15 / $0.5 1,05 M
23 DeepSeek V4.1 Flash DeepSeek 1 498 $0.3 / $1.2 1,05 M
24 GPT-5.4 OpenAI 1 497 $2.5 / $15 1,05 M
25 GLM 5.2 Z.ai 1 496 $0.032 / $12 1,05 M
26 Qwen3.7 Max Qwen 1 495 $1.48 / $4.43 1 M
27 Gemini 3.5 Flash Google 1 495 $1.5 / $9 1,05 M
28 MiMo-V2.5-Pro Xiaomi 1 495 $0.44 / $0.87 1,05 M
29 Claude Sonnet 5 Anthropic 1 491 $2 / $10 1 M
30 Grok 4.5 SpaceXAI 1 489 $2 / $6 500 k
31 GPT-5.6 Terra OpenAI 1 488 $2 / $12 1,05 M
32 GLM 5.1 Z.ai 1 488 $1.4 / $4.4 205 k
33 Kimi K2.6 Moonshot AI 1 486 $0.95 / $4 262 k
34 GPT-6 Sol OpenAI 1 484 $2 / $10 1,05 M
35 MiMo-V2.6-Flash Xiaomi 1 484 $0.14 / $0.28 1,05 M
36 Qwen3.6 Max Preview Qwen 1 482 $1.03 / $6.16 262 k
37 DeepSeek V4 Pro Preview DeepSeek 1 480 $0.21 / $0.42 1,05 M
38 Grok 4.6 SpaceXAI 1 478 $2 / $6 500 k
39 GLM 5 Z.ai 1 478 $0.6 / $1.92 205 k
40 Tencent Hy3 Tencent 1 477 $0.083 / $0.33 262 k
41 GPT-5.6 Luna OpenAI 1 476 $0.2 / $1.2 1,05 M
42 GPT-5.1 OpenAI 1 476 $1.25 / $10 400 k
43 Gemini 3.5 Flash Lite Google 1 474 $0.3 / $2.5 1,05 M
44 Qwen3.7 Plus Qwen 1 474 $0.32 / $1.28 1 M
45 Kimi K2.5 Moonshot AI 1 472 $0.45 / $2.25 262 k
46 GPT-6 Luna OpenAI 1 469 $0.1 / $0.5 1,05 M
47 GPT-5.4 Mini OpenAI 1 469 $0.75 / $4.5 400 k
48 Qwen3.6 Plus Qwen 1 468 $0.33 / $1.95 1 M
49 Qwen3.8 27B Qwen 1 464 $0.43 / $2.55 1 M
50 Qwen3.5 397B A17B Qwen 1 463 $0.55 / $3.5 262 k
51 Grok 4.7 SpaceXAI 1 462 $2 / $6 500 k
52 Thinking Machines Inkling Thinking Machines 1 462 $0.95 / $4.05 524 k
53 MiniMax M3 MiniMax 1 462 $0.3 / $1.2 1,05 M
54 MiMo-V2.5 Xiaomi 1 462 $0.14 / $0.28 1,05 M
55 GLM 4.7 Z.ai 1 462 $0.6 / $2.2 205 k
56 GPT-5.2 OpenAI 1 461 $1.75 / $14 400 k
57 DeepSeek V4 Flash 0423 DeepSeek 1 459 $0.03 / $1.28 1,05 M
58 Qwen3 Max Qwen 1 458 $0.78 / $3.9 262 k
59 Gemini 2.5 Pro Google 1 458 $1.25 / $10 1,05 M
60 Grok 4.3 SpaceXAI 1 456 $1.25 / $2.5 1 M
61 GLM 5V Turbo Z.ai 1 453 $1.2 / $4 203 k
62 GPT-5 OpenAI 1 448 $1.25 / $10 400 k
63 DeepSeek V3.2 DeepSeek 1 447 $0.26 / $0.42 164 k
64 DeepSeek V3.2 Exp DeepSeek 1 447 $0.27 / $0.41 164 k
65 Mistral Medium 3.5 Mistral AI 1 446 $1.5 / $7.5 262 k
66 DeepSeek V3.1 Terminus DeepSeek 1 445 $0.3 / $1 164 k
67 GLM 4.6 Z.ai 1 442 $0.43 / $1.75 205 k
68 MiniMax M2.7 MiniMax 1 441 $0.21 / $0.84 205 k
69 Qwen3 VL 235B A22B Instruct Qwen 1 438 $0.21 / $1.9 262 k
70 Kimi K2 0905 Moonshot AI 1 438 $0.6 / $2.5 262 k
71 GLM 4.5 Z.ai 1 433 $0.6 / $2.2 131 k
72 DeepSeek R1 0528 DeepSeek 1 433 $0.5 / $2.15 164 k
73 Qwen3.5-122B-A10B Qwen 1 432 $0.26 / $2.08 262 k
74 Qwen3.5-27B Qwen 1 428 $0.2 / $1.56 262 k
75 Inkling Small Thinking Machines 1 427 $0.45 / $1.2 524 k
76 GPT-5.4 Nano OpenAI 1 421 $0.2 / $1.25 400 k
77 Qwen3 Next 80B A3B Instruct Qwen 1 419 $0.1 / $1.1 262 k
78 Gemini 2.5 Flash Google 1 419 $0.3 / $2.5 1,05 M
79 DeepSeek R1 DeepSeek 1 419 $0.7 / $2.5 64 k
80 MiniMax M2.5 MiniMax 1 417 $0.27 / $1.08 205 k
81 Qwen3 VL 235B A22B Thinking Qwen 1 417 $0.4 / $4 131 k
82 Qwen3 235B A22B Thinking 2507 Qwen 1 417 $0.23 / $2.3 131 k
83 Step 3.5 Flash StepFun 1 413 $0.1 / $0.3 262 k
84 Qwen3.5-35B-A3B Qwen 1 412 $0.15 / $1 262 k
85 Solar Pro 4 Upstage 1 409 $0.09 / $0.36 524 k
86 MiniMax M2.1 MiniMax 1 408 $0.3 / $1.2 205 k
87 Qwen3 30B A3B Instruct 2507 Qwen 1 407 $0.048 / $0.19 262 k
88 GPT-5 Mini OpenAI 1 404 $0.25 / $2 400 k
89 OpenAI o1 OpenAI 1 396 $15 / $60 200 k
90 Qwen3 235B A22B Qwen 1 392 $0.46 / $1.82 131 k
91 GLM 4.5 Air Z.ai 1 391 $0.13 / $0.85 131 k
92 Trinity Large Thinking Arcee AI 1 385 $0.25 / $0.8 262 k
93 GLM 4.6V Z.ai 1 385 $0.3 / $0.9 131 k
94 Qwen3 Next 80B A3B Thinking Qwen 1 385 $0.15 / $1.2 262 k
95 GLM 4.7 Flash Z.ai 1 384 $0.061 / $0.4 200 k
96 MiniMax M1 MiniMax 1 381 $0.55 / $2.2 1 M
97 GLM 4.5V Z.ai 1 374 $0.6 / $1.8 66 k
98 o3 Mini OpenAI 1 371 $1.1 / $4.4 200 k
99 MiniMax M2 MiniMax 1 367 $0.3 / $1.2 205 k
100 Qwen3 32B Qwen 1 367 $0.08 / $0.28 131 k

Score Elo calculé par Arena, d'après les préférences des utilisateurs. Le rang suit le score. La colonne de l'éditeur mène à l'outil qui utilise le modèle. Prix en dollars par million de tokens, en entrée puis en sortie. Cliquez sur un en-tête pour trier, sur une pastille pour changer de classement.

Comment le score est-il calculé ?

Le score est un Elo calculé par Arena. Des personnes comparent à l'aveugle les réponses de deux modèles à une même demande et désignent la meilleure. Chaque duel fait monter le gagnant et descendre le perdant, et battre un adversaire fort rapporte davantage.

Le rang suit le score. Chaque classement (général, par modalité, par tâche) a ses propres scores et ses propres rangs, et un modèle qui n'a pas été évalué dans un classement n'y figure pas. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.