Les meilleurs modèles d'IA pour les jeux
Jeux : la capacité du modèle à créer un jeu jouable dans le navigateur (règles, mécaniques, réactivité). Réussir, c'est un jeu qui fonctionne et que l'on a envie de rejouer. Score Elo calculé par Arena. Comment ça marche ?
| Éditeur | |||||
|---|---|---|---|---|---|
| 22 | Gemini 3.8 Flash Sa place en Jeux | 1 634 | $0.75 / $3.75 | 1,05 M | |
| 1 | Claude Opus 5.5 | 1 927 | $4 / $20 | 1 M | |
| 2 | GPT-6 Astra | 1 869 | $10 / $50 | 1,05 M | |
| 3 | Claude Fable 5.1 | 1 868 | $10 / $50 | 1 M | |
| 4 | GPT-6.1 Sol | 1 853 | $2 / $10 | 1,05 M | |
| 5 | Claude Sonnet 5.5 | 1 833 | $2 / $10 | 1 M | |
| 6 | GPT-6 Sol | 1 770 | $2 / $10 | 1,05 M | |
| 7 | Claude Opus 5 | 1 770 | $5 / $25 | 1 M | |
| 8 | Qwen3.8 Max (0902) | 1 730 | $2 / $6 | 1 M | |
| 9 | Muse Spark 1.3 | 1 727 | $1.25 / $4.25 | 1,05 M | |
| 10 | Kimi K3 | 1 707 | $1.29 / $14 | 1,05 M | |
| 11 | Hy4 preview | 1 701 | $0.75 / $2.25 | 1,05 M | |
| 12 | Claude Fable 5 | 1 698 | $10 / $50 | 1 M | |
| 13 | Grok 4.7 | 1 688 | $2 / $6 | 500 k | |
| 14 | MiMo-V2.6-Pro | 1 682 | $0.44 / $0.87 | 1,05 M | |
| 15 | Grok 4.6 | 1 673 | $2 / $6 | 500 k | |
| 16 | GPT-5.6 Sol | 1 673 | $2 / $10 | 1,05 M | |
| 17 | GLM 5.3 | 1 672 | $0.06 / $7 | 1,05 M | |
| 18 | DeepSeek V4.1 Flash | 1 668 | $0.3 / $1.2 | 1,05 M | |
| 19 | GLM 5.3 Flash | 1 667 | $0.15 / $0.5 | 1,05 M | |
| 20 | GLM 5.2 | 1 645 | $0.032 / $12 | 1,05 M | |
| 21 | Gemini 3.7 Flash | 1 638 | $0.75 / $3.75 | 1,05 M | |
| 22 | Gemini 3.8 Flash | 1 634 | $0.75 / $3.75 | 1,05 M | |
| 23 | Qwen3.8 27B | 1 628 | $0.43 / $2.55 | 1 M | |
| 24 | GPT-6 Luna | 1 618 | $0.1 / $0.5 | 1,05 M | |
| 25 | Claude Opus 4.8 | 1 607 | $5 / $25 | 1 M | |
| 26 | DeepSeek V4 Flash 0423 | 1 602 | $0.03 / $1.28 | 1,05 M | |
| 27 | Claude Opus 4.7 | 1 590 | $5 / $25 | 1 M | |
| 28 | Grok 4.5 | 1 587 | $2 / $6 | 500 k | |
| 29 | Claude Opus 4.6 | 1 584 | $5 / $25 | 1 M | |
| 30 | Claude Sonnet 5 | 1 577 | $2 / $10 | 1 M | |
| 31 | Muse Spark 1.2 | 1 561 | $1.25 / $4.25 | 1,05 M | |
| 32 | GPT-5.5 | 1 558 | $5 / $30 | 1,05 M | |
| 33 | Gemini 3.6 Flash | 1 549 | $0.75 / $3.75 | 1,05 M | |
| 34 | GPT-5.6 Terra | 1 547 | $2 / $12 | 1,05 M | |
| 35 | Muse Spark 1.1 | 1 543 | $1.25 / $4.25 | 1,05 M | |
| 36 | Claude Sonnet 4.6 | 1 540 | $3 / $15 | 1 M | |
| 37 | Tencent Hy3 | 1 538 | $0.083 / $0.33 | 262 k | |
| 38 | GLM 5.1 | 1 538 | $1.4 / $4.4 | 205 k | |
| 39 | Gemini 3.5 Flash | 1 527 | $1.5 / $9 | 1,05 M | |
| 40 | GPT-5.6 Luna | 1 522 | $0.2 / $1.2 | 1,05 M | |
| 41 | Qwen3.6 Max Preview | 1 512 | $1.03 / $6.16 | 262 k | |
| 42 | GPT-5.4 | 1 509 | $2.5 / $15 | 1,05 M | |
| 43 | Kimi K2.6 | 1 498 | $0.95 / $4 | 262 k | |
| 44 | MiMo-V2.5-Pro | 1 497 | $0.44 / $0.87 | 1,05 M | |
| 45 | Kimi K2.7 Code | 1 478 | $0.67 / $3.35 | 262 k | |
| 46 | MiniMax M3 | 1 472 | $0.3 / $1.2 | 1,05 M | |
| 47 | DeepSeek V4 Pro Preview | 1 472 | $0.21 / $0.42 | 1,05 M | |
| 48 | Qwen3.6 Plus | 1 468 | $0.33 / $1.95 | 1 M | |
| 49 | Gemini 3.1 Pro Preview | 1 468 | $2 / $12 | 1,05 M | |
| 50 | GPT-5.3-Codex | 1 450 | $1.75 / $14 | 400 k | |
| 51 | GLM 5 | 1 435 | $0.6 / $1.92 | 205 k | |
| 52 | MiMo-V2.5 | 1 434 | $0.14 / $0.28 | 1,05 M | |
| 53 | GPT-5.2 | 1 432 | $1.75 / $14 | 400 k | |
| 54 | GPT-5 | 1 429 | $1.25 / $10 | 400 k | |
| 55 | Kimi K2.5 | 1 427 | $0.45 / $2.25 | 262 k | |
| 56 | GLM 4.7 | 1 424 | $0.6 / $2.2 | 205 k | |
| 57 | GPT-5.4 Mini | 1 420 | $0.75 / $4.5 | 400 k | |
| 58 | GLM 5V Turbo | 1 411 | $1.2 / $4 | 203 k | |
| 59 | GPT-5.1 | 1 403 | $1.25 / $10 | 400 k | |
| 60 | Qwen3.5 397B A17B | 1 401 | $0.55 / $3.5 | 262 k | |
| 61 | Thinking Machines Inkling | 1 390 | $0.95 / $4.05 | 524 k | |
| 62 | MiniMax M2.7 | 1 383 | $0.21 / $0.84 | 205 k | |
| 63 | Inkling Small | 1 382 | $0.45 / $1.2 | 524 k | |
| 64 | MiniMax M2.5 | 1 381 | $0.27 / $1.08 | 205 k | |
| 65 | Solar Pro 4 | 1 378 | $0.09 / $0.36 | 524 k | |
| 66 | MiniMax M2.1 | 1 368 | $0.3 / $1.2 | 205 k | |
| 67 | Grok 4.3 | 1 355 | $1.25 / $2.5 | 1 M | |
| 68 | Qwen3.5-122B-A10B | 1 351 | $0.26 / $2.08 | 262 k | |
| 69 | Qwen3.5-27B | 1 348 | $0.2 / $1.56 | 262 k | |
| 70 | DeepSeek V3.2 | 1 345 | $0.26 / $0.42 | 164 k | |
| 71 | GPT-5.1-Codex | 1 333 | $1.25 / $10 | 400 k | |
| 72 | GLM 4.6 | 1 331 | $0.43 / $1.75 | 205 k | |
| 73 | GPT-5.2-Codex | 1 329 | $1.75 / $14 | 400 k | |
| 74 | DeepSeek V3.2 Exp | 1 279 | $0.27 / $0.41 | 164 k | |
| 75 | MiniMax M2 | 1 277 | $0.3 / $1.2 | 205 k | |
| 76 | Trinity Large Thinking | 1 253 | $0.25 / $0.8 | 262 k | |
| 77 | Mistral Medium 3.5 | 1 249 | $1.5 / $7.5 | 262 k | |
| 78 | Qwen3.5-35B-A3B | 1 246 | $0.15 / $1 | 262 k | |
| 79 | GPT-5.1-Codex-Mini | 1 246 | $0.25 / $2 | 400 k | |
| 80 | Gemini 2.5 Pro | 1 230 | $1.25 / $10 | 1,05 M | |
| 81 | Inception Mercury 2 | 1 198 | $0.25 / $0.75 | 128 k | |
| Gemini 3.5 Flash Lite | $0.3 / $2.5 | 1,05 M |
Aucun modèle ne correspond à votre recherche.
Aucun modèle classé en Code › Jeux pour le moment.
Score Elo calculé par Arena, d'après les préférences des utilisateurs. Le rang suit le score. La colonne de l'éditeur mène à l'outil qui utilise le modèle. Prix en dollars par million de tokens, en entrée puis en sortie. Cliquez sur un en-tête pour trier, sur une pastille pour changer de classement.
Comment le score est-il calculé ?
Le score est un Elo calculé par Arena. Des personnes comparent à l'aveugle les réponses de deux modèles à une même demande et désignent la meilleure. Chaque duel fait monter le gagnant et descendre le perdant, et battre un adversaire fort rapporte davantage.
Le rang suit le score. Chaque classement (général, par modalité, par tâche) a ses propres scores et ses propres rangs, et un modèle qui n'a pas été évalué dans un classement n'y figure pas. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.