Revue publiée le Scores mis à jour le
Comparer

OpenAI : gpt-oss-120b

gpt-oss-120b est un modèle ouvert publié par OpenAI le 5 août 2025. Selon OpenAI, il lit et produit uniquement du texte, et il est conçu pour la production, les usages généralistes et les tâches demandant un raisonnement poussé.

gpt-oss-120b ou gpt-oss-20b : lequel choisir ?

À sa sortie, OpenAI publie gpt-oss-120b avec un second modèle ouvert, gpt-oss-20b ; selon OpenAI, gpt-oss-120b demande un seul GPU de 80 Go. Publié le même jour, gpt-oss-20b tourne avec 16 Go de mémoire et vise, selon l’éditeur, une latence plus faible ainsi que les usages locaux ou spécialisés. Selon OpenAI, à sa sortie, gpt-oss-120b atteint une quasi-parité avec OpenAI o4-mini sur les principaux tests de raisonnement, quand gpt-oss-20b donne des résultats proches d’OpenAI o3-mini. Ce second modèle est une autre taille de la gamme, pas une version antérieure.

À quoi sert gpt-oss-120b

Chat

gpt-oss-120b est conçu pour la production, les usages généralistes et les demandes nécessitant un raisonnement poussé, selon OpenAI à sa sortie. Au-delà des réponses conversationnelles, ses capacités natives comprennent l’appel de fonctions, la navigation web et l’exécution de Python. Il peut aussi produire des sorties structurées, c’est-à-dire des réponses organisées dans un format défini.

Suivi de consignes

gpt-oss-120b est conçu pour des flux de travail agentiques, selon OpenAI : des tâches où le modèle mobilise des outils en suivant des consignes. À sa sortie, l’éditeur met en avant son bon suivi des instructions et l’association du raisonnement à l’usage d’outils.

Mathématiques

gpt-oss-120b appartient à une famille qu’OpenAI décrit, à sa sortie, comme particulièrement forte en mathématiques. Selon l’éditeur, cette capacité repose sur l’exploitation de très longues chaînes de raisonnement.

Code

gpt-oss-120b peut servir aux tâches de programmation et à l’usage d’outils, domaines dans lesquels OpenAI présente la famille gpt-oss comme particulièrement performante à sa sortie. Pour Python, l’éditeur décrit la capacité d’exécuter du code dans un notebook Jupyter, un environnement de travail organisé en cellules.

  • Chat1352
  • Suivi de consignes1323
  • Mathématiques1381
  • Code
Comment lire ces scores

Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.

Les performances de gpt-oss-120b

gpt-oss-120b dépasse, selon OpenAI à sa sortie, OpenAI o3-mini et égale ou dépasse OpenAI o4-mini en programmation de compétition (Codeforces), en résolution de problèmes générale (MMLU et HLE) et en appel d’outils (TauBench). Le tableau rassemble les scores annoncés dans la carte du modèle d’OpenAI au niveau de réflexion high, avec la distinction entre évaluations avec et sans outils lorsqu’elle est indiquée.

ÉvaluationDomaineScore annoncé au niveau de réflexion high
AIME 2025 avec outilsRaisonnement97,9 %
AIME 2025 sans outilsRaisonnement92,5 %
GPQA Diamond sans outilsRaisonnement et connaissances80,1 %
SWE-Bench VerifiedCode62,4 %
Tau-Bench RetailAppel de fonctions67,8 %

Bien utiliser gpt-oss-120b : réflexion et effort

gpt-oss-120b permet de régler l’effort de réflexion selon le cas d’usage et la latence souhaitée, selon OpenAI.

  1. Fixer l’effort dans le prompt système : selon OpenAI, tu choisis parmi trois niveaux : low, medium et high. Pour le dialogue courant, low privilégie des réponses rapides, tandis que medium équilibre vitesse et détail. Avec high, le modèle produit une analyse approfondie. Tu fixes ce niveau dans le prompt système, c’est-à-dire l’instruction qui encadre la conversation, avec une indication comme « Reasoning: high ».
  2. Arbitrer entre précision, latence et coût : selon OpenAI, un raisonnement plus long améliore la précision, mais augmente nettement le délai de réponse et le coût. L’entreprise recommande de choisir la taille du modèle et l’effort de réflexion selon ce compromis. Sur OpenRouter, medium est le réglage par défaut. La réflexion y est obligatoire : le choix porte sur son niveau d’effort, pas sur sa désactivation.
  3. Respecter le format et gérer les traces : selon OpenAI, le modèle doit être utilisé avec harmony, son format de réponse d’entraînement, sans lequel il ne fonctionne pas correctement. Sa chaîne de raisonnement complète est accessible pour le débogage, mais n’est pas destinée aux utilisateurs finaux. Dans une conversation à plusieurs tours, OpenAI demande de retirer les traces de raisonnement des réponses précédentes.

Caractéristiques techniques de gpt-oss-120b

gpt-oss-120b est sorti le 5 août 2025. Le tableau des caractéristiques donne la liste complète.

Selon la documentation d’OpenAI, sa fenêtre de contexte atteint 131 072 tokens, les unités de texte traitées par le modèle. Pour la sortie maximale, OpenAI indique également 131 072 tokens par réponse, tandis qu’OpenRouter fixe cette limite à 117 964 tokens. Le modèle lit et produit uniquement du texte, selon la documentation d’OpenAI.

Selon OpenAI, son architecture à mélange d’experts (MoE) compte 117 milliards de paramètres, dont 5,1 milliards actifs par token : tous les paramètres ne participent pas au traitement de chaque unité de texte. Ses connaissances s’arrêtent en juin 2024. Toujours selon OpenAI, l’entraînement repose sur des données uniquement textuelles, surtout en anglais, centrées sur les sciences, le code et la culture générale. Le modèle est publié sous licence Apache 2.0, selon la carte Hugging Face d’OpenAI.

Éditeur
OpenAI
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
131 k tokens
Réponse maximale (selon OpenRouter)
118 k tokens
Réflexion (selon OpenRouter)
Toujours active
Connaissances jusqu'à (selon OpenRouter)
juin 2024
Tâches
Aide au codeAffaires et financeJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesRédaction créativeSanté et bien-êtreSuivi de consignes
Entrées (selon OpenRouter)
Texte
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolsstructured_outputstemperaturetop_preasoningseedstoplogprobsresponse_formatmax_tokens
Hébergeurs via OpenRouter
AkashML, Amazon Bedrock, BaseTen, Cerebras, CoreWeave, Crusoe, DeepInfra, DekaLLM, DigitalOcean, Google, Groq, Mancer 2, Mara, Nebius, Novita, Parasail, Phala, SambaNova, SiliconFlow, Together

Où utiliser gpt-oss-120b, et comment il se facture

gpt-oss-120b a été publié avec des poids librement téléchargeables sur Hugging Face, selon OpenAI. La carte d’accès donne les derniers prix relevés.

  • Poids ouverts : à sa sortie, OpenAI distribue les poids avec une quantification native en MXFP4, un format qui réduit la mémoire nécessaire à leur chargement.
  • Exécution locale avec Ollama : pour du matériel grand public, la carte Hugging Face d’OpenAI renvoie à Ollama. Elle donne la commande ollama pull gpt-oss:120b pour télécharger le modèle, puis ollama run gpt-oss:120b pour le lancer.
  • Traitement par lot sur OpenRouter : accès au modèle en mode batch, c’est-à-dire par traitement par lot, selon le catalogue d’OpenRouter.

L'API chez des hébergeurs

Servi par d'autres hébergeurs que OpenAI, selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,037 $ / M tokens en entrée, 0,17 $ / M tokens en sortie.

Tarification0,037 $ en entrée, 0,17 $ en sortie, par million de tokens
Hébergé via OpenRouter chezAkashML, Amazon Bedrock, BaseTen, Cerebras, CoreWeave, Crusoe, DeepInfra, DekaLLM, DigitalOcean, Google, Groq, Mancer 2, Mara, Nebius, Novita, Parasail, Phala, SambaNova, SiliconFlow, Together

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

gpt-oss-120b parmi les versions de GPT OSS

gpt-oss-120b et sa version sœur gpt-oss-20b sont sortis le même jour, le 5 août 2025, au sein de la famille GPT OSS. La frise des versions situe ces modèles dans leur famille et indique leurs dates de sortie.

1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.

FAQ

C’est quoi GPT oss 120B ?

Selon OpenAI, gpt-oss-120b est un modèle ouvert à mélange d’experts (MoE) de 117 milliards de paramètres. Il active 5,1 milliards de paramètres par token.

Peut-on faire tourner gpt-oss-120b en local ?

Selon OpenAI, gpt-oss-120b tourne sur un seul GPU de 80 Go grâce à la quantification MXFP4. Sa carte Hugging Face donne la commande « ollama run gpt-oss:120b » pour le lancer avec Ollama.

gpt-oss-120b est-il gratuit ?

Selon OpenAI, les poids de gpt-oss-120b sont téléchargeables librement sur Hugging Face. Ils sont distribués sous licence Apache 2.0.

Quelle différence entre gpt-oss-120b et gpt-oss-20b ?

Selon OpenAI, gpt-oss-120b est fait pour la production, les usages généralistes et le raisonnement poussé sur un seul GPU de 80 Go. gpt-oss-20b vise une latence plus faible et les usages locaux ou spécialisés, dans 16 Go de mémoire.

Quand gpt-oss-120b est-il sorti ?

gpt-oss-120b est sorti le 5 août 2025, le même jour que gpt-oss-20b.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.