gpt-oss-120b est un modèle ouvert publié par OpenAI le 5 août 2025. Selon OpenAI, il lit et produit uniquement du texte, et il est conçu pour la production, les usages généralistes et les tâches demandant un raisonnement poussé.
À sa sortie, OpenAI publie gpt-oss-120b avec un second modèle ouvert, gpt-oss-20b ; selon OpenAI, gpt-oss-120b demande un seul GPU de 80 Go. Publié le même jour, gpt-oss-20b tourne avec 16 Go de mémoire et vise, selon l’éditeur, une latence plus faible ainsi que les usages locaux ou spécialisés. Selon OpenAI, à sa sortie, gpt-oss-120b atteint une quasi-parité avec OpenAI o4-mini sur les principaux tests de raisonnement, quand gpt-oss-20b donne des résultats proches d’OpenAI o3-mini. Ce second modèle est une autre taille de la gamme, pas une version antérieure.
À quoi sert gpt-oss-120b
Chat
gpt-oss-120b est conçu pour la production, les usages généralistes et les demandes nécessitant un raisonnement poussé, selon OpenAI à sa sortie. Au-delà des réponses conversationnelles, ses capacités natives comprennent l’appel de fonctions, la navigation web et l’exécution de Python. Il peut aussi produire des sorties structurées, c’est-à-dire des réponses organisées dans un format défini.
Suivi de consignes
gpt-oss-120b est conçu pour des flux de travail agentiques, selon OpenAI : des tâches où le modèle mobilise des outils en suivant des consignes. À sa sortie, l’éditeur met en avant son bon suivi des instructions et l’association du raisonnement à l’usage d’outils.
Mathématiques
gpt-oss-120b appartient à une famille qu’OpenAI décrit, à sa sortie, comme particulièrement forte en mathématiques. Selon l’éditeur, cette capacité repose sur l’exploitation de très longues chaînes de raisonnement.
Code
gpt-oss-120b peut servir aux tâches de programmation et à l’usage d’outils, domaines dans lesquels OpenAI présente la famille gpt-oss comme particulièrement performante à sa sortie. Pour Python, l’éditeur décrit la capacité d’exécuter du code dans un notebook Jupyter, un environnement de travail organisé en cellules.
Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.
Les performances de gpt-oss-120b
gpt-oss-120b dépasse, selon OpenAI à sa sortie, OpenAI o3-mini et égale ou dépasse OpenAI o4-mini en programmation de compétition (Codeforces), en résolution de problèmes générale (MMLU et HLE) et en appel d’outils (TauBench). Le tableau rassemble les scores annoncés dans la carte du modèle d’OpenAI au niveau de réflexion high, avec la distinction entre évaluations avec et sans outils lorsqu’elle est indiquée.
Évaluation
Domaine
Score annoncé au niveau de réflexion high
AIME 2025 avec outils
Raisonnement
97,9 %
AIME 2025 sans outils
Raisonnement
92,5 %
GPQA Diamond sans outils
Raisonnement et connaissances
80,1 %
SWE-Bench Verified
Code
62,4 %
Tau-Bench Retail
Appel de fonctions
67,8 %
Bien utiliser gpt-oss-120b : réflexion et effort
gpt-oss-120b permet de régler l’effort de réflexion selon le cas d’usage et la latence souhaitée, selon OpenAI.
Fixer l’effort dans le prompt système : selon OpenAI, tu choisis parmi trois niveaux : low, medium et high. Pour le dialogue courant, low privilégie des réponses rapides, tandis que medium équilibre vitesse et détail. Avec high, le modèle produit une analyse approfondie. Tu fixes ce niveau dans le prompt système, c’est-à-dire l’instruction qui encadre la conversation, avec une indication comme « Reasoning: high ».
Arbitrer entre précision, latence et coût : selon OpenAI, un raisonnement plus long améliore la précision, mais augmente nettement le délai de réponse et le coût. L’entreprise recommande de choisir la taille du modèle et l’effort de réflexion selon ce compromis. Sur OpenRouter, medium est le réglage par défaut. La réflexion y est obligatoire : le choix porte sur son niveau d’effort, pas sur sa désactivation.
Respecter le format et gérer les traces : selon OpenAI, le modèle doit être utilisé avec harmony, son format de réponse d’entraînement, sans lequel il ne fonctionne pas correctement. Sa chaîne de raisonnement complète est accessible pour le débogage, mais n’est pas destinée aux utilisateurs finaux. Dans une conversation à plusieurs tours, OpenAI demande de retirer les traces de raisonnement des réponses précédentes.
Caractéristiques techniques de gpt-oss-120b
gpt-oss-120b est sorti le 5 août 2025. Le tableau des caractéristiques donne la liste complète.
Selon la documentation d’OpenAI, sa fenêtre de contexte atteint 131 072 tokens, les unités de texte traitées par le modèle. Pour la sortie maximale, OpenAI indique également 131 072 tokens par réponse, tandis qu’OpenRouter fixe cette limite à 117 964 tokens. Le modèle lit et produit uniquement du texte, selon la documentation d’OpenAI.
Selon OpenAI, son architecture à mélange d’experts (MoE) compte 117 milliards de paramètres, dont 5,1 milliards actifs par token : tous les paramètres ne participent pas au traitement de chaque unité de texte. Ses connaissances s’arrêtent en juin 2024. Toujours selon OpenAI, l’entraînement repose sur des données uniquement textuelles, surtout en anglais, centrées sur les sciences, le code et la culture générale. Le modèle est publié sous licence Apache 2.0, selon la carte Hugging Face d’OpenAI.
Éditeur
OpenAI
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
131 k tokens
Réponse maximale (selon OpenRouter)
118 k tokens
Réflexion (selon OpenRouter)
Toujours active
Connaissances jusqu'à (selon OpenRouter)
juin 2024
Tâches
Aide au codeAffaires et financeJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesRédaction créativeSanté et bien-êtreSuivi de consignes
Entrées (selon OpenRouter)
Texte
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
Où utiliser gpt-oss-120b, et comment il se facture
gpt-oss-120b a été publié avec des poids librement téléchargeables sur Hugging Face, selon OpenAI. La carte d’accès donne les derniers prix relevés.
Poids ouverts : à sa sortie, OpenAI distribue les poids avec une quantification native en MXFP4, un format qui réduit la mémoire nécessaire à leur chargement.
Exécution locale avec Ollama : pour du matériel grand public, la carte Hugging Face d’OpenAI renvoie à Ollama. Elle donne la commande ollama pull gpt-oss:120b pour télécharger le modèle, puis ollama run gpt-oss:120b pour le lancer.
Traitement par lot sur OpenRouter : accès au modèle en mode batch, c’est-à-dire par traitement par lot, selon le catalogue d’OpenRouter.
L'API chez des hébergeurs
Servi par d'autres hébergeurs que OpenAI, selon OpenRouter
Chez OpenRouter (relevé du 05/10/2026) : 0,037 $ / M tokens en entrée, 0,17 $ / M tokens en sortie.
Tarification0,037 $ en entrée, 0,17 $ en sortie, par million de tokens
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
gpt-oss-120b parmi les versions de GPT OSS
gpt-oss-120b et sa version sœur gpt-oss-20b sont sortis le même jour, le 5 août 2025, au sein de la famille GPT OSS. La frise des versions situe ces modèles dans leur famille et indique leurs dates de sortie.
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.
Comparaison rapide
Les versions sélectionnées
Repères
gpt-oss-120bVous êtes ici
gpt-oss-20b
Score
1352
1318
Sortie
Contexte
131 k tokens
131 k tokens
Prix d'entrée
0,037 $ / M tokens
0,018 $ / M tokens
Prix de sortie
0,17 $ / M tokens
0,090 $ / M tokens
Entrées
Texte
Texte
Réflexion
Toujours active
Toujours active
Tâches
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes
Ce qui le distingue
gpt-oss-120b est un modèle ouvert publié par OpenAI le 5 août 2025. Selon OpenAI, il lit et produit uniquement du texte, et il est conçu pour la production, les usages généralistes et les tâches demandant un raisonnement poussé.
gpt-oss-20b est un modèle publié par OpenAI le 5 août 2025, qui lit et produit uniquement du texte. Selon OpenAI, il est conçu pour les usages locaux ou spécialisés et les flux de travail agentiques, associant raisonnement et utilisation d’outils.
Les repères sont ceux renseignés dans l'annuaire ; un repère absent de toutes les versions sélectionnées n'est pas affiché. Comparaison complète dans le comparateur
FAQ
C’est quoi GPT oss 120B ?
Selon OpenAI, gpt-oss-120b est un modèle ouvert à mélange d’experts (MoE) de 117 milliards de paramètres. Il active 5,1 milliards de paramètres par token.
Peut-on faire tourner gpt-oss-120b en local ?
Selon OpenAI, gpt-oss-120b tourne sur un seul GPU de 80 Go grâce à la quantification MXFP4. Sa carte Hugging Face donne la commande « ollama run gpt-oss:120b » pour le lancer avec Ollama.
gpt-oss-120b est-il gratuit ?
Selon OpenAI, les poids de gpt-oss-120b sont téléchargeables librement sur Hugging Face. Ils sont distribués sous licence Apache 2.0.
Quelle différence entre gpt-oss-120b et gpt-oss-20b ?
Selon OpenAI, gpt-oss-120b est fait pour la production, les usages généralistes et le raisonnement poussé sur un seul GPU de 80 Go. gpt-oss-20b vise une latence plus faible et les usages locaux ou spécialisés, dans 16 Go de mémoire.
Quand gpt-oss-120b est-il sorti ?
gpt-oss-120b est sorti le 5 août 2025, le même jour que gpt-oss-20b.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.