gpt-oss-20b est un modèle publié par OpenAI le 5 août 2025, qui lit et produit uniquement du texte. Selon OpenAI, il est conçu pour les usages locaux ou spécialisés et les flux de travail agentiques, associant raisonnement et utilisation d’outils.
gpt-oss-20b constitue, à sa sortie, l’une des deux tailles de modèles ouverts publiées par OpenAI. Selon l’éditeur, à sa sortie, ses résultats sont proches de ceux d’OpenAI o3-mini sur les tests courants. Pour la production, les usages généralistes et le raisonnement poussé, OpenAI destine gpt-oss-120b à une exécution sur un seul GPU de 80 Go. À leur sortie, ce second modèle atteint, selon l’éditeur, une quasi-parité avec OpenAI o4-mini sur les principaux tests de raisonnement.
À quoi sert gpt-oss-20b
Chat
gpt-oss-20b est conçu pour une latence plus faible et des usages locaux ou spécialisés, selon OpenAI. À sa sortie, l’entreprise le destine notamment aux applications fonctionnant sur l’appareil, sans infrastructure coûteuse. Pour enrichir les échanges, le modèle sait nativement appeler des fonctions, naviguer sur le web et produire des sorties structurées, toujours selon OpenAI.
Suivi de consignes
gpt-oss-20b est conçu pour les flux de travail agentiques, selon OpenAI : des tâches où le modèle suit des consignes et utilise des outils. Dans ces enchaînements, l’entreprise met en avant son bon suivi des instructions et ses capacités de raisonnement. Recherche web et exécution de code font partie des outils qu’il peut mobiliser.
Mathématiques
gpt-oss-20b utilise de longues chaînes de raisonnement pour les problèmes mathématiques, selon OpenAI. Sur AIME, il emploie en moyenne plus de 20 000 tokens par problème, les tokens étant les unités de texte traitées par le modèle. L’entreprise relie la force des modèles gpt-oss en mathématiques à ce raisonnement prolongé.
Code
gpt-oss-20b peut exécuter du code Python dans un notebook Jupyter, selon OpenAI. Dans son évaluation de la famille gpt-oss, l’entreprise met aussi en avant les performances sur les tâches de programmation et d’usage d’outils.
Le score est un Elo calculé par Arena, d'après des duels à l'aveugle : plus il est haut, plus le modèle l'emporte souvent face aux autres. Quand un modèle existe en plusieurs niveaux de réflexion, seul son meilleur score est retenu.
Les performances de gpt-oss-20b
gpt-oss-20b égale ou dépasse OpenAI o3-mini à sa sortie, selon OpenAI, en programmation de compétition (Codeforces), en résolution de problèmes générale (MMLU et HLE) et en appel d’outils (TauBench), malgré sa petite taille. Il le dépasse en mathématiques de compétition. Sur les tâches axées sur les connaissances, comme GPQA, le modèle reste en retrait, ce qu’OpenAI attribue à sa taille. Le tableau rassemble les scores annoncés dans la carte du modèle d’OpenAI au niveau de réflexion high, et non un classement.
Évaluation
Domaine
Score annoncé au niveau de réflexion high
AIME 2025 avec outils
Raisonnement mathématique
98,7 %
AIME 2025 sans outils
Raisonnement mathématique
91,7 %
GPQA Diamond sans outils
Raisonnement et connaissances
71,5 %
SWE-Bench Verified
Code
60,7 %
Tau-Bench Retail
Appel de fonctions
54,8 %
Bien utiliser gpt-oss-20b : réflexion et effort
Fixer l’effort de réflexion : gpt-oss-20b se règle, selon OpenAI, dans le prompt système, l’instruction qui encadre le comportement du modèle, avec une indication comme « Reasoning: high ». Pour le dialogue courant, low privilégie des réponses rapides. Avec medium, le modèle équilibre vitesse et détail ; high donne une analyse approfondie.
Arbitrer entre précision, latence et coût : selon OpenAI, un raisonnement plus long améliore la précision, mais augmente nettement le délai de réponse et le coût. L’entreprise recommande de choisir ensemble la taille du modèle et le niveau de réflexion selon ce compromis.
Tenir compte des paramètres OpenRouter : sur OpenRouter, la réflexion est obligatoire. Les niveaux disponibles sont low, medium et high, avec medium par défaut sur OpenRouter.
Respecter le format harmony : selon OpenAI, le modèle a été entraîné avec le format de réponse harmony et doit être utilisé uniquement avec celui-ci. Sans ce format, il ne fonctionne pas correctement.
Caractéristiques techniques de gpt-oss-20b
gpt-oss-20b est sorti le 5 août 2025. Le tableau des caractéristiques rassemble ses données techniques, notamment la fenêtre de contexte, la sortie maximale et les formats pris en charge.
Selon OpenAI, son architecture à mélange d’experts (MoE) compte 21 milliards de paramètres, dont 3,6 milliards actifs par token, une unité de traitement du texte. Elle comprend 24 couches et 32 experts, dont 4 actifs par token. Avec la quantification MXFP4 des poids du mélange d’experts, le modèle tient dans 16 Go de mémoire, selon la carte Hugging Face d’OpenAI.
Selon la documentation d’OpenAI, sa fenêtre de contexte atteint 131 072 tokens, avec une sortie maximale également fixée à 131 072 tokens par réponse. Sur OpenRouter, la limite de sortie est de 32 768 tokens par réponse. Il lit et produit uniquement du texte, selon la documentation d’OpenAI.
Selon la documentation d’OpenAI, ses connaissances s’arrêtent au 1er juin 2024. Son entraînement repose sur des données surtout en anglais et uniquement textuelles, centrées sur les sciences, le code et la culture générale, selon OpenAI. Il est publié sous licence Apache 2.0, y compris pour un déploiement commercial, selon la carte Hugging Face de l’éditeur.
Éditeur
OpenAI
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
131 k tokens
Réponse maximale (selon OpenRouter)
33 k tokens
Réflexion (selon OpenRouter)
Toujours active
Connaissances jusqu'à (selon OpenRouter)
juin 2024
Tâches
Aide au codeAffaires et financeJuridiqueMathématiquesConversation à plusieurs toursPrompts difficilesRédaction créativeSanté et bien-êtreSuivi de consignes
Entrées (selon OpenRouter)
Texte
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
gpt-oss-20b peut s’exécuter localement à partir de ses poids ouverts, selon OpenAI. Les cartes d’accès donnent les derniers prix relevés.
Poids ouverts : selon OpenAI, les poids sont téléchargeables librement sur Hugging Face et quantifiés nativement en MXFP4, un format de représentation numérique compact.
Exécution avec Ollama : pour le matériel grand public, la carte Hugging Face publiée par OpenAI renvoie à Ollama. Elle donne les commandes « ollama pull gpt-oss:20b » pour récupérer le modèle et « ollama run gpt-oss:20b » pour le lancer.
Exécution locale sous Windows : selon OpenAI, à sa sortie, Microsoft apporte aux appareils Windows des versions optimisées pour le GPU, le processeur graphique. Ces versions destinées à l’inférence locale sont proposées dans Foundry Local et l’AI Toolkit pour VS Code.
Traitement par lot sur OpenRouter : le modèle est répertorié avec un mode de traitement par lot, ou batch, dans le catalogue OpenRouter.
L'API chez des hébergeurs
Servi par d'autres hébergeurs que OpenAI, selon OpenRouter
Chez OpenRouter (relevé du 05/10/2026) : 0,018 $ / M tokens en entrée, 0,090 $ / M tokens en sortie.
Tarification0,018 $ en entrée, 0,090 $ en sortie, par million de tokens
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
gpt-oss-20b parmi les versions de GPT OSS
gpt-oss-20b et sa version sœur gpt-oss-120b sont sortis le même jour, le 5 août 2025, dans la famille GPT OSS. La frise des versions situe ces modèles dans leur famille avec leurs dates de sortie.
1 version sélectionnéeAjoutez 1 ou 2 autres versions pour comparer leurs données.
Comparaison rapide
Les versions sélectionnées
Repères
gpt-oss-20bVous êtes ici
gpt-oss-120b
Score
1318
1352
Sortie
Contexte
131 k tokens
131 k tokens
Prix d'entrée
0,018 $ / M tokens
0,037 $ / M tokens
Prix de sortie
0,090 $ / M tokens
0,17 $ / M tokens
Entrées
Texte
Texte
Réflexion
Toujours active
Toujours active
Tâches
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes
Aide au code, Affaires et finance, Juridique, Mathématiques, Conversation à plusieurs tours, Prompts difficiles, Rédaction créative, Santé et bien-être, Suivi de consignes
Ce qui le distingue
gpt-oss-20b est un modèle publié par OpenAI le 5 août 2025, qui lit et produit uniquement du texte. Selon OpenAI, il est conçu pour les usages locaux ou spécialisés et les flux de travail agentiques, associant raisonnement et utilisation d’outils.
gpt-oss-120b est un modèle ouvert publié par OpenAI le 5 août 2025. Selon OpenAI, il lit et produit uniquement du texte, et il est conçu pour la production, les usages généralistes et les tâches demandant un raisonnement poussé.
Les repères sont ceux renseignés dans l'annuaire ; un repère absent de toutes les versions sélectionnées n'est pas affiché. Comparaison complète dans le comparateur
FAQ
C’est quoi gpt-oss-20b ?
gpt-oss-20b est, selon OpenAI, un modèle ouvert à mélange d’experts (MoE) de 21 milliards de paramètres. Parmi ces paramètres, 3,6 milliards sont actifs par token.
gpt-oss-20b est-il gratuit ?
gpt-oss-20b possède des poids téléchargeables librement sur Hugging Face, selon OpenAI. Ils sont distribués sous licence Apache 2.0.
Quelle différence entre gpt-oss-20b et gpt-oss-120b ?
gpt-oss-20b est conçu, selon OpenAI, pour une latence plus faible et les usages locaux ou spécialisés, dans 16 Go de mémoire. OpenAI destine gpt-oss-120b à la production, aux usages généralistes et au raisonnement poussé sur un seul GPU de 80 Go.
Peut-on faire tourner gpt-oss-20b en local ?
gpt-oss-20b tourne dans 16 Go de mémoire grâce à la quantification MXFP4, selon OpenAI. Pour le lancer avec Ollama, sa carte Hugging Face donne la commande « ollama run gpt-oss:20b ».
Quand gpt-oss-20b est-il sorti ?
gpt-oss-20b est sorti le 5 août 2025. gpt-oss-120b est sorti le même jour.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.