Revue publiée le Scores mis à jour le
Comparer

OpenAI : gpt-oss-safeguard-20b

gpt-oss-safeguard-20b est un modèle de raisonnement de sécurité publié par OpenAI le 29 octobre 2025. Selon le rapport technique d’OpenAI, il lit et produit uniquement du texte pour classer des contenus selon une politique fournie par le développeur.

À quoi sert gpt-oss-safeguard-20b

gpt-oss-safeguard-20b est destiné aux cas d’usage de sécurité, selon sa carte Hugging Face publiée par OpenAI. Selon le rapport technique d’OpenAI, le modèle est recommandé pour classer du contenu selon une politique fournie.

Chat

Selon le rapport technique d’OpenAI, gpt-oss-safeguard-20b est un modèle textuel, qu’OpenAI recommande d’utiliser pour classer du contenu selon une politique fournie, et non comme la fonction principale avec laquelle les utilisateurs finaux interagissent. Pour les applications avec lesquelles les utilisateurs finaux interagissent directement, OpenAI juge les modèles gpt-oss d’origine meilleurs. Selon sa carte Hugging Face, OpenAI recommande également ces modèles d’origine pour les applications autres que la sécurité.

Suivi de consignes

Selon OpenAI, à sa sortie, le modèle interprète la politique du développeur au moment de l’inférence, c’est-à-dire lorsqu’il traite le contenu soumis. Selon le guide d’OpenAI et de ROOST, il est conçu pour suivre des politiques écrites explicites. À sa sortie, selon OpenAI, il reçoit ensemble une politique et le contenu à classer, puis produit une conclusion accompagnée de son raisonnement. Selon OpenAI, le développeur décide de l’usage de ces conclusions.

Selon OpenAI, à sa sortie, le modèle peut classer les messages des utilisateurs, les réponses générées et des conversations entières. Pour illustrer les politiques définies par le développeur, OpenAI cite à sa sortie un forum de jeu vidéo qui classe les messages parlant de triche et un site d’avis qui repère les avis semblant faux. Selon OpenAI, à sa sortie, l’étiquetage peut aussi répondre à des besoins autres que la sécurité.

Selon sa carte Hugging Face publiée par OpenAI, le modèle est entraîné et réglé pour le raisonnement de sécurité, notamment le filtrage des entrées et des sorties d’un grand modèle de langage. Selon cette même carte d’OpenAI, les usages comprennent aussi l’étiquetage de contenus en ligne et l’étiquetage hors ligne par les équipes Trust and Safety, chargées de la confiance et de la sécurité.

Selon OpenAI, à sa sortie, cette approche par raisonnement a donné des résultats particulièrement bons face aux risques nouveaux ou changeants, aux domaines très nuancés et au manque d’exemples d’entraînement. OpenAI rapporte aussi, à sa sortie, de bons résultats lorsque la qualité et l’explicabilité des étiquettes comptent davantage que la latence. Selon OpenAI, à sa sortie, cette approche à poids ouverts reprend celle développée en interne dans Safety Reasoner.

Les performances de gpt-oss-safeguard-20b

gpt-oss-safeguard-20b obtient 43,6 % d’exactitude multi-politiques à l’évaluation interne de modération, contre 32,1 % pour gpt-oss-20b et 43,2 % pour gpt-5-thinking, selon le rapport technique d’OpenAI du 29 octobre 2025. Pour cette évaluation, selon le rapport d’OpenAI, une réponse ne compte comme correcte que si le modèle retrouve les étiquettes de référence de toutes les politiques fournies.

Sur le jeu de modération d’OpenAI de 2022, le score F1 atteint 82,9 % pour le modèle safeguard, contre 78,7 % pour gpt-oss-20b, selon le rapport technique d’OpenAI du 29 octobre 2025. Avec ToxicChat, le score F1 est de 79,9 % pour le modèle safeguard, contre 75,9 % pour gpt-oss-20b, selon le même rapport technique d’OpenAI.

Selon OpenAI, à sa sortie, des classifieurs entraînés sur des dizaines de milliers d’exemples étiquetés de qualité peuvent encore mieux classer le contenu que gpt-oss-safeguard raisonnant directement à partir d’une politique. Toujours selon OpenAI, à sa sortie, ce raisonnement peut demander beaucoup de temps et de calcul, ce qui rend difficile son application à tout le contenu d’une plateforme.

Bien utiliser gpt-oss-safeguard-20b : réflexion et effort

gpt-oss-safeguard-20b impose la réflexion sur OpenRouter. Selon la carte Hugging Face d’OpenAI, l’effort se règle sur trois niveaux, low, medium et high, selon le cas d’usage et la latence souhaitée. Selon le guide d’OpenAI et de ROOST, ce réglage se fixe dans le message système, avec medium comme niveau par défaut.

Selon le guide d’OpenAI et de ROOST, un effort plus élevé fait prendre en compte davantage de facteurs et plusieurs sections de la politique. Un effort plus faible donne des réponses plus rapides pour les classements simples, selon ce même guide. Avec des messages de chat, la politique va dans le message système et le contenu à classer dans le message de l’utilisateur, selon le guide d’OpenAI et de ROOST.

Selon la carte Hugging Face d’OpenAI, le modèle a été entraîné sur le format de réponse harmony et doit être utilisé uniquement avec ce format, sans lequel il ne fonctionne pas correctement. Sa chaîne de raisonnement brute est destinée aux développeurs et aux praticiens de la sécurité, et non au grand public ni aux usages hors sécurité, selon la carte Hugging Face d’OpenAI.

Caractéristiques techniques de gpt-oss-safeguard-20b

gpt-oss-safeguard-20b est sorti le 29 octobre 2025. Selon la carte Hugging Face d’OpenAI, ce modèle de raisonnement de sécurité est affiné à partir de gpt-oss-20b. Le tableau des caractéristiques présente ses propriétés techniques.

Selon la carte Hugging Face d’OpenAI, le modèle compte 21 milliards de paramètres, dont 3,6 milliards actifs. Il tient dans un GPU doté de 16 Go de mémoire vidéo, selon la même carte d’OpenAI. Dans cette famille, gpt-oss-safeguard-120b compte 117 milliards de paramètres, dont 5,1 milliards actifs, selon la carte Hugging Face d’OpenAI.

Selon le rapport technique d’OpenAI, à sa sortie, le modèle lit et produit uniquement du texte. Il est personnalisable, expose sa chaîne de raisonnement complète et prend en charge les sorties structurées, c’est-à-dire des réponses conformes à un format défini, selon ce rapport d’OpenAI. À sa sortie, il est publié sous licence permissive Apache 2.0, autorisant son utilisation, sa modification et son déploiement libres, selon OpenAI. Sur OpenRouter, sa fenêtre de contexte est de 131 072 tokens.

Éditeur
OpenAI
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
131 k tokens
Réponse maximale (selon OpenRouter)
66 k tokens
Réflexion (selon OpenRouter)
Toujours active
Entrées (selon OpenRouter)
Texte
Licence
Apache 2.0
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolsstructured_outputstemperaturetop_preasoningseedstopresponse_formatmax_tokens
Hébergeurs via OpenRouter
Groq

Où utiliser gpt-oss-safeguard-20b

gpt-oss-safeguard-20b était téléchargeable sur Hugging Face dès le jour de son annonce, selon OpenAI. À sa sortie, l’éditeur le publiait comme une préversion de recherche en deux tailles, avec gpt-oss-safeguard-120b.

Selon le guide d’OpenAI et de ROOST, le modèle se lance en local avec Ollama, avec la commande « ollama run gpt-oss-safeguard:20b », qui le télécharge et le fait tourner, ou avec LM Studio, où « lms get openai/gpt-oss-safeguard-20b » le télécharge. Pour un déploiement sur serveur, ce même guide d’OpenAI et de ROOST décrit l’utilisation de vLLM ou de Hugging Face Transformers. La carte d’accès donne les derniers prix relevés.

L'API chez des hébergeurs

Servi par d'autres hébergeurs que OpenAI, selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,075 $ / M tokens en entrée, 0,30 $ / M tokens en sortie.

Tarification0,075 $ en entrée, 0,30 $ en sortie, par million de tokens
Hébergé via OpenRouter chezGroq

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

FAQ

Quand gpt-oss-safeguard-20b est-il sorti ?

gpt-oss-safeguard-20b est sorti le 29 octobre 2025. Il est décrit dans le rapport technique d’OpenAI daté du même jour.

Que peut lire gpt-oss-safeguard-20b ?

gpt-oss-safeguard-20b lit uniquement du texte en entrée, selon le rapport technique d’OpenAI du 29 octobre 2025. Il produit également du texte, selon le rapport technique d’OpenAI.

Quelle est la fenêtre de contexte de gpt-oss-safeguard-20b ?

gpt-oss-safeguard-20b possède une fenêtre de contexte exprimée en tokens sur OpenRouter. Elle atteint 131 072 tokens sur OpenRouter.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.