Revue publiée le Scores mis à jour le
Comparer

NVIDIA : Nemotron 3 Ultra

Nemotron 3 Ultra, publié par NVIDIA, est sorti le 4 juin 2026. Selon NVIDIA, ce modèle de raisonnement et de conversation lit et produit du texte, et il est destiné aux développeurs de systèmes d’agents, de chatbots et de systèmes RAG.

Nemotron 3 Ultra ou Nemotron 3 Super : lequel choisir ?

Nemotron 3 Ultra rejoignait à sa sortie une gamme où NVIDIA proposait déjà Nemotron 3 Super sur OpenRouter. Selon NVIDIA, Ultra compte 550 milliards de paramètres au total, dont 55 milliards actifs. Super compte 120 milliards de paramètres au total, dont 12 milliards actifs, selon NVIDIA. Selon NVIDIA, les deux modèles intègrent des couches de prédiction multi-tokens (MTP), qui accélèrent la génération de texte, et partagent un pré-entraînement en NVFP4.

À quoi sert Nemotron 3 Ultra

Chat

Nemotron 3 Ultra est, selon NVIDIA, un modèle généraliste de raisonnement et de conversation destiné aux développeurs d’agents, de chatbots et de systèmes RAG, qui associent recherche documentaire et génération de réponses. Selon NVIDIA, il est optimisé pour les agents complexes fonctionnant en plusieurs étapes. Sur OpenRouter, le modèle sait appeler des outils et produire des sorties structurées.

Suivi de consignes

Nemotron 3 Ultra convient au suivi de consignes complexes, selon NVIDIA. Selon NVIDIA, il prend aussi en charge le raisonnement sur de longs contextes, notamment lorsque la tâche porte sur de très gros documents.

Code

Nemotron 3 Ultra est optimisé pour le raisonnement de haute précision sur le code, selon NVIDIA. Selon NVIDIA, il convient aussi au raisonnement sur de longs contextes portant sur de très grosses bases de code. Dans un workflow autonome, c’est-à-dire un processus de travail autonome, il gère l’orchestration et les appels de raisonnement complexes liés aux décisions d’architecture pendant de longues sessions de codage, selon NVIDIA.

  • Chat
  • Suivi de consignes
  • Code

Les performances de Nemotron 3 Ultra

Nemotron 3 Ultra atteint, à sa sortie et selon NVIDIA, un débit 5 fois supérieur à celui des autres modèles ouverts de sa catégorie. Selon NVIDIA, à sa sortie, il réduit le coût des tâches agentiques complexes jusqu’à 30 %. Le tableau des évaluations rassemble les scores publiés par NVIDIA sur sa carte Hugging Face, avec les variantes de test associées.

ÉvaluationScore selon la carte Hugging Face de NVIDIA
Terminal Bench 2.156,4
SWE-Bench Verified70,7
TauBench V3, moyenne70,9
LiveCodeBench v689,0
GPQA sans outils87,0
MMLU-Pro86,8
IFBench (prompt loose)81,7
Multi-Challenge63,8
RULER sur 1 million de tokens94,7
MMLU-ProX, moyenne sur dix langues83,0

Bien utiliser Nemotron 3 Ultra : réflexion et effort

Nemotron 3 Ultra produit une trace de raisonnement avant sa réponse finale, selon NVIDIA. Deux réglages distincts portent sur l’activation de cette réflexion et sur son niveau d’effort.

  1. Activer ou couper la réflexion : selon NVIDIA, le paramètre enable_thinking permet d’activer ou de désactiver le mode de réflexion dans le modèle de chat.
  2. Commencer par l’effort moyen : selon NVIDIA, le mode medium_effort utilise nettement moins de tokens de raisonnement, les unités de texte traitées par le modèle, que la réflexion complète. NVIDIA recommande ce mode comme point de départ avant de fixer un budget de tokens.
  3. Distinguer les réglages sur OpenRouter : sur OpenRouter, la réflexion est activée par défaut. Tu peux désactiver la réflexion sur OpenRouter. Les niveaux d’effort proposés sur OpenRouter sont high et medium, avec high comme valeur par défaut sur OpenRouter.

Caractéristiques techniques de Nemotron 3 Ultra

Nemotron 3 Ultra accepte un contexte allant jusqu’à 1 million de tokens selon NVIDIA. Sur OpenRouter, la fenêtre de contexte est plus restreinte que cette capacité annoncée par le constructeur. Le tableau des caractéristiques rassemble la date de sortie et les limites de contexte et de sortie relevées sur OpenRouter. Sur OpenRouter, une réponse peut atteindre 16 384 tokens.

Éditeur
NVIDIA
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
262 k tokens
Réponse maximale (selon OpenRouter)
16 k tokens
Réflexion (selon OpenRouter)
Activée par défaut
Entrées (selon OpenRouter)
Texte
Licence
OpenMDW 1.1
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolsstructured_outputstemperaturetop_preasoningseedstopresponse_formatmax_tokens
Hébergeurs via OpenRouter
BaseTen, DeepInfra, Venice

Où utiliser Nemotron 3 Ultra, et comment il se facture

  • Plateformes à la sortie : Nemotron 3 Ultra est disponible, selon NVIDIA, à sa sortie sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com, sous forme de microservices NVIDIA NIM.
  • Poids ouverts et personnalisation : selon NVIDIA, les modèles Nemotron sont publiés avec leurs poids, leurs jeux de données et leurs protocoles ouverts. Ils peuvent être personnalisés et déployés là où résident les applications et les données.
  • Déploiement sur tes propres serveurs : selon NVIDIA, à sa sortie, le modèle peut être servi avec vLLM, SGLang ou TensorRT-LLM derrière une API compatible avec celle d’OpenAI.

La carte d’accès donne les derniers prix relevés.

L'API chez des hébergeurs

Servi par d'autres hébergeurs que NVIDIA, selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,50 $ / M tokens en entrée, 2,20 $ / M tokens en sortie.

Tarification0,50 $ en entrée, 2,20 $ en sortie, par million de tokens
Hébergé via OpenRouter chezBaseTen, DeepInfra, Venice

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

FAQ

Quand Nemotron 3 Ultra est-il sorti ?

Nemotron 3 Ultra est sorti le 4 juin 2026, selon NVIDIA. Selon NVIDIA, le modèle est publié à poids ouverts.

Nemotron 3 Ultra est-il plus grand que Nemotron 3 Super ?

Nemotron 3 Ultra compte 550 milliards de paramètres au total, dont 55 milliards actifs, selon NVIDIA. Selon NVIDIA, Nemotron 3 Super compte 120 milliards de paramètres au total, dont 12 milliards actifs.

Nemotron 3 Ultra est-il un modèle ouvert ?

Nemotron 3 Ultra est publié à poids ouverts, selon NVIDIA. Selon NVIDIA, sa licence est OpenMDW 1.1.

Quel matériel faut-il pour faire tourner Nemotron 3 Ultra ?

Nemotron 3 Ultra, dans sa version BF16, demande au minimum huit GPU B200 sur un seul nœud, selon NVIDIA. Pour une empreinte plus réduite, NVIDIA renvoie à sa version NVFP4.

Nemotron 3 Ultra comprend-il le français ?

Nemotron 3 Ultra prend en charge le français, selon NVIDIA. Selon NVIDIA, le modèle est publié à poids ouverts sous la licence OpenMDW 1.1.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.