Nemotron 3 Ultra, publié par NVIDIA, est sorti le 4 juin 2026. Selon NVIDIA, ce modèle de raisonnement et de conversation lit et produit du texte, et il est destiné aux développeurs de systèmes d’agents, de chatbots et de systèmes RAG.
Nemotron 3 Ultra ou Nemotron 3 Super : lequel choisir ?
Nemotron 3 Ultra rejoignait à sa sortie une gamme où NVIDIA proposait déjà Nemotron 3 Super sur OpenRouter. Selon NVIDIA, Ultra compte 550 milliards de paramètres au total, dont 55 milliards actifs. Super compte 120 milliards de paramètres au total, dont 12 milliards actifs, selon NVIDIA. Selon NVIDIA, les deux modèles intègrent des couches de prédiction multi-tokens (MTP), qui accélèrent la génération de texte, et partagent un pré-entraînement en NVFP4.
À quoi sert Nemotron 3 Ultra
Chat
Nemotron 3 Ultra est, selon NVIDIA, un modèle généraliste de raisonnement et de conversation destiné aux développeurs d’agents, de chatbots et de systèmes RAG, qui associent recherche documentaire et génération de réponses. Selon NVIDIA, il est optimisé pour les agents complexes fonctionnant en plusieurs étapes. Sur OpenRouter, le modèle sait appeler des outils et produire des sorties structurées.
Suivi de consignes
Nemotron 3 Ultra convient au suivi de consignes complexes, selon NVIDIA. Selon NVIDIA, il prend aussi en charge le raisonnement sur de longs contextes, notamment lorsque la tâche porte sur de très gros documents.
Code
Nemotron 3 Ultra est optimisé pour le raisonnement de haute précision sur le code, selon NVIDIA. Selon NVIDIA, il convient aussi au raisonnement sur de longs contextes portant sur de très grosses bases de code. Dans un workflow autonome, c’est-à-dire un processus de travail autonome, il gère l’orchestration et les appels de raisonnement complexes liés aux décisions d’architecture pendant de longues sessions de codage, selon NVIDIA.
Nemotron 3 Ultra atteint, à sa sortie et selon NVIDIA, un débit 5 fois supérieur à celui des autres modèles ouverts de sa catégorie. Selon NVIDIA, à sa sortie, il réduit le coût des tâches agentiques complexes jusqu’à 30 %. Le tableau des évaluations rassemble les scores publiés par NVIDIA sur sa carte Hugging Face, avec les variantes de test associées.
Évaluation
Score selon la carte Hugging Face de NVIDIA
Terminal Bench 2.1
56,4
SWE-Bench Verified
70,7
TauBench V3, moyenne
70,9
LiveCodeBench v6
89,0
GPQA sans outils
87,0
MMLU-Pro
86,8
IFBench (prompt loose)
81,7
Multi-Challenge
63,8
RULER sur 1 million de tokens
94,7
MMLU-ProX, moyenne sur dix langues
83,0
Bien utiliser Nemotron 3 Ultra : réflexion et effort
Nemotron 3 Ultra produit une trace de raisonnement avant sa réponse finale, selon NVIDIA. Deux réglages distincts portent sur l’activation de cette réflexion et sur son niveau d’effort.
Activer ou couper la réflexion : selon NVIDIA, le paramètre enable_thinking permet d’activer ou de désactiver le mode de réflexion dans le modèle de chat.
Commencer par l’effort moyen : selon NVIDIA, le mode medium_effort utilise nettement moins de tokens de raisonnement, les unités de texte traitées par le modèle, que la réflexion complète. NVIDIA recommande ce mode comme point de départ avant de fixer un budget de tokens.
Distinguer les réglages sur OpenRouter : sur OpenRouter, la réflexion est activée par défaut. Tu peux désactiver la réflexion sur OpenRouter. Les niveaux d’effort proposés sur OpenRouter sont high et medium, avec high comme valeur par défaut sur OpenRouter.
Caractéristiques techniques de Nemotron 3 Ultra
Nemotron 3 Ultra accepte un contexte allant jusqu’à 1 million de tokens selon NVIDIA. Sur OpenRouter, la fenêtre de contexte est plus restreinte que cette capacité annoncée par le constructeur. Le tableau des caractéristiques rassemble la date de sortie et les limites de contexte et de sortie relevées sur OpenRouter. Sur OpenRouter, une réponse peut atteindre 16 384 tokens.
Éditeur
NVIDIA
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
262 k tokens
Réponse maximale (selon OpenRouter)
16 k tokens
Réflexion (selon OpenRouter)
Activée par défaut
Entrées (selon OpenRouter)
Texte
Licence
OpenMDW 1.1
Paramètres pris en charge (noms techniques de l'API OpenRouter)
Où utiliser Nemotron 3 Ultra, et comment il se facture
Plateformes à la sortie : Nemotron 3 Ultra est disponible, selon NVIDIA, à sa sortie sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com, sous forme de microservices NVIDIA NIM.
Poids ouverts et personnalisation : selon NVIDIA, les modèles Nemotron sont publiés avec leurs poids, leurs jeux de données et leurs protocoles ouverts. Ils peuvent être personnalisés et déployés là où résident les applications et les données.
Déploiement sur tes propres serveurs : selon NVIDIA, à sa sortie, le modèle peut être servi avec vLLM, SGLang ou TensorRT-LLM derrière une API compatible avec celle d’OpenAI.
La carte d’accès donne les derniers prix relevés.
L'API chez des hébergeurs
Servi par d'autres hébergeurs que NVIDIA, selon OpenRouter
Chez OpenRouter (relevé du 05/10/2026) : 0,50 $ / M tokens en entrée, 2,20 $ / M tokens en sortie.
Tarification0,50 $ en entrée, 2,20 $ en sortie, par million de tokens
Hébergé via OpenRouter chezBaseTen, DeepInfra, Venice
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
FAQ
Quand Nemotron 3 Ultra est-il sorti ?
Nemotron 3 Ultra est sorti le 4 juin 2026, selon NVIDIA. Selon NVIDIA, le modèle est publié à poids ouverts.
Nemotron 3 Ultra est-il plus grand que Nemotron 3 Super ?
Nemotron 3 Ultra compte 550 milliards de paramètres au total, dont 55 milliards actifs, selon NVIDIA. Selon NVIDIA, Nemotron 3 Super compte 120 milliards de paramètres au total, dont 12 milliards actifs.
Nemotron 3 Ultra est-il un modèle ouvert ?
Nemotron 3 Ultra est publié à poids ouverts, selon NVIDIA. Selon NVIDIA, sa licence est OpenMDW 1.1.
Quel matériel faut-il pour faire tourner Nemotron 3 Ultra ?
Nemotron 3 Ultra, dans sa version BF16, demande au minimum huit GPU B200 sur un seul nœud, selon NVIDIA. Pour une empreinte plus réduite, NVIDIA renvoie à sa version NVFP4.
Nemotron 3 Ultra comprend-il le français ?
Nemotron 3 Ultra prend en charge le français, selon NVIDIA. Selon NVIDIA, le modèle est publié à poids ouverts sous la licence OpenMDW 1.1.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.