Nemotron 3.5 Lightning est un modèle de NVIDIA sorti le 11 août 2026. Selon NVIDIA, il lit et produit du texte et est destiné aux développeurs de systèmes d'agents, de chatbots et de systèmes RAG.
Ce que Nemotron 3.5 Lightning change par rapport à Nemotron 3 Nano
Nemotron 3.5 Lightning rejoint, à sa sortie, la famille Nemotron 3 et succède à Nemotron 3 Nano, selon NVIDIA.
Nemotron 3.5 Lightning, dans sa version BF16, obtient 51,56 à SWE-bench Verified contre 34,08 pour Nemotron 3 Nano, et 24,58 à Terminal-Bench 2.1 contre 8,29, selon la carte Hugging Face de NVIDIA. Sur PinchBench, sa version BF16 obtient 85,37 contre 66,11 pour Nemotron 3 Nano, et sur MMLU Pro, 81,94 contre 78,46, selon la carte Hugging Face de NVIDIA.
Nemotron 3.5 Lightning, Nemotron 3 Super ou Nemotron 3 Ultra : lequel choisir ?
Nemotron 3.5 Lightning est, à sa sortie, le plus petit modèle de la famille Nemotron 3, selon NVIDIA. Sur OpenRouter, Nemotron 3 Super et Nemotron 3 Ultra figurent également dans la gamme.
Selon NVIDIA, à sa sortie, Lightning peut exécuter des tâches ciblées en tant que modèle spécialisé plus petit. Pour planifier et orchestrer un flux de travail, NVIDIA décrit à sa sortie le rôle d’un modèle de raisonnement de pointe tel que Nemotron 3 Ultra. Selon NVIDIA, à sa sortie, la prédiction multi-tokens est intégrée à l’entraînement de Lightning, comme pour Nemotron 3 Super et Nemotron 3 Ultra.
À quoi sert Nemotron 3.5 Lightning
Chat
Nemotron 3.5 Lightning est, selon NVIDIA, un modèle généraliste de raisonnement et de conversation destiné aux développeurs de systèmes d’agents, de chatbots et de systèmes RAG, où la génération est augmentée par la recherche d’informations. À sa sortie, selon NVIDIA, il est construit pour la couche d’exécution des agents toujours actifs : appels d’outils, validation de résultats et délégation à des sous-agents. Sur OpenRouter, il prend en charge l’appel d’outils et les sorties structurées.
Suivi de consignes
Nemotron 3.5 Lightning convient aussi aux tâches courantes de suivi de consignes, selon NVIDIA. Pour son affinage, selon NVIDIA, il a été entraîné sur des données couvrant le code, les mathématiques et les sciences, ainsi que l’appel d’outils, le suivi de consignes et la production de sorties structurées.
Code
Nemotron 3.5 Lightning peut, selon NVIDIA à sa sortie, exécuter des tâches ciblées telles que la revue de code, l’utilisation d’outils, la surveillance des alertes de sécurité et la réponse aux questions de facturation. Pour le doter de capacités d’agent de codage, selon NVIDIA à sa sortie, son post-entraînement utilise le jeu de données Nemotron-RL-Agentic-Terminal-Pivot, publié avec le modèle.
Les performances de Nemotron 3.5 Lightning
Nemotron 3.5 Lightning offre, selon NVIDIA à sa sortie, une vitesse de génération jusqu’à 4 fois supérieure à celle d’autres modèles de sa catégorie. Selon NVIDIA, à sa sortie, cette vitesse lui permet d’accomplir les tâches agentiques 30 % plus rapidement que ces modèles. Le tableau rassemble les scores de la version BF16 pour chaque benchmark, tels que NVIDIA les publie sur sa carte Hugging Face.
Évaluation
Score BF16 selon la carte Hugging Face de NVIDIA
MMLU Pro
81,94
GPQA Diamond sans outils
75,44
HLE en texte seul et sans outils
11,72
SWE-bench Verified
51,56
SWE-bench Multilingual
39,33
Terminal-Bench 2.1
24,58
BrowseComp
36,97
Bien utiliser Nemotron 3.5 Lightning : réflexion et échantillonnage
Nemotron 3.5 Lightning active la réflexion par défaut, selon NVIDIA.
Mode de réflexion : selon NVIDIA, le paramètre enable_thinking=True/False active ou coupe la réflexion dans le modèle de chat. Avec enable_thinking=False, le modèle produit des réponses directes, selon NVIDIA.
Échantillonnage : selon NVIDIA, les réglages recommandés sont une température de 1,0 et un top_p de 0,95.
Réflexion sur OpenRouter : sur OpenRouter, la réflexion n’est pas obligatoire et peut être désactivée.
Caractéristiques techniques de Nemotron 3.5 Lightning
Nemotron 3.5 Lightning est sorti le 11 août 2026. Le tableau des caractéristiques rassemble les données techniques du modèle, notamment le contexte, les entrées et la licence.
Selon NVIDIA, le modèle compte 30 milliards de paramètres au total, dont 3 milliards actifs. Son architecture hybride à mélange d’experts alterne des couches Mamba-2 et MoE avec quelques couches d’attention, selon la carte Hugging Face de NVIDIA. Il est publié sous licence OpenMDW 1.1, selon cette carte de NVIDIA. Pour l’usage commercial, NVIDIA le présente comme prêt dans sa carte Hugging Face.
Sur OpenRouter, la fenêtre de contexte atteint 262 144 tokens. Selon la carte Hugging Face de NVIDIA, le modèle accepte un contexte allant jusqu’à 1 million de tokens ; pour un déploiement sur un seul GPU H100, NVIDIA utilise 256K tokens. Il lit et produit du texte, selon NVIDIA. Pour les langues, NVIDIA indique la prise en charge de l’anglais et des langages de programmation, ainsi que de l’espagnol, du français, de l’allemand, de l’italien et du japonais.
Éditeur
NVIDIA
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
262 k tokens
Réponse maximale (selon OpenRouter)
33 k tokens
Réflexion (selon OpenRouter)
Facultative
Entrées (selon OpenRouter)
Texte
Licence
OpenMDW 1.1
Paramètres pris en charge (noms techniques de l'API OpenRouter)
Où utiliser Nemotron 3.5 Lightning, et comment il se facture
Nemotron 3.5 Lightning était disponible à sa sortie sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com sous la forme d’un microservice NVIDIA NIM, selon NVIDIA. La carte d’accès donne les derniers prix relevés.
Poids ouverts : selon NVIDIA, à sa sortie, les poids, les données d’entraînement et les recettes du modèle étaient publiés sous la licence OpenMDW-1.1.
Exécution locale : selon NVIDIA, à sa sortie, le modèle pouvait fonctionner sur des systèmes d’IA locaux, dont les PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson.
Logiciels compatibles : selon NVIDIA, à sa sortie, le modèle s’exécutait avec LM Studio, llama.cpp, Ollama et Unsloth.
L'API chez des hébergeurs
Servi par d'autres hébergeurs que NVIDIA, selon OpenRouter
Chez OpenRouter (relevé du 05/10/2026) : 0,060 $ / M tokens en entrée, 0,16 $ / M tokens en sortie.
Tarification0,060 $ en entrée, 0,16 $ en sortie, par million de tokens
Hébergé via OpenRouter chezCoreWeave, Darkbloom, DeepInfra, Io Net, Phala
Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.
FAQ
Quand Nemotron 3.5 Lightning est-il sorti ?
Nemotron 3.5 Lightning est sorti le 11 août 2026, selon la carte Hugging Face de NVIDIA. À sa sortie, il rejoint la famille Nemotron 3 et succède à Nemotron 3 Nano, selon NVIDIA.
Nemotron 3.5 Lightning est-il un modèle ouvert ?
Nemotron 3.5 Lightning est un modèle ouvert : à sa sortie, ses poids, ses données d’entraînement et ses recettes sont publiés sous la licence OpenMDW-1.1, selon NVIDIA. Selon la carte Hugging Face de NVIDIA, il est prêt pour un usage commercial.
Nemotron 3.5 Lightning peut-il tourner en local ?
Nemotron 3.5 Lightning peut fonctionner en local à sa sortie, notamment sur les PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson, selon NVIDIA. À sa sortie, il s’exécute avec LM Studio, llama.cpp, Ollama et Unsloth, selon NVIDIA.
Quelle est la fenêtre de contexte de Nemotron 3.5 Lightning ?
Nemotron 3.5 Lightning accepte un contexte allant jusqu’à 1 million de tokens, selon NVIDIA. Pour un déploiement sur un seul GPU H100, NVIDIA utilise 256K tokens, selon NVIDIA. Sur OpenRouter, la fenêtre de contexte de Nemotron 3.5 Lightning est de 262 144 tokens.
Testez votre outil avec un prompt
Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.
Prêt à utiliser
1Choisissez un testPrenez le cas qui vous intéresse.
2Copiez le promptIl fonctionne sans modification.
3Collez-le dans votre outilPuis continuez la conversation.
Tester la rédaction
Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.
Rédigez un e-mail professionnel et cordial pour relancer un client qui n'a pas encore répondu à une proposition commerciale envoyée il y a une semaine. Le message doit rester chaleureux, ne pas paraître insistant et se terminer par une question simple pour savoir s'il souhaite poursuivre. Faites une version courte, naturelle et directement envoyable.
Tester l'explication
Voir s'il sait rendre un sujet complexe vraiment compréhensible.
Expliquez-moi ce qu'est l'intelligence artificielle générative comme si je n'y connaissais absolument rien. Utilisez des mots simples, donnez deux exemples du quotidien, évitez le jargon et terminez par trois choses importantes à retenir.
Tester l'organisation
Voir comment il transforme un projet en étapes simples et concrètes.
Je souhaite créer un nouveau site internet pour une petite entreprise. Organisez le projet étape par étape, depuis la définition des besoins jusqu'à la mise en ligne. Pour chaque étape, indiquez ce qu'il faut préparer, la décision principale à prendre et l'erreur la plus fréquente à éviter. Terminez par les trois premières actions à réaliser cette semaine.
Vous pouvez copier ce texte tel quel
Aucune modification nécessaire : copiez, collez et envoyez.
Après la copie
Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.