Revue publiée le Scores mis à jour le
Comparer

NVIDIA : Nemotron 3.5 Lightning

Récent

Nemotron 3.5 Lightning est un modèle de NVIDIA sorti le 11 août 2026. Selon NVIDIA, il lit et produit du texte et est destiné aux développeurs de systèmes d'agents, de chatbots et de systèmes RAG.

Ce que Nemotron 3.5 Lightning change par rapport à Nemotron 3 Nano

Nemotron 3.5 Lightning rejoint, à sa sortie, la famille Nemotron 3 et succède à Nemotron 3 Nano, selon NVIDIA.

Nemotron 3.5 Lightning, dans sa version BF16, obtient 51,56 à SWE-bench Verified contre 34,08 pour Nemotron 3 Nano, et 24,58 à Terminal-Bench 2.1 contre 8,29, selon la carte Hugging Face de NVIDIA. Sur PinchBench, sa version BF16 obtient 85,37 contre 66,11 pour Nemotron 3 Nano, et sur MMLU Pro, 81,94 contre 78,46, selon la carte Hugging Face de NVIDIA.

Nemotron 3.5 Lightning, Nemotron 3 Super ou Nemotron 3 Ultra : lequel choisir ?

Nemotron 3.5 Lightning est, à sa sortie, le plus petit modèle de la famille Nemotron 3, selon NVIDIA. Sur OpenRouter, Nemotron 3 Super et Nemotron 3 Ultra figurent également dans la gamme.

Selon NVIDIA, à sa sortie, Lightning peut exécuter des tâches ciblées en tant que modèle spécialisé plus petit. Pour planifier et orchestrer un flux de travail, NVIDIA décrit à sa sortie le rôle d’un modèle de raisonnement de pointe tel que Nemotron 3 Ultra. Selon NVIDIA, à sa sortie, la prédiction multi-tokens est intégrée à l’entraînement de Lightning, comme pour Nemotron 3 Super et Nemotron 3 Ultra.

À quoi sert Nemotron 3.5 Lightning

Chat

Nemotron 3.5 Lightning est, selon NVIDIA, un modèle généraliste de raisonnement et de conversation destiné aux développeurs de systèmes d’agents, de chatbots et de systèmes RAG, où la génération est augmentée par la recherche d’informations. À sa sortie, selon NVIDIA, il est construit pour la couche d’exécution des agents toujours actifs : appels d’outils, validation de résultats et délégation à des sous-agents. Sur OpenRouter, il prend en charge l’appel d’outils et les sorties structurées.

Suivi de consignes

Nemotron 3.5 Lightning convient aussi aux tâches courantes de suivi de consignes, selon NVIDIA. Pour son affinage, selon NVIDIA, il a été entraîné sur des données couvrant le code, les mathématiques et les sciences, ainsi que l’appel d’outils, le suivi de consignes et la production de sorties structurées.

Code

Nemotron 3.5 Lightning peut, selon NVIDIA à sa sortie, exécuter des tâches ciblées telles que la revue de code, l’utilisation d’outils, la surveillance des alertes de sécurité et la réponse aux questions de facturation. Pour le doter de capacités d’agent de codage, selon NVIDIA à sa sortie, son post-entraînement utilise le jeu de données Nemotron-RL-Agentic-Terminal-Pivot, publié avec le modèle.

Les performances de Nemotron 3.5 Lightning

Nemotron 3.5 Lightning offre, selon NVIDIA à sa sortie, une vitesse de génération jusqu’à 4 fois supérieure à celle d’autres modèles de sa catégorie. Selon NVIDIA, à sa sortie, cette vitesse lui permet d’accomplir les tâches agentiques 30 % plus rapidement que ces modèles. Le tableau rassemble les scores de la version BF16 pour chaque benchmark, tels que NVIDIA les publie sur sa carte Hugging Face.

ÉvaluationScore BF16 selon la carte Hugging Face de NVIDIA
MMLU Pro81,94
GPQA Diamond sans outils75,44
HLE en texte seul et sans outils11,72
SWE-bench Verified51,56
SWE-bench Multilingual39,33
Terminal-Bench 2.124,58
BrowseComp36,97

Bien utiliser Nemotron 3.5 Lightning : réflexion et échantillonnage

Nemotron 3.5 Lightning active la réflexion par défaut, selon NVIDIA.

  1. Mode de réflexion : selon NVIDIA, le paramètre enable_thinking=True/False active ou coupe la réflexion dans le modèle de chat. Avec enable_thinking=False, le modèle produit des réponses directes, selon NVIDIA.
  2. Échantillonnage : selon NVIDIA, les réglages recommandés sont une température de 1,0 et un top_p de 0,95.
  3. Réflexion sur OpenRouter : sur OpenRouter, la réflexion n’est pas obligatoire et peut être désactivée.

Caractéristiques techniques de Nemotron 3.5 Lightning

Nemotron 3.5 Lightning est sorti le 11 août 2026. Le tableau des caractéristiques rassemble les données techniques du modèle, notamment le contexte, les entrées et la licence.

Selon NVIDIA, le modèle compte 30 milliards de paramètres au total, dont 3 milliards actifs. Son architecture hybride à mélange d’experts alterne des couches Mamba-2 et MoE avec quelques couches d’attention, selon la carte Hugging Face de NVIDIA. Il est publié sous licence OpenMDW 1.1, selon cette carte de NVIDIA. Pour l’usage commercial, NVIDIA le présente comme prêt dans sa carte Hugging Face.

Sur OpenRouter, la fenêtre de contexte atteint 262 144 tokens. Selon la carte Hugging Face de NVIDIA, le modèle accepte un contexte allant jusqu’à 1 million de tokens ; pour un déploiement sur un seul GPU H100, NVIDIA utilise 256K tokens. Il lit et produit du texte, selon NVIDIA. Pour les langues, NVIDIA indique la prise en charge de l’anglais et des langages de programmation, ainsi que de l’espagnol, du français, de l’allemand, de l’italien et du japonais.

Éditeur
NVIDIA
Produit (selon OpenRouter)
Texte
Sortie
Contexte (selon OpenRouter)
262 k tokens
Réponse maximale (selon OpenRouter)
33 k tokens
Réflexion (selon OpenRouter)
Facultative
Entrées (selon OpenRouter)
Texte
Licence
OpenMDW 1.1
Paramètres pris en charge (noms techniques de l'API OpenRouter)
toolsstructured_outputstemperaturetop_preasoningseedstoplogprobsresponse_formatmax_tokens
Hébergeurs via OpenRouter
CoreWeave, Darkbloom, DeepInfra, Io Net, Phala

Où utiliser Nemotron 3.5 Lightning, et comment il se facture

Nemotron 3.5 Lightning était disponible à sa sortie sur Hugging Face, ModelScope, OpenRouter et build.nvidia.com sous la forme d’un microservice NVIDIA NIM, selon NVIDIA. La carte d’accès donne les derniers prix relevés.

  • Poids ouverts : selon NVIDIA, à sa sortie, les poids, les données d’entraînement et les recettes du modèle étaient publiés sous la licence OpenMDW-1.1.
  • Exécution locale : selon NVIDIA, à sa sortie, le modèle pouvait fonctionner sur des systèmes d’IA locaux, dont les PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson.
  • Logiciels compatibles : selon NVIDIA, à sa sortie, le modèle s’exécutait avec LM Studio, llama.cpp, Ollama et Unsloth.

L'API chez des hébergeurs

Servi par d'autres hébergeurs que NVIDIA, selon OpenRouter

Chez OpenRouter (relevé du 05/10/2026) : 0,060 $ / M tokens en entrée, 0,16 $ / M tokens en sortie.

Tarification0,060 $ en entrée, 0,16 $ en sortie, par million de tokens
Hébergé via OpenRouter chezCoreWeave, Darkbloom, DeepInfra, Io Net, Phala

Un accès gratuit dépend toujours de l'outil, de l'offre et de ses limites : nous ne l'attribuons pas au modèle seul.

FAQ

Quand Nemotron 3.5 Lightning est-il sorti ?

Nemotron 3.5 Lightning est sorti le 11 août 2026, selon la carte Hugging Face de NVIDIA. À sa sortie, il rejoint la famille Nemotron 3 et succède à Nemotron 3 Nano, selon NVIDIA.

Nemotron 3.5 Lightning est-il un modèle ouvert ?

Nemotron 3.5 Lightning est un modèle ouvert : à sa sortie, ses poids, ses données d’entraînement et ses recettes sont publiés sous la licence OpenMDW-1.1, selon NVIDIA. Selon la carte Hugging Face de NVIDIA, il est prêt pour un usage commercial.

Nemotron 3.5 Lightning peut-il tourner en local ?

Nemotron 3.5 Lightning peut fonctionner en local à sa sortie, notamment sur les PC NVIDIA RTX, NVIDIA DGX Spark, NVIDIA DGX Station et NVIDIA Jetson, selon NVIDIA. À sa sortie, il s’exécute avec LM Studio, llama.cpp, Ollama et Unsloth, selon NVIDIA.

Quelle est la fenêtre de contexte de Nemotron 3.5 Lightning ?

Nemotron 3.5 Lightning accepte un contexte allant jusqu’à 1 million de tokens, selon NVIDIA. Pour un déploiement sur un seul GPU H100, NVIDIA utilise 256K tokens, selon NVIDIA. Sur OpenRouter, la fenêtre de contexte de Nemotron 3.5 Lightning est de 262 144 tokens.

Testez votre outil avec un prompt

Pas besoin d'écrire un bon prompt vous-même. Choisissez un exemple, copiez-le tel quel, puis collez-le dans votre outil pour voir immédiatement le type de réponse obtenu.

Prêt à utiliser
  1. 1Choisissez un testPrenez le cas qui vous intéresse.
  2. 2Copiez le promptIl fonctionne sans modification.
  3. 3Collez-le dans votre outilPuis continuez la conversation.

Tester la rédaction

Voir comment il rédige un e-mail professionnel à partir d'une situation concrète.

Tester l'explication

Voir s'il sait rendre un sujet complexe vraiment compréhensible.

Tester l'organisation

Voir comment il transforme un projet en étapes simples et concrètes.

Après la copie

Ouvrez votre outil, collez le texte et envoyez. Ensuite, répondez naturellement à l'IA si vous voulez préciser ou modifier le résultat.

Suivez l'IA et les agents IA avec notre newsletter.

Inscrivez-vous pour recevoir les nouveautés, les tendances et des astuces sur l'intelligence artificielle.

En vous abonnant, vous acceptez notre politique de confidentialité et notre politique de cookies.