Nvidia accélère dans l’IA à poids ouverts avec Nemotron 3.5 Lightning, un modèle pensé pour les agents autonomes et les tâches spécialisées à haut volume. Le groupe revendique une architecture plus légère à exécuter, capable de mobiliser seulement une partie de ses paramètres à chaque calcul. L’objectif est clair : réduire le coût des agents IA sans abandonner la personnalisation en entreprise.
Nvidia mise sur un modèle IA plus léger à exécuter
Cette annonce prolonge la stratégie déjà visible lorsque Nvidia a présenté ses agents IA pour concevoir les puces de demain. Selon le Wall Street Journal, Nemotron 3.5 Lightning est un nouveau modèle ouvert conçu pour offrir de bonnes performances dans un format plus compact.
Le modèle repose sur une logique de Mixture-of-Experts. L’idée consiste à ne pas mobiliser toute la capacité du système pour chaque requête. Une partie seulement du modèle est activée selon la tâche demandée, ce qui peut améliorer le débit et réduire le coût d’inférence.
Nvidia présente cette approche comme particulièrement adaptée aux systèmes d’agents. Ces architectures exécutent de nombreuses opérations successives : appeler un outil, vérifier une réponse, classer une information, décider d’une action ou transmettre une tâche à un autre composant. Dans ce contexte, utiliser systématiquement un modèle très lourd peut devenir coûteux.
L’IA à poids ouverts devient une priorité stratégique
Nemotron 3.5 Lightning s’inscrit dans la poussée de Jensen Huang en faveur de modèles plus ouverts et plus personnalisables. Nvidia publie des ressources permettant aux entreprises d’adapter ses modèles à leurs propres données, outils et processus.
Cette approche ne signifie pas que tout devient libre de contraintes. Un modèle à poids ouverts peut rester lié à des licences, à des outils d’entreprise et à une infrastructure matérielle spécifique. Mais il donne davantage de contrôle aux organisations qui ne veulent pas dépendre uniquement d’une API fermée.
Le calcul économique reste évident pour Nvidia. Plus les entreprises déploient d’agents IA personnalisés, plus elles ont besoin de GPU, de logiciels de déploiement et d’outils de suivi. Les modèles ouverts ne menacent donc pas forcément son activité. Ils peuvent au contraire élargir l’usage de son écosystème.
NeMo Switchyard veut choisir automatiquement le bon modèle
Nvidia accompagne cette stratégie avec NeMo Switchyard. La documentation de NeMo Platform décrit Switchyard comme une brique de routage permettant d’envoyer une requête vers un modèle fort ou plus léger selon le compromis recherché entre qualité, coût et latence.
Cette logique devient importante avec la multiplication des modèles. Une tâche simple peut être traitée par un modèle plus rapide et moins coûteux. Un problème complexe peut être envoyé vers un modèle plus puissant. L’application ne dépend alors plus d’un seul système pour toutes ses décisions.
Ce routage automatique répond aussi à une question de souveraineté des données. Certaines entreprises veulent éviter d’envoyer systématiquement leurs informations sensibles vers des fournisseurs tiers. Des modèles adaptables et des outils de routage peuvent leur permettre de garder davantage de contrôle sur leur architecture IA.
Nvidia veut devenir le fournisseur des briques d’agents
Le lancement de Nemotron 3.5 Lightning dépasse donc le simple ajout d’un modèle à un catalogue. Nvidia cherche à construire une pile complète pour les agents : modèles, optimisation, routage, déploiement, sécurité et matériel.
Cette bataille rejoint celle menée par d’autres fournisseurs autour des agents autonomes. Anthropic cherche aussi à réduire les coûts et améliorer l’autonomie de ses modèles, comme le montrait récemment l’annonce autour de Claude Opus 5.
L’enjeu se déplace donc de la taille brute des modèles vers leur efficacité opérationnelle. Une entreprise n’a pas seulement besoin du modèle le plus puissant. Elle a besoin du bon modèle au bon moment, capable d’exécuter des milliers de petites décisions sans faire exploser la facture.
Ce mouvement concerne aussi la crypto, où les agents commencent à payer, commander et interagir avec des services numériques. Le développement de paiements automatisés sur Base montre pourquoi des agents moins coûteux et plus rapides peuvent devenir une infrastructure économique à part entière.
En bref
Nvidia lance Nemotron 3.5 Lightning pour les agents IA spécialisés.
Le modèle mise sur une exécution plus légère grâce à une architecture Mixture-of-Experts.
NeMo Switchyard doit aider les entreprises à choisir automatiquement le bon modèle.
