Ollama vient de mettre en avant son partenariat avec NVIDIA autour des modèles d’intelligence artificielle ouverts. Derrière cette annonce se trouve une nouveauté particulièrement intéressante : NVIDIA Nemotron 3.5 Lightning, un modèle conçu pour les agents IA, désormais exploitable localement avec Ollama.
Le 11 août 2026, Ollama a publié sur X un message saluant sa collaboration avec Jensen Huang et les équipes NVIDIA AI pour faciliter le lancement et l’utilisation de modèles ouverts.
Le message peut sembler relativement anodin. Pourtant, il accompagne une évolution beaucoup plus importante : NVIDIA renforce fortement son positionnement dans les modèles IA ouverts et exécutables localement, tandis qu’Ollama devient l’un des moyens les plus simples pour les utiliser sur un PC ou une station de travail.
Au centre de cette annonce se trouve un nouveau modèle : NVIDIA Nemotron 3.5 Lightning.
Nemotron 3.5 Lightning : un modèle conçu pour les agents IA
Nemotron 3.5 Lightning n’a pas été conçu pour être simplement un chatbot supplémentaire.
NVIDIA le destine notamment aux agents IA capables d’exécuter de nombreuses opérations successives : utiliser des outils, analyser des informations, vérifier des résultats, traiter des alertes, répondre à des demandes ou encore intervenir dans des workflows automatisés. Reuters cite par exemple le code review, l’utilisation d’outils, la surveillance d’alertes de sécurité ou le traitement de questions de facturation parmi les usages visés.
Le modèle repose sur une architecture Mixture-of-Experts (MoE). Il compte environ 30 milliards de paramètres au total, mais seule une fraction de ceux-ci est activée pour chaque token généré. Cette approche permet de conserver une capacité importante tout en limitant la puissance de calcul nécessaire lors de l’inférence. La famille Nemotron 3 utilise par ailleurs une architecture hybride associant notamment des mécanismes MoE et Mamba, conçus pour améliorer l’efficacité et la gestion de contextes longs.
C’est un point important pour comprendre le positionnement du modèle.
L’objectif n’est pas uniquement de produire la réponse la plus intelligente possible à une question difficile. Il s’agit aussi de pouvoir exécuter très rapidement un grand nombre de petites tâches, ce qui correspond précisément au fonctionnement des agents IA modernes.
Pourquoi la vitesse devient essentielle pour les agents IA
Un chatbot traditionnel peut générer quelques centaines ou quelques milliers de tokens pour répondre à une question.
Un agent IA peut fonctionner très différemment.
Il peut par exemple :
- analyser une demande ;
- rechercher un fichier ;
- lire son contenu ;
- appeler une API ;
- vérifier le résultat ;
- modifier un document ou du code ;
- relancer un test ;
- analyser l’erreur ;
- corriger sa première tentative.
Une seule demande utilisateur peut donc provoquer des dizaines, voire des centaines d’appels au modèle.
Dans ce contexte, utiliser systématiquement le modèle le plus puissant disponible devient rapidement coûteux et lent.
C’est précisément le problème que NVIDIA cherche à résoudre avec Nemotron 3.5 Lightning : disposer d’un modèle suffisamment performant pour effectuer les tâches courantes d’un agent, mais surtout très efficace pour enchaîner les opérations. NVIDIA présente cette approche comme particulièrement adaptée aux workflows IA à fort volume.
Ollama rend Nemotron accessible en local
L’intérêt de l’annonce augmente fortement avec l’intégration dans Ollama.
Ollama permet d’exécuter des modèles IA directement sur Windows, Linux ou macOS et propose également des intégrations avec différents outils destinés au développement et aux agents IA. Sa documentation permet notamment de lancer Claude Code, Codex, OpenCode ou OpenClaw en utilisant les modèles configurés dans Ollama.
Le principe reste donc extrêmement simple :
ollama run nemotron-3.5-lightning
Un développeur peut ainsi expérimenter avec Nemotron sans avoir à construire lui-même toute l’infrastructure nécessaire au chargement et à l’exécution du modèle.
Cette simplicité explique en grande partie le succès d’Ollama dans l’écosystème de l’IA locale.
Dixie Consulting évoquait déjà ce phénomène dans notre guide consacré au choix d’une carte graphique pour Ollama : l’arrivée de modèles performants utilisables directement sur des PC équipés d’un GPU récent transforme progressivement l’IA locale en alternative crédible à certains services exclusivement cloud.
IA locale : un intérêt majeur pour les entreprises
L’autre intérêt de cette évolution concerne évidemment les données.
Lorsqu’un modèle fonctionne réellement en local avec Ollama, les prompts et les documents utilisés pour l’inférence n’ont pas besoin d’être envoyés au fournisseur du modèle. Ollama indique explicitement ne pas voir les prompts ni les données lorsque l’exécution est effectuée localement.
Pour une entreprise, cela peut devenir particulièrement intéressant pour traiter :
- du code source ;
- des documents internes ;
- des procédures métier ;
- des données clients ;
- des bases documentaires ;
- des informations commerciales ;
- ou encore certains processus automatisés.
Il faut néanmoins conserver une nuance importante : un agent utilisant un modèle local n’est pas forcément entièrement local.
S’il utilise ensuite Gmail, un CRM, un moteur de recherche ou une API externe, une partie des informations nécessaires à ces opérations peut naturellement être transmise à ces services.
L’IA locale apporte donc davantage de contrôle sur l’inférence, mais elle ne dispense pas d’analyser l’ensemble du workflow et des outils auxquels l’agent a accès.
NVIDIA introduit aussi NeMo Switchyard
L’annonce de Nemotron 3.5 Lightning s’accompagne d’une autre technologie probablement encore plus importante à long terme : NeMo Switchyard.
Switchyard est un système de routage de modèles développé par NVIDIA. Son principe consiste à déterminer automatiquement quel modèle IA doit répondre à une requête selon plusieurs critères comme la complexité, la qualité recherchée, la latence ou le coût. NVIDIA publie le projet dans son écosystème NeMo sous licence Apache 2.0.
Imaginez par exemple un agent chargé d’analyser une centaine de documents.
Les opérations simples pourraient être confiées à un modèle local rapide comme Nemotron Lightning.
Lorsqu’une étape nécessite un raisonnement beaucoup plus complexe, l’agent pourrait temporairement utiliser un modèle plus puissant.
Puis les opérations courantes seraient à nouveau exécutées localement.
Le Wall Street Journal explique que NVIDIA a justement développé cette logique pour éviter d’utiliser systématiquement les modèles les plus coûteux et pour mieux équilibrer qualité, latence et coût.
Cette approche pourrait devenir une composante essentielle des futurs agents IA.
Vers des agents utilisant plusieurs modèles
Pendant les premières années de l’IA générative, les applications étaient généralement conçues autour d’un modèle unique.
ChatGPT utilisait GPT, une application Claude utilisait Claude, et de nombreux outils étaient directement liés au fournisseur de leur modèle.
L’IA agentique pousse progressivement vers une architecture différente.
Un système pourrait utiliser :
- un petit modèle local pour les opérations simples ;
- un modèle spécialisé pour programmer ;
- un autre pour analyser des documents ;
- et un modèle très puissant uniquement lorsqu’un raisonnement complexe est nécessaire.
L’agent devient alors moins dépendant d’un modèle unique et davantage comparable à un orchestrateur de plusieurs intelligences spécialisées.
Cette logique est déjà au cœur de la stratégie Nemotron de NVIDIA, qui positionne ses modèles ouverts comme des composants destinés aux systèmes d’agents et aux environnements multi-agents.
Attention cependant aux benchmarks
NVIDIA annonce naturellement des performances très élevées pour Nemotron 3.5 Lightning.
Mais comme toujours avec un nouveau modèle, il faudra attendre davantage de tests indépendants pour évaluer son comportement dans des situations réelles.
Un modèle capable de générer énormément de tokens par seconde n’est pas nécessairement meilleur sur une tâche complexe.
Pour un agent IA, une erreur peut même coûter cher : un modèle très rapide qui choisit une mauvaise action peut déclencher plusieurs nouvelles opérations pour réparer son erreur.
Il faut donc distinguer :
la vitesse du modèle
et
la capacité de l’agent à terminer correctement une tâche.
C’est probablement sur ce deuxième critère que Nemotron 3.5 Lightning devra être évalué dans les prochains mois.
NVIDIA pousse de plus en plus les modèles ouverts
Cette annonce ne semble d’ailleurs pas isolée.
NVIDIA multiplie depuis plusieurs mois les investissements dans la famille Nemotron et présente désormais les modèles ouverts comme une composante stratégique de son écosystème IA. L’entreprise publie modèles, outils, données et technologies utilisables aussi bien sur des infrastructures cloud que sur des systèmes locaux accélérés par GPU.
Reuters rapporte également que NVIDIA travaille déjà sur la génération suivante, Nemotron 4, qui devrait poursuivre cette stratégie autour des modèles ouverts.
Le rapprochement avec Ollama est donc logique.
NVIDIA fournit les modèles et l’écosystème matériel.
Ollama fournit une couche extrêmement simple pour les télécharger, les lancer et les connecter à des applications.
Une évolution particulièrement intéressante pour les PME
Pour les TPE et PME, cette évolution mérite d’être suivie.
L’IA locale ne remplacera probablement pas totalement les grands services cloud. Les modèles les plus puissants resteront nécessaires pour certaines tâches complexes.
Mais un scénario hybride devient de plus en plus crédible :
IA locale pour les tâches nombreuses, répétitives ou sensibles + IA cloud pour les opérations nécessitant davantage de puissance.
Cette architecture peut potentiellement apporter trois avantages importants aux entreprises :
- davantage de contrôle sur les données ;
- une meilleure maîtrise des coûts liés aux tokens ;
- moins de dépendance envers un fournisseur unique.
Elle pourrait également rendre économiquement viables des agents qui fonctionnent en permanence, puisqu’il ne serait plus nécessaire d’envoyer chaque petite opération vers un modèle cloud haut de gamme.
Conclusion : l’IA locale devient une véritable couche d’exécution
L’arrivée de Nemotron 3.5 Lightning dans Ollama est donc plus intéressante qu’une simple sortie de modèle.
Elle illustre une transformation plus profonde de l’écosystème de l’intelligence artificielle.
Les modèles locaux ne cherchent plus uniquement à reproduire un chatbot comme ChatGPT sur son ordinateur. Ils deviennent progressivement des moteurs spécialisés capables d’alimenter des agents IA, des automatisations et des applications métier.
Avec Nemotron, NVIDIA veut fournir ces moteurs.
Avec Ollama, leur installation devient accessible à beaucoup plus de développeurs et d’entreprises.
Et avec des technologies de routage comme NeMo Switchyard, l’avenir pourrait ne plus être de choisir le meilleur modèle IA, mais de permettre à une application de choisir automatiquement le meilleur modèle pour chaque tâche.
Pour les entreprises qui réfléchissent déjà à l’automatisation et aux agents IA, c’est probablement cette évolution qu’il faudra surveiller de près.