Mise à jour du 11 septembre 2026 — ajout de DeepSeek-V4.1-Flash et de sa nouvelle grille tarifaire.
Avec une IA facturée au token, le volume de texte traité compte. Sur Ollama Cloud, l’heure d’utilisation compte aussi : les modèles DeepSeek bénéficient de tarifs réduits en dehors des heures de pointe.
Depuis le 10 septembre 2026, DeepSeek-V4.1-Flash est également disponible sur Ollama Cloud. Cette nouvelle version est non seulement plus récente que V4 Flash, mais aussi moins chère à utiliser.
Pour un traitement qui peut attendre, décaler son lancement permet donc toujours de consommer moins de crédits — et V4.1 Flash rend cette stratégie encore plus intéressante.
Cette fiche complète notre guide des abonnements et crédits Ollama Cloud, en se concentrant sur la programmation des tâches et le démarrage de DeepSeek.
DeepSeek V4.1 Flash arrive sur Ollama
Ollama propose désormais DeepSeek-V4.1-Flash dans son catalogue Cloud.
Le modèle dispose notamment :
- d’un contexte allant jusqu’à 1 million de tokens ;
- d’entrées texte et image ;
- de capacités d’utilisation d’outils ;
- de fonctions de raisonnement ;
- d’une architecture particulièrement optimisée pour les charges de travail agentiques.
DeepSeek V4.1 Flash cherche notamment à réduire le coût du traitement de contextes importants, un point particulièrement intéressant pour les agents IA qui doivent conserver de nombreux documents, appels d’outils et étapes intermédiaires.
➡️ À lire également : notre présentation complète de DeepSeek V4.1 Flash, de son architecture et de ses nouveautés.
Quels sont les tarifs ?
Les montants ci-dessous s’appliquent à un million de tokens, et non à un million de requêtes.
| Modèle | Période | Entrée | Entrée en cache | Sortie |
|---|---|---|---|---|
| DeepSeek-V4.1-Flash | Heures creuses | 0,15 $ | 0,003 $ | 0,60 $ |
| DeepSeek-V4.1-Flash | Heures de pointe | 0,30 $ | 0,006 $ | 1,20 $ |
| DeepSeek-V4-Flash | Heures creuses | 0,22 $ | 0,007 $ | 0,66 $ |
| DeepSeek-V4-Flash | Heures de pointe | 0,44 $ | 0,014 $ | 1,32 $ |
| DeepSeek-V4-Pro | Heures creuses | 0,66 $ | 0,022 $ | 1,98 $ |
| DeepSeek-V4-Pro | Heures de pointe | 1,32 $ | 0,044 $ | 3,96 $ |
Source : grille tarifaire officielle Ollama, vérifiée le 11 septembre 2026.
L’entrée correspond au contenu fourni au modèle ; la sortie, aux tokens générés et facturés.
Le tarif « entrée en cache » concerne la partie du contexte reconnue comme réutilisable par le service. Pour une première estimation, mieux vaut ne pas supposer que toute l’entrée bénéficiera automatiquement du cache.
V4.1 Flash devient particulièrement compétitif
Le changement est notable.
En heures creuses, un million de tokens d’entrée sans cache coûte :
- V4.1 Flash : 0,15 $ ;
- V4 Flash : 0,22 $ ;
- V4 Pro : 0,66 $.
Sur l’entrée, V4.1 Flash coûte donc environ 32 % de moins que V4 Flash.
L’écart est encore plus important sur les données mises en cache :
- V4.1 Flash : 0,003 $ ;
- V4 Flash : 0,007 $.
Pour les agents IA qui réutilisent régulièrement un contexte important, cette différence peut devenir significative à grande échelle.
À quelles heures lancer ses tâches ?
Le fonctionnement n’a pas changé.
La période de pointe d’Ollama va de :
12 h à 18 h UTC, du lundi au vendredi.
En dehors de cette plage ainsi que pendant le week-end, les tarifs de base s’appliquent.
Pour la France métropolitaine :
| Repère horaire | Pointe du lundi au vendredi | Heures creuses en semaine |
|---|---|---|
| UTC | 12 h–18 h | Avant 12 h et après 18 h |
| Paris, heure d’été (UTC+2) | 14 h–20 h | Avant 14 h et après 20 h |
| Paris, heure d’hiver (UTC+1) | 13 h–19 h | Avant 13 h et après 19 h |
Pour automatiser un traitement, il reste préférable d’utiliser UTC dans le planificateur.
Une heure française fixe peut en effet changer de position par rapport à la période de pointe lors du passage entre heure d’été et heure d’hiver.
Combien peut-on économiser avec V4.1 Flash ?
Reprenons notre exemple initial :
- 2 millions de tokens d’entrée sans cache ;
- 500 000 tokens de sortie.
Avec DeepSeek V4.1 Flash :
En heures de pointe
2 × 0,30 $ + 0,5 × 1,20 $
= 1,20 $
En heures creuses
2 × 0,15 $ + 0,5 × 0,60 $
= 0,60 $
Soit une économie de :
0,60 $ par traitement, soit 50 %.
Comparons les trois modèles :
| Modèle | Pointe | Heures creuses | Économie |
|---|---|---|---|
| V4.1 Flash | 1,20 $ | 0,60 $ | 0,60 $ |
| V4 Flash | 1,54 $ | 0,77 $ | 0,77 $ |
| V4 Pro | 4,62 $ | 2,31 $ | 2,31 $ |
À volume identique, V4.1 Flash devient donc le modèle le moins cher des trois.
Pour 100 traitements identiques :
- V4.1 Flash en pointe : 120 $ ;
- V4.1 Flash en heures creuses : 60 $.
La programmation du traitement permettrait ainsi d’économiser théoriquement 60 $ de crédits.
Il s’agit cependant d’une simulation à volume identique. Elle ne mesure pas la qualité des réponses ni le nombre de tentatives éventuellement nécessaires pour accomplir une tâche.
Comment démarrer DeepSeek V4.1 Flash dans Ollama ?
Ollama Cloud exécute ces grands modèles à distance. Il n’est donc pas nécessaire de disposer localement de l’infrastructure GPU nécessaire pour exécuter le modèle complet.
Après avoir connecté votre compte :
ollama signin
vous pouvez maintenant lancer V4.1 Flash avec :
ollama run deepseek-v4.1-flash:cloud
L’ancien V4 Flash reste accessible avec :
ollama run deepseek-v4-flash:cloud
et V4 Pro avec :
ollama run deepseek-v4-pro:cloud
Le suffixe :cloud indique que le modèle est exécuté sur l’infrastructure Cloud d’Ollama et non intégralement sur votre ordinateur.
V4.1 Flash ou V4 Flash ?
Pour une nouvelle utilisation, V4.1 Flash mérite désormais d’être testé en priorité.
Son intérêt ne repose pas uniquement sur son prix.
Ollama indique notamment :
- un contexte de 1 million de tokens ;
- la prise en charge du texte et des images ;
- les outils ;
- le raisonnement ;
- une architecture optimisée pour les traitements agentiques.
Il est par ailleurs moins cher que V4 Flash sur les trois catégories tarifaires : entrée, entrée mise en cache et sortie.
Cela ne signifie pas pour autant qu’il soit automatiquement meilleur pour toutes les applications.
Avant de modifier un workflow de production, testez les deux modèles sur un échantillon représentatif et comparez :
- la qualité du résultat ;
- le taux d’erreur ;
- le nombre de reprises ;
- la vitesse ;
- la consommation totale de tokens ;
- le coût réel de la tâche terminée.
Le modèle affichant le tarif au token le plus faible n’est pas nécessairement celui qui produit le résultat final au coût le plus faible.
Quelles tâches décaler ?
Les meilleurs candidats restent les traitements dont le résultat n’est pas attendu immédiatement :
- résumé de nombreux documents ;
- analyse de fichiers ;
- traitements par lots ;
- génération de brouillons ;
- traductions ;
- benchmarks de modèles ;
- analyse de bases de code ;
- tâches réalisées par des agents IA ;
- traitements nocturnes automatisés.
Une entreprise peut par exemple programmer ses traitements volumineux après 20 heures en été en France, ou pendant le week-end.
Pour une requête ponctuelle ou une urgence, attendre plusieurs heures uniquement pour économiser quelques centimes n’a évidemment que peu d’intérêt.
Le prix du token ne suffit pas
L’arrivée de DeepSeek V4.1 Flash renforce encore un principe important : le prix affiché au million de tokens ne suffit pas pour mesurer le coût réel d’une IA.
Il faut également prendre en compte :
- le nombre de tokens nécessaires ;
- le contexte réutilisé ;
- les erreurs ;
- les nouvelles tentatives ;
- la vitesse d’exécution ;
- le temps humain nécessaire pour vérifier le résultat.
Cette question devient encore plus importante avec les agents IA, capables d’effectuer plusieurs dizaines d’étapes pour accomplir une seule mission.
Une différence de quelques centimes par million de tokens peut alors finir par représenter une économie significative.
Et la confidentialité ?
Ollama indique appliquer une politique Zero Data Retention à son offre Cloud : les prompts et réponses ne sont pas utilisés pour entraîner les modèles et les fournisseurs d’infrastructure doivent également respecter cette politique.
Ollama indique disposer d’une infrastructure notamment aux États-Unis et en Europe, avec Singapour pour certains modèles.
Cette politique ne doit cependant pas être confondue avec une garantie d’hébergement systématiquement et exclusivement européen.
Pour des données sensibles ou réglementées, une entreprise doit donc toujours vérifier les conditions exactes correspondant à son utilisation.
À retenir
Avec DeepSeek V4.1 Flash, Ollama propose désormais une option encore plus économique pour les traitements intensifs.
Trois éléments sont particulièrement intéressants :
0,15 $ par million de tokens entrants en heures creuses, un contexte pouvant atteindre 1 million de tokens, et toujours une réduction de 50 % en dehors de la période 12 h–18 h UTC du lundi au vendredi.
Pour les tâches différables — analyse documentaire, développement, traitements par lots ou agents IA — programmer les opérations en heures creuses peut donc réellement réduire la consommation de crédits.
Et avec l’arrivée de V4.1 Flash, cette stratégie devient encore plus attractive qu’elle ne l’était quelques jours auparavant.