DeepSeek sur Ollama : utiliser les heures creuses pour réduire ses coûts

septembre 7, 2026
- Jérôme HENRY
DeepSeek sur Ollama : utiliser les heures creuses pour réduire ses coûts

Mise à jour du 11 septembre 2026 — ajout de DeepSeek-V4.1-Flash et de sa nouvelle grille tarifaire.

Avec une IA facturée au token, le volume de texte traité compte. Sur Ollama Cloud, l’heure d’utilisation compte aussi : les modèles DeepSeek bénéficient de tarifs réduits en dehors des heures de pointe.

Depuis le 10 septembre 2026, DeepSeek-V4.1-Flash est également disponible sur Ollama Cloud. Cette nouvelle version est non seulement plus récente que V4 Flash, mais aussi moins chère à utiliser.

Pour un traitement qui peut attendre, décaler son lancement permet donc toujours de consommer moins de crédits — et V4.1 Flash rend cette stratégie encore plus intéressante.

Cette fiche complète notre guide des abonnements et crédits Ollama Cloud, en se concentrant sur la programmation des tâches et le démarrage de DeepSeek.

DeepSeek V4.1 Flash arrive sur Ollama

Ollama propose désormais DeepSeek-V4.1-Flash dans son catalogue Cloud.

Le modèle dispose notamment :

  • d’un contexte allant jusqu’à 1 million de tokens ;
  • d’entrées texte et image ;
  • de capacités d’utilisation d’outils ;
  • de fonctions de raisonnement ;
  • d’une architecture particulièrement optimisée pour les charges de travail agentiques.

DeepSeek V4.1 Flash cherche notamment à réduire le coût du traitement de contextes importants, un point particulièrement intéressant pour les agents IA qui doivent conserver de nombreux documents, appels d’outils et étapes intermédiaires.

➡️ À lire également : notre présentation complète de DeepSeek V4.1 Flash, de son architecture et de ses nouveautés.

Quels sont les tarifs ?

Les montants ci-dessous s’appliquent à un million de tokens, et non à un million de requêtes.

ModèlePériodeEntréeEntrée en cacheSortie
DeepSeek-V4.1-FlashHeures creuses0,15 $0,003 $0,60 $
DeepSeek-V4.1-FlashHeures de pointe0,30 $0,006 $1,20 $
DeepSeek-V4-FlashHeures creuses0,22 $0,007 $0,66 $
DeepSeek-V4-FlashHeures de pointe0,44 $0,014 $1,32 $
DeepSeek-V4-ProHeures creuses0,66 $0,022 $1,98 $
DeepSeek-V4-ProHeures de pointe1,32 $0,044 $3,96 $

Source : grille tarifaire officielle Ollama, vérifiée le 11 septembre 2026.

L’entrée correspond au contenu fourni au modèle ; la sortie, aux tokens générés et facturés.

Le tarif « entrée en cache » concerne la partie du contexte reconnue comme réutilisable par le service. Pour une première estimation, mieux vaut ne pas supposer que toute l’entrée bénéficiera automatiquement du cache.

V4.1 Flash devient particulièrement compétitif

Le changement est notable.

En heures creuses, un million de tokens d’entrée sans cache coûte :

  • V4.1 Flash : 0,15 $ ;
  • V4 Flash : 0,22 $ ;
  • V4 Pro : 0,66 $.

Sur l’entrée, V4.1 Flash coûte donc environ 32 % de moins que V4 Flash.

L’écart est encore plus important sur les données mises en cache :

  • V4.1 Flash : 0,003 $ ;
  • V4 Flash : 0,007 $.

Pour les agents IA qui réutilisent régulièrement un contexte important, cette différence peut devenir significative à grande échelle.

À quelles heures lancer ses tâches ?

Le fonctionnement n’a pas changé.

La période de pointe d’Ollama va de :

12 h à 18 h UTC, du lundi au vendredi.

En dehors de cette plage ainsi que pendant le week-end, les tarifs de base s’appliquent.

Pour la France métropolitaine :

Repère horairePointe du lundi au vendrediHeures creuses en semaine
UTC12 h–18 hAvant 12 h et après 18 h
Paris, heure d’été (UTC+2)14 h–20 hAvant 14 h et après 20 h
Paris, heure d’hiver (UTC+1)13 h–19 hAvant 13 h et après 19 h

Pour automatiser un traitement, il reste préférable d’utiliser UTC dans le planificateur.

Une heure française fixe peut en effet changer de position par rapport à la période de pointe lors du passage entre heure d’été et heure d’hiver.

Combien peut-on économiser avec V4.1 Flash ?

Reprenons notre exemple initial :

  • 2 millions de tokens d’entrée sans cache ;
  • 500 000 tokens de sortie.

Avec DeepSeek V4.1 Flash :

En heures de pointe

2 × 0,30 $ + 0,5 × 1,20 $

= 1,20 $

En heures creuses

2 × 0,15 $ + 0,5 × 0,60 $

= 0,60 $

Soit une économie de :

0,60 $ par traitement, soit 50 %.

Comparons les trois modèles :

ModèlePointeHeures creusesÉconomie
V4.1 Flash1,20 $0,60 $0,60 $
V4 Flash1,54 $0,77 $0,77 $
V4 Pro4,62 $2,31 $2,31 $

À volume identique, V4.1 Flash devient donc le modèle le moins cher des trois.

Pour 100 traitements identiques :

  • V4.1 Flash en pointe : 120 $ ;
  • V4.1 Flash en heures creuses : 60 $.

La programmation du traitement permettrait ainsi d’économiser théoriquement 60 $ de crédits.

Il s’agit cependant d’une simulation à volume identique. Elle ne mesure pas la qualité des réponses ni le nombre de tentatives éventuellement nécessaires pour accomplir une tâche.

Comment démarrer DeepSeek V4.1 Flash dans Ollama ?

Ollama Cloud exécute ces grands modèles à distance. Il n’est donc pas nécessaire de disposer localement de l’infrastructure GPU nécessaire pour exécuter le modèle complet.

Après avoir connecté votre compte :

ollama signin

vous pouvez maintenant lancer V4.1 Flash avec :

ollama run deepseek-v4.1-flash:cloud

L’ancien V4 Flash reste accessible avec :

ollama run deepseek-v4-flash:cloud

et V4 Pro avec :

ollama run deepseek-v4-pro:cloud

Le suffixe :cloud indique que le modèle est exécuté sur l’infrastructure Cloud d’Ollama et non intégralement sur votre ordinateur.

V4.1 Flash ou V4 Flash ?

Pour une nouvelle utilisation, V4.1 Flash mérite désormais d’être testé en priorité.

Son intérêt ne repose pas uniquement sur son prix.

Ollama indique notamment :

  • un contexte de 1 million de tokens ;
  • la prise en charge du texte et des images ;
  • les outils ;
  • le raisonnement ;
  • une architecture optimisée pour les traitements agentiques.

Il est par ailleurs moins cher que V4 Flash sur les trois catégories tarifaires : entrée, entrée mise en cache et sortie.

Cela ne signifie pas pour autant qu’il soit automatiquement meilleur pour toutes les applications.

Avant de modifier un workflow de production, testez les deux modèles sur un échantillon représentatif et comparez :

  • la qualité du résultat ;
  • le taux d’erreur ;
  • le nombre de reprises ;
  • la vitesse ;
  • la consommation totale de tokens ;
  • le coût réel de la tâche terminée.

Le modèle affichant le tarif au token le plus faible n’est pas nécessairement celui qui produit le résultat final au coût le plus faible.

Quelles tâches décaler ?

Les meilleurs candidats restent les traitements dont le résultat n’est pas attendu immédiatement :

  • résumé de nombreux documents ;
  • analyse de fichiers ;
  • traitements par lots ;
  • génération de brouillons ;
  • traductions ;
  • benchmarks de modèles ;
  • analyse de bases de code ;
  • tâches réalisées par des agents IA ;
  • traitements nocturnes automatisés.

Une entreprise peut par exemple programmer ses traitements volumineux après 20 heures en été en France, ou pendant le week-end.

Pour une requête ponctuelle ou une urgence, attendre plusieurs heures uniquement pour économiser quelques centimes n’a évidemment que peu d’intérêt.

Le prix du token ne suffit pas

L’arrivée de DeepSeek V4.1 Flash renforce encore un principe important : le prix affiché au million de tokens ne suffit pas pour mesurer le coût réel d’une IA.

Il faut également prendre en compte :

  • le nombre de tokens nécessaires ;
  • le contexte réutilisé ;
  • les erreurs ;
  • les nouvelles tentatives ;
  • la vitesse d’exécution ;
  • le temps humain nécessaire pour vérifier le résultat.

Cette question devient encore plus importante avec les agents IA, capables d’effectuer plusieurs dizaines d’étapes pour accomplir une seule mission.

Une différence de quelques centimes par million de tokens peut alors finir par représenter une économie significative.

Et la confidentialité ?

Ollama indique appliquer une politique Zero Data Retention à son offre Cloud : les prompts et réponses ne sont pas utilisés pour entraîner les modèles et les fournisseurs d’infrastructure doivent également respecter cette politique.

Ollama indique disposer d’une infrastructure notamment aux États-Unis et en Europe, avec Singapour pour certains modèles.

Cette politique ne doit cependant pas être confondue avec une garantie d’hébergement systématiquement et exclusivement européen.

Pour des données sensibles ou réglementées, une entreprise doit donc toujours vérifier les conditions exactes correspondant à son utilisation.

À retenir

Avec DeepSeek V4.1 Flash, Ollama propose désormais une option encore plus économique pour les traitements intensifs.

Trois éléments sont particulièrement intéressants :

0,15 $ par million de tokens entrants en heures creuses, un contexte pouvant atteindre 1 million de tokens, et toujours une réduction de 50 % en dehors de la période 12 h–18 h UTC du lundi au vendredi.

Pour les tâches différables — analyse documentaire, développement, traitements par lots ou agents IA — programmer les opérations en heures creuses peut donc réellement réduire la consommation de crédits.

Et avec l’arrivée de V4.1 Flash, cette stratégie devient encore plus attractive qu’elle ne l’était quelques jours auparavant.

Jérôme HENRY

En tant que consultant en transformation digitale chez Dixie Consulting, je suis un expert du service client et un gestionnaire de projets aguerri, plaçant l'intelligence artificielle (IA) au cœur de mes approches. Mon objectif premier est d'assurer la satisfaction des clients en intégrant judicieusement l'IA pour faciliter leur transition digitale. Axé sur les résultats, je m'efforce de relever les défis de la digitalisation des processus en optimisant les performances grâce à l'IA. Chez Dixie Consulting, on accompagne les TPE et PME vers un avenir numérique réussi, propulsé par les avantages de l'IA. Retrouvez-moi sur LinkedIn : https://www.linkedin.com/in/jerome13henry/

Laisser un commentaire