Ollama change ses tarifs cloud : ce que vos 20 dollars paient vraiment

septembre 8, 2026
- Jérôme HENRY
Ollama change ses tarifs cloud : ce que vos 20 dollars paient vraiment

Dixie Consulting — Informations vérifiées le 8 septembre 2026.

Un abonnement à 20 dollars qui inclut 60 dollars d’utilisation : la nouvelle offre cloud d’Ollama semble généreuse. Mais sa valeur dépend du modèle choisi, du volume de texte traité et, parfois, de l’heure à laquelle vous travaillez. Pour un indépendant ou une PME, comprendre ce compteur devient essentiel.

Le 31 août 2026, Ollama a annoncé une nouvelle tarification cloud au token, accompagnée d’une enveloppe mensuelle de crédits. L’entreprise abandonne, pour ces nouvelles offres, le calcul fondé sur le temps GPU et les limites par session ou par semaine. Les anciens abonnés peuvent toutefois conserver leur formule. Annonce officielle d’Ollama.

20 dollars d’abonnement, 60 dollars de consommation

Les nouvelles formules mensuelles se présentent ainsi :

OffreAbonnement mensuel affichéConsommation incluse par mois
Pro20 $60 $
Max100 $300 $
Team500 $1 000 $, partagés entre les utilisateurs

Team est proposé à un tarif de lancement, sans limite de nombre d’utilisateurs. Les crédits inclus sont renouvelés chaque mois ; le reliquat ne se reporte pas. Annonce et conditions des nouvelles offres.

Prenons Pro : vous payez 20 dollars et disposez d’une enveloppe valorisée à 60 dollars selon la grille tarifaire d’Ollama. Ces 60 dollars représentent un droit de consommation du service. Ils ne constituent pas une somme versée sur votre compte bancaire.

Il faut donc distinguer deux compteurs : le montant réellement dépensé et la valeur de l’usage déduit de votre enveloppe.

Si vous consommez toute l’enveloppe Pro, un dollar d’usage au catalogue vous revient à environ 0,33 dollar d’abonnement. Si vous n’en utilisez que 10 dollars, vous aurez quand même payé votre mensualité de 20 dollars. L’intérêt du forfait dépend de son utilisation réelle.

Ce que le compteur mesure

Un token est une unité de texte traitée par le modèle : un mot, un fragment de mot ou un signe peuvent contribuer au décompte. Une question courte et un dossier complet ne mobilisent donc pas le même volume.

Ollama distingue les tokens d’entrée, l’entrée servie depuis le cache lorsqu’elle bénéficie d’un tarif spécifique, et les tokens de sortie. Les prix sont exprimés par million de tokens. Grille tarifaire.

Pour comprendre un coût sans cache, le calcul est simple :

Coût = volume d’entrée × tarif d’entrée + volume de sortie × tarif de sortie.

Les volumes doivent être exprimés en millions de tokens. Il faut additionner tous les appels nécessaires à la tâche, et pas seulement regarder la longueur de la réponse finale.

Imaginons un assistant chargé de corriger un problème sur un site WordPress. Il pourrait lire plusieurs fichiers, proposer une modification, examiner une erreur, puis recommencer. Une seule demande de l’utilisateur peut ainsi déclencher plusieurs échanges avec le modèle. Compter les « questions posées » serait un mauvais indicateur de budget.

Combien de travail peut-on faire avec ces crédits ?

Voici une simulation portant sur un million de tokens d’entrée non mis en cache et 200 000 tokens de sortie facturés, cumulés sur un ensemble de tâches.

Modèle cloudEntrée / millionSortie / millionCoût du volume simulé
DeepSeek V4 Flash, tarif de base0,22 $0,66 $0,352 $
Kimi K33,00 $15,00 $6,00 $

Calculs réalisés à partir des tarifs des fiches DeepSeek V4 Flash et Kimi K3, consultées le 8 septembre 2026.

À volumes identiques, le second scénario consomme environ 17 fois plus de crédits. Une enveloppe de 60 dollars couvrirait théoriquement environ 170 volumes de ce type avec DeepSeek V4 Flash au tarif de base, contre 10 avec Kimi K3.

Ce calcul ne compare ni la qualité des réponses ni le nombre de tâches effectivement terminées. Un modèle peut avoir besoin de davantage de tentatives qu’un autre. Les volumes réels peuvent aussi varier, notamment avec le raisonnement généré. Les chiffres retenus ici représentent la totalité des tokens facturés dans chaque catégorie, pas uniquement le texte visible à l’écran.

Pour une entreprise, le meilleur indicateur sera donc le coût d’un résultat utilisable, après les corrections et les vérifications nécessaires.

Le détail à connaître : les heures de pointe

DeepSeek V4 Flash et Pro ont une tarification de pointe du lundi au vendredi, de 12 h à 18 h UTC. Les tarifs doublent pendant cette plage. En France métropolitaine, cela correspond à 14 h–20 h en heure d’été et 13 h–19 h en heure d’hiver. Tarifs de pointe Ollama.

Notre simulation DeepSeek V4 Flash passe alors de 0,352 à 0,704 dollar. Le volume théorique couvert par 60 dollars est divisé par deux.

Pour une tâche interactive urgente, ce surcoût peut rester acceptable. Pour un traitement différé de centaines de documents, l’horaire d’exécution devient un paramètre du budget.

Une enveloppe mensuelle n’est pas un usage illimité

Une fois les crédits inclus épuisés, l’utilisation peut continuer avec des crédits supplémentaires. Ollama propose également l’achat de crédits sans abonnement via Free. Des limites de requêtes simultanées subsistent : trois pour Pro, dix pour Max et Team. Fonctionnement de la consommation et de la concurrence.

Les 20 dollars ne doivent donc pas être interprétés comme un plafond universel de dépense. Avant de laisser tourner une automatisation, vérifiez le solde supplémentaire et les paramètres de paiement de votre compte.

Pour choisir une formule, partez d’une semaine représentative : quelques synthèses, vos travaux de code habituels, les corrections et les relances. Notez la consommation et les résultats réellement obtenus. Un essai sur vos propres tâches sera plus utile qu’une promesse de nombre de messages.

Déjà abonné ? Vérifiez avant de changer

Selon la FAQ de l’annonce, l’ancienne tarification peut être conservée tant que l’abonnement continue à se renouveler. Changer de formule ou de cycle de facturation, notamment du mensuel à l’annuel, entraîne le passage aux nouvelles conditions. FAQ sur les abonnements existants.

La nouvelle offre améliore la visibilité du coût par appel. Elle ne garantit pas une économie pour chaque profil. Pour un usage intensif, comparez vos habitudes actuelles à leur coût estimé au token avant de migrer.

Le cloud finance le calcul à distance

L’intérêt pratique reste de pouvoir utiliser de grands modèles depuis ses outils habituels, sans disposer d’un ordinateur capable de les faire tourner. Ollama permet de solliciter ses modèles cloud depuis son client ou directement par API. Documentation Ollama Cloud.

L’exécution locale demeure possible et l’usage sur votre propre matériel reste illimité chez Ollama. Vous supportez alors le coût du matériel, de l’électricité et de son exploitation. Offres et usage local.

La distinction concerne également les données : un modèle cloud traite les contenus à distance, même si vous le sollicitez depuis un logiciel installé sur votre PC. Ollama affirme ne pas conserver les prompts et réponses cloud ni les utiliser pour entraîner ses modèles ; des métadonnées d’usage limitées sont collectées. FAQ sur les données.

Le regard Dixie Consulting

Cette évolution rend le budget plus mesurable, à condition de choisir le bon indicateur. Pour une PME, nous privilégierions trois mesures : le coût par tâche terminée, le temps de travail économisé et la qualité après vérification humaine.

Un modèle économique peut suffire pour reformater du texte ou préparer une première synthèse. Une tâche plus exigeante peut justifier un modèle plus coûteux, si les essais montrent qu’il réduit les erreurs ou les reprises. Le choix se fait sur le résultat obtenu.

Vos 20 dollars achètent une enveloppe de calcul à distance. Sa valeur réelle se mesure au travail utile que vous parvenez à en tirer.

Jérôme HENRY

En tant que consultant en transformation digitale chez Dixie Consulting, je suis un expert du service client et un gestionnaire de projets aguerri, plaçant l'intelligence artificielle (IA) au cœur de mes approches. Mon objectif premier est d'assurer la satisfaction des clients en intégrant judicieusement l'IA pour faciliter leur transition digitale. Axé sur les résultats, je m'efforce de relever les défis de la digitalisation des processus en optimisant les performances grâce à l'IA. Chez Dixie Consulting, on accompagne les TPE et PME vers un avenir numérique réussi, propulsé par les avantages de l'IA. Retrouvez-moi sur LinkedIn : https://www.linkedin.com/in/jerome13henry/

Laisser un commentaire