Ollama
Un runtime open source pour lancer des modèles localement ou appeler le cloud avec la même API.
Qu'est-ce que Ollama ?
Ollama installe et exécute des modèles depuis une commande simple, puis expose une API locale sur le port 11434. Les bibliothèques officielles Python et JavaScript facilitent l’intégration. Les modèles cloud utilisent la même famille d’API, ce qui permet de déporter les charges trop grandes pour le matériel local.
Le mode local améliore le contrôle sur les données, mais la confidentialité dépend aussi du modèle, des journaux et des applications connectées. Les performances varient fortement selon la mémoire, la quantification et la taille du contexte. Pour servir plusieurs utilisateurs ou garantir un débit, il faut mesurer l’infrastructure plutôt que supposer qu’un prototype sur portable se comporte comme un service de production.
Pour qui ?
Ollama convient aux développeurs, indépendants et petites équipes qui veulent tester des modèles sur leur propre machine, exposer une API locale ou combiner calcul local et cloud sans changer d’interface.
Ce que Ollama fait vraiment.
Exécution locale
Télécharge et lance des modèles sur la machine sans envoyer chaque requête vers une API externe.
API stable
Expose des points d’accès locaux pour le chat, la génération, les embeddings et la gestion des modèles.
Modèles cloud
Déporte les modèles plus lourds vers Ollama Cloud tout en conservant une interface proche du runtime local.
Import et quantification
Gère plusieurs formats et permet de créer des variantes adaptées aux ressources disponibles.
Avantages
- Installation simple pour tester de nombreux modèles localement
- API locale et cloud utilisables avec un workflow cohérent
- Logiciel MIT et exécution locale illimitée
Inconvénients
- La qualité et la vitesse dépendent directement du matériel et du modèle
- Le cloud ajoute un abonnement et un traitement hors de la machine
- Un prototype local ne garantit pas le débit nécessaire à plusieurs utilisateurs
Combien ça coûte ?
L’exécution locale est gratuite et illimitée sous licence MIT, hors coût du matériel et de l’électricité. Au 18 juillet 2026, Ollama Cloud propose Free à 0$, Pro à 20$ par mois ou 200$ par an, puis Max à 100$ par mois. Les quotas cloud dépendent du temps GPU plutôt que d’un nombre fixe de tokens.
Prix vérifié le 2026-07-18
Notre avis sur Ollama.
Ollama est adapté au prototypage local, aux tests de confidentialité et aux petites API internes. Son cloud élargit les modèles accessibles, mais change le lieu de traitement et le coût. Pour une charge soutenue, compare les mesures réelles avec un moteur d’inférence conçu pour le débit.
Vérifier les informations.
On te répond.
Oui pour le logiciel et l’exécution locale, hors matériel et électricité. Ollama Cloud propose aussi un plan Free, puis Pro à 20$ par mois et Max à 100$ par mois au 18 juillet 2026.
Seulement avec des modèles réellement locaux et des applications configurées pour le point d’accès local. Les modèles Ollama Cloud envoient les requêtes au service distant et nécessitent une authentification.
Tu veux maîtriser Ollama concrètement ?
Le programme LE LABO IA t'accompagne pendant 90 jours pour construire des systèmes IA utiles avec les outils adaptés à ton activité.
Découvrir LE LABO IA