Mon idée initiale était d'installer Ollama directement sur le laptop d'un client. Deux semaines plus tard, il fallait comprendre pourquoi ça ne marchait plus sur son poste. Leçon retenue : Ollama doit tourner sur une machine dédiée, avec Docker, et quelqu'un qui surveille. Ce guide est celui que je déploie maintenant dans les PME de la région.
Pourquoi Docker et pas l'installation directe
L'installation directe (curl | sh) fonctionne en deux minutes sur une machine Libre de test. Mais dès qu'il faut mettre à jour, migrer de serveur, ou le sauvegarder, Docker sauve la vie : votre environnement est décrit dans un fichier, reproductible d'une machine à l'autre.
Le fichier docker-compose.yml qui tourne chez nos clients
version: '3.8'
services:
ollama:
image: ollama/ollama:latest
restart: always
ports:
- "11434:11434"
volumes:
- ollama:/root/.ollama
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]
open-webui:
image: ghcr.io/open-webui/open-webui:main
restart: always
ports:
- "3000:8080"
environment:
- OLLAMA_BASE_URL=http://ollama:11434
volumes:
- open-webui:/app/backend/data
depends_on:
- ollama
volumes:
ollama:
open-webui:
Open WebUI est l'interface web qui donne à vos collaborateurs une interface type ChatGPT, en blanc et en français.
Télécharger les modèles
docker-compose exec ollama ollama pull llama3.1
docker-compose exec ollama ollama pull mistral
docker-compose exec ollama ollama pull codellama
Le téléchargement prend 10 à 30 minutes par modèle selon la connexion. Après ça, aucun besoin d'Internet.
Le choix des modèles selon le cas :
- Llama 3.1 70B : généraliste, rédaction, résumé. Ça tourne sur RTX 4090, nécessite 45 Go de RAM.
- Mistral 7B : rapide, adapté à une petite équipe.
- Qwen 2.5 7B : très bon pour le code.
La sécurité non négociable
Ollama ne doit jamais être exposé tel quel. Trois règles absolues :
1. Le port 11434 est réservé à l'interne. ufw allow 11434 n'est pas une bonne idée. Au contraire, laissez-le accessible uniquement depuis le réseau local, voire depuis localhost si Open WebUI est le seul point d'accès.
2. Open WebUI gère l'authentification. Créez des comptes par utilisateur et n'utilisez pas un compte unique partagé. Vous saurez qui interroge le serveur.
3. Nginx en front avec TLS. Le certificat SSL pour Open WebUI, et limitez les IP internes.
Le point probablement le plus négligé : Open WebUI stocke les conversations. Elles sont chiffrées sur le disque, mais si votre serveur est compromis, les conversations sont compromises. La sauvegarde du volume doit être chiffrée.
Intégrer à vos outils
L'API est compatible OpenAI :
curl http://localhost:11434/api/generate -d '{
"model": "llama3.1",
"prompt": "Résume ce texte..."
}'
Connectable à n8n, à votre site web interne, à une application, à Microsoft 365. Si vous avez un serveur n8n, l'intégration prend 30 minutes : un nœud HTTP vers l'API Ollama suffit.
La maintenance que personne n'anticipe
Nous avons typiquement :
- Une mise à jour mensuelle :
docker-compose pull && docker-compose up -d - Le renouvellement des modèles : quand une version plus récente paraît,
ollama pullla remplace - La consommation disque qui monte avec les modèles : vérifier tous les mois
Le point commun de ces missions : Ollama est simple au départ et devient un composant de ton système par la suite. Sans maintenance, il se dégrade. Si vous n'avez pas de ressources en interne, confiez-le plutôt à un prestataire. Notre offre Serveur IA inclut la supervision, les mises à jour et un test de restauration régulier.

