Le blog

Date : 9 septembre 2026
Catégorie : Infrastructure
Déployer Ollama en entreprise : guide pratique 2026

Mon idée initiale était d'installer Ollama directement sur le laptop d'un client. Deux semaines plus tard, il fallait comprendre pourquoi ça ne marchait plus sur son poste. Leçon retenue : Ollama doit tourner sur une machine dédiée, avec Docker, et quelqu'un qui surveille. Ce guide est celui que je déploie maintenant dans les PME de la région.

Pourquoi Docker et pas l'installation directe

L'installation directe (curl | sh) fonctionne en deux minutes sur une machine Libre de test. Mais dès qu'il faut mettre à jour, migrer de serveur, ou le sauvegarder, Docker sauve la vie : votre environnement est décrit dans un fichier, reproductible d'une machine à l'autre.

Le fichier docker-compose.yml qui tourne chez nos clients

version: '3.8'
services:
  ollama:
    image: ollama/ollama:latest
    restart: always
    ports:
      - "11434:11434"
    volumes:
      - ollama:/root/.ollama
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]

  open-webui:
    image: ghcr.io/open-webui/open-webui:main
    restart: always
    ports:
      - "3000:8080"
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
    volumes:
      - open-webui:/app/backend/data
    depends_on:
      - ollama

volumes:
  ollama:
  open-webui:

Open WebUI est l'interface web qui donne à vos collaborateurs une interface type ChatGPT, en blanc et en français.

Télécharger les modèles

docker-compose exec ollama ollama pull llama3.1
docker-compose exec ollama ollama pull mistral
docker-compose exec ollama ollama pull codellama

Le téléchargement prend 10 à 30 minutes par modèle selon la connexion. Après ça, aucun besoin d'Internet.

Le choix des modèles selon le cas :

  • Llama 3.1 70B : généraliste, rédaction, résumé. Ça tourne sur RTX 4090, nécessite 45 Go de RAM.
  • Mistral 7B : rapide, adapté à une petite équipe.
  • Qwen 2.5 7B : très bon pour le code.

La sécurité non négociable

Ollama ne doit jamais être exposé tel quel. Trois règles absolues :

1. Le port 11434 est réservé à l'interne. ufw allow 11434 n'est pas une bonne idée. Au contraire, laissez-le accessible uniquement depuis le réseau local, voire depuis localhost si Open WebUI est le seul point d'accès.

2. Open WebUI gère l'authentification. Créez des comptes par utilisateur et n'utilisez pas un compte unique partagé. Vous saurez qui interroge le serveur.

3. Nginx en front avec TLS. Le certificat SSL pour Open WebUI, et limitez les IP internes.

Le point probablement le plus négligé : Open WebUI stocke les conversations. Elles sont chiffrées sur le disque, mais si votre serveur est compromis, les conversations sont compromises. La sauvegarde du volume doit être chiffrée.

Intégrer à vos outils

L'API est compatible OpenAI :

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.1",
  "prompt": "Résume ce texte..."
}'

Connectable à n8n, à votre site web interne, à une application, à Microsoft 365. Si vous avez un serveur n8n, l'intégration prend 30 minutes : un nœud HTTP vers l'API Ollama suffit.

La maintenance que personne n'anticipe

Nous avons typiquement :

  • Une mise à jour mensuelle : docker-compose pull && docker-compose up -d
  • Le renouvellement des modèles : quand une version plus récente paraît, ollama pull la remplace
  • La consommation disque qui monte avec les modèles : vérifier tous les mois

Le point commun de ces missions : Ollama est simple au départ et devient un composant de ton système par la suite. Sans maintenance, il se dégrade. Si vous n'avez pas de ressources en interne, confiez-le plutôt à un prestataire. Notre offre Serveur IA inclut la supervision, les mises à jour et un test de restauration régulier.

Questions fréquentes

Ollama est-il gratuit pour les entreprises ?

Oui, Ollama est open source et gratuit. Vous payez le serveur et l'électricité. Pas de licence, pas de coût par requête.

Quels modèles fonctionnent avec Ollama ?

Llama 3.1, Mistral 7B, Qwen, CodeLlama, Gemma, et plus de 100 modèles disponibles dans le catalogue Ollama.

Faut-il une connexion Internet ?

Seulement pour télécharger les modèles. Une fois téléchargés, tout fonctionne en local, sans aucune connexion Internet.

Nicolas Pivaut
Rédigé par

Nicolas Pivaut

Fondateur & Développeur Web

Fondateur de WebSentinel, Nicolas accompagne les PME et artisans dans leur transformation digitale depuis 2015. Expert SEO, développement web et e-commerce.