Un client m'a demandé un "serveur A100 pour être sérieux". J'ai demandé pourquoi. "Parce qu'on a vu que c'est ce qu'utilisent les gros." Ce client a 12 personnes et des besoins de résumé de documents. Il a finalement pris une RTX 4090, et il fait tout très bien. La carte GPU se choisit selon ce que vous faites, pas selon l'argumentaire d'un commercial qui vend du carburant pour avion à un vélo.
Le trio qui couvre 95 % des PME
RTX 4090 (24 Go), environ 1 800 €. C'est le choix que fait ma clientèle de PME. Elle fait tourner Llama 3.1 70B en quantifié, Mistral 7B à pleine vitesse, Qwen pour le code. Consommation 450 W. Avec l'interface Ollama et 64 Go de RAM, la quasi-totalité de vos besoins.
RTX A6000 (48 Go), environ 4 500 €. Cinquante pour cent plus chère que la 4090, elle prend le double de VRAM. C'est la carte pour les modèles plus gros (120B et plus), pour les usages multi-utilisateurs simultanés, ou pour les fondations de RAG (recherche documentaire) sur de gros corpus. Sa consommation est plus raisonnable : 300 W sous charge.
NVIDIA A100 (80 Go), au-delà de 10 000 €. C'est une carte datacenter, refroidissement professionnel, conçue pour tourner 24 h/24 en charge permanente et pour le training. Pour une PME, c'est du gaspillage d'argent. À 12 personnes qui font de l'inférence par intermittence, elle ne sera jamais utilisée à 10 % de ses capacités.
Le point que les vendeurs ne disent pas
Pour 90 % des usages d'une PME, la différence se joue moins sur la carte que sur le reste de la machine. Un serveur IA, c'est :
- CPU : Ryzen 9 ou Intel Xeon, c'est le CPU qui gère tout
- RAM : 64 Go minimum, 128 Go recommandé (le modèle est chargé en RAM, pas seulement en VRAM)
- SSD : 2 To NVMe minimum. Les modèles pèsent entre 4 et 40 Go chacun, et le chargement depuis un disque lent rend l'expérience médiocre.
- Alimentation : 1 200 W, pour la marge (des alimentations justes menacent la stabilité sur les pics de charge)
J'ai vu un serveur avec une RTX 4090 monté sur une alimentation 650 W : instable, redémarrage au mauvais moment. Ce n'est pas le GPU qu'il faut blâmer.
La consommation électrique, le coût caché
- RTX 4090 : 450 W max, mais en usage normal (inférence par intermittence), comptez 150 W de moyenne. Soit 20 à 30 €/mois d'électricité.
- RTX A6000 : 300 W, plus efficace en périodes de charge, comptez 25 à 35 €/mois.
Les datacenters intégrés amortissent mieux, et c'est un argument pour choisir un prestataire si vos locaux ne sont pas prévus pour.
Le tableau qui tranche
| Carte | Prix | VRAM | Conso | Modèles | Pour qui |
|---|---|---|---|---|---|
| RTX 4090 | 1 800 € | 24 Go | 450W | jusqu'à 70B | PME standard (mon choix) |
| RTX A6000 | 4 500 € | 48 Go | 300W | jusqu'à 120B | Multi-utilisateurs |
| A100 | 10 000 €+ | 80 Go | 400W | illimité | Hors PME |
| AMD MI100 | 1 200 € | 32 Go | 300W | jusqu'à 40B | Budget très serré, uniquement cas particuliers |
Mon conseil final
Pour une PME, prenez la RTX 4090 avec 64 Go de RAM et 2 To de NVMe. C'est le bon rapport. Si après 6 mois vous en avez besoin de plus, passez à la A6000. C'est une évolution simple sur une machine bien dimensionnée.
Le piège inverse serait de prendre une RTX 4060 ou une carte AMD gaming. La RTX 4060 a 8 Go de VRAM, c'est trop juste pour les modèles actuels. Les cartes AMD ont un eco-système limité pour les libs comme CUDA.
Si vous voulez éviter les frais de dimensionnement et de montage, c'est fait dans notre offre Serveur IA, installée et infogérée depuis Lille. Le tableau ci-dessus est celui qu'on utilise pour dimensionner, à la différence qu'on regarde votre cas réel avant.

