DeepSeek V4 en self hosting : pourquoi tout le monde en parle
DeepSeek V4 coche une case rare dans l’univers des LLM modernes : un modèle très costaud, avec des poids ouverts, sous licence MIT. Traduction : vous pouvez l’héberger, le modifier, le fine-tuner, et le déployer en prod sans devoir négocier un pacte secret avec un vendor.
Mais avant de commander une palette de GPU comme si c’était le Black Friday, une question mérite d’être posée : est-ce que le self hosting de DeepSeek V4 est une bonne idée pour votre usage ? Spoiler : techniquement oui, économiquement… ça dépend, et souvent la réponse est “pas pour le coût”.
Dans ce guide, on décortique l’essentiel pour héberger DeepSeek V4 avec vLLM, comprendre les besoins matériels (VRAM, RAM, stockage), configurer un serveur compatible OpenAI, et éviter les pièges classiques comme “j’ai 160GB de VRAM, donc ça passe” (non).
DeepSeek V4 Pro vs V4 Flash : deux modèles, deux réalités
DeepSeek V4 existe en deux variantes principales :
V4 Flash, le choix “réaliste”
- Environ 284B paramètres
- Poids autour de 158GB en mix FP4 plus FP8
- Empreinte totale typique 170 à 175GB de VRAM pour viser le contexte géant (KV cache inclus)
- Qualité souvent estimée à 85 à 95% de V4 Pro sur beaucoup de tâches
C’est la version qui rend le self hosting plausible pour une équipe bien équipée, sans forcément monter un mini datacenter dans le garage.
V4 Pro, le choix “cluster sinon rien”
- Environ 1.6T paramètres
- Poids autour de 862GB
- Là, on parle d’une vraie stratégie multi GPU, parfois multi nœuds, avec interconnect rapide
Si votre objectif est d’avoir le modèle le plus fort possible “chez vous”, V4 Pro est incroyable. Si votre objectif est de sortir une feature ce trimestre, V4 Flash est votre meilleur ami.
Les besoins hardware : VRAM, RAM, stockage et interconnect
Tableau rapide des exigences
| Élément | V4 Flash | V4 Pro |
| — | — | — |
| Taille des poids (FP4 plus FP8) | ~158GB | ~862GB |
| GPUs minimum | 2x H200 ou 2x RTX Pro 6000 Blackwell | 8x H200 141GB (1 nœud) ou 16x H100 80GB (2 nœuds) |
| RAM système | 256GB+ | 1TB+ |
| Stockage | 500GB NVMe | 2TB NVMe |
| Interconnect | NVLink recommandé | NVLink plus InfiniBand |
Pourquoi V4 Flash demande plus que “juste 158GB”
Parce que vous n’hébergez pas une statue, vous faites tourner un modèle. En plus des poids, vous devez loger le KV cache et l’overhead runtime.
Pour un contexte maximal, on retombe sur environ :
- 158GB pour les poids
- ~10GB pour le KV cache complet sur 1M de tokens
- quelques GB d’overhead
Total : 170 à 175GB.
Le piège classique des 2x A100 80GB
2x A100 80GB = 160GB. Et 160GB, c’est inférieur au budget VRAM quand vous activez un gros contexte. D’où la recommandation courante : 4x A100 80GB.
Le détail important : vLLM aime les puissances de deux pour le tensor parallelism (1, 2, 4, 8). Donc si 2 GPU ne suffisent pas, le saut naturel devient 4 GPU.
Télécharger DeepSeek V4 depuis Hugging Face
Les poids officiels sont disponibles sous l’organisation deepseek-ai. Pour la prod, les checkpoints Instruct en mix FP4 plus FP8 sont généralement le meilleur compromis.
Commandes pratiques
pip install huggingface_hub
# V4 Flash
huggingface-cli download deepseek-ai/DeepSeek-V4-Flash \
--local-dir ./deepseek-v4-flash
# V4 Pro
huggingface-cli download deepseek-ai/DeepSeek-V4-Pro \
--local-dir ./deepseek-v4-pro
Astuce : prévoyez un stockage NVMe confortable. Rien ne ruine une journée comme une erreur “no space left on device” après 97% de téléchargement.
Déployer DeepSeek V4 avec vLLM : le chemin le plus simple
vLLM est souvent le framework privilégié pour servir DeepSeek V4, notamment parce qu’il gère efficacement les contextes longs et les modèles MoE.
Installation
pip install "vllm>=0.8.0"
Démarrer un serveur OpenAI compatible
Exemple avec V4 Flash sur 4 GPU :
python -m vllm.entrypoints.openai.api_server \
--model ./deepseek-v4-flash \
--tensor-parallel-size 4 \
--max-model-len 131072 \
--trust-remote-code \
--port 8000
Le point fort : l’API est compatible OpenAI, ce qui permet de migrer un client existant en changeant surtout l’URL de base.
Parallelism : TP, EP et le vocabulaire qui fait peur
DeepSeek V4 est un modèle MoE, donc deux stratégies de parallélisation comptent.
Tensor Parallelism (TP)
Le TP découpe les couches entre GPU. C’est utile quand une couche ne tient pas sur un seul GPU.
- Paramètre clé :
--tensor-parallel-size
Expert Parallelism (EP)
L’EP répartit les experts sur plusieurs GPU. Comme seuls certains experts s’activent par token, c’est souvent plus efficace à grande échelle.
En pratique :
- V4 Flash sur 2x H200 ou 4x A100 : TP seul suffit souvent
- V4 Pro sur 8 GPU et plus : combiner TP et EP donne de meilleurs débits
Quantization : FP8, FP4, INT4 et la tentation du “ça passe sur une 4090”
Les formats fournis officiellement sont déjà optimisés.
Ce que DeepSeek fournit
- Checkpoints base en FP8 mix
- Checkpoints instruct en FP4 plus FP8 mix, recommandés pour le déploiement
Et INT4 alors ?
Oui, INT4 peut réduire fortement l’empreinte, parfois jusqu’à permettre des setups exotiques. Mais le compromis est réel : perte de qualité, surtout sur le raisonnement, les maths et les tâches agentiques.
Moralité : si vous visez la prod et la fiabilité, commencez avec les checkpoints officiels, et ne quantifiez davantage que si vous n’avez pas le choix.
Contexte 1M tokens : comment le configurer sans faire exploser la VRAM
DeepSeek V4 utilise une attention hybride qui réduit fortement le coût KV cache. Résultat : un contexte gigantesque devient beaucoup plus accessible qu’avant.
Réglage vLLM
Le paramètre à surveiller :
--max-model-len
Conseil pragmatique :
- démarrez à 131072 (128K)
- monitorez la VRAM en charge
- montez progressivement si vous avez de la marge
Même si le 1M de tokens fait rêver, beaucoup d’applications tournent mieux avec un contexte plus modéré et une latence plus stable.
Déployer sur AWS : instances utiles et ordre de grandeur des coûts
Instances typiques
| Instance | GPUs | VRAM | Coût on demand | Usage |
| — | — | — | — | — |
| p5.48xlarge | 8x H100 80GB | 640GB | ~55 dollars par heure | V4 Flash très confortable |
| p5e.48xlarge | 8x H200 141GB | 1128GB | ~40 à 50 dollars par heure | V4 Pro sur 1 nœud |
| p5en.48xlarge | 8x H200 141GB | 1128GB | ~63 dollars par heure | V4 Pro avec meilleur réseau |
| 2x p5.48xlarge | 16x H100 80GB | 1280GB | ~110 dollars par heure | V4 Pro multi nœuds |
Ces chiffres bougent selon la région et les variations AWS, donc vérifiez avant de promettre un budget “stable” en réunion.
Self hosting vs API : le vrai calcul de break even
C’est souvent là que les rêves rencontrent la facture.
Côté API
Ordres de grandeur mentionnés :
- 0.14 dollar par million de tokens en entrée
- 0.28 dollar par million de tokens en sortie
- un mix 50/50 donne environ 0.21 dollar par million
Côté self hosting
- une p5.48xlarge autour de 55 dollars par heure
- soit environ 1321 dollars par jour
- en réservé 1 an, environ 40% de réduction, donc ~790 dollars par jour
Le résultat
Pour égaler ~790 dollars par jour à 0.21 dollar par million, il faut environ 3.8 milliards de tokens par jour. Et même si vous aviez ce trafic, un seul nœud 8x H100 ne tiendrait probablement pas la charge.
Donc le self hosting gagne rarement sur le prix brut. Il gagne sur d’autres critères.
Les bonnes raisons de self hoster DeepSeek V4
Souveraineté et résidence des données
Si vous êtes dans une industrie régulée, ou si vos données ne doivent pas transiter par certaines zones, l’hébergement sur votre infra change tout.
Personnalisation et fine tuning
Licence MIT + poids ouverts = liberté. Vous pouvez ajuster le modèle à votre domaine, adapter les pipelines, brancher vos outils, et industrialiser sans restrictions.
Latence et contrôle opérationnel
Quand vous maîtrisez le runtime, vous maîtrisez aussi :
- les quotas
- la stabilité
- l’observabilité
- la stratégie de cache
Et accessoirement, votre équipe SRE arrête de jouer à “devine pourquoi l’API est lente aujourd’hui”.
Patterns de déploiement à viser en production
Quelques bonnes pratiques simples pour éviter les douleurs.
1) Commencer petit, mesurer, puis scaler
Déployez V4 Flash avec un contexte raisonnable. Mesurez tokens par seconde, latence p95, VRAM en charge, et efficacité du batching.
2) Mettre de l’observabilité dès le début
Surveillez :
- VRAM et fragmentation
- file d’attente requêtes
- erreurs OOM
- latence par taille de contexte
3) Prévoir une stratégie de roll out
Blue green ou canary, surtout si vous changez :
- quantization
- max context
- version vLLM
Parce que “on a juste changé un flag” est souvent le début d’une histoire passionnante.
FAQ rapide
Quelle VRAM pour DeepSeek V4 Flash ?
Comptez 170 à 175GB au total pour viser le contexte maximal. 2x H200 ou 2x RTX Pro 6000 Blackwell peuvent suffire, 4x A100 80GB offrent une marge confortable.
Peut-on faire tourner V4 Pro sur une seule machine ?
Oui, mais il faut une machine avec beaucoup de VRAM. Typiquement 8x H200 141GB pour que ça rentre correctement sur un seul nœud.
vLLM est-il obligatoire ?
Non, mais c’est un excellent choix pour ce type de modèle et un déploiement API compatible OpenAI. SGLang peut aussi être une alternative.
Sources
- https://lushbinary.com/blog/deepseek-v4-self-hosting-guide-vllm-hardware-deployment/
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
