Le prix affiché d’un modèle de langage — quelques euros par million de tokens chez OpenAI, Anthropic ou Mistral — ne reflète qu’une fraction du coût total réel d’une plateforme d’IA en production. Voici les sept postes qui pèsent vraiment, avec un chiffrage indicatif fondé sur nos déploiements.
Cas d’étude fil rouge : assistant métier interne, 500 utilisateurs actifs, 150 000 requêtes/mois, 1 000 tokens moyens par requête (contexte + réponse), latence cible 2 secondes, disponibilité 99,9 %.
1. L’inférence — le poste visible
Option A : API tierce
- Modèle équivalent Llama 4 Maverick via OpenAI / Anthropic / Mistral : ≈ 1,5 € par million de tokens en entrée, 4 € en sortie
- 150 000 requêtes × 1 000 tokens × mix 60/40 = 540 €/mois, soit 6 480 €/an
Avantages : zéro infrastructure, scale instantané. Inconvénient : sortie de données, dépendance, tarification qui évolue.
Option B : self-hosted
- 2 × NVIDIA H100 (PCIe ou SXM) — ≈ 25 000 € à 40 000 € à l’achat OU ≈ 3 500 € à 5 000 €/mois en location (cloud souverain français)
- Débit en continu : 80 à 150 requêtes/seconde sur un modèle 70B quantifié — largement au-delà du besoin
- Amortissement sur 3 ans en propriété : ≈ 10 000 €/an + électricité (≈ 2 500 €/an à 2400 W en continu à 0,12 €/kWh)
Le self-hosted devient rentable au-delà de ~500 000 requêtes/mois ou quand la souveraineté des données est non négociable.
2. Le serving et l’orchestration
Ce que personne ne budgète au départ :
- Runtime d’inférence (vLLM, TGI) — OSS, mais nécessite de la compétence pour tuner batch, KV-cache, PagedAttention
- Load balancer + autoscaling — Kubernetes + GPU operator : ≈ 200 €/mois d’infra plus
- Cache sémantique (optionnel mais rentable) — Redis + embeddings : 20 à 40 % de réduction des coûts d’inférence sur requêtes répétitives
Budget réaliste : 200 à 500 €/mois d’infra additionnelle.
3. La base vectorielle (pour RAG)
- pgvector sur PostgreSQL managé : ≈ 100 €/mois pour < 10 M de vecteurs
- Qdrant ou Weaviate managé : 300 à 600 €/mois selon volume
- Embedding API (OpenAI text-embedding-3-large) : ≈ 0,11 € par million de tokens — ≈ 20 €/mois pour notre cas
4. L’observabilité sémantique
Pas optionnel. Un LLM qui dérive sans qu’on le sache est un passif latent.
- Langfuse / Phoenix self-hosted : infra dédiée ≈ 80 €/mois
- Dataset d’évaluation versionné : création et maintenance — 10 à 30 jours-ingénieur/an
- Alerting sur drift : intégration + tuning — 5 jours-ingénieur en initialisation
Souvent omis au cadrage, ce poste représente 5 à 10 % du TCO annuel.
5. L’équipe
C’est le poste dominant sur la durée.
| Profil | Effort annuel estimé |
|---|---|
| Ingénieur ML/LLM senior (exploitation + évolution) | 40 à 80 jours |
| DevOps/Cloud pour l’infra GPU | 20 à 40 jours |
| Data engineer (pipelines RAG, connecteurs, indexation) | 30 à 60 jours |
| SRE pour l’astreinte | 10 à 20 jours |
Au TJM moyen d’un cabinet de conseil : ≈ 80 000 à 200 000 €/an selon la criticité. Sur un déploiement interne avec équipe salariée : 90 000 à 150 000 €/an chargé.
6. Sécurité et conformité
- Red teaming trimestriel du modèle (attaques par prompt, extraction de données) : ≈ 5 000 € à 15 000 €/trimestre selon la profondeur
- Audit RGPD (analyse d’impact AIPD sur traitement IA) : ≈ 8 000 à 20 000 € à l’initialisation, puis revue annuelle
- Traçabilité + logs horodatés signés pour audit : infra et storage — ≈ 50 à 150 €/mois
7. L’obsolescence — le poste invisible
Les modèles évoluent tous les 6 à 12 mois. Migrer d’un Llama 3.3 vers Llama 4, ou d’un Claude 3.5 vers Claude 4, demande :
- Re-évaluation sur votre dataset : 10 à 20 jours-ingénieur
- Re-tuning des prompts : les formats d’instruction évoluent — 5 à 15 jours-ingénieur
- Re-benchmark performance/coût : à chaque bascule de fournisseur
Budgétez une migration majeure tous les 12 à 18 mois. Cadence à anticiper contractuellement si vous signez avec un intégrateur.
La synthèse chiffrée
Pour notre cas fil rouge (500 utilisateurs, 150 K req/mois) :
| Poste | Self-hosted (€/an) | API tierce (€/an) |
|---|---|---|
| Inférence | 18 000 | 6 500 |
| Serving & infra | 6 000 | 2 400 |
| Base vectorielle + embeddings | 3 600 | 3 600 |
| Observabilité sémantique | 4 000 | 4 000 |
| Équipe dédiée | 110 000 | 90 000 |
| Sécurité & conformité | 15 000 | 15 000 |
| Obsolescence (amorti) | 8 000 | 8 000 |
| Total annuel | ≈ 164 600 € | ≈ 129 500 € |
L’écart entre self-hosted et API tierce est de 25 à 30 % sur ce profil. Il s’inverse au-delà de 1 million de requêtes/mois ou dès que le cadre régulatoire impose la résidence des données.
Les pièges à éviter
- Budgéter uniquement l’inférence — l’erreur la plus fréquente
- Négliger l’équipe — un LLM en production est un produit vivant, pas un projet livré
- Oublier l’obsolescence — qui paie la migration dans 18 mois ?
- Confondre prototype et production — un POC à 5 000 € peut devenir un système à 200 000 €/an
Pour aller plus loin
- Cadrage d’un déploiement IA maîtrisé : Solutions IA
- Infrastructure cloud souveraine et FinOps : Cloud & infrastructure
- Quelle architecture avant de chiffrer : RAG ou fine-tuning — trancher avant de dépenser
- Anticiper les scénarios de rupture fournisseur : Si votre fournisseur IA vous coupe l’accès demain
- Cinq exigences incontournables : Déployer l’IA sous souveraineté
- Niveaux de service et engagements d’exploitation : Support IBIFACE
Vous préparez un cadrage budgétaire LLM et souhaitez une lecture chiffrée sur votre contexte ? Écrivez-nous, nous revenons sous 24 h ouvrées.