Aller au contenu principal
Intelligence artificielle· · 6 min de lecture

Coût total de possession d'un LLM en production : la grille qu'aucun éditeur ne vous donnera

Sept postes chiffrés à anticiper avant de budgéter un LLM interne — GPU, serving, observabilité, équipe, sécurité, conformité, obsolescence. Exemple réel sur un cas modéré.

Le prix affiché d’un modèle de langage — quelques euros par million de tokens chez OpenAI, Anthropic ou Mistral — ne reflète qu’une fraction du coût total réel d’une plateforme d’IA en production. Voici les sept postes qui pèsent vraiment, avec un chiffrage indicatif fondé sur nos déploiements.

Cas d’étude fil rouge : assistant métier interne, 500 utilisateurs actifs, 150 000 requêtes/mois, 1 000 tokens moyens par requête (contexte + réponse), latence cible 2 secondes, disponibilité 99,9 %.

1. L’inférence — le poste visible

Option A : API tierce

  • Modèle équivalent Llama 4 Maverick via OpenAI / Anthropic / Mistral : ≈ 1,5 € par million de tokens en entrée, 4 € en sortie
  • 150 000 requêtes × 1 000 tokens × mix 60/40 = 540 €/mois, soit 6 480 €/an

Avantages : zéro infrastructure, scale instantané. Inconvénient : sortie de données, dépendance, tarification qui évolue.

Option B : self-hosted

  • 2 × NVIDIA H100 (PCIe ou SXM) — ≈ 25 000 € à 40 000 € à l’achat OU ≈ 3 500 € à 5 000 €/mois en location (cloud souverain français)
  • Débit en continu : 80 à 150 requêtes/seconde sur un modèle 70B quantifié — largement au-delà du besoin
  • Amortissement sur 3 ans en propriété : ≈ 10 000 €/an + électricité (≈ 2 500 €/an à 2400 W en continu à 0,12 €/kWh)

Le self-hosted devient rentable au-delà de ~500 000 requêtes/mois ou quand la souveraineté des données est non négociable.

2. Le serving et l’orchestration

Ce que personne ne budgète au départ :

  • Runtime d’inférence (vLLM, TGI) — OSS, mais nécessite de la compétence pour tuner batch, KV-cache, PagedAttention
  • Load balancer + autoscaling — Kubernetes + GPU operator : ≈ 200 €/mois d’infra plus
  • Cache sémantique (optionnel mais rentable) — Redis + embeddings : 20 à 40 % de réduction des coûts d’inférence sur requêtes répétitives

Budget réaliste : 200 à 500 €/mois d’infra additionnelle.

3. La base vectorielle (pour RAG)

  • pgvector sur PostgreSQL managé : ≈ 100 €/mois pour < 10 M de vecteurs
  • Qdrant ou Weaviate managé : 300 à 600 €/mois selon volume
  • Embedding API (OpenAI text-embedding-3-large) : ≈ 0,11 € par million de tokens≈ 20 €/mois pour notre cas

4. L’observabilité sémantique

Pas optionnel. Un LLM qui dérive sans qu’on le sache est un passif latent.

  • Langfuse / Phoenix self-hosted : infra dédiée ≈ 80 €/mois
  • Dataset d’évaluation versionné : création et maintenance — 10 à 30 jours-ingénieur/an
  • Alerting sur drift : intégration + tuning — 5 jours-ingénieur en initialisation

Souvent omis au cadrage, ce poste représente 5 à 10 % du TCO annuel.

5. L’équipe

C’est le poste dominant sur la durée.

Profil Effort annuel estimé
Ingénieur ML/LLM senior (exploitation + évolution) 40 à 80 jours
DevOps/Cloud pour l’infra GPU 20 à 40 jours
Data engineer (pipelines RAG, connecteurs, indexation) 30 à 60 jours
SRE pour l’astreinte 10 à 20 jours

Au TJM moyen d’un cabinet de conseil : ≈ 80 000 à 200 000 €/an selon la criticité. Sur un déploiement interne avec équipe salariée : 90 000 à 150 000 €/an chargé.

6. Sécurité et conformité

  • Red teaming trimestriel du modèle (attaques par prompt, extraction de données) : ≈ 5 000 € à 15 000 €/trimestre selon la profondeur
  • Audit RGPD (analyse d’impact AIPD sur traitement IA) : ≈ 8 000 à 20 000 € à l’initialisation, puis revue annuelle
  • Traçabilité + logs horodatés signés pour audit : infra et storage — ≈ 50 à 150 €/mois

7. L’obsolescence — le poste invisible

Les modèles évoluent tous les 6 à 12 mois. Migrer d’un Llama 3.3 vers Llama 4, ou d’un Claude 3.5 vers Claude 4, demande :

  • Re-évaluation sur votre dataset : 10 à 20 jours-ingénieur
  • Re-tuning des prompts : les formats d’instruction évoluent — 5 à 15 jours-ingénieur
  • Re-benchmark performance/coût : à chaque bascule de fournisseur

Budgétez une migration majeure tous les 12 à 18 mois. Cadence à anticiper contractuellement si vous signez avec un intégrateur.

La synthèse chiffrée

Pour notre cas fil rouge (500 utilisateurs, 150 K req/mois) :

Poste Self-hosted (€/an) API tierce (€/an)
Inférence 18 000 6 500
Serving & infra 6 000 2 400
Base vectorielle + embeddings 3 600 3 600
Observabilité sémantique 4 000 4 000
Équipe dédiée 110 000 90 000
Sécurité & conformité 15 000 15 000
Obsolescence (amorti) 8 000 8 000
Total annuel ≈ 164 600 € ≈ 129 500 €

L’écart entre self-hosted et API tierce est de 25 à 30 % sur ce profil. Il s’inverse au-delà de 1 million de requêtes/mois ou dès que le cadre régulatoire impose la résidence des données.

Les pièges à éviter

  • Budgéter uniquement l’inférence — l’erreur la plus fréquente
  • Négliger l’équipe — un LLM en production est un produit vivant, pas un projet livré
  • Oublier l’obsolescence — qui paie la migration dans 18 mois ?
  • Confondre prototype et production — un POC à 5 000 € peut devenir un système à 200 000 €/an

Pour aller plus loin

Vous préparez un cadrage budgétaire LLM et souhaitez une lecture chiffrée sur votre contexte ? Écrivez-nous, nous revenons sous 24 h ouvrées.

|b| Partager