Aller au contenu principal
Intelligence artificielle· · 7 min de lecture

Si votre fournisseur IA vous coupe l'accès demain : le plan que vous n'avez pas encore écrit

Quatre scénarios réels de coupure — sanction, dépréciation, tarification, panne — et la matrice de continuité à mettre en place avant, pas après. Approche ingénieur.

Lundi matin, 8h47. Votre SaaS reçoit 10 000 requêtes par minute. Votre orchestrateur IA renvoie subitement 403 Forbidden sur chaque appel à Anthropic. Le support répond par un lien vers une page d’information réglementaire. Votre PDG demande à votre DSI, par téléphone, combien de temps avant que ça reparte.

Réponse probable aujourd’hui : « on regarde. »

Réponse après lecture de cet article : « 2 heures pour bascule, service nominal dans 6 heures, coût supplémentaire +18 % le temps du régime dégradé. »

Les quatre scénarios de coupure, réellement observés

Les scénarios ci-dessous ne sont pas hypothétiques. Ils se sont produits entre 2022 et 2026.

Scénario 1 — Sanction géopolitique

En mars 2022, OpenAI a bloqué l’accès depuis la Russie sous 72 heures suite aux sanctions. Entre 2023 et 2025, plusieurs vagues ont suivi : Iran, Cuba, Syrie, certains territoires ukrainiens occupés. Des clients européens avec des équipes ou filiales dans ces zones ont perdu leur stack d’un jour à l’autre.

Le risque pour une entreprise française : filiale au Maghreb, équipe off-shore en Asie, un partenaire qui change de nationalité — autant d’angles morts.

Scénario 2 — Dépréciation de modèle

Juin 2023 : OpenAI annonce la dépréciation de text-davinci-003 avec 6 mois de préavis. Plusieurs milliers d’applications de production ont dû migrer vers gpt-3.5-turbo — qui ne répond pas de la même manière. Les régressions qualitatives ont coûté à certains des mois de tests et de re-calibration.

Plus récemment : dépréciation progressive de Claude 2, de GPT-3.5-turbo-0301, de claude-instant-1. À chaque fois, du code à refaire.

Scénario 3 — Choc tarifaire

Entre juillet 2024 et janvier 2026, les prix des modèles les plus capables ont évolué en dents de scie : baisses de 50 % puis hausses de 30 %, changement des règles de facturation des tokens (prompt caching, batch, tiers prioritaires). Pour un SaaS consommant 500 M de tokens/mois, un basculement de prix de +20 % représente ≈ 4 000 € de marge annuelle évaporée.

Aucune garantie contractuelle de prix chez les fournisseurs grand public.

Scénario 4 — Panne majeure

Novembre 2023 : OpenAI hors-service pendant 4 heures suite à une attaque DDoS revendiquée. Mai 2025 : incident Anthropic sur la région us-east-1 pendant 2 heures 40. Pour un service client automatisé qui traite 15 000 tickets/heure, chaque minute d’indisponibilité est comptable.

Les trois couches de dépendance

Quand l’accès est coupé, trois choses peuvent se passer. Savoir laquelle vous frappe détermine le temps de reprise.

Couche 1 — API : vous ne pouvez plus appeler le modèle. C’est le cas le plus simple à traiter si vous avez préparé un fallback. Temps de reprise possible : quelques minutes avec bascule automatique multi-provider.

Couche 2 — Poids du modèle : le modèle spécifique que vous utilisiez n’existe plus ou n’est plus autorisé. Les poids sont propriétaires et non transférables. Temps de reprise : de quelques jours à quelques semaines pour re-calibrer prompts et évaluations sur un modèle équivalent.

Couche 3 — Données : vos embeddings, fine-tunes, contextes personnalisés, mémoires conversationnelles sont bloqués chez le fournisseur. Si vous ne les avez pas exportés régulièrement, la reprise peut prendre des mois ou être impossible.

La majorité des entreprises n’ont aucune défense sur la couche 3. La plupart n’ont même pas une cartographie claire de leurs artefacts IA distribués chez les fournisseurs.

La matrice de continuité à construire

Voici la grille que nous demandons à chaque client dès la phase de cadrage. Remplissez-la avec des chiffres, pas des intentions.

Dimension Question Engagement cible
RTO technique En combien de temps un fallback provider reprend le service ? < 15 minutes
RTO qualité Combien de temps pour retrouver la qualité de réponse d’origine sur le modèle de secours ? < 48 heures
RPO données Combien de temps de données personnalisées acceptez-vous de perdre ? 0 (réplication continue)
Portabilité prompts Vos prompts fonctionnent-ils identiquement sur 2 providers différents ? Oui, testé en CI
Export embeddings Vos vecteurs sont-ils stockés chez vous (pgvector, Qdrant) plutôt que chez le provider ? Auto-hébergé obligatoire
Budget de bascule Combien coûte un mois de fonctionnement sur le provider de secours ? ≤ +25 % du coût nominal
Preuve documentaire Pouvez-vous démontrer à un régulateur que le plan existe et est testé ? Oui, PCA mis à jour annuellement

Si vous mettez « à évaluer » ou « bonne question » sur plus de trois lignes, vous n’avez pas de plan.

Les architectures qui absorbent les chocs

Trois patterns d’architecture, du moins au plus robuste.

Pattern 1 — Wrapper agnostique (MVP de résilience)

Une couche d’abstraction unique devant tous les appels LLM, avec bascule manuelle entre fournisseurs. LangChain, LiteLLM, ou un wrapper maison. Inconvénient : la bascule reste manuelle, les prompts peuvent donner des résultats différents.

Temps de reprise sur sanction ou panne : 2 à 8 heures.

Pattern 2 — Routage multi-provider automatique

Un orchestrateur qui route chaque requête en fonction de règles : coût, qualité, latence, disponibilité. En cas d’erreur sur le provider primaire, bascule automatique. C’est ce que permet PCL nativement via son mécanisme de fallback providers.

Les prompts sont testés en CI sur tous les providers cibles. Un test régresse — le déploiement est bloqué.

Temps de reprise : < 5 minutes. Budget de sécurité : +5 à 15 % du coût nominal.

Pattern 3 — Self-hosted avec fallback cloud

Production sur modèle ouvert auto-hébergé (Llama 4, Mistral Large 3, DeepSeek-V3) sur infrastructure souveraine (Outscale, OVHcloud, Clever Cloud AI Endpoints). Le cloud hyperscaler reste en secours pour les pics de charge ou les profils hors scope du modèle local.

Temps de reprise : 0 — le fournisseur ne peut plus vous couper. Coût : plus élevé à l’entrée, amorti au-delà de 2 à 5 millions de requêtes/mois.

Le test qui vous dira où vous en êtes

Demain matin, avant 10 heures, désactivez l’accès Anthropic sur un seul environnement de recette pendant une heure. Observez :

  • Combien de tests automatiques ont cassé ?
  • Combien de temps avant que l’équipe comprenne la cause racine ?
  • La bascule sur un modèle de secours s’est-elle faite, ou a-t-elle nécessité une intervention manuelle ?
  • La qualité de réponse sur le modèle de secours est-elle acceptable ou équivalente ?
  • Votre golden set d’évaluation tourne-t-il automatiquement sur le nouveau modèle ?

Si l’une de ces réponses vous fait hésiter, vous venez de découvrir où investir la prochaine semaine d’ingénierie.

La question qu’un auditeur posera

« Démontrez-moi que votre service peut continuer à fonctionner sans votre principal fournisseur d’IA pendant 72 heures. »

Cette phrase sera prononcée dans une salle de conseil, à un régulateur, à un investisseur ou à un grand compte B2B. De plus en plus souvent. La seule réponse acceptable à court terme ne sera pas « nous y travaillons », mais un document signé, testé, daté.


Pour aller plus loin

Vous voulez construire votre plan de continuité IA sans partir de la page blanche ? Écrivez-nous, nous revenons sous 24 h ouvrées avec un audit de dépendances fournisseurs et une première feuille de route chiffrée.

|b| Partager