← Retour au blog
tech 20 mai 2026

Rapport d'Incident : Railway Bloqué par Google Cloud (Résolu)

Le 19 mai 2026, Railway a subi une panne globale due à la suspension incorrecte de son compte Google Cloud. Cet article détaille l'incident, sa résolution et les mesures préventives futures.

Article inspiré de la source originale
Incident Report: Railway Blocked by Google Cloud (Resolved) ↗ blog.railway.com

Introduction

Le 19 mai 2026, Railway, une plateforme de déploiement d'applications, a rencontré un obstacle majeur : une suspension incorrecte de son compte Google Cloud a entraîné une interruption de service à l'échelle de la plateforme. Cet incident a eu des répercussions sur l'ensemble des infrastructures hébergées sur Google Cloud, y compris le tableau de bord, l'API et certaines portions de l'infrastructure réseau.

Chronologie de l'Incident

L'incident a débuté le 19 mai 2026 à 22:20 UTC et s'est prolongé jusqu'à environ 06:14 UTC le 20 mai. Pendant ces huit heures, Railway a été confronté à une panne totale de ses services, rendant ses API et ses bases de données inaccessibles. Les utilisateurs ont immédiatement rencontré des erreurs 503 et d'autres messages d'erreur, et étaient incapables de se connecter.

Ce qui s'est passé

Google Cloud a placé par erreur le compte de production de Railway en statut suspendu. Cette action a mis hors ligne les infrastructures de calcul hébergées sur Google Cloud. Bien que les charges de travail sur Railway Metal et les environnements AWS soient restées opérationnelles, la dépendance de Railway à une API de plan de contrôle hébergée par Google Cloud pour remplir ses tables de routage a provoqué une cascade de défaillances au-delà de Google Cloud. Au pic de l'impact, toutes les charges de travail de Railway à travers toutes les régions étaient inaccessibles.

Réponse et Récupération

L'équipe Railway a immédiatement commencé à travailler sur la récupération de l'environnement Google Cloud. Les déploiements ont été bloqués sur toute la plateforme pendant que les services individuels étaient restaurés. Une fois que l'intégralité de l'infrastructure a été rétablie, un important arriéré de déploiements en attente a été progressivement traité pour éviter de submerger la plateforme.

Mesures Préventives

Railway a pris la responsabilité des décisions architecturales qui ont permis à une action d'un fournisseur en amont de se transformer en une panne à l'échelle de la plateforme. L'équipe s'engage à adopter des pratiques de redondance plus robustes pour éviter de futures interruptions. Cela inclut la diversification des fournisseurs de cloud et l'amélioration des systèmes de cache.

Conclusion

Cet incident a mis en lumière la dépendance critique de Railway vis-à-vis de Google Cloud et l'importance de développer des systèmes résilients. En tirant les leçons de cet événement, Railway s'efforce de renforcer sa plateforme pour assurer une fiabilité accrue pour ses utilisateurs.

Discutons de ton projet en 15 minutes.

Google Cloud Railway Incident Report Platform Outage Service Recovery
Newsletter Deepthix · 100% IA · chaque lundi 8h

Un agent IA lit la tech à ta place.

Notre agent IA scanne ~200 sources par semaine et te livre les meilleurs articles le lundi 8h. Gratuit. 1 clic pour se désinscrire.

Voir la page newsletter →

Tu veux automatiser tes opérations ?

Discutons de ton projet en 15 minutes.

Réserver un call