Introduction
Le 19 mai 2026, Railway, une plateforme de déploiement d'applications, a rencontré un obstacle majeur : une suspension incorrecte de son compte Google Cloud a entraîné une interruption de service à l'échelle de la plateforme. Cet incident a eu des répercussions sur l'ensemble des infrastructures hébergées sur Google Cloud, y compris le tableau de bord, l'API et certaines portions de l'infrastructure réseau.
Chronologie de l'Incident
L'incident a débuté le 19 mai 2026 à 22:20 UTC et s'est prolongé jusqu'à environ 06:14 UTC le 20 mai. Pendant ces huit heures, Railway a été confronté à une panne totale de ses services, rendant ses API et ses bases de données inaccessibles. Les utilisateurs ont immédiatement rencontré des erreurs 503 et d'autres messages d'erreur, et étaient incapables de se connecter.
Ce qui s'est passé
Google Cloud a placé par erreur le compte de production de Railway en statut suspendu. Cette action a mis hors ligne les infrastructures de calcul hébergées sur Google Cloud. Bien que les charges de travail sur Railway Metal et les environnements AWS soient restées opérationnelles, la dépendance de Railway à une API de plan de contrôle hébergée par Google Cloud pour remplir ses tables de routage a provoqué une cascade de défaillances au-delà de Google Cloud. Au pic de l'impact, toutes les charges de travail de Railway à travers toutes les régions étaient inaccessibles.
Réponse et Récupération
L'équipe Railway a immédiatement commencé à travailler sur la récupération de l'environnement Google Cloud. Les déploiements ont été bloqués sur toute la plateforme pendant que les services individuels étaient restaurés. Une fois que l'intégralité de l'infrastructure a été rétablie, un important arriéré de déploiements en attente a été progressivement traité pour éviter de submerger la plateforme.
Mesures Préventives
Railway a pris la responsabilité des décisions architecturales qui ont permis à une action d'un fournisseur en amont de se transformer en une panne à l'échelle de la plateforme. L'équipe s'engage à adopter des pratiques de redondance plus robustes pour éviter de futures interruptions. Cela inclut la diversification des fournisseurs de cloud et l'amélioration des systèmes de cache.
Conclusion
Cet incident a mis en lumière la dépendance critique de Railway vis-à-vis de Google Cloud et l'importance de développer des systèmes résilients. En tirant les leçons de cet événement, Railway s'efforce de renforcer sa plateforme pour assurer une fiabilité accrue pour ses utilisateurs.
Discutons de ton projet en 15 minutes.