클라우드 배포 플랫폼인 Railway는 베이징 시간 5월 20일 새벽에 대규모 서비스 장애를 겪었습니다. 원인은 Google Cloud가 Railway의 계정을 차단했기 때문으로, 이로 인해 Google Cloud에 호스팅되던 대시보드(Dashboard), API 및 내부 네트워크 제어 평면이 모두 사용 불가 상태가 되었습니다. Google Cloud 인프라 위에서 운영되던 모든 사용자 서비스도 동시에 다운되었으며, 보고된 오류로는 “no healthy upstream”, “unconditional drop overload” 및 로그인 실패 등이 있었습니다. 다만 Railway Metal(자가 구축한 물리적 서버) 상에서 실행되는 워크로드는 영향을 받지 않았습니다.
이 사고는 베이징 시간 약 6시 29분에 발생했으며, Railway 측은 즉시 Google Cloud 지원팀과 직접 연락을 취했습니다. 하지만 Google Cloud 측 네트워크 계층 문제로 인해 컴퓨팅 리소스가 복구된 뒤에도 서비스가 정상 가동되지 못했으며, 전체 복구 과정은 총 7시간 이상 소요되었습니다.
복구 기간 중 Railway는 인프라 안정성을 보호하기 위해 비기업 사용자의 빌드 작업 속도를 제한했으나 기업 사용자의 배포에는 영향이 없었습니다. 베이징 시간 약 14시 14분에 Railway는 서비스가 완전히 복구되었음을 발표하고, 비정상 상태로 감지된 워크로드에 대해 자동 재배포를 실시했습니다. 일부 서비스가 여전히 정상 응답하지 않을 경우 사용자는 대시보드나 CLI를 통해 수동으로 재배포를 진행할 수 있습니다. Railway 측은 안정성이 확인된 후 상세한 사후 분석 보고서(postmortem)를 공개할 예정입니다.