최근 정부 데이터센터에 화재가 발생했고, 아직도 복구가 진행 중이라는데 토스에서도 아직은 정부 시스템 안내가 떠 있는 것을 볼수 있습니다.
사실 이런 사고는 처음이 아닙니다. 예전에도 유사한 사고가 있었고, 정부는 과거 사고 이후 Active-Active 수준의 DR 체계 구축 계획을 발표했지만, 실제 구현은 부처별·시스템별로 상이하며 대부분은 Active-Passive 혹은 Warm-Standby 형태에 머물러 있는 것으로 보입니다.
운이 좋게도 저는 쿠팡에서 DR 프로젝트를 직접 수행한 경험이 있습니다. 그 경험을 통해 느낀 점은 — 말처럼 쉽지 않다는 것입니다.
첫째,
기존 Legacy 시스템(온프라미스든 클라우드든)을 DR 환경으로 Onboarding 하는 과정은 생각보다 훨씬 복잡합니다.
정부 시스템은 부처별로 개발 언어, 인프라 구조, 운영 방식이 제각각 일것이라 결국 하나씩 맞춤형으로 이관해야 하기에, 단기간에 구현하는 건 거의 불가능에 가깝습니다. 생각보다 복잡도도 높고 기간이 상당히 소요될 수 있는 프로젝트입니다. 입니다.
특히 DR 구축은 ‘한 번에 전체를 옮기는 프로젝트’가 아니라, 하나하나 다른 퍼즐을 맞추는 과정에 가깝습니다.
둘째,
RTO(복구시간목표)와 RPO(복구시점목표) 를 최적화하는 일은 단순한 기술의 문제가 아닙니다.
금융 시스템이나 쿠팡과 같은 커머스와 같이 짧은 RTO, RPO 를 요구하지는 않아도 정부 시스템처럼 전국민이 사용하는 서비스라면, 몇십분 혹은 시간 단위의 복구가 요구되고 그렇게 짧은 복구시간을 만들려면 비용이 상상 이상으로 커집니다. 특히 노후화된 시스템이 많다면, 기술적 제약도 상당했을 것으로 보입니다.
셋째,
부처 간 협력의 어려움도 있었을 것이라 생각합니다.
정부의 모든 시스템을 직접 운영하는 게 아니라 외주나 위탁 형태가 많고 각 업체의 기술 수준이 제각각이고, 조율해야 할 이해관계자가 너무 많습니다.
게다가 공공조직 특유의 보수적인 의사결정 구조를 생각하면, Active-Active 구조를 실제로 합의하고 설계하는 일은 결코 쉽지 않았을 겁니다.
결국 DR은 그렇게 단순한 기술 프로젝트가 아닙니다.
기술, 조직, 예산, 의사결정 구조가 동시에 맞물려야만 성공할 수 있는 종합 엔지니어링 과제입니다.
이번 사건을 보며, “완벽한 DR”이라는 것이 얼마나 어렵고, 동시에 얼마나 중요한 일인지를 다시금 생각하게 됩니다. 쿠팡에서도 DR 프로젝트를 진행하면서 위에서 언급한 것들 뿐만 아니라 생각보다 많은 어려움이 있었음에도 높은 수준으로 구현되고 또한 지속적인 점검을 통해 Gap 을 줄여 나가고 있습니다.
재난은 언제든 일어날 수 있지만, 복구는 미리 준비 되지 않으면 생각보다 큰 손해가 생기게 됩니다. 모쪼록 이번 일을 계기로 정부 시스템도 늦었지만 Active-Active 방식의 DR 이 잘 구성되길 바랍니다!
#DisasterRecovery #DR #ActiveActive #DigitalInfrastructure #CloudArchitecture #Resilience #TechLeadership #ITStrategy #Coupang #ProjectManagement
