Funkční disaster recovery strategie je pro enterprise IT zásadní. Zde sdílíme, jak jsme náš DR plán vytvořili a otestovali.
DR plan je dokument, o kterém vsichni mluví, ale málokdo ho má aktuální a otestovany. Po zkusenosti s vypadkem datacentra jsme se rozhodli vzít DR vazne.
RPO a RTO¶
Prioritní systemy: RPO pod 1 min, RTO pod 30 min. Sekundární: RPO pod 24h, RTO pod 8h. Interni: RPO/RTO pod 24h.
Scénáře¶
Selhání disku (RAID), serveru (VMware HA), SAN (redundantní paths), datacentra (DR site), regionu (geo-distributed).
Failover procedury¶
Krok-za-krokem. Kdo je zodpovědný, kontakty, očekávaný čas. Psano pro junior admina v neděli v noci.
Testovani¶
Mesicne: tabletop exercise. Kvartálně: partial test. Ročně: full DR test. Dokumentováno s lessons learned.
Udržování¶
Living document v Confluence. Review po kazdem incidentu a infra zmene. Tistena kopie v serverovně, USB v trezoru.
Závěrem¶
DR plan je pojistka. Rozdíl mezi 30minutovým vypadkem a celodenni katastrofou. Investujte do tvorby, testovani a udržování. Netestovany plan není plan.
Potřebujete pomoc s implementací?
Naši experti vám pomohou s návrhem, implementací i provozem. Od architektury po produkci.
Kontaktujte nás