Felaket kurtarma dosya transferi: iş sürekliliği
Felaket kurtarma dosya transferi planlarıyla iş sürekliliğini sağlayın. Çoğaltma, yük devretme ve hızlı veri geri yükleme stratejileri.
Felaket kurtarma dosya transferi, birincil site başarısız olduğunda operasyonları ayakta tutar — bölgeler arası çoğaltma (S3 CRR, Azure GRS), ılık bekleme altyapısı ve belgelenmiş yük devretme kılavuzları aracılığıyla. DR'a hazır dosya sistemi, saniyelik ile saatlik RPO içinde değişiklikleri sürekli olarak ikincil konuma kopyalar, RTO hedefi içinde yük devretmeyi destekler ve gerçekçi koşullarda test edilmiştir. Kullanışlı DR'ye giden en kısa yol: bir iş yükü seçin, onu ikinci bölgeye çoğaltın, cumartesi günü bölgesel arızayı simüle edin ve gerçekte ne olduğunu ölçün.
İş Etkisine Göre İş Yüklerini Sınıflandırma
Her dosya sistemi sıcak-sıcak çoğaltmayı hak etmez. Bir iş etkisi analizi, sistemleri kesinti ve veri kaybı toleranslarına göre sınıflandırır:
- Katman 0 (görev kritik): ödeme işleme, klinik sistemler. RPO <1 dk, RTO <15 dk.
- Katman 1 (kritik): sipariş yönetimi, müşteriye yönelik uygulamalar. RPO <15 dk, RTO <1 saat.
- Katman 2 (önemli): dahili araçlar, raporlama. RPO <24 saat, RTO <8 saat.
- Katman 3 (standart): eğitim materyalleri, arşivler. RPO <1 hafta, RTO <3 gün.
Katman 0, Katman 3'ten çoğaltmak için 3-10 kat daha pahalıya mal olur. Sistemleri dürüstçe haritalayın. Çoğu şirketin Katman 0-1'de %5-10 sistemi vardır ve harcamayı her şeyi eşit biçimde altın kaplamak yerine burada yoğunlaştırmalıdır.
Çoğaltma Topolojileri
Dosya depolama için üç çoğaltma modeli öne çıkar:
- Aktif-pasif: Birincil yazmaları alır, ikincil kopyayı alır. Yük devretme promosyon gerektirir. Çoğu bölgesel DR kurulumu tarafından kullanılır.
- Aktif-aktif: Her iki bölge de yazmaları alır, çakışma çözümüyle. Daha yüksek karmaşıklık ancak sıfıra yakın RTO. Küresel sistemler tarafından kullanılır.
- Yedekleme tabanlı: Periyodik yedekleme ikincile. En yüksek RPO ancak en basit. Katman 3 için kullanılır.
S3 Cross-Region Replication (CRR), dakika altı RPO ile aktif-pasif uygular. S3 Multi-Region Access Points yük devretme yönlendirmesi ekler. Aktif-aktif için DynamoDB Global Tables ve CockroachDB veritabanlarını halleder; dosyalar için her iki yönde rclone ile çakışma çözümleme etiketleri bir kendin yap yaklaşımıdır.
İkincil Bölge Seçimi
Birincil ve ikincil bağımsız olarak başarısız olmalıdır. Temel kurallar:
- Farklı coğrafi bölge (us-east-1 → us-west-2, us-east-1 → us-east-2 değil)
- Farklı güç şebekesi (ABD'de Batı kıyısı ile Doğu kıyısı, Avrupa'da farklı ülke şebekeleri)
- İlgili yerlerde farklı tektonik bölgeler (her ikisini de Pasifik Ateş Çemberi'ne koymaktan kaçının)
Uyumluluk iş yükleri için her iki bölgenin de düzenlemeyi karşılaması gerekir. KVKK kapsamındaki veriler Türkiye sınırlarında kalmalıdır — yerel bölgeler arası çoğaltmayı planlayın. HIPAA ikincil bölgede de BAA gerektirir. Bölge seçimini ve gerekçesini belgeleyin; denetçiler soracaktır.
Bölgeler Arası Çoğaltma Maliyeti
Çoğaltmanın üç maliyet bileşeni vardır:
- Depolama: birincil maliyetin iki katı (her iki bölge de bir kopyayı tutar)
- Veri transferi: AWS, bölgeler arasında CRR için GB başına 0,02 $ alır
- İstek ücretleri: hedefte PUT işlemleri
Aylık çoğaltılan 10 TB için Virginia ve Oregon arasında AWS'de yaklaşık 700 $/ay (~24.000 TL) bekleyin. Azaltmalar: hedefe daha ucuz depolama sınıfına çoğaltın (Standard yerine S3 Glacier Instant Retrieval), kritik olmayan verileri hariç tutmak için önek veya etikete göre çoğaltmayı filtreleyin ve ölçüsüz çoğaltmayı yakalamak için bucket çoğaltma metriklerini kullanın.
Yük Devretme Kılavuzu
Yalnızca fikir olarak var olan kılavuz, başarısız olan kılavuzdur. Üretime hazır kılavuz şunları kapsar:
- Tetikleyici kriterler: yük devretmeyi başlatan koşullar (bölge durum sayfası, uygulama sağlık kontrolleri, eşiğin üzerinde P99 gecikme)
- Karar yetkisi: kararı kimin verdiği (genellikle Mühendislik VP'si + SRE lideri, otomatik tetikleyici için önceden onaylanmış eşiklerle)
- Adımlar: beklenen çıktıyla sırayla tam komutlar
- Doğrulama: her adımın çalıştığını onaylama yöntemi
- Geri alma: yük devretmenin kendisi sorun çıkarırsa geri alma yöntemi
- İletişim: durum sayfası güncellemesi, müşteri bildirimi, dahili Slack
S3 destekli uygulama için örnek yük devretme adımı: Route 53'ü files.example.com'u birincil bucket'ın CloudFront'undan ikincil bucket'ın CloudFront'una yönlendirecek şekilde güncelleyin. dig ve bir kanarya yüklemeyle test edin. Süre hedefi: 10 dakikanın altında.
DNS ve Yönlendirme Stratejisi
DNS genellikle yük devretmeyi yönetir. Seçenekler:
- Route 53 Failover yönlendirme: sağlık kontrollerine dayalı otomatik geçişle aktif-pasif
- Route 53 Gecikme yönlendirme: en yakın sağlıklı bölgeye trafik
- Kaynak yük devretmeyle CloudFront: istemcilere saydam
- Çok bölgeli arka uçlarla yük dengeleyici: çalışır ancak karmaşıklık ekler
TTL önemlidir. 300 saniyelik TTL'li DNS kaydı 5 dakikada yük devreder; 3.600 saniyelik TTL bir saat alır. DR kritik kayıtları daha hızlı yakınsama için biraz daha fazla DNS trafiğini kabul ederek 60-300 saniyeye ayarlayın.
Yük Devretme Sırasında Veri Bütünlüğü
Çoğaltma gecikmesi, ikincilerin biraz geride olduğu anlamına gelir. Yük devretmek en son yazmaları kaybedebilir. RPO'yu en kötü beklenen kayıp olarak belgeleyin ve uzlaşma planı yapın:
- Yeniden oynatılabilmeleri için uygulama katmanında taahhüt edilmemiş yazmaları günlüğe kaydedin
- Uçuştaki işlemleri yakalayın ve olay günlüklerinden yeniden oynatın
- Kaybı açıkça kabul edin (kritik olmayan veriler için daha basit daha iyidir)
Özellikle dosya yüklemeleri için, yük devretme tarafından kesilen çok parçalı yükleme ikincilde tamamlanmamış yüklemeler bırakabilir. Her iki bölgede de temizlemek için AbortIncompleteMultipartUpload yaşam döngüsü kurallarını yapılandırın.
DR'yi Ciddiye Almak
Test edilmiş bir DR planı ile test edilmemiş biri farklı şeylerdir. Test katmanları:
- Masa üstü alıştırması: kılavuzu sözlü olarak gözden geçirin. Üç ayda bir.
- Kısmi yük devretme: yalnızca bir alt sistemi (örn. dosya hizmeti) yük devre. Altı ayda bir.
- Tam bölgesel yük devretme: planlanmış bakım penceresinde her şeyi yük devre. Yıllık.
- Kaos mühendisliği: Çeyrek Katman 0 sistemleri için programsız, simüle edilmiş, mesai saatlerinde.
Her şeyi kaydedin. Nelerin bozulduğunu. Her adımın gerçekte ne kadar sürdüğünü. Kime ihtiyaç duyduklarında belgelere ulaşamadığını. Her testin ardından kılavuzu iyileştirin. Bunu yapan ekiplerin yük devretmeleri çalışır; yapmayanlar gerçek olaylar sırasında sorunları keşfeder.
İletişim Kanalları Önemlidir
Bir olay sırasında bulut içi iletişim kullanılamıyor olabilir. Başarısız olan AWS bölgesinde barındırılan Slack işe yaramaz. Bant dışı kanalları önceden düzenleyin:
- Farklı bölgede barındırılan ikincil Slack çalışma alanı
- Twilio veya Telnyx aracılığıyla SMS köprüsü
- Son çare olarak kişisel telefon ağacı
- Birincil altyapınızın dışında barındırılan genel durum sayfası (Atlassian Statuspage, StatusGator)
Kanalları fiziksel klasörde belgeleyin. Bunlara geçişi prova edin.
Kurtarma Dosyalarını Kişiler Arasında Aktarma
Bölgesel bir arıza insanları normal işbirliği araçlarından mahrum bıraktığında, belirli dosyaları aktarma — güncel bir veritabanı dökümü, bir yapılandırma dışa aktarma, bir olay müdahale kılavuzu — altyapınızdan bağımsız çalışan bir kanala ihtiyaç duyar.
HexaTransfer, hesap kurulumu olmadan herhangi bir tarayıcıda çalışır — SSO sağlayıcısı da çevrimdışıyken veya yanıt veren danışmanların kiracınıza eklenmeden dosya alması gerektiğinde kullanışlıdır. Uçtan uca AES-256-GCM şifrelemesi, klavye başındaki stresli anlarda bile gizli bilgilerin tel üzerinden sızdırılmamasını sağlar.
Olay Sonrası İncelemeler
Her DR testi ve her gerçek olay suçlamasız bir ölüm sonrası incelemeyi hak eder. Şunları belgeleyin:
- Olayların zaman çizelgesi
- Neyin işe yaradığı
- Neyin işe yaramadığı
- Kök nedenler (teknik ve süreç)
- Sahipleri ve bitiş tarihleriyle eylem maddeleri
Eylem maddelerini tamamlanmaya kadar takip edin. 20 eylemli ve sıfır tamamlanmış ölüm sonrası inceleme, hiç incelemeden kötüdür — ekibe iyileştirmelerin önemli olmadığını bildirir. Döngüyü kapatın ve bir sonraki olay bir öncekinden daha iyi gider.
Felaket kurtarma çoğunlukla disiplindir. RPO/RTO'yu belirleyin, sürekli çoğaltın, kılavuzu belgeleyin, üç ayda bir test edin ve bant dışı iletişim kurun. Teknoloji kolay kısımdır.
hexatransfer.com'da deneyin — ücretsiz, hesap gerekmez, maksimum 10 GB.
Uçtan uca şifreleme ile büyük dosyaları güvenle gönderin
Uçtan uca şifreleme ile 10 GB'a kadar dosya ücretsiz aktarın. Hesap gerekmez. Dosyalarınız yüklenmeden önce tarayıcınızda şifrelenir — başka kimse okuyamaz.
Dosya gönder