Şablonlar

Web Sitesi Kesinti Olaylarına Müdahale Kontrol Listesi ve Başucu Kitabı

Web sitesi kesinti olaylarını teşhis etmek, çözmek ve belgelemek için adım adım operasyonel kontrol listesi.
2026-07-25 tarihinde incelendi

Otomatik bir izleme uyarısı tetiklendiğinde mühendislik ekiplerinin, Ortalama Kurtarma Süresini (MTTR) en aza indirmek ve kullanıcı kesintisini önlemek için yapılandırılmış bir olay müdahale iş akışını takip etmesi gerekir.

Bu operasyonel taktik kitabı, yüksek önemdeki üretim kesintileri sırasında Site Güvenilirliği Mühendisleri (SRE'ler), DevOps ekipleri ve web geliştiricileri için tasarlanmış, savaşta test edilmiş, adım adım bir kontrol listesi sağlar.

Cevap-İlk Özet

Etkili bir web sitesi kesintisi olay müdahale iş akışı dört kritik aşamadan oluşur: Tanımlama ve Triyaj (çok bölgeli araştırma konsensüsünün doğrulanması), Kök Neden Yalıtımı (DNS, TLS, uç CDN ve arka uç veritabanı katmanlarının incelenmesi), Olay Azaltma (son dağıtımların geri alınması veya sunucu kaynaklarının ölçeklendirilmesi) ve Ölüm Sonrası Analiz (kök nedenlerin ve önleyici eylem öğelerinin belgelenmesi).Standartlaştırılmış bir kontrol listesinin takip edilmesi, Ortalama İyileşme Süresini (MTTR) saatlerden dakikalara düşürür.

Adım Adım Olay Önceliklendirme İş Akışı

Aşama 1: Kesinti Tespiti ve Triyaj (0 - 2 Dakika)

  1. Kesinti Kapsamını Doğrulayın: Kesintinin genel kullanıcıları mı yoksa belirli coğrafi bölgeleri etkileyip etkilemediğini doğrulamak için SimpleOps'da çok bölgeli araştırma konsensüsünü inceleyin.
  2. Uyarı Önceliğini Kontrol Edin: Tam kullanılabilirlik hataları (HTTP 5xx, TCP bağlantı zaman aşımları) ile yerelleştirilmiş performans düşüşleri (LCP > 4,0s) arasında ayrım yapın.
  3. Çağrı Ekibine Bildir: Olay güncellemelerini dahili geliştirici sohbet kanallarına (Slack, Telegram) yönlendirin ve bir Olay Komutanı atayın.

Aşama 2: Kök Sebep İzolasyonu (2 - 5 Dakika)

  1. DNS Çözümleme Katmanını Denetleyin: Alan adı sunucularının doğru A/AAAA kayıtlarını çözdüğünü doğrulayın ve küresel DNS yayılma gecikmelerini veya kayıt şirketi kilitleme hatalarını kontrol edin.
  2. SSL/TLS Sertifika Sağlığını Doğrulayın: Sertifikanın son kullanma tarihlerini, Konu Alternatif Adlarını (SAN'lar) ve CA güven zinciri bütünlüğünü doğrulayın.
  3. Edge CDN ve Ters Proxy'yi İnceleyin: Edge HTTP yanıt durum kodlarını (örneğin, 502 Hatalı Ağ Geçidi, 504 Ağ Geçidi Zaman Aşımı, 500 Dahili Hata) ve uç önbellek isabet oranlarını inceleyin.
  4. Arka Uç Veritabanını ve Uygulama Sunucusunu Değerlendirin: CPU kullanımını, bellek kullanımını, bağlantı havuzu doygunluğunu ve veritabanı kilidi kilitlenmelerini kontrol edin.

Aşama 3: Azaltma ve Çözüm (5 - 15 Dakika)

  1. Acil Durum Geri Alma İşlemini Yürütün: Kesinti, yakın zamanda gerçekleşen bir kod dağıtımı veya altyapı değişikliğiyle çakıştıysa hemen otomatik bir CI/CD geri alma işlemini gerçekleştirin.
  2. İkincil Bölgeye Yük Devretme: Bölgesel donanım arızaları meydana gelirse trafiği yedekli altyapı düğümlerine veya ikincil CDN kaynaklarına yeniden yönlendirin.
  3. Hız Sınırlama veya Devre Kesiciler Uygulayın: Hız sınırlamayı etkinleştirerek veya kritik olmayan arka plan işlerini geçici olarak devre dışı bırakarak trafik artışları sırasında veritabanı örneklerini koruyun.

Aşama 4: Otopsi ve Önleyici Faaliyetler (Olay Sonrası)

  1. Belge Olay Zaman Çizelgesi: Uyarı tespiti, ilk öncelik belirleme, temel neden tanımlama ve çözüm için tam zaman damgalarını kaydedin.
  2. Suçsuz Ölüm Sonrası Yürütme: Önlemlerin neden başarısız olduğunu analiz etmek ve önleyici eylem öğeleri oluşturmak için bir mühendislik retrospektif toplantısı düzenleyin.
  3. Otomatik İzlemeyi Güncelleyin: Gelecekte benzer güvenlik açığı modellerini tespit etmek için SimpleOps'a belirli regresyon kontrolleri veya özel sentetik testler ekleyin.

Olay Şiddet Matrisi

Önem DüzeyiTanımıEtki KapsamıHedef MTTREskalasyon Kanalı
SEV-1 (Kritik)Tam çekirdek hizmet kesintisi veya API hatası.Tüm üretim kullanıcıları etkilendi.$< 15\text{ dakika}$Telegram Botu + PagerDuty
SEV-2 (Yüksek)Temel özelliklerde kısmi bozulma (örn. ödeme yavaşlığı).Etkilenen kullanıcıların önemli bir alt kümesi.$< 45\text{ dakika}$Slack #devops-alerts
SEV-3 (Orta)Kritik olmayan özellik hatası veya Web Verileri'nde küçük gerileme.Minimum müşteri etkisi.$< 4\text{ saat}$E-posta Özeti

Yaygın Arıza Modelleri ve Acil Durum Çözümleri

  1. Veritabanı Bağlantı Havuzunun Tükenmesi: my.cnf / postgresql.conf yapılandırma dosyalarında etkin bağlantıları sıfırlayın veya maksimum havuz sınırını artırın.
  2. Süresi dolmuş ACME SSL Sertifikası: --force-renewal ile manuel Certbot yenileme komutlarını çalıştırın ve Nginx aracılığıyla HTTP-01 yönlendirme yönlendirmesini doğrulayın.
  3. Nginx Reverse Proxy 502 Bad Gateway: Yukarı akış uygulama sunucusu işleminin (örn. Node.js PM2 örneği veya Go Gin ikili programı) 8080 veya 4000 numaralı bağlantı noktasında çalıştığını doğrulayın.
  4. Bellek Sızıntısı Sürecinde Çökmeler: Çalışan iş parçacığı havuzlarını veya uygulama örneklerini yeniden başlatın, ardından tanılama profili oluşturmak için yığın dökümü bellek anlık görüntülerini toplayın.

İletişim ve Paydaş Şeffaflığı

Büyük bir üretim kesintisi sırasında, açık dış ve iç iletişim, teknik iyileştirme kadar önemlidir:

  • Müşteri Bildirimi: Genel durum sayfalarını gerçekçi tahmini çözüm süreleri ve net ilerleme güncellemeleriyle anında güncelleyin.
  • Dahili Durum Senkronizasyonu: Olay Komutanı, mühendislik liderleri ve müşteri destek temsilcileri arasında 15 dakikalık operasyonel senkronizasyonlar sağlayın.
  • Olay Sonrası İletişim: Ne olduğunu, neden olduğunu ve tekrarını önlemek için hangi kalıcı mühendislik değişikliklerinin yapıldığını açıklayan, müşteriye yönelik olay raporları gönderin.

Olay Başucu Kitabı Bakımı için En İyi Uygulamalar

  • Her SEV-1 Kesintisinden Sonra İnceleme: Önceliklendirme adımlarını hassaslaştırmak için ölüm sonrası geriye dönük incelemelerden hemen sonra prosedür adımlarını güncelleyin.
  • İzleme Kancalarını Otomatikleştirin: SimpleOps Web Kancalarının Slack ve Telegram kanallarına otomatik olarak uyarı gönderdiğinden emin olun.
  • Tatbikata Müdahale İş Akışları: Yeni mühendislik ekibi üyelerini olay protokolü konusunda eğitmek için üç ayda bir simülasyonlu kesinti yangın tatbikatları gerçekleştirin.
  • İlerletme Yollarını Açık Tutun: İkincil ve üçüncül çağrı sırasında iletişim bilgilerini olay yönetimi listenizde güncel tutun.

Otomatik Olay Yanıtı için SimpleOps Kullanımı

SimpleOps doğrudan modern DevOps iş akışlarıyla entegre olur ve ilk onaylanan arıza üzerine ekibinizin kontrol listesini otomatik olarak başlatmak için Slack, Telegram, E-posta veya özel Web kancaları aracılığıyla anında olay uyarıları gönderir.

Sıkça Sorulan Sorular

Bu konuyla ilgili sık sorulan sorular

7/24 Otomatik Web Sitesi İzleme

Web Sitenizin Hızlı ve Çalışır Kalmasını Sağlayın

SimpleOps, 15'ten fazla küresel kontrol bölgesinden her 60 saniyede bir çalışma süresini, SSL güvenlik sertifikalarını, API uç noktalarını ve Önemli Web Verilerini sürekli olarak izler.