Mẫu

Danh sách kiểm tra & Cẩm nang ứng phó sự cố ngừng hoạt động của trang web

Danh sách kiểm tra hoạt động từng bước để chẩn đoán, giải quyết và ghi lại các sự cố ngừng hoạt động của trang web.
Đã đánh giá trên 2026-07-25

Khi cảnh báo giám sát tự động kích hoạt, các nhóm kỹ thuật phải tuân theo quy trình ứng phó sự cố có cấu trúc để giảm thiểu Thời gian khôi phục trung bình (MTTR) và ngăn chặn sự gián đoạn của người dùng.

Cẩm nang vận hành này cung cấp danh sách kiểm tra từng bước đã được thử nghiệm trong thực tế, được thiết kế cho Kỹ sư độ tin cậy của trang web (SRE), nhóm DevOps và nhà phát triển web trong thời gian ngừng sản xuất ở mức độ nghiêm trọng.

Trả lời-Tóm tắt đầu tiên

Quy trình ứng phó sự cố ngừng hoạt động của trang web hiệu quả bao gồm bốn giai đoạn quan trọng: Xác định & Phân loại (xác minh sự đồng thuận thăm dò đa khu vực), Cách ly nguyên nhân gốc (kiểm tra DNS, TLS, CDN biên và các lớp cơ sở dữ liệu phụ trợ), Giảm thiểu sự cố (khôi phục các hoạt động triển khai gần đây hoặc mở rộng quy mô tài nguyên máy chủ) và Phân tích sau khi giết mổ (ghi lại các nguyên nhân gốc và các mục hành động phòng ngừa).Việc tuân theo danh sách kiểm tra được tiêu chuẩn hóa giúp giảm Thời gian phục hồi trung bình (MTTR) từ vài giờ xuống còn vài phút.

Quy trình xử lý sự cố từng bước

Giai đoạn 1: Xác định & phân loại mất điện (0 - 2 phút)

  1. Xác minh phạm vi ngừng hoạt động: Kiểm tra sự đồng thuận thăm dò đa khu vực trong SimpleOps để xác nhận xem việc ngừng hoạt động có ảnh hưởng đến người dùng toàn cầu hay các khu vực địa lý cụ thể hay không.
  2. Kiểm tra mức độ ưu tiên của cảnh báo: Phân biệt giữa các lỗi hoàn toàn có sẵn (HTTP 5xx, thời gian chờ kết nối TCP) và sự suy giảm hiệu suất cục bộ (LCP > 4.0).
  3. Thông báo cho nhóm đang gọi: Định tuyến các bản cập nhật sự cố đến các kênh trò chuyện nội bộ của nhà phát triển (Slack, Telegram) và chỉ định Người chỉ huy sự cố.

Giai đoạn 2: Cách ly nguyên nhân gốc rễ (2 - 5 phút)

  1. Kiểm tra lớp phân giải DNS: Xác minh rằng máy chủ tên miền phân giải các bản ghi A/AAAA chính xác và kiểm tra độ trễ truyền DNS toàn cầu hoặc lỗi khóa nhà đăng ký.
  2. Xác thực tình trạng chứng chỉ SSL/TLS: Xác nhận ngày hết hạn của chứng chỉ, Tên thay thế chủ đề (SAN) và tính toàn vẹn của chuỗi tin cậy CA.
  3. Kiểm tra Edge CDN & Reverse Proxy: Kiểm tra mã trạng thái phản hồi HTTP biên (ví dụ: 502 Bad Gateway, 504 Gateway Timeout, 500 Internal Error) và tỷ lệ trúng bộ nhớ đệm biên.
  4. Đánh giá cơ sở dữ liệu phụ trợ và máy chủ ứng dụng: Kiểm tra mức sử dụng CPU, mức sử dụng bộ nhớ, độ bão hòa nhóm kết nối và tình trạng khóa cơ sở dữ liệu.

Giai đoạn 3: Giảm thiểu & Giải quyết (5 - 15 phút)

  1. Thực hiện khôi phục khẩn cấp: Nếu ngừng hoạt động trùng với thời điểm triển khai mã gần đây hoặc thay đổi cơ sở hạ tầng, hãy thực hiện khôi phục CI/CD tự động ngay lập tức.
  2. Chuyển sang khu vực thứ cấp: Định tuyến lại lưu lượng truy cập đến các nút cơ sở hạ tầng dự phòng hoặc nguồn CDN thứ cấp nếu xảy ra lỗi phần cứng khu vực.
  3. Áp dụng Giới hạn tốc độ hoặc Bộ ngắt mạch: Bảo vệ các phiên bản cơ sở dữ liệu trong thời gian lưu lượng truy cập tăng đột biến bằng cách bật giới hạn tốc độ hoặc tạm thời vô hiệu hóa các tác vụ nền không quan trọng.

Giai đoạn 4: Hành động phòng ngừa và khám nghiệm tử thi (Sau sự cố)

  1. Dòng thời gian sự cố của tài liệu: Ghi lại dấu thời gian chính xác để phát hiện cảnh báo, phân loại ban đầu, xác định nguyên nhân gốc rễ và giải pháp.
  2. Tiến hành khám nghiệm tử thi không đổ lỗi: Triệu tập một cuộc họp hồi cứu kỹ thuật để phân tích lý do tại sao các biện pháp bảo vệ không thành công và thiết lập các hạng mục hành động phòng ngừa.
  3. Cập nhật giám sát tự động: Thêm kiểm tra hồi quy cụ thể hoặc kiểm tra tổng hợp tùy chỉnh trong SimpleOps để phát hiện các mẫu lỗ hổng tương tự trong tương lai.

Ma trận mức độ nghiêm trọng của sự cố

Mức độ nghiêm trọngĐịnh nghĩaPhạm vi tác độngMục tiêu MTTRKênh nâng cao
SEV-1 (Quan trọng)Hoàn toàn ngừng hoạt động dịch vụ cốt lõi hoặc lỗi API.Tất cả người dùng sản xuất đều bị ảnh hưởng.$< 15\text{ phút}$Telegram Bot + PagerDuty
SEV-2 (Cao)Suy thoái một phần các tính năng chính (ví dụ: thanh toán chậm).Một nhóm nhỏ người dùng bị ảnh hưởng.$< 45\text{ phút}$Slack #devops-cảnh báo
SEV-3 (Trung bình)Lỗi tính năng không nghiêm trọng hoặc hồi quy nhỏ trong Web Vitals.Tác động tối thiểu đến khách hàng.$< 4\text{ giờ}$Thông báo qua email

Các kiểu lỗi phổ biến & Cách khắc phục khẩn cấp

  1. Cạn kiệt nhóm kết nối cơ sở dữ liệu: Đặt lại các kết nối đang hoạt động hoặc tăng giới hạn nhóm tối đa trong các tệp cấu hình my.cnf / postgresql.conf.
  2. Chứng chỉ SSL ACME đã hết hạn: Chạy các lệnh gia hạn Certbot thủ công với --force-renewal và xác minh định tuyến thử thách HTTP-01 thông qua Nginx.
  3. Nginx Reverse Proxy 502 Bad Gateway: Xác minh quy trình máy chủ ứng dụng ngược dòng (ví dụ: phiên bản Node.js PM2 hoặc nhị phân Go Gin) đang chạy trên cổng 8080 hoặc 4000.
  4. Sự cố trong quá trình rò rỉ bộ nhớ: Khởi động lại nhóm luồng công việc hoặc phiên bản ứng dụng, sau đó thu thập ảnh chụp nhanh bộ nhớ kết xuất vùng lưu trữ để lập hồ sơ chẩn đoán.

Truyền thông & Tính minh bạch của các bên liên quan

Trong thời gian ngừng hoạt động sản xuất lớn, việc liên lạc rõ ràng với bên ngoài và nội bộ cũng quan trọng như việc khắc phục kỹ thuật:

  • Thông báo cho khách hàng: Cập nhật ngay các trang trạng thái công khai với thời gian giải quyết ước tính thực tế và cập nhật tiến độ rõ ràng.
  • Đồng bộ hóa trạng thái nội bộ: Giữ đồng bộ hóa hoạt động trong 15 phút giữa Người chỉ huy sự cố, trưởng nhóm kỹ thuật và đại diện hỗ trợ khách hàng.
  • Truyền đạt sau sự cố: Gửi báo cáo sự cố cho khách hàng giải thích điều gì đã xảy ra, lý do sự cố xảy ra và những thay đổi kỹ thuật vĩnh viễn nào đã được thực hiện để ngăn ngừa tái diễn.

Các phương pháp thực hành tốt nhất để bảo trì sổ tay sự cố

  • Xem xét sau mỗi lần ngừng hoạt động của SEV-1: Cập nhật các bước quy trình ngay sau khi hồi cứu khám nghiệm tử thi để tinh chỉnh các bước phân loại.
  • Tự động hóa các móc giám sát: Đảm bảo SimpleOps Webhooks tự động đăng thông báo lên các kênh Slack và Telegram.
  • Quy trình ứng phó với diễn tập: Tiến hành các cuộc diễn tập cứu hỏa mô phỏng khi ngừng hoạt động hàng quý để đào tạo các thành viên nhóm kỹ thuật mới về quy trình xử lý sự cố.
  • Duy trì đường dẫn báo cáo rõ ràng: Luôn cập nhật thông tin liên hệ cấp hai và cấp ba khi có cuộc gọi trong danh sách quản lý sự cố của bạn.

Sử dụng SimpleOps để ứng phó sự cố tự động

SimpleOps tích hợp trực tiếp với quy trình làm việc DevOps hiện đại, gửi cảnh báo sự cố tức thời qua Slack, Telegram, Email hoặc Webhooks tùy chỉnh để tự động bắt đầu danh sách kiểm tra của nhóm bạn khi có lỗi đầu tiên được xác nhận.

Câu hỏi thường gặp

Các câu hỏi thường gặp về chủ đề này

Giám sát trang web tự động 24/7

Đảm bảo trang web của bạn luôn nhanh chóng và hoạt động tốt

SimpleOps liên tục giám sát thời gian hoạt động, chứng chỉ bảo mật SSL, điểm cuối API và Core Web Vitals cứ sau 60 giây từ hơn 15 khu vực kiểm tra toàn cầu.