คู่มือที่ครอบคลุมเกี่ยวกับข้อตกลงระดับการให้บริการ (SLA)
ข้อตกลงระดับการบริการ (SLA) คือข้อผูกพันอย่างเป็นทางการระหว่างผู้ให้บริการและลูกค้า ซึ่งกำหนดหน่วยวัดประสิทธิภาพที่วัดได้ เกณฑ์ความพร้อมใช้งาน และความรับผิดชอบในสถาปัตยกรรมคลาวด์สมัยใหม่ ความพร้อมใช้งานจะแสดงเป็นเปอร์เซ็นต์ของเวลาทั้งหมดที่เว็บไซต์ ตำแหน่งข้อมูล API หรือบริการโครงสร้างพื้นฐานยังคงดำเนินการได้อย่างเต็มที่และผู้ใช้ปลายทางสามารถเข้าถึงได้
การบรรลุความพร้อมใช้งานสูงจำเป็นต้องมีการปรับสมดุลความยืดหยุ่นของระบบ ความซ้ำซ้อนของโครงสร้างพื้นฐาน การปรับใช้อัตโนมัติ และความสามารถในการติดตามกับการลงทุนทางการเงินเนื่องจากข้อกำหนด SLA เพิ่มขึ้นจาก "Three Nines" (99.9%) เป็น "Five Nines" (99.999%) เวลาหยุดทำงานที่อนุญาตจึงลดลงจากชั่วโมงต่อปีเหลือเพียงไม่กี่นาที
อธิบายระดับความพร้อมใช้งานมาตรฐาน
มาตรฐานอุตสาหกรรมจัดหมวดหมู่เป้าหมายความพร้อมใช้งานออกเป็นระดับ "เก้า" ที่แตกต่างกันโดยพิจารณาจากเวลาหยุดทำงานสูงสุดที่อนุญาต:
| ระดับ SLA ความพร้อมใช้งาน | การหยุดทำงานที่อนุญาตรายวัน | การหยุดทำงานที่อนุญาตรายเดือน | การหยุดทำงานที่อนุญาตประจำปี | โปรไฟล์โครงสร้างพื้นฐาน |
|---|---|---|---|---|
ความแตกต่างที่สำคัญระหว่าง SLA, SLO และ SLI
ทีมวิศวกรมักสับสนระหว่าง SLA, วัตถุประสงค์ระดับการบริการ (SLO) และตัวชี้วัดระดับการบริการ (SLI)การทำความเข้าใจความแตกต่างเหล่านี้ถือเป็นสิ่งสำคัญสำหรับความน่าเชื่อถือในการปฏิบัติงาน:
- ตัวบ่งชี้ระดับการบริการ (SLI): ประสิทธิภาพการติดตามตัวชี้วัดเชิงประจักษ์ที่วัดจริงแบบเรียลไทม์ (เช่น "99.94% ของคำขอ HTTP ส่งคืน 200 OK ในช่วง 30 วันที่ผ่านมา")
- วัตถุประสงค์ระดับการบริการ (SLO): เกณฑ์เป้าหมายภายในที่กำหนดโดยทีมวิศวกรเพื่อรักษาส่วนต่างด้านความปลอดภัยให้สูงกว่าสัญญาทางกฎหมาย (เช่น "รักษาสถานะการออนไลน์ภายใน 99.95% เพื่อให้เราไม่ละเมิดข้อตกลงของลูกค้า 99.9%")
- ข้อตกลงระดับการให้บริการ (SLA): ข้อตกลงตามสัญญากับลูกค้าที่ระบุบทลงโทษทางการเงิน เครดิตบริการ หรือการเยียวยาหากบริการไม่เป็นไปตามเป้าหมายเวลาทำงานที่ตกลงไว้
วิธีการคำนวณความพร้อมใช้งานของ SLA
สูตรทางคณิตศาสตร์สำหรับการคำนวณเปอร์เซ็นต์ความพร้อมใช้งานในช่วงเวลาการวัดที่กำหนดคือ:
ตัวอย่างเช่น ในเดือนที่เรียกเก็บเงินมาตรฐาน 30 วัน (30 x 24 x 3600 = 2,592,000 วินาที) ระยะเวลาหยุดทำงานรวม 43 นาที 12 วินาที (2,592 วินาที) จะได้:
แนวทางปฏิบัติที่ดีที่สุดสำหรับการรักษาความพร้อมใช้งาน 99.99%
- ใช้การซ้ำซ้อนหลายภูมิภาค: หลีกเลี่ยงการปรับใช้จุดเดียวของความล้มเหลวโดยกระจายการรับส่งข้อมูลไปยังโซนความพร้อมใช้งานคลาวด์หลายแห่งและภูมิภาคทางภูมิศาสตร์
- การตรวจสอบสภาพการทำงานและการกำหนดเส้นทางการแจ้งเตือนโดยอัตโนมัติ: ปรับใช้โพรบสังเคราะห์หลายภูมิภาคด้วยช่วงเวลาการตรวจสอบ 1 นาทีเพื่อตรวจจับการหยุดทำงานทันที
- แยกบริการแอปพลิเคชันหลัก: ใช้การประมวลผลคิวแบบอะซิงโครนัสและรูปแบบเซอร์กิตเบรกเกอร์เพื่อป้องกันความล้มเหลวของส่วนประกอบที่แปลเป็นภาษาท้องถิ่นไม่ให้ระบบทั้งหมดล่ม
- ดำเนินการฝึกซ้อมการกู้คืนความเสียหายเป็นประจำ: ทำการทดสอบการเฟลโอเวอร์อัตโนมัติเพื่อให้แน่ใจว่าแบบจำลองฐานข้อมูลรองได้รับการส่งเสริมอย่างราบรื่นในระหว่างที่โหนดหลักหยุดทำงาน
คำถามที่พบบ่อย
คำถามทั่วไปเกี่ยวกับหัวข้อนี้
ไม่พลาดคำเตือนการละเมิด SLA
การคำนวณเกณฑ์การหยุดทำงานของ SLA เป็นเพียงขั้นตอนแรกเท่านั้นSimpleOps ตรวจสอบจุดสิ้นสุดเว็บไซต์ของคุณอย่างต่อเนื่องทุกวันตลอด 24 ชั่วโมงจากสถานที่ตรวจสอบทั่วโลกมากกว่า 15 แห่ง แจ้งเตือนทีมของคุณผ่านทาง Slack โทรเลข หรืออีเมล ก่อนที่เวลาหยุดทำงานจะละเมิด SLA เป้าหมายของคุณ