Section 9: การตั้งกฎแจ้งเตือน (Alerting Rules)
- การเขียน Alerting Rule ด้วย PromQL และการกำหนดระยะเวลา for ให้ไม่แจ้งเตือนพร่ำเพรื่อ
- การจัดระดับความรุนแรงและการใส่ข้อมูลที่ทีมต้องใช้แก้ปัญหาไว้ในการแจ้งเตือน
- แนวคิดการแจ้งเตือนตามอาการที่ผู้ใช้รู้สึก (Symptom-based Alerting)
- Lab: เขียนกฎแจ้งเตือนสำหรับเซิร์ฟเวอร์และบริการที่เฝ้าระวังอยู่
Section 10: Alertmanager และการส่งการแจ้งเตือน
- การติดตั้งและตั้งค่า Alertmanager และการเชื่อมกับ Prometheus
- การจัดกลุ่ม (Grouping) การระงับ (Silence) และการยับยั้ง (Inhibition) เพื่อลดเสียงรบกวน
- การส่งการแจ้งเตือนเข้าอีเมล, LINE, Slack หรือช่องทางขององค์กร
- Lab: ตั้งค่าส่งการแจ้งเตือนเข้าช่องทางจริงและทดสอบสถานการณ์ระบบล่ม
Section 11: การเก็บข้อมูลระยะยาวและประสิทธิภาพ
- การกำหนดระยะเวลาเก็บข้อมูลและการประเมินพื้นที่จัดเก็บที่ต้องใช้
- แนวทางการเก็บข้อมูลระยะยาวและการทำ Federation เมื่อระบบขยายตัว
- การปรับแต่งประสิทธิภาพ: ความถี่ในการดึงข้อมูล จำนวน Label และปัญหา Cardinality สูง
- การสำรองข้อมูลและการดูแลระบบเฝ้าระวังให้พร้อมใช้งานเสมอ
Section 12: Log, Trace และ Capstone
- การเก็บ Log ด้วย Loki และการดู Log ควบคู่กับ Metric ใน Grafana
- แนวคิด Distributed Tracing และ OpenTelemetry สำหรับตามรอยคำขอข้ามบริการ
- โจทย์รวบยอด: วางระบบ Observability ครบชุดสำหรับบริการหนึ่งตั้งแต่เก็บ Metric ถึงแจ้งเตือน
- Workshop: นำเสนอ Dashboard และกฎแจ้งเตือนที่ออกแบบ พร้อมรับ Feedback