เครื่องตอบ ping ไม่ได้แปลว่า EA ทำงานถูกต้อง Monitoring ที่มีประโยชน์ต้องครอบคลุมทั้ง infrastructure, process และสัญญาณระดับธุรกิจ โดยแจ้งเตือนเฉพาะเหตุการณ์ที่ผู้ดูแลมี action ชัดเจน
Infrastructure metrics
- ติดตาม CPU และ memory ต่อเนื่องเพื่อเห็นแนวโน้ม
- เฝ้าดูพื้นที่ disk, I/O และการเติบโตของ log
- ตรวจ network availability, packet loss และ DNS ตามความจำเป็น
Application health
- ตรวจว่า process และ terminal ที่จำเป็นยังทำงาน
- อ่าน error จาก journal, expert log หรือ service log
- ใช้ heartbeat ที่ยืนยันว่า loop งานยังเดิน ไม่ใช่เพียง process ยังอยู่
ออกแบบ Alert
- กำหนด threshold จาก baseline ของระบบจริง
- ใช้ระยะเวลาต่อเนื่องก่อนแจ้งเตือนเพื่อลด spike
- ระบุเจ้าของ ช่องทาง และขั้นตอนตอบสนองของแต่ละ alert
AI-assisted monitoring อย่างระมัดระวัง
- ใช้ AI ช่วยจัดกลุ่ม log หรือสรุปเหตุการณ์ได้
- ต้องตรวจสอบผลสรุปกับข้อมูลต้นทาง
- ไม่ควรให้ระบบอัตโนมัติทำ action ที่มีผลสูงโดยไม่มี guardrail