เครื่องตอบ ping ไม่ได้แปลว่า EA ทำงานถูกต้อง Monitoring ที่มีประโยชน์ต้องครอบคลุมทั้ง infrastructure, process และสัญญาณระดับธุรกิจ โดยแจ้งเตือนเฉพาะเหตุการณ์ที่ผู้ดูแลมี action ชัดเจน

01

Infrastructure metrics

  • ติดตาม CPU และ memory ต่อเนื่องเพื่อเห็นแนวโน้ม
  • เฝ้าดูพื้นที่ disk, I/O และการเติบโตของ log
  • ตรวจ network availability, packet loss และ DNS ตามความจำเป็น
02

Application health

  • ตรวจว่า process และ terminal ที่จำเป็นยังทำงาน
  • อ่าน error จาก journal, expert log หรือ service log
  • ใช้ heartbeat ที่ยืนยันว่า loop งานยังเดิน ไม่ใช่เพียง process ยังอยู่
03

ออกแบบ Alert

  • กำหนด threshold จาก baseline ของระบบจริง
  • ใช้ระยะเวลาต่อเนื่องก่อนแจ้งเตือนเพื่อลด spike
  • ระบุเจ้าของ ช่องทาง และขั้นตอนตอบสนองของแต่ละ alert
04

AI-assisted monitoring อย่างระมัดระวัง

  • ใช้ AI ช่วยจัดกลุ่ม log หรือสรุปเหตุการณ์ได้
  • ต้องตรวจสอบผลสรุปกับข้อมูลต้นทาง
  • ไม่ควรให้ระบบอัตโนมัติทำ action ที่มีผลสูงโดยไม่มี guardrail