การรีสตาร์ตทันทีอาจทำให้หลักฐานหายและปัญหากลับมาอีก วิธีที่มีประสิทธิภาพคือกำหนดขอบเขต เก็บข้อมูลตามเวลา และเปลี่ยนทีละปัจจัย เพื่อแยกว่าเหตุเกิดที่ VPS, terminal, EA หรือระบบปลายทาง
กำหนดอาการให้ชัด
- หยุดทั้งเครื่อง เฉพาะ terminal หรือเฉพาะ EA
- เริ่มเกิดเมื่อใดและมี deployment หรือ update ก่อนหน้าหรือไม่
- กระทบทุกบัญชี ทุกกราฟ หรือเพียงหนึ่ง instance
เก็บหลักฐานก่อนแก้
- บันทึก CPU, RAM, disk, process และเวลาเครื่อง
- เก็บ journal, expert log, Windows Event หรือ service log
- ตรวจ network และสถานะของระบบปลายทางจากช่องทางทางการ
ทดสอบสมมติฐานทีละข้อ
- ตรวจ permission, credential, license และเวลาหมดอายุ
- เปรียบเทียบ config กับเวอร์ชันที่เคยทำงาน
- ทดลองใน environment แยกเมื่อการเปลี่ยนแปลงมีความเสี่ยง
กู้คืนและป้องกันซ้ำ
- rollback เมื่อมีเวอร์ชันที่ยืนยันแล้ว
- เพิ่ม alert หรือ health check ที่ตรวจพบอาการนี้
- เขียน incident note พร้อมสาเหตุ ผลกระทบ และ action