AIOps ระบบ Monitor IT ด้วย AI ในประเทศไทย
ใช้ AI Monitor ระบบ IT ที่จับปัญหาได้ก่อนผู้ใช้จะรู้สึก เรานำการตรวจจับความผิดปกติ การแจ้งเตือนอัจฉริยะ และการแก้ไขอัตโนมัติมาสู่งาน IT สำหรับองค์กรในเชียงใหม่และทั่วประเทศไทย
ระบบเฝ้าระวังที่เรียนรู้ว่าอะไรคือสภาวะปกติของระบบท่าน จึงแจ้งเตือนเมื่อผิดปกติจริง แทนที่จะแจ้งทุกครั้งที่ค่าเกินเกณฑ์ ผลลัพธ์ที่วัดได้คือการแจ้งเตือนน้อยลง ไม่ใช่มากขึ้น เพราะระบบที่แจ้งเตือนทุกเรื่องฝึกให้คนเพิกเฉย
คุณสมบัติหลัก
ตรวจจับความผิดปกติ
Machine Learning ที่จับพฤติกรรมผิดปกติทั้งใน Metric, Log และ Trace
ลดสัญญาณรบกวน
เชื่อมโยงและรวมการแจ้งเตือน ให้ทีมโฟกัสกับสิ่งที่สำคัญจริง
แก้ไขอัตโนมัติ
Playbook ที่แก้เหตุการณ์ทั่วไปได้เองโดยไม่ต้องใช้คน
พยากรณ์ทรัพยากร
คาดการณ์ความต้องการทรัพยากรก่อนประสิทธิภาพจะตก
ขั้นตอนการทำงาน
ตรวจ Observability
ประเมินการ Monitor, Logging และ Alert ในปัจจุบัน
รวมข้อมูล
รวม Metric, Log และ Trace ไว้ในชั้น Observability เดียว
สร้างโมเดล & อัตโนมัติ
Deploy การตรวจจับความผิดปกติและ Workflow แก้ไขอัตโนมัติ
ปรับจูน
ปรับโมเดลและ Playbook เพื่อลด False Positive ตามเวลา
เทคโนโลยีที่ใช้
ประโยชน์ที่ได้รับ
ปัญหาที่ AIOps แก้จริง ๆ
อาการชินกับการแจ้งเตือน ระบบ Monitor แบบเกณฑ์คงที่จะแจ้งทุกครั้งที่ค่าเกินโดยไม่สนบริบท ทีมจึงได้รับการแจ้งเตือนหลายร้อยครั้งต่อสัปดาห์และเรียนรู้ที่จะไม่สนใจ แล้วครั้งที่สำคัญจริงก็หายไปในกองเสียงรบกวน AIOps สร้างเส้นฐานของสภาวะปกติแล้วชี้เฉพาะสิ่งที่เบี่ยงเบนจริง
ตัววัดความสำเร็จขัดกับสัญชาตญาณ คือการติดตั้งที่ดีจะลดจำนวนการแจ้งเตือนลงมาก ขณะที่จับเหตุการณ์จริงได้มากขึ้น หากการเปลี่ยนระบบ Monitor ทำให้ทีมได้รับการแจ้งเตือนมากขึ้น แปลว่าแย่ลง ไม่ว่าหน้าจอจะอ้างว่าอย่างไร
สิ่งนี้คุ้มค่าเมื่อถึงขนาดหนึ่งเท่านั้น สำหรับธุรกิจที่มีเซิร์ฟเวอร์สองเครื่อง การ Monitor แบบเกณฑ์คงที่กับวิศวกรที่เก่งก็เพียงพอ AIOps คุ้มค่าเมื่อมีระบบมากพอจนไม่มีใครคนเดียวจำสภาวะปกติได้ทั้งหมด
การตรวจจับความผิดปกติและหาสาเหตุราก
โมเดลเรียนรู้รูปแบบปกติรายวันและรายสัปดาห์ของท่าน รวมถึงโหลดที่พุ่งขึ้นทุกสิ้นเดือนซึ่งเกณฑ์คงที่จะมองว่าเป็นปัญหา แล้วรวมการแจ้งเตือนที่เกี่ยวข้องกันเป็นเหตุการณ์เดียวพร้อมสาเหตุที่น่าจะเป็น แทนที่จะเป็นการแจ้งเตือนสี่สิบรายการแยกกัน
การรวมความสัมพันธ์คือจุดที่ประหยัดเวลาได้มากที่สุด เมื่อฐานข้อมูลช้าลง ทุกอย่างที่พึ่งพามันจะแจ้งเตือนพร้อมกัน การนำเสนอสิ่งนั้นเป็นเหตุการณ์เดียวที่ชี้ไปที่ฐานข้อมูล แทนที่จะเป็นอาการสี่สิบอย่าง มักเป็นความต่างระหว่างการแก้ใน 15 นาทีกับการสืบสวนสองชั่วโมง
การแก้ไขอัตโนมัติ อย่างระมัดระวัง
เหตุการณ์ที่พบบ่อยและเข้าใจดีแล้วสามารถแก้ได้อัตโนมัติ เช่น การรีสตาร์ตบริการที่ค้าง การล้างพาร์ทิชัน Log ที่เต็ม หรือการขยายระบบเมื่อโหลดสูง เราทำอัตโนมัติในขอบเขตแคบ และกำหนดให้ต้องมีคนอนุมัติสำหรับสิ่งที่อาจทำให้เหตุการณ์แย่ลง
รูปแบบความล้มเหลวที่ต้องเลี่ยงคือระบบอัตโนมัติที่ตอบสนองต่ออาการจนทำให้ปัญหาต้นตอวินิจฉัยยากขึ้น หรือที่วนซ้ำไม่จบ ทุกการกระทำอัตโนมัติถูกบันทึก ย้อนกลับได้ และจำกัดอัตรา ส่วนอะไรที่แตะข้อมูลต้องให้คนอนุมัติเป็นค่าเริ่มต้น
บริการที่เกี่ยวข้อง
คำถามที่พบบ่อย
AIOps คืออะไร?+
คือการนำ AI มาดูแลงาน IT ทั้งตรวจจับความผิดปกติ ลดสัญญาณรบกวน และแก้ไขอัตโนมัติ เพื่อจับและแก้ปัญหาก่อนผู้ใช้จะรู้สึก
ทำงานกับระบบ Monitor เดิมได้ไหม?+
ได้ครับ มันรวม Metric, Log และ Trace จากเครื่องมือที่คุณใช้อยู่
ใช้เวลานานแค่ไหนกว่าจะเรียนรู้ระบบเรา?+
โดยทั่วไปไม่กี่สัปดาห์เพื่อเรียนรู้รูปแบบปกติ ก่อนจะเริ่มแจ้งเตือนด้วยความมั่นใจสูง