AIOps

AIOps ระบบ Monitor IT ด้วย AI ในประเทศไทย

ใช้ AI Monitor ระบบ IT ที่จับปัญหาได้ก่อนผู้ใช้จะรู้สึก เรานำการตรวจจับความผิดปกติ การแจ้งเตือนอัจฉริยะ และการแก้ไขอัตโนมัติมาสู่งาน IT สำหรับองค์กรในเชียงใหม่และทั่วประเทศไทย

ระบบเฝ้าระวังที่เรียนรู้ว่าอะไรคือสภาวะปกติของระบบท่าน จึงแจ้งเตือนเมื่อผิดปกติจริง แทนที่จะแจ้งทุกครั้งที่ค่าเกินเกณฑ์ ผลลัพธ์ที่วัดได้คือการแจ้งเตือนน้อยลง ไม่ใช่มากขึ้น เพราะระบบที่แจ้งเตือนทุกเรื่องฝึกให้คนเพิกเฉย

AIOps Live MonitorHighMedLowAnomaly DetectedCPUMemoryAuto-remediation: scaled CPU +2 pods · 4s ago

คุณสมบัติหลัก

ตรวจจับความผิดปกติ

Machine Learning ที่จับพฤติกรรมผิดปกติทั้งใน Metric, Log และ Trace

ลดสัญญาณรบกวน

เชื่อมโยงและรวมการแจ้งเตือน ให้ทีมโฟกัสกับสิ่งที่สำคัญจริง

แก้ไขอัตโนมัติ

Playbook ที่แก้เหตุการณ์ทั่วไปได้เองโดยไม่ต้องใช้คน

พยากรณ์ทรัพยากร

คาดการณ์ความต้องการทรัพยากรก่อนประสิทธิภาพจะตก

ขั้นตอนการทำงาน

1

ตรวจ Observability

ประเมินการ Monitor, Logging และ Alert ในปัจจุบัน

2

รวมข้อมูล

รวม Metric, Log และ Trace ไว้ในชั้น Observability เดียว

3

สร้างโมเดล & อัตโนมัติ

Deploy การตรวจจับความผิดปกติและ Workflow แก้ไขอัตโนมัติ

4

ปรับจูน

ปรับโมเดลและ Playbook เพื่อลด False Positive ตามเวลา

เทคโนโลยีที่ใช้

DatadogDynatracePrometheusGrafanaElasticPagerDutyOpenTelemetryMoogsoft

ประโยชน์ที่ได้รับ

จับปัญหาได้ก่อนผู้ใช้รู้สึก
ลดความล้าจากการแจ้งเตือนมาก
แก้ปัญหาได้เร็วขึ้น (MTTR)
แก้เหตุการณ์ทั่วไปได้เอง
วางแผนทรัพยากรได้ฉลาดขึ้น
ระบบพร้อมใช้มากขึ้น ดับไฟน้อยลง

ปัญหาที่ AIOps แก้จริง ๆ

อาการชินกับการแจ้งเตือน ระบบ Monitor แบบเกณฑ์คงที่จะแจ้งทุกครั้งที่ค่าเกินโดยไม่สนบริบท ทีมจึงได้รับการแจ้งเตือนหลายร้อยครั้งต่อสัปดาห์และเรียนรู้ที่จะไม่สนใจ แล้วครั้งที่สำคัญจริงก็หายไปในกองเสียงรบกวน AIOps สร้างเส้นฐานของสภาวะปกติแล้วชี้เฉพาะสิ่งที่เบี่ยงเบนจริง

ตัววัดความสำเร็จขัดกับสัญชาตญาณ คือการติดตั้งที่ดีจะลดจำนวนการแจ้งเตือนลงมาก ขณะที่จับเหตุการณ์จริงได้มากขึ้น หากการเปลี่ยนระบบ Monitor ทำให้ทีมได้รับการแจ้งเตือนมากขึ้น แปลว่าแย่ลง ไม่ว่าหน้าจอจะอ้างว่าอย่างไร

สิ่งนี้คุ้มค่าเมื่อถึงขนาดหนึ่งเท่านั้น สำหรับธุรกิจที่มีเซิร์ฟเวอร์สองเครื่อง การ Monitor แบบเกณฑ์คงที่กับวิศวกรที่เก่งก็เพียงพอ AIOps คุ้มค่าเมื่อมีระบบมากพอจนไม่มีใครคนเดียวจำสภาวะปกติได้ทั้งหมด

การตรวจจับความผิดปกติและหาสาเหตุราก

โมเดลเรียนรู้รูปแบบปกติรายวันและรายสัปดาห์ของท่าน รวมถึงโหลดที่พุ่งขึ้นทุกสิ้นเดือนซึ่งเกณฑ์คงที่จะมองว่าเป็นปัญหา แล้วรวมการแจ้งเตือนที่เกี่ยวข้องกันเป็นเหตุการณ์เดียวพร้อมสาเหตุที่น่าจะเป็น แทนที่จะเป็นการแจ้งเตือนสี่สิบรายการแยกกัน

การรวมความสัมพันธ์คือจุดที่ประหยัดเวลาได้มากที่สุด เมื่อฐานข้อมูลช้าลง ทุกอย่างที่พึ่งพามันจะแจ้งเตือนพร้อมกัน การนำเสนอสิ่งนั้นเป็นเหตุการณ์เดียวที่ชี้ไปที่ฐานข้อมูล แทนที่จะเป็นอาการสี่สิบอย่าง มักเป็นความต่างระหว่างการแก้ใน 15 นาทีกับการสืบสวนสองชั่วโมง

การแก้ไขอัตโนมัติ อย่างระมัดระวัง

เหตุการณ์ที่พบบ่อยและเข้าใจดีแล้วสามารถแก้ได้อัตโนมัติ เช่น การรีสตาร์ตบริการที่ค้าง การล้างพาร์ทิชัน Log ที่เต็ม หรือการขยายระบบเมื่อโหลดสูง เราทำอัตโนมัติในขอบเขตแคบ และกำหนดให้ต้องมีคนอนุมัติสำหรับสิ่งที่อาจทำให้เหตุการณ์แย่ลง

รูปแบบความล้มเหลวที่ต้องเลี่ยงคือระบบอัตโนมัติที่ตอบสนองต่ออาการจนทำให้ปัญหาต้นตอวินิจฉัยยากขึ้น หรือที่วนซ้ำไม่จบ ทุกการกระทำอัตโนมัติถูกบันทึก ย้อนกลับได้ และจำกัดอัตรา ส่วนอะไรที่แตะข้อมูลต้องให้คนอนุมัติเป็นค่าเริ่มต้น

บริการที่เกี่ยวข้อง

คำถามที่พบบ่อย

AIOps คืออะไร?+

คือการนำ AI มาดูแลงาน IT ทั้งตรวจจับความผิดปกติ ลดสัญญาณรบกวน และแก้ไขอัตโนมัติ เพื่อจับและแก้ปัญหาก่อนผู้ใช้จะรู้สึก

ทำงานกับระบบ Monitor เดิมได้ไหม?+

ได้ครับ มันรวม Metric, Log และ Trace จากเครื่องมือที่คุณใช้อยู่

ใช้เวลานานแค่ไหนกว่าจะเรียนรู้ระบบเรา?+

โดยทั่วไปไม่กี่สัปดาห์เพื่อเรียนรู้รูปแบบปกติ ก่อนจะเริ่มแจ้งเตือนด้วยความมั่นใจสูง

พร้อมเริ่มแล้วใช่ไหม?

นัดประเมินฟรี และรับใบเสนอราคาคงที่สำหรับระบบของท่าน

ขอประเมินระบบ IT ฟรี