การตอบสนองเหตุการณ์ด้วย AI: วินิจฉัยเร็วและแผนปฏิบัติการ

เหตุการณ์: AI วิเคราะห์ล็อก หาสาเหตุราก และเสนอวิธีแก้

เอเจนต์เฝ้าดูการแจ้งเตือน (Datadog, Prometheus) รวบรวมล็อก วิเคราะห์สาเหตุราก (อะไรพังและทำไม) เสนอขั้นตอนการแก้ และประสานทีมผ่าน Slack ลดเวลาวินิจฉัยจากชั่วโมงเหลือนาที เริ่มต้นที่ $19/เดือน

366k+⭐ OpenClaw บน GitHub
<5นาทีสู่การเปิดใช้

คุ้นๆ ไหม?

อะไรกำลังกินเวลาของคุณ

เหตุการณ์ยืดเยื้อ: เมื่อมีอะไรล่ม การวินิจฉัยใช้เวลาหนึ่งชั่วโมง การแก้ใช้อีกหนึ่งชั่วโมง และลูกค้าเสียเงินระหว่างนั้น

ล็อกมีเสียงรบกวน: ล้านบรรทัดที่ต้องหาสองบรรทัดที่สำคัญ เป็นไปไม่ได้ด้วยมือ

ไม่มีแนวทางเป็นระบบ: ทุกครั้งมีคนต่อสู้กับล็อกคนเดียว โดยไม่มีแผนปฏิบัติการที่ตั้งไว้

ข้อมูลกระจายอยู่: ล็อกใน Datadog เมตริกใน Prometheus เทรซใน Jaeger โค้ดใน GitHub ต้องรวมทั้งหมด

ความสามารถ

เอเจนต์ AI ของคุณทำอะไรได้บ้าง

การเฝ้าดูและการรวบรวมการแจ้งเตือน

เอเจนต์เชื่อมต่อ Datadog, Prometheus และ Grafana และตรวจจับการแจ้งเตือนในขณะที่ถูกยิง เห็นทันทีว่าอะไรล้ม (CPU? หน่วยความจำ? ความหน่วงของคำขอ?) เมื่อไหร่ และรุนแรงแค่ไหน

การสหสัมพันธ์ล็อกและเมตริก

เอเจนต์ไม่ดูล็อกแยกต่างหาก เห็นว่า: เวลา 14:23 มีพีค CPU และในเวลาเดียวกันในล็อก «OOM killed»: นั่นคือสาเหตุ สหสัมพันธ์เหตุการณ์: ระบบเสื่อมแล้วล่ม แสดงกราฟเมตริกร่วมกับชิ้นส่วนล็อก

วิเคราะห์สาเหตุรากและคำแนะนำ

เอเจนต์วิเคราะห์ว่าเป็นบั๊กในโค้ด (หน่วยความจำรั่วในฟังก์ชัน X) การตั้งค่าผิด (ขีดจำกัดการเชื่อมต่อต่ำเกินไป) หรือปัญหาภายนอก (ฐานข้อมูลโอเวอร์โหลด) และเสนอวิธีแก้ที่เป็นรูปธรรม

แผนปฏิบัติการทีละขั้นตอน

เอเจนต์ไม่ได้แค่พูด «รีสตาร์ทเซิร์ฟเวอร์» แต่ให้แผน: «สามขั้นตอนเพื่อแก้: (1) เพิ่มขนาดพูลในการตั้งค่า (2) ดีพลอยอิมเมจใหม่ (3) ตรวจว่าการกู้คืนถูกต้อง»

ประสานผ่าน Slack และ PagerDuty

เอเจนต์โพสต์ในช่องเหตุการณ์ของ Slack: การวินิจฉัยและแผน ทำเครื่องหมายเหตุการณ์ PagerDuty ว่าแก้ไขแล้วเมื่อใช้วิธีแก้ ทีมได้รับข้อมูลโดยไม่ต้องส่งข้อความแยก

ทำงานกับเครื่องมือของคุณ

Datadog
Prometheus
Grafana
Slack
PagerDuty
GitHub
วิธีใช้งาน

เริ่มต้นได้ในไม่กี่ขั้นตอน

1

การแจ้งเตือนถูกยิง

การแจ้งเตือนจาก Datadog หรือ Prometheus กระโดด: «CPU สูงกว่า 80% ในโปรดักชัน» การแจ้งเตือนไปถึง PagerDuty และวิศวกรเวรเห็น เอเจนต์ได้รับการแจ้งเตือนในเวลาเดียวกัน

2

เอเจนต์รวบรวมข้อมูลและวิเคราะห์

ในไม่กี่วินาที เอเจนต์รวบรวมล็อกล่าสุด (ชั่วโมงที่ผ่านมา) เมตริกจาก Datadog (CPU หน่วยความจำ ดิสก์) เทรซ (ถ้ามี) และคอมมิต Git ของวันสุดท้าย และวิเคราะห์ว่าอะไรเปลี่ยนไป

3

สาเหตุรากและคำแนะนำ

เอเจนต์ระบุว่าเกี่ยวกับอะไร: บั๊กในโค้ด (ดีพลอยเมื่อชั่วโมงที่แล้วพังการจัดการหน่วยความจำ) การตั้งค่าผิด หรือภาระที่เพิ่มขึ้น และเสนอวิธีแก้ที่เป็นรูปธรรม: ย้อนดีพลอยหรือเพิ่มทรัพยากร

4

ข้อความใน Slack พร้อมแผนปฏิบัติการ

เอเจนต์โพสต์ในช่องเหตุการณ์: «สาเหตุราก: หน่วยความจำรั่วในฟังก์ชัน X (คอมมิต abc123) วิธีแก้: ดีพลอยสาขาที่มีการแก้ไข หรือเป็นการชั่วคราว เพิ่มขีดจำกัดหน่วยความจำ คุณชอบอะไร? (1) วิธีแก้ชั่วคราวเร็ว (2) การแก้ไขเต็ม»

5

ติดตามและปิด

วิศวกรเลือกและใช้วิธีแก้ เอเจนต์เฝ้าดู: เมตริกกลับสู่ปกติไหม? ถ้าใช่ ปิดเหตุการณ์ใน PagerDuty และบันทึกใน Slack postmortem และงานติดตามก็สามารถทำให้เป็นอัตโนมัติได้

FAQ

คำถามที่พบบ่อย

ได้ Prometheus กับ Grafana, Elastic, Splunk, CloudWatch: เอเจนต์เชื่อมต่อกับใดก็ได้ ต้องการการเข้าถึง API และการตั้งค่าที่เหมาะสม คุณสามารถรวม: เมตริกจาก Datadog ล็อกจาก GitHub การแจ้งเตือนใน Slack

อยากได้ OpenClaw โดยไม่ต้อง DevOps?

OpenKlo คือโฮสติ้งแบบจัดการสำหรับ OpenClaw ต้นฉบับ เอเจนต์เดิม พร้อมใน 3 นาที

ยกเลิกได้ทุกเมื่อ · รวมโมเดลชั้นนำ · เปลี่ยนแพ็กเกจได้ทุกเมื่อ