ห้าปีที่แล้ว AIOps (AI for IT Operations) เป็น buzzword ของ vendor presentation วันนี้มันคือ operational reality ในองค์กรขนาดกลาง-ใหญ่ที่จัดการ workload กระจายอยู่บน on-prem, multiple cloud, edge, และ container — สเกลที่ทีม Operations 5-10 คนไม่มีทางตามทันด้วย manual process
ตลาด AIOps คาดว่าจะแตะ 18.95 พันล้านดอลลาร์ในปี 2026 ตาม Gartner Market Guide ที่สำคัญคือ market segment ที่โตเร็วที่สุดไม่ใช่ "detection" อีกแล้ว — แต่เป็น closed-loop automation ที่ระบบวินิจฉัยและแก้ไขเองโดยไม่รอ ticket
AIOps ในปี 2026 ทำอะไรได้บ้าง
แตกต่างจากยุค 2020-2022 ที่ AIOps คือ "log aggregation + correlation" ในปี 2026 เห็น capability ที่ครอบคลุมกว่าเดิม:
1. Anomaly detection ที่ context-aware
ไม่ใช่แค่ threshold-based (CPU > 80%) แต่เป็น causal AI ที่เข้าใจ topology ของระบบ ตัวอย่าง: ถ้า latency ของ checkout service ขึ้น 200ms ขณะที่ traffic ลดลง 30% — AIOps รู้ว่าน่าจะเป็น downstream database issue ไม่ใช่ traffic spike
2. Root-cause analysis (RCA) แบบ automate
รวม signal จาก metric, log, trace, change event, deploy pipeline แล้วชี้ตัวการที่น่าจะเป็น within minute ไม่ใช่ชั่วโมง — Dynatrace Davis AI, BigPanda, ServiceNow Now Assist เป็น example
3. Self-healing action
- ขยาย container instance อัตโนมัติเมื่อ load ขึ้น
- Restart service ที่ memory leak ที่ตรวจสอบจาก trend ไม่ใช่ crash
- Rollback deploy ที่เปอร์เซ็นต์ error เพิ่มขึ้นเกิน baseline
- Open + assign ticket ให้ทีมที่เกี่ยวข้องโดยอัตโนมัติพร้อม diagnosis
4. Closed-loop verification
หลัง remediate ระบบรอดู metric และ verify ว่า incident ปิดจริง ไม่ใช่แค่ alert หาย — ถ้าไม่ recover ภายในเวลาที่กำหนด escalate ไปอีก step
AIOps ปี 2020 บอกว่าระบบป่วยที่ไหน AIOps ปี 2026 รักษาให้ — แต่ตัวระบบไม่ควรเป็นหมอที่ดูแลตัวเอง 100%
Platform leader ในปี 2026
จาก Gartner Magic Quadrant และ Forrester Wave ปี 2026 พบว่ากลุ่ม leader มี 3 กลุ่ม:
กลุ่ม Full-stack observability + embedded AIOps
- Datadog — observability ที่กว้างที่สุด มี AI watch + Bits AI assistant
- Dynatrace — strong RCA ผ่าน Davis causal AI engine
- New Relic — embedded AI Monitoring สำหรับ LLM-based app
กลุ่ม Pure-play AIOps / correlation specialist
- BigPanda — เก่งที่ alert correlation across tool
- Moogsoft (เป็นของ Dell) — historical leader, integration หลาย ITSM
- OpenObserve — open-source first
กลุ่ม ITSM-integrated
- ServiceNow ITOM + Now Assist — closed-loop กับ ticket lifecycle
- BMC Helix AIOps — รวมกับ Discovery + ITSM
- OpenText AI Operations Management — multi-vendor enterprise
ข้อควรพิจารณาที่มัก underestimate
1. Data quality เป็น prerequisite ไม่ใช่ output
AIOps เก่งแค่ไหนก็เป็น garbage-in, garbage-out หาก:
- CMDB ไม่อัปเดต — RCA จะชี้ผิดทาง
- Tagging ของ resource ไม่ consistent — correlation พังเพราะ AI ไม่รู้ว่า EC2 instance "i-abc123" คือ database ของ service ไหน
- Log schema เปลี่ยนบ่อย — anomaly model ต้อง retrain ซ้ำ
2. Auto-remediation = dangerous if scoped wrong
ตัวอย่างจริงที่ทำให้ engineer หงุดหงิด: AIOps ที่ auto-restart "service ที่ดู unhealthy" แต่ services นั้นกำลังทำ long-running batch job — restart = data loss
แนวทาง: ใช้ action class แยกระดับ:
- Safe (read-only, retry, log) — auto ได้
- Reversible (restart pod, drain node) — auto ภายใน guard rail (เช่น ไม่เกิน N ครั้ง/ชั่วโมง)
- Irreversible (delete resource, rollback DB) — เปิด ticket ให้คน approve ก่อน
3. ทักษะทีมต้องเปลี่ยน
SRE/Ops ในยุค AIOps ไม่ใช่คน "ดู dashboard" แต่เป็นคน:
- ออกแบบ runbook ที่ machine-executable
- Tune alert policy + suppression rule บน automation platform
- Audit AI decision และ explain ให้ business เข้าใจเมื่อเกิด incident
ถ้าทีมยังคุ้นแต่กับ Nagios/Zabbix dashboard แล้วกระโดดเข้า AIOps จะกลายเป็น "automation theatre" — ระบบทำงานเองแต่ทีมไม่เข้าใจสิ่งที่เกิดขึ้น
4. Cost management
AIOps platform ส่วนใหญ่คิดราคาตาม data ingest volume (GB/วัน หรือ events/วินาที) — ถ้าไม่กรอง log noise (DEBUG log จาก dev, health-check polling) bill จะพุ่งเดือนละ 2-3 เท่าได้ในเวลาสั้น
Roadmap 12 เดือนสำหรับองค์กรที่จะเริ่ม
เดือน 1-2: Baseline
- ทำ inventory tool monitoring ที่มีอยู่ (Zabbix, Prometheus, Splunk, Datadog) และวัด volume + cost ปัจจุบัน
- กำหนด golden signal (latency, traffic, errors, saturation) ที่จะ track ในระดับ business service
เดือน 3-4: Centralize + clean
- รวม alert ทุก source ไว้ที่ AIOps platform เดียว — เน้น correlation ก่อน automation
- Clean CMDB และ asset tag ให้ consistent
เดือน 5-6: Detect + Triage
- เปิด anomaly detection บน 3-5 service ที่สำคัญที่สุด
- ให้ AI ช่วย RCA แต่ยังเป็น manual remediation
เดือน 7-9: Safe auto-action
- เปิด safe-class auto-action (retry, scale-out, clear cache)
- Audit ทุกสัปดาห์ — เปิด post-mortem แม้ AI ทำสำเร็จ เพื่อสร้างความเข้าใจในทีม
เดือน 10-12: Reversible auto + closed loop
- ขยายไป reversible class (restart, drain) ภายใต้ guard rail
- ตั้ง closed-loop verification — ระบบรอ confirm ว่า remediate ได้ผลจริง
สรุป
AIOps ปี 2026 ไม่ได้แก้ปัญหา IT operations ทุกอย่าง — มันเปลี่ยน โหมดการทำงาน ของทีม จาก "ดับไฟตลอดเวลา" เป็น "ออกแบบและตรวจสอบระบบที่ดับไฟเอง" องค์กรที่ลงทุน tool เก่งๆ โดยไม่อัปเกรด process + people จะได้ ROI น้อยกว่าครึ่ง ขณะที่องค์กรที่เริ่มเล็กแต่ทำให้ครบ — clean data, scoped automation, audit ทุก action — จะเห็น MTTR (Mean Time To Resolve) ลดลง 40-60% ภายในปีแรก
คำถามไม่ใช่ "AIOps ใช่ทางหรือไม่" แต่เป็น "ทีมเราพร้อมจะรับผิดชอบ decision ที่ AI ทำแทนหรือยัง"