Thank you for sending your enquiry! One of our team members will contact you shortly.
Thank you for sending your booking! One of our team members will contact you shortly.
Course Outline
Foundations of Agentic AI in Operations
- Evolution from static runbooks to reasoning agents: the progression of IT automation.
- Anatomy of an agent: reasoning loops, tool utilization, memory, and planning.
- Determining when to automate versus when to maintain human oversight.
Agent Frameworks and Architectural Patterns
- Single-agent patterns: ReAct, Plan-and-Execute, and tool-calling loops.
- Multi-agent architectures: supervisor, hierarchical, and swarm models.
- Framework comparison: LangGraph, CrewAI, AutoGen, and custom agent solutions.
- Building your first operational agent: querying monitoring, diagnosing issues, and proposing solutions.
Tool Integration for IT Operations
- Connecting agents to APIs for Prometheus, Grafana, Datadog, and PagerDuty.
- Agent-driven log querying with Elasticsearch, Loki, and Splunk integrations.
- Utilizing infrastructure tools: kubectl, Terraform, and Ansible via agent actions.
- Designing secure tool interfaces with parameter validation and idempotency.
Automated Incident Response
- Automated incident triage: severity classification and intelligent routing.
- Generating root cause hypotheses and gathering supporting evidence.
- Automated remediation strategies: restart, scaling, rollback, and failover actions.
- Constructing an incident runbook agent with progressive levels of autonomy.
Safety, Guardrails, and Human-in-the-Loop Protocols
- Action classification: read-only, low-risk, high-risk, and destructive operations.
- Implementing approval gates and escalation policies for critical operations.
- Guardrail patterns: action allowlists, blast radius limitations, and rollback guarantees.
- Maintaining audit trails and decision provenance for compliance purposes.
Multi-Agent Orchestration for Complex Incidents
- Coordinating specialist agents: triage, diagnosis, and remediation units.
- Managing inter-agent communication and shared context.
- Resolving conflicts when agents propose contradictory actions.
- Conducting end-to-end major incident simulations with multi-agent responses.
Observability and Evaluation
- Tracing agent reasoning chains for debugging and audit purposes.
- Evaluating agent decision quality: precision, recall, and time-to-resolution.
- Establishing feedback loops: learning from operator overrides and outcomes.
- Tracking costs and managing token economics for operational agents.
Production Deployment and Operations
- Deploying agents as services: APIs, webhooks, and scheduled jobs.
- Gradual autonomy rollout: transitioning from shadow mode to full auto-remediation.
- Runbook for agent failures: protocols for when the agent itself breaks.
- Building the business case and measuring ROI for autonomous operations.
Requirements
- Practical experience with IT operations, DevOps, or SRE practices.
- Proficiency in Python scripting and REST APIs.
- Fundamental understanding of LLM capabilities and prompt engineering.
Target Audience
- SRE and DevOps engineers exploring AI-driven automation strategies.
- Platform engineers focused on building self-healing infrastructure.
- IT operations leaders evaluating agentic AI for incident management.
14 Hours