Overview
This guide provides operational procedures for managing MCP Server LangGraph on GKE Autopilot in production, including incident response, maintenance tasks, and troubleshooting.This guide provides essential operational procedures for managing GKE Autopilot deployments in production.
Daily Health Check (5 minutes)
Run this every morning to ensure system health:1
Check Cluster Status
Should return:
RUNNING2
Check Pod Health
All pods should show
Running status with 0-1 restarts3
Review Recent Events
No ERROR or WARNING events in last hour
4
Check Database Status
State should be:
RUNNABLE5
View Recent Errors
No critical errors in last hour
Incident Response
P0: Service Down (Complete Outage)
Response Time: 5-10 minutes1
Immediate Assessment
2
Quick Fixes
- Restart Deployment
- Rollback
- Scale Up
3
Verify Recovery
4
Post-Incident Analysis
P1: Performance Degradation
1
Check Resource Usage
2
Check HPA Status
3
Review Database Performance
4
Temporary Scale Up
P2: Database Connection Issues
Connection Refused
Connection Refused
Check Cloud SQL Proxy:Verify Instance Running:Restart Proxy:
Too Many Connections
Too Many Connections
Check Connection Count:Kill Idle Connections:Increase Max Connections (via Terraform):
Deployment Operations
Standard Deployment (via CI/CD)
Recommended: Use the automated GitHub Actions workflow for production deployments.
1
Create Release
2
Monitor CI/CD
The workflow automatically:
- Builds and scans image
- Requests manual approval
- Deploys to production
- Runs validation tests
- Rolls back on failure
https://github.com/USER/REPO/actions3
Verify Deployment
Manual Deployment (Emergency)
Rollback Deployment
- Quick Rollback
- Specific Revision
Database Operations
Manual Backup
Restore from Backup
- Restore to New Instance
- Point-in-Time Recovery
Database Maintenance
Check Maintenance Window:Scaling Operations
Manual Scaling
Cluster Resource Monitoring
Security Operations
Rotate Secrets
1
Generate New Secrets
2
Update Secret Manager
3
Pods Auto-Restart
External Secrets Operator automatically syncs secrets and Reloader restarts pods.Monitor:
Audit Access Logs
Review Binary Authorization Denials
Common Tasks
View Application Logs
View Application Logs
Update Configuration
Update Configuration
Connect to Database
Connect to Database
- Cloud SQL Proxy
- kubectl Port Forward
Export Metrics
Export Metrics
Maintenance Windows
Cluster Upgrades
GKE Autopilot upgrades automatically based on release channel (STABLE for production).Release Channels:
- RAPID: Weekly (for testing)
- REGULAR: Monthly (for general use)
- STABLE: Quarterly (for production) ✅
Database Maintenance
Scheduled maintenance: Sunday 3 AM UTC (configured in Terraform) Reschedule:Monitoring & Alerting
Active Alerts
Create Custom Alert
View Metrics
Access Cloud Monitoring dashboards:GKE Dashboard
Pod metrics, cluster health, node status
Custom Dashboard
Custom metrics created by setup script
Disaster Recovery
Cloud SQL Failover
Manual Failover (for testing):Full DR Procedure
For complete disaster recovery automation:Complete DR Guide
Multi-region failover, backup restoration, RTO/RPO targets
Emergency Procedures
Emergency Stop
Emergency Maintenance Mode
Contacts & Escalation
On-Call Rotation
Configure in PagerDuty/OpsgenieEscalation Path:
- P0/P1: On-call engineer (immediate)
- P2: Engineering team lead (within 4 hours)
- P3: Ticket for next sprint
Related Documentation
Troubleshooting Guide
Detailed debugging procedures
Security Hardening
Security operations and auditing
Cost Optimization
Resource rightsizing and cost controls
Deployment Guide
Production deployment procedures