Ravi Sharma
USA 872-***-**** ************@*****.*** LinkedIn
SUMMARY
Site Reliability Engineer with around 7 years of experience supporting cloud infrastructure, DevOps platforms, and production operations across banking and enterprise technology environments. Expertise in AWS, Kubernetes, Terraform, Docker, Prometheus, Grafana, Splunk, Python, CI/CD, Infrastructure as Code (IaC), Observability, Incident Management, and Service Reliability, delivering scalable and resilient solutions for business-critical applications.
PROFESSIONAL EXPERIENCE
Site Reliability Engineer The Huntington National Bank USA Sep 2025 – Present
● Engineered high-availability banking infrastructure using AWS EC2, Auto Scaling, and Route 53, partnering with application teams to maintain service availability and reducing system downtime by 18 hours monthly across 45 critical banking services.
● Implemented enterprise observability frameworks leveraging Prometheus, Grafana, and Splunk, collaborating with incident response teams to establish strict SLIs, SLOs, and alerting rules that maximized visibility across 120 production workloads.
● Constructed unified infrastructure provisioning pipelines through Terraform, AWS CloudFormation, and Python scripting, streamlining environment deployments and accelerating infrastructure staging for 20 enterprise application platforms.
● Optimized container orchestration utilizing Kubernetes, Helm, and AWS EKS, coordinating with development teams during Agile Scrum sprint cycles to support 150K+ daily banking transactions and executing RCA inside Jira to resolve 35 high-priority production incidents. DevOps Engineer / Site Reliability Engineer Dell Technologies India Jun 2019 – Aug 2023
● Constructed Infrastructure as Code (IaC) solutions using Terraform, partnering with infrastructure delivery managers to standardize cloud environments and eliminate manual provisioning activities across 18 engineering teams.
● Established Monitoring & Observability frameworks using Prometheus, Grafana, and alerting mechanisms, collaborating with development teams to identify performance bottlenecks and prevent 42 critical production incidents.
● Streamlined CI/CD delivery workflows leveraging Docker, Jenkins, and Git, working alongside release management teams to accelerate software deployment cycles across 65 microservices.
● Resolved container orchestration and service scaling challenges within Kubernetes, coordinating with network engineering teams to troubleshoot traffic routing issues and clear 28 high-priority production blockers.
● Developed automation and operational tooling using Python, supporting Site Reliability Engineering (SRE) initiatives including capacity management, system optimization, and platform stability across 140 enterprise server environments. Associate Site Reliability Engineer Robosoft Technologies India May 2018 – Jun 2019
● Formulated application service telemetry checks using Nagios monitoring systems, partnering with backend infrastructure squads to track host operational stability and reducing detection delays for 22 distinct technical service failures.
● Built server configuration provisioning playbooks using Ansible modules, collaborating with systems engineering teams to enforce uniform software environment definitions and removing manual host setup steps across 45 staging environments.
● Isolated recurring database connection exhaustion faults leveraging Linux shell scripting, working alongside production database administrators during patch windows to adjust system performance bounds and clearing 16 database service crashes.
● Triaged network layer connectivity bottlenecks involving reverse proxy configurations inside Nginx web servers, coordinating with software delivery leads to safely modify routing parameters and resolving 19 application accessibility bugs.
● Maintained log aggregation collection agents utilizing enterprise rsyslog configurations, aligning with information compliance security auditors to preserve data retention integrity and indexing 60 gigabytes of operational system logs daily. TECHNICAL SKILLS
● Cloud Platforms: AWS (EC2, S3, RDS, Lambda, VPC, Route 53, CloudWatch, Auto Scaling), Azure, GCP
● Site Reliability Engineering: Service Reliability, High Availability (HA), Disaster Recovery, Capacity Planning, Incident Management, Root Cause Analysis (RCA), Service Level Objectives (SLOs), Service Level Indicators (SLIs), Error Budgets
● Operating Systems: Linux (Ubuntu, Red Hat, CentOS), Unix, Windows Server
● Containers & Orchestration: Docker, Kubernetes, Helm, AWS EKS
● Infrastructure as Code (IaC): Terraform, AWS CloudFormation, Ansible
● Monitoring & Observability: Prometheus, Grafana, ELK Stack, Splunk, CloudWatch, Log Analysis, Alerting
● CI/CD & DevOps: Jenkins, GitHub Actions, GitLab CI/CD, ArgoCD, Continuous Deployment
● Scripting & Automation: Python, Bash, PowerShell, Shell Scripting
● Networking: TCP/IP, DNS, DHCP, Load Balancers, VPN, HTTP/HTTPS, Network Troubleshooting
● Databases & Messaging: MySQL, PostgreSQL, Redis, MongoDB, Apache Kafka, RabbitMQ
● Security & Reliability: IAM, RBAC, MFA, Secrets Management, SSL/TLS, Security Best Practices
● Version Control & Collaboration: Git, GitHub, Jira, Confluence, Agile (Scrum) EDUCATION
M.S. in Management Information Systems – DePaul University, Chicago, IL Sep 2023 – Jun 2025