Experience
4 - 9 yrs
Job Location
Hyderabad, India
Vacancy
4
Designation
Site Reliability Engineer
Job Type
Not specified
Job Description
Site Reliability Engineer (SRE)
ole Summary
The Site Reliability Engineer will improve reliability, observability, service availability, incident response and root cause analysis for AWS-hosted systems.
Required Primary Skills
- CloudWatch
- X-Ray
- Logs and metrics
- Incident response
- RCA
- Automation
Secondary Skills
- DevOps basics
- Scripting
- Capacity and performance
- Containers
- Operational reporting
Technical Skills
- Amazon CloudWatch, AWS X-Ray, logs, metrics and dashboarding
- Incident management, RCA and problem management practices
- Scripting and automation using Python, shell or related tools
- Availability, resilience, performance and capacity concepts
Key Responsibilities
- Monitor application and infrastructure availability, performance and reliability.
- Build dashboards, alerts and service health metrics.
- Support incidents, RCA and corrective action tracking.
- Automate operational and reliability improvement tasks.
- Partner with DevOps, application and operations teams to improve resilience.
Preferred Certifications
- AWS Certified SysOps Administrator - Associate
- AWS Certified DevOps Engineer - Professional
- AWS Certified Solutions Architect - Associate
Expected Deliverables
- Monitoring dashboards and alert rules
- Incident and RCA reports
- Reliability improvement backlog
- Operational automation scripts
Qualification
- B.E. / B.Tech / M.Tech / MCA or equivalent degree in Computer Science, Information Technology, Engineering or related discipline.
- Hands-on delivery experience aligned to the stated experience range and role scope.
Good to have
- AWS certification or active AWS certification plan.
- Experience in reusable assets, accelerators, cloud competency building, customer workshops or proposal support.
