
Search by job, company or skills
Strong experience as an SRE, DevOps Engineer, Platform Engineer, Infrastructure Engineer, or Production Engineer.
Hands-on experience deploying and operating production systems across multiple environments such as Dev, QA, UAT, and Prod.
Strong knowledge of Linux, shell scripting, Git, CI/CD, Docker, and Kubernetes.
Experience with observability platforms, logging, metrics, tracing, alerting, and dashboarding.
Experience integrating systems with enterprise monitoring, alerting, SIEM, or Incident Response workflows.
Experience defining and implementing runbooks, operational procedures, escalation paths, and production support models.
Strong troubleshooting skills across application, infrastructure, networking, container, and cloud layers.
Familiarity with production reliability practices such as SLIs, SLOs, incident management, capacity planning, failure handling, and post-incident review.
Experience working with APIs, gateways, microservices, service accounts, secrets management, and enterprise integration patterns.
Ability to collaborate with cybersecurity, AI engineering, infrastructure, application development, and operations teams.
Job ID: 151688251
Skills:
Logging, Git, Docker, Dashboarding, Linux Shell Scripting, Siem, metrics, Kubernetes, tracing, operational procedures, runbooks, CI CD, alerting, production support models, observability platforms, escalation paths, Incident Response workflows, enterprise monitoring
Skills:
.NET, Java, Prometheus, Spring Boot, Grafana, Datadog, Jenkins, Docker, Terraform, ECS, Dynatrace, Gitlab, Splunk, Python, Kubernetes, Site Reliability Engineering, observability
Skills:
Gcp, Docker, Cloud Infrastructure, Apache Kafka, Kubernetes, AWS, error budgets, SLIs, AI models, distributed tracing, infrastructure-as-code, AI-assisted engineering tools, SLOs, structured logging, application instrumentation
Skills:
Logging, Identity And Access Management, Git, Docker, Incident Management, Siem, Linux Shell Scripting, Kubernetes, automation using Python or Go, post-incident reviews, SLIs, tracing, secrets management, Monitoring, alerting, production reliability practices, Capacity Planning, observability platforms, SLOs, Incident Response workflows, enterprise monitoring
Skills:
Bash, Dns, SSL, Gcp, Docker, Ansible, Networking Protocols, Lua, Load Balancers, Linux Internals, MongoDB, Puppet, Oracle, Tls, Kubernetes, Python, Golang, AWS, AliCloud, DevOps practices, distributed system components, Spinnaker, Git-based source control