Especialista SRE

Hace 2 días

Medellín, Antioquia, Colombia Strategic Points S Trabajo remoto Jornada completa
Especialista SRE (Site Reliability Engineering)
Palabras clave:
  • Especialista SRE
  • Site Reliability Engineer
  • Ingeniero SRE
  • DevOps
  • Observabilidad
  • Cloud Computing
  • Kubernetes
  • Infraestructura Tecnológica
  • Métricas DORA
  • Automatización
  • SLO
  • SLI
  • IaC
  • CI/CD
  • Python

Hola ¿Listo para llevar la confiabilidad de nuestros servicios al siguiente nivel? Buscamos un Especialista SRE apasionado por la excelencia operativa y la automatización. Tu rol será clave para garantizar la disponibilidad, resiliencia y performance de nuestra plataforma tecnológica, trabajando de cerca con equipos de Platform, SRE y Desarrollo. Si te motiva el desafío de optimizar la operación mediante SRE, observabilidad, Kubernetes, métricas DORA y automatización, este es tu lugar Aquí tendrás la oportunidad de aprender y aplicar conocimientos en cloud, IA y las últimas tendencias en Site Reliability Engineering. Postúlate y participa en la evolución de una operación tecnológica más confiable

Responsabilidades:
  • Diseñar implementar y mantener sistemas robustos y escalables utilizando principios SRE.
  • Definir y monitorear SLOs y SLIs gestionando los Error Budgets para asegurar la confiabilidad del servicio.
  • Implementar y optimizar soluciones de observabilidad (APM logs métricas tracing) para una visibilidad completa del sistema.
  • Desarrollar y mantener pipelines de CI/CD y prácticas de IaC para automatizar el despliegue y la gestión de la infraestructura.
  • Gestionar y mantener entornos Kubernetes asegurando su estabilidad y performance.
  • Colaborar estrechamente con los equipos de desarrollo y plataforma para resolver incidentes críticos y mejorar la resiliencia del sistema.
  • Analizar métricas DORA para identificar cuellos de botella y oportunidades de mejora continua.
  • Participar en la guardia de incidentes y liderar la respuesta y resolución de problemas complejos.
  • Investigar y aplicar nuevas tecnologías y enfoques incluyendo inteligencia artificial para mejorar la operación.
Requerimientos:
  • Experiencia mínima de 3 a 5 años en roles de SRE Site Reliability Engineer Ingeniero DevOps o similares.
  • Dominio de conceptos clave como SLO SLI Error Budgets Observabilidad (APM Logs Métricas Trazabilidad) y métricas DORA (MTTR MTTD Change Failure Rate).
  • Experiencia sólida en Infraestructura como Código (IaC) y prácticas de CI/CD.
  • Conocimiento avanzado en orquestación de contenedores con Kubernetes y Helm.
  • Experiencia trabajando con proveedores de Cloud (AWS Azure GCP).
  • Nivel profesional tecnólogo o técnico avanzado en Ingeniería de Sistemas Software Infraestructura DevOps Cloud Telecomunicaciones o áreas afines.
  • Experiencia en lenguajes de scripting como Python Bash o PowerShell.
  • Conocimiento o interés en Inteligencia Artificial aplicada a la operación.
  • Capacidad demostrada para colaborar efectivamente con equipos de Platform SRE y Desarrollo.
  • Mentalidad orientada a la resolución de problemas y al aprendizaje continuo.
Habilidades técnicas:
  • SRE
  • Observabilidad
  • Kubernetes
  • Cloud
  • Python
  • Bash
  • IaC
  • CI/CD
Habilidades interpersonales:
  • Colaboración
  • Resolución de problemas
  • Comunicación
  • Aprendizaje continuo