Ingeniero SRE
Fiabilidad de sistemas distribuidos, automatización de infraestructura y gestión de incidentes en entornos cloud de alta exigencia
About
El ingeniero SRE (Site Reliability Engineer) diseña y mantiene infraestructuras de software con altos estándares de disponibilidad y rendimiento. Trabaja con herramientas de observabilidad como Prometheus, Grafana y Datadog, gestiona pipelines CI/CD con Jenkins o GitLab CI, y opera sobre plataformas cloud como AWS, GCP o Azure. Colabora estrechamente con equipos de desarrollo, operaciones y producto para definir SLOs, SLIs y presupuestos de error. Interviene en postmortems, automatiza tareas operativas con Python o Go, y aplica principios de ingeniería de software a los problemas de operaciones.
Habilidades
Habilidades técnicas
- Experiencia con Kubernetes y Docker para contenedores
- Uso de Prometheus, Grafana y Datadog para monitoreo
- Conocimiento en AWS / GCP / Azure para servicios en la nube
- Automatización con Python y Go
- Implementación de Terraform e Infraestructura como código
- Manejo de CI/CD con GitLab CI, Jenkins y ArgoCD
- Dominio de Linux avanzado y networking
- Gestión de SLO/SLI/Error Budget
Habilidades interpersonales
- Enfoque de pensamiento sistémico ante problemas complejos
- Habilidad para la comunicación técnica clara
- Priorización bajo presión en situaciones de incidente
- Compromiso con la mejora continua y automatización
- Colaboración efectiva entre equipos de desarrollo y operaciones
Misiones
- Definir y monitorizar SLOs, SLIs y presupuestos de error para servicios críticos en producción
- Diseñar alertas inteligentes en Prometheus y Grafana, reduciendo el ruido de alertas en un 40%
- Automatizar runbooks operativos con Python y Ansible, eliminando tareas manuales repetitivas
- Orquestar clústeres Kubernetes, gestionando la capacidad y la resiliencia de microservicios
- Liderar postmortems estructurados, documentando causas raíz y planes de acción verificables
- Implementar pipelines CI/CD en GitLab CI, optimizando tiempos de despliegue por debajo de 10 minutos
- Desarrollar herramientas internas de diagnóstico que reducen el tiempo medio de resolución (MTTR)
- Realizar análisis de capacidad y planificación de escalado horizontal y vertical de infraestructura
- Integrar prácticas de chaos engineering con Chaos Monkey para validar la resiliencia del sistema
- Colaborar con desarrollo en revisiones de arquitectura, evaluando el impacto operativo de nuevas funcionalidades
Entornos de trabajo
Los entornos de trabajo pueden variar:
Posibles evoluciones
- Avanzar a Staff Engineer o Principal SRE
- Convertirse en Arquitecto de infraestructura cloud
- Asumir el rol de Director de ingeniería de plataforma
- Liderar como Engineering Manager de equipos de operaciones
- Trabajar como Consultor independiente en fiabilidad de sistemas








