Misión
Garantizar la confiabilidad, disponibilidad, resiliencia y performance de los servicios tecnológicos críticos mediante la implementación de prácticas de Site Reliability Engineering, definición y seguimiento de SLO/SLI, gestión proactiva de incidentes, observabilidad, análisis de métricas DORA, automatización y mejora continua de la operación, asegurando continuidad del negocio y estabilidad de la plataforma.
Responsabilidades
Definir, implementar y gestionar indicadores de confiabilidad como SLO, SLI y error budgets para servicios críticos, asegurando seguimiento y acciones de mejora.
Liderar o coordinar incidentes de alta complejidad, respuesta cross-equipo, análisis de causa raíz, postmortems y eliminación de recurrencias.
Implementar y mantener observabilidad, monitoreo, trazabilidad, alertamiento, dashboards y runbooks que soporten detección temprana y respuesta efectiva.
Medir y analizar métricas DORA, MTTR, MTTD, change failure rate y eficiencia del ciclo de entrega para identificar riesgos de estabilidad.
Gestionar y mejorar despliegues de infraestructura como código desde una perspectiva de resiliencia, continuidad, rollback y control de cambios.
Brindar soporte operativo a Platform & SRE y equipos de desarrollo cuando la continuidad, performance o disponibilidad del servicio lo requiera.
Incorporar herramientas de inteligencia artificial en tareas técnicas para optimizar análisis, documentación, triage, automatización y calidad de la operación.