Líder de Observabilidad y SER (Perú)

Líder de Observabilidad y SER (Perú)

02 ago
|
STEFANINI LATAM
|
Perú

02 ago

STEFANINI LATAM

Perú

¡Sé parte de Stefanini!

En Stefanini somos más de 30.000 genios, conectados desde 41 países, haciendo lo que les apasiona y co-creando un futuro mejor.

Responsabilidades y atribuciones

Estrategia de observabilidad

- Definir la estrategia corporativa de Observabilidad.
- Diseñar y mantener el modelo de observabilidad tecnológica.
- Establecer estándares para la gestión de:
- Métricas.
- Registros.
- Trazas.
- Eventos.
- Alertas.
- Definir lineamientos para la instrumentación de aplicaciones y plataformas.
- Asegurar la visibilidad de servicios críticos, aplicaciones, APIs, infraestructura y componentes Cloud.
- Establecer criterios de monitoreo para ambientes productivos y no productivos.
- Promover una visión integral de observabilidad desde la experiencia del usuario hasta la infraestructura.

SRE y confiabilidad

- Definir y gobernar prácticas de Ingeniería de Confiabilidad del Sitio.
- Establecer SLI, SLO y Presupuestos de Error.
- Definir objetivos de disponibilidad, rendimiento y confiabilidad.
- Liderar la identificación y reducción de riesgos operativos.
- Promover la automatización de tareas repetitivas y manuales.
- Diseñar prácticas para mejorar la resiliencia de las aplicaciones.
- Gestionar la capacidad, disponibilidad y rendimiento de los servicios.
- Definir estándares para la operación de aplicaciones críticas.
- Trabaje con los equipos de desarrollo para incorporar confiabilidad desde el diseño.
- Impulsar la adopción de principios de ingeniería de confiabilidad en la organización.

Gestión de incidentes y problemas

- Liderar la gestión técnica de incidentes críticos.
- Coordinar la atención de incidentes de alto impacto.
- Participar en el Manejo de Incidentes.
- Liderar análisis de causa raíz —Root Cause Analysis—.
- Gestionar postmortems sin enfoque punitivo.
- Liderar el Manejo de Problemas Técnico.
- Identificar problemas recurrentes y definir planes de eliminación.
- Dar seguimiento a las acciones correctivas y preventivas.
- Evaluar tendencias de incidentes, degradaciones y fallas.
- Coordinador con Mesa de Ayuda, Operaciones, Desarrollo, Infraestructura, Cloud y proveedores.
- Participar en el Emergency Change Gate.
- Asegurar la documentación y trazabilidad de los incidentes relevantes.

Monitoreo y gestion de alertas

- Diseñar y gobernar tableros operativos y ejecutivos.
- Definir alertas inteligentes y accionables.
- Reduzca el ruido y la duplicidad de alertas.
- Establecer niveles de criticidad y prioridades.
- Definir procedimientos de respuesta ante eventos.
- Monitorear disponibilidad, latencia, errores, capacidad y rendimiento.
- Implementar prácticas de monitoreo proactivo.
- Promover el uso de automatización para detección y resolución.
- Asegurar que las alertas estén vinculadas con procedimientos operativos claros.

Plataformas y herramientas

- Liderar la evolución de las plataformas de observabilidad.
- Definir estándares de uso para Dynatrace, Datadog,



Grafana y Prometheus.
- Promover la adopción de OpenTelemetry.
- Establecer criterios de gestión de logs mediante ELK, Splunk, Azure Monitor y Azure Log Analytics.
- Integrar herramientas de observabilidad con plataformas Cloud, Kubernetes y DevOps.
- Coordinador de instrumentación de aplicaciones y servicios.
- Definir la estrategia de almacenamiento, retención y consulta de registros.
- Evaluar nuevas herramientas y tecnologías de monitoreo.
- Asegurar la interoperabilidad entre las diferentes herramientas de observabilidad.

Liderazgo y mejora continua

- Liderar el equipo de Observabilidad y SRE.
- Definir objetivos, prioridades y planes de trabajo del equipo.
- Desarrollar capacidades técnicas y metodológicas.
- Impulsar una cultura DevOps y SRE.
- Promover la colaboración entre desarrollo, operaciones y soporte.
- Establecer prácticas de mejora continua.
- Presentar resultados, riesgos y oportunidades a la dirección.
- Definir planos para mejorar la madurez de observabilidad y confiabilidad.
- Identificar oportunidades de automatización y reducción de esfuerzo operativo.

Requisitos y calificaciones

Experiencia general

- Más de 7 años de experiencia competente en tecnología, operaciones, infraestructura, Cloud, DevOps, observabilidad o confiabilidad.
- Experiencia en ambientes de alta criticidad y alta disponibilidad.

Experiencia específica

- Más de 3 años liderando equipos o iniciativas SRE.
- Experiencia comprobada en:
- Alta disponibilidad.
- Gestión de incidentes.
- Gestión de problemas.
- Análisis de la causa raíz.
- Observabilidad.
- Monitoreo de aplicaciones y plataformas.
- DevOps.
- Nube.
- Gestión de capacidad.
- Gestión de rendimiento.
- Automatización operativa.
- Definición de SLI, SLO y Presupuesto de errores.
- Gestión de postmortems.
- Diseño de tableros y métricas operativas.
- Gestión de incidentes críticos.
- Experiencia liderando equipos multidisciplinarios.
- Experiencia coordinando con desarrollo, infraestructura, soporte, seguridad, Cloud y proveedores.
- Experiencia en organizaciones de banca, fintech, telecomunicaciones o sectores con servicios digitales críticos, preferentemente.

Competencias y habilidades blandas

- Liderazgo técnico.
- Capacidad de resolución de problemas.
- Pensamiento analítico.
- Automatización.
- Mejora continúa.
- Influencia transversal.
- Comunicación efectiva.
- Capacidad para trabajar bajo presión.
- Toma de decisiones en situaciones críticas.
- Orientación a resultados.
- Capacidad de priorización.
- Liderazgo de equipos técnicos.




- Capacidad de negociación.
- Comunicación con áreas técnicas y ejecutivas.
- Orientación a la prevención.
- Cultura de aprendizaje a partir de incidentes.

Indicadores de éxito del puesto

- Disponibilidad de las aplicaciones y servicios críticos.
- Cumplimiento de los SLO definidos.
- Reducción del número de incidentes críticos.
- Reducción del tiempo medio de detección —MTTD—.
- Reducción del tiempo medio de recuperación —MTTR—.
- Reducción del número de incidentes recurrentes.
- Porcentaje de servicios con SLI y SLO definidos.
- Porcentaje de servicios con monitoreo completo de métricas, logs y trazas.
- Cumplimiento de Presupuestos Error.
- Reducción del ruido y falsas alertas.
- Porcentaje de autopsias ejecutadas en el tiempo.
- Cumplimiento de acciones correctivas derivadas de RCA.
- Nivel de automatización de tareas operativas.
- Reducción de intervenciones manuales.
- Porcentaje de aplicaciones críticas instrumentadas.
- Cobertura de observabilidad en ambientes productivos.
- Cumplimiento de los objetivos de capacidad y rendimiento.
- Nivel de madurez de las prácticas SRE y DevOps.

Entregables principales

- Estrategia corporativa de Observabilidad.
- Modelo operativo de SRE.
- Catálogo de servicios críticos.
- Estándares de métricas, logs y trazas.
- Catálogo de SLI y SLO.
- Definición de Error Budgets.
- Cuadros de mando operativos y ejecutivos.
- Matriz de criticidad de servicios.
- Modelo de alertamiento.
- Procedimientos de respuesta ante incidentes.
- Informes de disponibilidad y confiabilidad.
- Análisis de capacidad y rendimiento.
- Informes de incidentes críticos.
- Análisis de causa raíz.
- Post mortems y planos de acción.
- Informes de Gestión de Problemas.
- Hoja de ruta de automatización.
- Plan de evolución de la plataforma de observabilidad.
- Indicadores de madurez SRE y DevOps.

Competencias y habilidades blandas

- Liderazgo técnico.
- Capacidad de resolución de problemas.
- Pensamiento analítico.
- Automatización.
- Mejora continúa.
- Influencia transversal.
- Comunicación efectiva.
- Capacidad para trabajar bajo presión.
- Toma de decisiones en situaciones críticas.
- Orientación a resultados.
- Capacidad de priorización.
- Liderazgo de equipos técnicos.
- Capacidad de negociación.
- Comunicación con áreas técnicas y ejecutivas.
- Orientación a la prevención.
- Cultura de aprendizaje a partir de incidentes.

Informaciones adicionales

¿Buscas un lugar donde tus ideas brillen?

Con más de 38 años y una presencia global, en Stefanini transformamos el mañana juntos. Aquí, cada acción cuenta y cada idea puede marcar la diferencia. Únete a un equipo que valora la innovación, el respeto y el compromiso.

Si eres una persona disruptiva, te mantienes en aprendizaje continuo y la innovación está en tu ADN, entonces somos lo que buscas. ¡Ven y construyamos juntos un futuro mejor!

📌 Líder de Observabilidad y SER (Perú)
🏢 STEFANINI LATAM
📍 Perú

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: líder de observabilidad y ser (perú) / perú

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: líder de observabilidad y ser (perú) / perú