Cloud Operations & Observability Lead (AWS/Azure)

Mapfre
Mapfre
Madrid, SpainOn-siteCompetitiveAdded 27 days agoLead · 5+ yearsPermanentRemote: On Site🇪🇸Spanish: Native

This job was originally posted in Spanish and automatically translated to English. You'll most likely need Spanish to apply.

Requirements

Advanced level, with demonstrable experience, working with AWS and AZURE, with deep knowledge of HA and DR models oriented toward the resilience of Cloud Applications
Advanced level, with demonstrable experience, working with Kafka, MongoDB, Kubernetes (openShift, AKS, EKS, ...)
Expert level in ITIL processes
Solid knowledge in automation, preferably oriented toward infrastructures (Terraform, Ansible), although experience with Hyperscaler SDKs or APIs and OpenShift is highly valued.
Advanced level in administration, implementation, and operation of Dynatrace and the LGTM stack (Loki, Grafana, Tempo, and Mimir). Proficiency in the OpenTelemetry standard:
Access and Policy Administration, Dashboard Design and Alert Configuration, Performance Monitoring and Optimization, log exploitation...)

PROFESSIONAL EXPERIENCE REQUIRED FOR THE POSITION
In positions related to ITIL processes, 3 of which as a Service Delivery Manager, minimum of 5 years
In coordination of multidisciplinary teams and project management with multiple dependencies in Cloud environments, minimum of 5 years
In the design of architectures for applications, platforms, and Cloud services, etc., preferably in Serverless or PaaS models and their automated deployment and operation, minimum of 3 years
Implementation, operation, and use of observability tools such as Dynatrace and the LGTM stack (Loki, Grafana, Tempo, and Mimir). Proficiency in the OpenTelemetry standard, minimum of 3 years

Job Description

We are looking for an IBERIA Infrastructure and Operations Consultant (I&O IBERIA) to join our cross-platform team, responsible for leading the evolution of the operating model, driving and evolving observability, ensuring the cloud operation of applications, platforms, and products, implementing Service Delivery Manager best practices, and guaranteeing "Production Readiness".

You will integrate into a dynamic team highly oriented toward resolution and objectives, which must guarantee the availability, performance, service levels, and compliance of MAPFRE Spain's Cloud applications.

You must have "everything as code" in your DNA: from Infrastructure as Code (IaC) to auto-remediations, Pipelines, CD, etc., with strong Cloud knowledge regarding compute, serverless, storage, and networking, all oriented toward a Platform Engineering-based model.

JOB FUNCTIONS (KEY FUNCTIONS)

Service Delivery Manager:

• Responsible for ensuring that technological services are delivered effectively, aligned with business objectives, and meeting quality standards by ensuring the Operating model; to achieve this, you will supervise the execution of contracted services, ensuring compliance with service level agreements (SLAs).

• Act as a liaison between technical teams for products, platforms, applications, SRE, Architecture, and Security.

• Organize and lead teams to ensure the timely and efficient delivery of services.

• Identify optimization opportunities in processes, tools, and delivery methodologies.

• Supervise the performance of external providers and ensure that outsourced services meet established standards.

• Analyze key performance indicators and prepare reports for management.

Strategic Management:

• You will participate in the planning, design, and execution of the 360 Observability roadmap in MAPFRE Spain, ensuring its alignment with the Direction's strategic objectives, guaranteeing key decision-making based on data and operational needs for availability, performance, and security.

• You will design and evolve the Production Readiness of applications, from an Agile / Lean perspective, to facilitate development and maintenance, SRE, and Architecture teams in ensuring that applications reach Production with the necessary guarantees of Availability, Performance, Security, and operational resilience.

• You will drive automation and the "everything as code" objective as part of the new application operation model.

Technical Supervision:

• You will ensure the implementation and operation of observability tools such as Dynatrace, Grafana, standards like Open Telemetry, alerting, auto-scaling, auto-remediations, etc., to guarantee compliance with the operation model and Production Readiness.

• You must collaborate with Architecture, the SRE team, Release Management, and Product teams so that the design and subsequent implementation of applications meet the requirements and objectives of the Direction, adapting and aligning Production Readiness according to identified needs.

• You will supervise and track the necessary security compliance in Spain's infrastructures, ensuring that the region's infrastructures and services are in "compliance," and maintaining appropriate reporting to the regional CTO of the state and the necessary action plans.

• You will promote the use of reference architectures and automation using Terraform, Ansible, and CAP in Infrastructure pipelines and operations.

Team Management:

• You will lead and coordinate multidisciplinary teams that will help you meet the objectives of the I&O Iberia Direction and the Business.

• You will act as a point of union between different product teams, platforms, and providers, and you will have to establish mechanisms that optimize this collaboration to achieve common objectives, fostering decision-making and prioritization based on data and aligned with the Organization's strategy.

Supervision and Reporting:

• You will guarantee that the area's Direction has the necessary, correctly updated reports to be presented and defended in various Monitoring, Direction, and Strategic Committees: SLA, SLO, APPDEX, COMPLIANCE, etc.

• You will lead the tracking of vulnerabilities in coordination with the responsible teams (Security/DCS, Product, Infrastructure, providers), ensuring prioritization, action plans, deadline control, and evidence of mitigation/closure.

• You will drive the tracking of technological obsolescence (software, platforms, and components out of support), in accordance with the entity's annual technological update plans.

• You will track the application decommissioning plans defined in the Systems Plan, ensuring progress, dependencies, risks, milestones, and communication in the corresponding monitoring forums, as well as their reflection in Direction reports.

• You will be responsible for guaranteeing the existence of dashboards that represent the status of the activities and responsibilities of the I&O Iberia Direction, adapting, evolving, or creating those that are necessary.

Communication:

• You will disseminate and communicate the pillars of the operation model of the Cross-Platform Service of MAPFRE Spain based on CloudOps (NoOps), production readiness, end-to-end observability, and extreme automation with an "everything as code" mentality.

• You will be responsible for communicating clearly and timely any change, improvement, or benefit introduced in existing or new processes that impact the Governance model and the relationship model with Product, Platform, Architecture, and SRE teams.

REQUIRED TRAINING AND KNOWLEDGE

Advanced level, with demonstrable experience, working with AWS and AZURE, with deep knowledge of HA and DR models oriented toward the resilience of Cloud Applications.

Advanced level, with demonstrable experience, working with Kafka, MongoDB, Kubernetes (openShift, AKS, EKS, ...).

Expert level in ITIL processes.

Solid knowledge in automation, preferably oriented toward infrastructures (Terraform, Ansible), although experience with Hyperscaler SDKs or APIs and OpenShift is highly valued.

Advanced level in administration, implementation, and operation of Dynatrace and the LGTM stack (Loki, Grafana, Tempo, and Mimir). Proficiency in the OpenTelemetry standard:

Access and Policy Administration, Dashboard Design and Alert Configuration, Performance Monitoring and Optimization, log exploitation...)

PROFESSIONAL EXPERIENCE REQUIRED FOR THE POSITION

In positions related to ITIL processes, 3 of which as a Service Delivery Manager, minimum of 5 years.

In coordination of multidisciplinary teams and project management with multiple dependencies in Cloud environments, minimum of 5 years.

In the design of architectures for applications, platforms, and Cloud services, etc., preferably in Serverless or PaaS models and their automated deployment and operation, minimum of 3 years.

Implementation, operation, and use of observability tools such as Dynatrace and the LGTM stack (Loki, Grafana, Tempo, and Mimir). Proficiency in the OpenTelemetry standard, minimum of 3 years.

View original advert (Spanish)

Buscamos a un/a Consultor/a de Infraestructuras y Operaciones IBERIA (I&O IBERIA), para unirse a nuestro equipo de plataforma trasversal, responsable de liderar la evolución del modelo de operación, impulsar y evolucionar la observabilidad, asegurar la operación cloud de las aplicaciones, plataformas y productos, las mejores prácticas de Service Delivery Manager y garantizar el "Production Readiness".

Te integraras en un equipo dinámico y altamente orientado a resolución y objetivos, que debe garantizar la disponibilidad, rendimiento, niveles de servicio y compliance de las aplicaciones Cloud de MAPFRE España.

Deberás tener en tu ADN el "everything as code": desde la Infraestructura como Código (IaC) hasta las auto-remediaciones, Pipelines, CD, etc. con fuertes conocimientos en Cloud relativos a cómputo, serverless, storage y networking, orientado todo a un modelo basado en Platform Engineering.

FUNCIONES DEL PUESTO (FUNCIONES CLAVE)

Service Delivery Manager:

• Responsable de asegurar que los servicios tecnológicos se entreguen de forma eficaz, alineados con los objetivos del negocio y cumpliendo los estándares de calidad asegurando el modelo de Operación para ello tendrás que supervisar la ejecución de los servicios contratados, asegurando el cumplimiento de los acuerdos de nivel de servicio (SLA).

• Actuar como enlace entre los equipos técnicos de productos, plataformas, aplicaciones, SRE, Arquitectura y Seguridad.

• Organizar y liderar equipos para garantizar la entrega puntual y eficiente de los servicios.

• Identificar oportunidades de optimización en procesos, herramientas y metodologías de entrega.

• Supervisar el rendimiento de proveedores externos y asegurar que los servicios subcontratados cumplen con los estándares establecidos.

• Analizar indicadores clave de rendimiento y elaborar informes para la dirección.

Gestión estratégica:

• Tendrás que participar en la planificación, diseño y ejecución del roadmap de Observabilidad 360 en MAPFRE España, asegurando su alineamiento con los objetivos estratégicos de la Dirección, garantizando la toma de decisiones clave basándote en datos y necesidades operativas de disponibilidad, rendimiento y seguridad.

• Diseñarás y evolucionarás el Production Readiness de las aplicaciones, con una perspectiva Agile / Lean, para facilitar a los equipos de desarrollo y mantenimiento, SRE y Arquitectura, que las aplicaciones llegan a Producción con las garantías necesarias de Disponibilidad, Rendimiento, Seguridad y resiliencia operativa.

• Impulsarás la automatización y el objetivo "everything as code" como parte del nuevo modelo de operación de aplicaciones.

Supervisión técnica:

• Asegurarás la implantación y explotación de herramientas de observabilidad como Dynatrace, Grafana, estándares como Open Telemetry, alertado, auto-escalados, auto-remediaciones, etc... para garantizar el cumplimiento del modelo operación y Production Readiness.

• Deberás colaborar con Arquitectura, el equipo de SRE, Release Management y equipos de Producto, para que el diseño y posterior implantación de las aplicaciones cumplan con las exigencias y objetivos de la Dirección, adaptando y alineando el Production Readiness según las necesidades que se vayan identificando.

• Supervisarás y darás seguimiento al cumplimiento de seguridad necesario en las infraestructuras de España, asegurando que las infraestructuras y servicios de la región se encuentran en ""compliance"", y manteniendo el reporting adecuado al CTO regional del estado y de los planes de acción necesarios.

• Impulsarás el uso de las arquitecturas de referencia y la automatización con el uso de Terraform, Ansible y CAP en los pipelines y operaciones de Infraestructura.

Gestión de equipos:

• Liderarás y coordinarás equipos multidisciplinares que te ayudarán a cumplir los objetivos de la Dirección de I&O Iberia y de Negocio.

• Actuarás como punto de unión entre diferentes equipos de productos, plataformas y proveedores, y tendrás que establecer mecanismos que optimicen esta colaboración en pro de la consecución de los objetivos comunes, fomentando la toma de decisiones y la priorización basada en datos y alineadas a la estrategia de la Organización.

Supervisión y Reporting:

• Garantizarás que la Dirección del área cuenta con los informes necesarios, correctamente actualizados, que se deban presentar y defender en los diferentes Comités de Seguimiento, Dirección y Estratégicos: SLA, SLO, APPDEX, COMPLIANCE, etc...

• Liderarás el seguimiento de vulnerabilidades en coordinación con los equipos responsables (Seguridad/DCS, Producto, Infraestructura, proveedores), asegurando priorización, planes de acción, control de plazos y evidencias de mitigación/cierre.

• Impulsarás el seguimiento de obsolescencia tecnológica (software, plataformas y componentes fuera de soporte), acorde a los planes anuales de actualización tecnológica de la entidad.

• Realizarás el seguimiento de los planes de decomisado de aplicaciones definidos en el Plan de Sistemas, asegurando su avance, dependencias, riesgos, hitos y comunicación en los foros de seguimiento correspondientes, así como su reflejo en los informes de la Dirección.

• Serás responsable de garantizar la existencia de los dashboards que representen el estado de las actividades y responsabilidades de la Dirección de I&O Iberia, adaptando, evolucionando o creando aquellos que sean necesarios.

Comunicación:

• Divulgarás y comunicarás los pilares del modelo de operación del Servicio de Plataformas Transversales de MAPFRE España basado en CloudOps (NoOps), production readiness, observabilidad end to end y automatización extrema con la mentalidad "everything as code"

• Serás responsable de comunicar de manera clara y oportuna cualquier cambio, mejora o beneficio introducido en los procesos existentes o nuevos que impacten en el modelo de Gobierno y en el de relación con los equipos de Producto, Plataformas, Arquitectura y SREs."

FORMACION Y CONOCIMIENTOS REQUERIDOS

Nivel avanzado, con experiencia demostrable, trabajando con AWS y AZURE, con profundo conocimiento de modelos de HA y DR, orientados a la resiliencia de Aplicaciones Cloud

Nivel avanzado, con experiencia demostrable, trabajando con Kafka, MongoDB, Kubernetes (openShift, AKS, EKS, ...)

Nivel experto en procesos ITIL

Conocimientos sólidos en automatización, preferentemente orientado a infraestructuras (Terraform, Ansible) pero muy valorable el trabajo con SDKs o APIs de Hiper-escalares y OpenShift.

Nivel avanzado en administración, implementación y operación de Dynatrace y el stack LGTM (Loki, Grafana, Tempo y Mimir). Manejo del estándar OpenTelemetry:

Administración de Acceso y Políticas, Diseño de Dashboards y Configuración de Alertas, Monitorización y Optimización de Rendimiento, explotación de logs...)

EXPERIENCIA PROFESIONAL REQUERIDA PARA EL PUESTO

En puestos relacionados con procesos ITIL, de los cuales 3 como Service Delivery Manager, mínima de 5 años

En coordinación de equipos multidisciplinares y gestión de proyectos con múltiples dependencias en entornos Cloud, mínima de 5 años

En diseño de arquitecturas de aplicaciones, plataformas y servicios Cloud, etc. preferentemente en modelos Serverless o PaaS y sus despliegues y operación automatizado, mínima de 3 años

Implantación, explotación y uso de herramientas de observabilidad como Dynatrace y stack LGTM (Loki, Grafana, Tempo y Mimir). Manejo del estándar OpenTelemetry, mínima de 3 años

Need a visa? No sponsorship mentioned here. Browse visa jobs