Sre Observability
Guarda esta oferta y sigue tu búsqueda
Crea una cuenta gratis para guardar empleos, crear alertas y volver a esta oferta desde tu panel.
¿Te apasiona garantizar la máxima fiabilidad, observabilidad y rendimiento en entornos distribuidos de alta complejidad? Buscamos una persona para incorporarse como Observability & Performance Engineer (SRE) y liderar la estrategia de rendimiento y monitorización de una plataforma logística crítica que gestiona servicios en Go, Kafka, MQTT, PostgreSQL e integraciones industriales.
Todas las habilidades, cualificaciones y experiencia relevantes que necesitará un candidato seleccionado se enumeran en la siguiente descripción.
¿POR QUÉ ELEGIR SNGULAR?
La gente viene a SNGULAR atraída por proyectos que usan tecnologías punteras, y se quedan por los grandes profesionales con los que trabajan. Y además porque ofrecemos esto:
Personas primero: somos una empresa colaborativa orientada a las personas, donde TÚ y tu perspectiva siempre serán valoradas. Nuestro valor número uno es "Personas antes que resultados". ¿Suena bonito? Pues en SNGULAR, además, lo llevamos a la práctica.
Crecimiento y formación continua: Tenemos un espíritu de Start-up con la infraestructura de una gran organización (ya somos 1500). Se te ofrecerán oportunidades de crecimiento profesional: aprender nuevas habilidades, obtener nuevas certificaciones, o convertirte en un/a gran Líder... deja tu zona de confort de la manera que TÚ quieras
Beneficios increíbles: tenemos incluso un Wellbeing Pack para cuidar nuestro bienestar físico y mental.
Hemos obtenido el reconocimiento de ser una de las 10 mejores empresas para desarrollar una carrera profesional en España, según la prestigiosa lista LinkedIn Top Companies 2026.
Conoce todo lo que hace de Sngular un #BestPlaceToGrow
¿CUÁL SERÁ TU ROL?
Quien ocupe la posición asumirá la responsabilidad de garantizar la alta disponibilidad, observabilidad holística y optimización continua de nuestra plataforma logística distribuida. Tu misión será evolucionar los estándares de SRE, diseñando e implementando estrategias avanzadas de métricas, trazas y logs para asegurar la continuidad de negocio y la máxima eficiencia técnica en ecosistemas críticos e industriales.
RESPONSABILIDADES CLAVE
- Diseñar e implementar la estrategia global de observabilidad utilizando el stack LGTM (Loki, Grafana, Tempo, Prometheus) y OpenTelemetry.
- Definir y auditar métricas operativas clave mediante el establecimiento de SLIs, SLOs y SLAs, asegurando la creación y mantenimiento de runbooks automatizados.
- Ejecutar pruebas de carga y análisis exhaustivos de rendimiento para identificar cuellos de botella en entornos distribuidos de alta demanda.
- Optimizar la infraestructura cloud y contenerizada en entornos AWS/Azure (EKS, ECS, Lambda, CloudWatch) y Kubernetes/OpenShift.
- Automátizar procesos de infraestructura y respuesta ante incidentes mediante scripting y prácticas de CI/CD.
- Garantizar la visibilidad y salud del flujo de datos a través de arquitecturas de mensajería (Kafka, MQTT) y bases de datos (PostgreSQL).
- Colaborar de manera transversal con los equipos de desarrollo e ingeniería para promover buenas prácticas de SRE y rendimiento desde las fases iniciales del diseño.
¿CUÁL SERÁ TU RETO TECNOLÓGICO?
- Gestión de telemetría a gran escala: Unificar la recolección de trazas, métricas y logs con OpenTelemetry en un sistema heterogéneo que conecta la nube con dispositivos IoT e industriales.
- Rendimiento bajo alta demanda: Garantizar latencias mínimas y un procesamiento fluido en flujos intensivos de mensajes con Kafka y MQTT dentro de entornos de logística en tiempo real.
- Resiliencia distribuida: Diseñar alertas inteligentes y modelos de autorrecuperación para mitigar falsos positivos y reducir el MTTR (Mean Time to Resolution) en arquitecturas basadas en microservicios y serverless.
- Diagnóstico profundo de bases de datos y servicios: Identificar e iterar sobre cuellos de botella de rendimiento en PostgreSQL y microservicios de alta concurrencia.
¿QUÉ BUSCAMOS EN TI? (Requisitos)
- Experiencia demostrable (Senior) en roles de SRE, Observability Engineer o Performance Engineer en plataformas distribuidas.
- Dominio del stack de observabilidad: Uso avanzado de Grafana, Prometheus, Loki, Tempo y el estándar OpenTelemetry.
- Experiencia sólida en Cloud Pública: AWS y/o Azure, con foco especializado en AWS EKS, ECS, AWS Lambda y CloudWatch.
- Conocimiento de infraestructura y contenedores: Manejo fluido de Kubernetes/OpenShift, Docker, administración de Linux y pipelines de CI/CD.
- Definición de confiabilidad: Experiencia contrastada diseñando SLIs, SLOs, SLAs, estrategias de alertado efectivo y redacción de runbooks.
- Pruebas de rendimiento: Capacidad para planificar y llevar a cabo pruebas de carga, stress testing y profilado de aplicaciones.
- Habilidad en scripting/desarrollo: Dominio de lenguajes como Pyth