Site Reliability Engineer

Hace 2 semanas

, España Telefónica S.A. Jornada completa

Conectamos el presente. Transformamos el futuro.

¿Alguna vez te has preguntado qué hace posible que millones de personas estén conectadas al mismo tiempo, desde cualquier lugar del mundo, sin que nada falle?

En Telefónica, hacemos que sea posible.

Somos una compañía global de telecomunicaciones y tecnología que conecta a personas, empresas y comunidades a través de redes de última generación y soluciones digitales avanzadas como cloud, inteligencia artificial, IoT o ciberseguridad.

Con una trayectoria de más de 100 años, trabajamos cada día para que la innovación esté al servicio de la sociedad, impulsando una transformación digital responsable, sostenible y con impacto real.

Aquí no solo diseñamos infraestructuras, diseñamos el futuro . Buscamos personas que tengan inquietudes, entusiasmo y pasión por lo que hacen, que no se conformen y que quieran crear la Telefónica del mañana.

Si te apasiona la tecnología que transforma vidas, este es tu lugar.

El área de CDO (Chief Digital Officer) de Telefónica Innovación Digital (TID) es responsable de diseñar, desarrollar y operar productos y plataformas digitales de alto impacto que dan servicio a millones de clientes del Grupo Telefónica en todo el mundo. Se trata de un entorno tecnológico avanzado donde la innovación, la escalabilidad y la excelencia operativa son fundamentales para garantizar la calidad y disponibilidad de los servicios digitales.

¿Cuál será tu misión?

Como Site Reliability Engineer (SRE), tu misión será mejorar la fiabilidad, escalabilidad y eficiencia operativa de las plataformas cloud de producción mediante la automatización, la observabilidad y la aplicación de buenas prácticas de ingeniería.

Trabajarás junto a equipos de desarrollo y operaciones para incorporar principios de resiliencia desde las fases iniciales del ciclo de vida de los servicios, contribuyendo a la estabilidad de las plataformas y a la mejora continua de los procesos operativos.

¿Qué capacidades buscamos en ti?

  • Mentalidad orientada a la automatización, la mejora continua y la excelencia operativa.
  • Capacidad para comunicarse eficazmente con equipos técnicos, de producto y de negocio.
  • Actitud proactiva en la identificación y resolución de problemas.
  • Experiencia trabajando en entornos ágiles bajo metodologías Scrum o Kanban.
  • Capacidad para trabajar de forma colaborativa y contribuir al crecimiento técnico del equipo.
  • Capacidad de automatización mediante Python, Go o Bash.
  • Nivel profesional de inglés.

¿Cómo contribuirás con tus capacidades al propósito del rol?

  • Diseñando y evolucionando estrategias de observabilidad mediante métricas, logs y trazas utilizando herramientas como Prometheus, Grafana y OpenTelemetry.
  • Gestionando infraestructuras cloud en GCP, AWS y/o Azure, garantizando disponibilidad, seguridad, escalabilidad y optimización de costes.
  • Automatizando procesos e infraestructura mediante Terraform y Helm para reducir tareas manuales y mejorar la eficiencia operativa.
  • Colaborando en la resolución de incidencias, escalaciones y mejora de procedimientos operativos
  • Trabajando junto a equipos de desarrollo para incorporar buenas prácticas de fiabilidad, resiliencia y operabilidad desde las fases de diseño.
  • Participando en guardias (on-call), respuesta a incidentes y análisis postmortem orientados al aprendizaje y la mejora continua.
  • Contribuyendo a la adopción de la cultura SRE y a la evolución de las prácticas de fiabilidad dentro del equipo.

¿Qué otros aspectos valoramos?

  • Titulación en Ingeniería Informática, Ingeniería de Telecomunicaciones o áreas afines.
  • Al menos 3 años de experiencia en posiciones de SRE, DevOps, Platform Engineering o Infraestructura en entornos cloud de producción.
  • Experiencia con plataformas cloud como Google Cloud Platform (GCP), Amazon Web Services (AWS) o Microsoft Azure.
  • Experiencia en Infraestructura como Código utilizando Terraform y Helm.
  • Conocimientos de observabilidad mediante Prometheus, Grafana, OpenTelemetry, Elastic Stack o herramientas equivalentes.
  • Experiencia en gestión de incidencias, análisis postmortem y fundamentos de fiabilidad de servicios.
  • Experiencia en pipelines CI/CD mediante GitHub Actions, Jenkins o herramientas similares.
  • Certificaciones relacionadas con cloud, Kubernetes o DevOps (GCP Professional DevOps Engineer, AWS DevOps Engineer, Azure, CKA, entre otras).
  • Experiencia en entornos multi-cloud y gestión de infraestructuras híbridas.
  • Conocimientos de GitOps utilizando her