Data-architect

Hace 3 días

Madrid, Area Metropolitana (comarca); Comunidad de Madrid, España SATEC Jornada completa
En Satec buscamos un/a Data Architect — Hands-on, Governance-first , que entienda que una arquitectura solo aporta valor si puede llevarse a la práctica. Queremos incorporar a una persona con mentalidad de constructor/a , capaz de diseñar e implementar arquitecturas de datos desde cero y de colaborar estrechamente con científicos/as e ingenieros/as de datos para alcanzar la excelencia técnica. Todo ello con una visión clara: el verdadero valor del dato reside en su gobierno y en su capacidad para alimentar soluciones analíticas, RAG e IA Agéntica . Se espera capacidad para tomar decisiones de particionado, optimización de costes de cómputo/almacenamiento y definición de contratos de datos entre capas Gobierno del Dato desde cero Definición e implantación de estrategia de gobierno: catálogo de activos, linaje técnico y operacional, clasificación y calidad del dato. Se valora experiencia real con ingesta de metadatos vía APIs, configuración de políticas de acceso y trazabilidad end-to-end desde fuente hasta consumo analítico o IA. Referente técnico de ingeniería Estandarización de prácticas de desarrollo (Python, SQL, Java) en un equipo de ingeniería de datos. Implica diseño de arquitecturas de ingesta y transformación con herramientas como Apache Ni Fi o Airflow, revisión de código, definición de patrones reutilizables, documentación técnica y mentoring. No es un rol de gestión: se espera participación directa en decisiones de diseño y resolución de problemas técnicos complejos, incluyendo elección y configuración de herramientas de orquestación y pipeline. Infraestructura de datos para IA Agéntica y RAG Diseño de pipelines de preparación de datos para sistemas RAG: estrategias de chunking, generación y almacenamiento de embeddings, selección de vector stores, optimización de recuperación semántica. Stack relevante: Procesamiento y cómputo distribuido: Apache Spark / Py Spark
· Databricks
· Cloudera CDP Plataformas cloud y servicios de datos (conocimiento valorado) : Azure: Microsoft Fabric
· Azure Data Factory
· Azure Synapse
· ADLS Gen2 GCP: Big Query
· Dataflow
· Dataproc
· Cloud Composer AWS: EMR
· Glue
· Redshift
· S3 Formatos y motores de tabla abierta: Delta Lake
· Apache Iceberg
· Apache Hudi Motores de consulta: Trino
· Hive
· Impala
· Presto
· Big Query Orquestación e ingesta: Apache Airflow
· Apache Ni Fi
· dbt
· Kafka
· Spark Streaming Almacenamiento distribuido: HDFS
· Apache Ozone
· S3 / S3-compatible
· Azure Data Lake Bases de datos relacionales: Postgre SQL
· My SQL
· SQL Server
· Oracle Bases de datos No SQL: Mongo DB
· Cassandra
· HBase
· Redis Bases de datos de series temporales: Influx DB
· Timescale DB
· Open TSDB Bases de datos de grafos: Neo4j
· Apache Tinker Pop / Gremlin
· SPARQL / RDF Gobierno y catálogo: Data Hub
· Open Metadata
· Apache Atlas
· Databricks Unity Catalog
· Microsoft Purview Búsqueda y recuperación: Elasticsearch
· Open Search
· Solr Vector stores Lenguajes: Python
· SQL
· Java
· Scala, spark Información adicional: Modalidad: Híbrida.

Horario:
Jornada flexible con horario general de 9:00 a 18:00 horas de lunes a jueves y los viernes de 9:00 a 15:00 horas. Además, jornada reducida coincidente con el calendario escolar durante el verano.

Ubicación:
Madrid. ¿Quiénes somos? Somos SATEC , un grupo tecnológico con más de 30 años de experiencia en proyectos de integración e innovación tecnológica en sectores clave como telecomunicaciones, sanidad y administración pública. Operamos en España, Marruecos, Arabia Saudí y otros países, impulsando la transformación digital de nuestros clientes.