via Indeed · 11 de septiembre de 2026 ·hace 8 días

Lead Data & Platform Engineer

Farmatalento
Madrid Remote
Este anuncio proviene de Indeed
Ver oferta original ↗

Buscamos un/a “Lead Data \& Platform Engineer” para la Unidad de Health Data Platform and Innovation de una compañía española de Consultoría, Investigación e Innovación en salud, fundada en 2022 y en plena expansión.

MISIÓN

Responsabilidad técnica de la Plataforma de Datos: Arquitectura, Modelo de Datos, Integración de Fuentes, Ingesta Continua, Calidad, Rendimiento y Operación.

No es un puesto de mantenimiento ni de ejecución de decisiones ajenas: quien ocupa este puesto decide la arquitectura, la documenta y la sostiene.

*El puesto tiene cuatro áreas principales:*

1\. Consolidar y escalar la Plataforma Clínica. Rediseñar el Modelo de Datos, el Rendimiento y la Trazabilidad para que soporte el crecimiento en volumen, en fuentes y en número de proyectos simultáneos.

2\. Integrar nuevas Fuentes de Datos Sanitarios. Incorporar nuevos Orígenes Clínicos, Hospitalarios y Administrativos al modelo común, resolviendo la Heterogeneidad de Formatos, Terminologías e Identificadores que caracteriza al sector.

3\. Arquitectura orientada a Eventos e Interoperabilidad. Diseñar y operar la Ingesta Continua y el Procesamiento de Datos Asistenciales sobre Arquitecturas orientadas a Eventos, con Interoperabilidad HL7 FHIR y bajo requisitos estrictos de seguridad y soberanía del dato. Es una parte central del puesto, no un complemento.

4\. Estándar técnico y equipo. Definir las prácticas de Ingeniería de la Unidad, documentar la Arquitectura y las Decisiones, y participar en la incorporación y el desarrollo del equipo conforme crece. Trabajarás en estrecha colaboración con Data analysts, Data scientists, Bioestadísticos y el Equipo Científico y Clínico para garantizar que los datos estén disponibles, validados, trazables y listos para los proyectos, y reportarás a la Dirección de la unidad.

Herramientas de Trabajo

  • PostgreSQL on\-premise (modelo propio de datos clínicos): tuning, particionado, RLS y replicación.

  • Python para procesamiento, integración y automatización de datos.

  • Apache Kafka / Confluent Platform: ingesta y procesamiento de eventos.

  • Change Data Capture desde sistemas asistenciales (Debezium, Kafka Connect).

  • Procesamiento distribuido de eventos: Kafka Streams, Apache Flink o ksqlDB.

  • Gobierno de esquemas y contratos de datos: Schema Registry, Avro/Protobuf, versionado y compatibilidad.

  • Interoperabilidad sanitaria: HL7 FHIR R4, HL7v2, CDA. Terminologías clínicas: SNOMED\-CT, CIE\-10, ATC, LOINC.

  • Modelos comunes de datos: OMOP CDM y otros estándares europeos aplicables.

  • Orquestación y transformación versionada: Airflow o Dagster, dbt.

  • Kubernetes, Docker, CI/CD y despliegue on\-premise y cloud híbrido.

  • Pipelines de LLM y agentes sobre datos clínicos estructurados. No se espera un dominio absoluto de todo el listado, sino que las arquitecturas orientadas a eventos y la operación en producción sean terreno conocido, y criterio suficiente para decidir en el resto.
FUNCIONES DEL PUESTO

Arquitectura orientada a eventos

  • Definir la arquitectura de la ingesta y el procesamiento de eventos: topología de clústeres, diseño de topics y particionado, garantías de entrega, idempotencia, retención, replicación y recuperación ante desastre.

  • Implantar Change Data Capture y validación en tránsito sobre datos asistenciales.

  • Diseñar la capa de interoperabilidad: transformación a recursos FHIR R4, perfiles e Implementation Guides, y su expresión como contratos de datos.

  • Traducir requisitos clínicos y normativos en decisiones de arquitectura verificables: latencia, trazabilidad, auditoría y calidad del dato en tránsito.

  • Colaborar con los equipos clínicos en la traducción de reglas de validación y plausibilidad clínica a lógica ejecutable sobre los flujos de datos. Plataforma y modelo de datos

  • Rediseñar y optimizar el modelo relacional sobre PostgreSQL: particionado, índices, RLS por estudio/usuario, tuning y replicación.

  • Diseñar, administrar y optimizar bases de datos orientadas a datos clínicos y de vida real, garantizando calidad, integridad, trazabilidad y seguridad a lo largo de todo el flujo.

  • Definir la arquitectura de datos que soporte el crecimiento de la compañía en fuentes, volumen y clientes. Integración de nuevas fuentes.

  • Construir pipelines de extracción desde HCE/EHR, incluyendo datos estructurados y no estructurados, registros clínicos y datos administrativos.

  • Incorporar nuevas fuentes al modelo común: análisis de origen, mapeo, resolución de identificadores de paciente y control de calidad de la carga.

  • Implementar y mantener procesos ETL/ELT para la integración, transformación y carga de datos procedentes de múltiples orígenes.

  • Curado y normalización a CDM (Common Data Model). Mapeo a terminologías clínicas: SNOMED\-CT, CIE\-10, ATC, LOINC. Seguridad, cumplimiento y soberanía del dato

  • Diseñar y operar la plataforma bajo los requisitos de ENS categoría ALTA y de RGPD/LOPDGDD aplicado a datos de salud.

  • Pseudonimización, anonimización y k\-anonimato; gestión de identificadores de paciente; segregación por proyecto; auditoría de accesos y de consultas.

  • Sostener despliegues on\-premise o aislados de red cuando el marco de soberanía del dato lo exija. Reproducibilidad y calidad

  • Versionado reproducible de cohortes (dbt o equivalente): snapshots fechados de criterios y resultados.

  • Tests automatizados de calidad de datos y observabilidad de pipelines.

  • Implementación y mantenimiento de Modelos Comunes de Datos (CDM) como OMOP u otros estándares europeos aplicables. Integración de IA

  • Desarrollo y mantenimiento de servidores MCP para el acceso controlado a datos clínicos: autenticación, scoping por proyecto y auditoría de consultas.

  • Pipelines de LLM para procesamiento y estructuración de la información clínica. Liderazgo técnico, DevOps y equipo

  • Establecer los estándares de ingeniería de la unidad: revisión de código, decisiones de arquitectura documentadas (ADR), gestión de deuda técnica.

  • Aplicar DevOps: Docker, Kubernetes, CI/CD, infraestructura como código y gestión de despliegues on\-prem y cloud híbrido.

  • Liderar o participar en las discusiones técnicas con equipos de IT internos y externos y con proveedores tecnológicos.

  • Participar en la selección, incorporación y desarrollo del equipo de ingeniería de datos.

  • Elaborar y mantener la documentación técnica de procesos, bases de datos y flujos de trabajo.
REQUISITOS

Formación: Grado en Ingeniería Informática, Ingeniería de Telecomunicaciones, Matemáticas o titulación afín. Se valora máster o estudios de posgrado en Big Data, Bases de Datos o Inteligencia Artificial.

Experiencia: Mínimo 10 años en ingeniería de datos o arquitectura de plataformas de datos, de los cuales al menos 3–5 como referente técnico, lead o arquitecto/a.

  • Haber liderado de principio a fin la construcción o modernización de una plataforma de datos crítica a escala regional, nacional o corporativa, con responsabilidad simultánea sobre arquitectura, implementación y operación en producción.

  • Experiencia en entornos regulados o de sector público (sanidad, administración, banca, defensa, energía), con requisitos exigentes de seguridad, trazabilidad y soberanía del dato.

  • Experiencia como interlocutor técnico ante proveedores tecnológicos y ante organismos públicos: comités de arquitectura, seguimiento de proyecto, especificaciones y pliegos.

  • Haber liderado equipos técnicos (orientativamente entre 5 y 20 personas) sin dejar de estar hands\-on.

  • Experiencia con datos clínicos reales (HCE/EHR, registros, datos hospitalarios).
Se considerará también experiencia en dominios de complejidad y regulación equivalentes con voluntad clara de especialización en salud.

Conocimientos técnicos imprescindibles

  • Apache Kafka / Confluent Platform en producción: diseño de topics y particionado, Kafka Connect, Schema Registry, semántica de entrega, replicación multi\-clúster, seguridad (mTLS, RBAC, ACLs) y operación del día a día.
Se valorará muy positivamente certificación oficial Confluent (Kafka Developer y/o Kafka Administrator) o equivalente demostrable.
  • Change Data Capture con Debezium o equivalente sobre orígenes relacionales.

  • Procesamiento distribuido de eventos: Kafka Streams, Apache Flink o ksqlDB.

  • PostgreSQL nivel avanzado: tuning, EXPLAIN, particionado, RLS y replicación.

  • Python avanzado para procesamiento y automatización de datos, con soltura suficiente en el entorno JVM (Java/Scala) propio del ecosistema Kafka/Flink.

  • Kubernetes y despliegue de sistemas distribuidos on\-premise y en cloud híbrido; Docker, CI/CD, infraestructura como código.

  • Observabilidad y operación de sistemas distribuidos: instrumentación, alertado, diagnóstico de incidentes en producción y análisis de rendimiento.

  • Orquestación de pipelines (Airflow, Prefect o Dagster) y transformación versionada (dbt o herramienta equivalente).

  • Interoperabilidad sanitaria y terminologías clínicas: HL7 FHIR R4 y SNOMED CT, CIE\-10, ATC, LOINC. Se admite recorrido de aprendizaje si el resto del perfil es sólido.

  • Control de versiones (Git), buenas prácticas de ingeniería de software y metodologías ágiles.

  • Inglés nivel profesional (C1 o superior).
El trabajo con proveedores tecnológicos internacionales, con documentación y con soporte de producto se realiza en inglés.

SE OFRECE

  • Responsabilidad técnica real. Decides la arquitectura, la documentas y la defiendes.

  • Impacto real: los datos que vas a mover se usan para decidir sobre tratamientos y políticas de salud. No es un dashboard más.

  • Problemas técnicos difíciles y reales: ingesta continua de datos asistenciales, interoperabilidad, soberanía del dato y calidad clínica. Poca gente en España trabaja en esta intersección.

  • Un equipo en crecimiento: participas en la ampliación de la unidad, a quién se incorpora y cómo se trabaja.

  • Presupuesto de formación y certificación oficial en las tecnologías del stack.

  • Retribución acorde a un perfil de liderazgo técnico seni

El mercado para este tipo de puesto

Ofertas similares
304
puestos de Ingeniería en Madrid
Jornada completa
82%
de las ofertas de Ingeniería en España
Teletrabajo posible
33%
de las ofertas de Ingeniería
Farmatalento

2 open positions · Madrid

📊 Ingeniería · España
720
active jobs
32.5%
Remote
Ø 3d
avg. online
Top skills in demand
ExcelERPISOPythonAWSCI/CDSQLAzureAgileLean

Preguntas frecuentes

¿Cuántos empleos de Ingeniería hay disponibles en Madrid?
Actualmente 304 puestos de Ingeniería en Madrid en AlmostHired, en 101 empresas diferentes. Nuestros datos se actualizan a diario.
¿Los puestos de Ingeniería ofrecen teletrabajo?
33% de las ofertas de Ingeniería en España permiten teletrabajo, parcial o completo. Para filtrar específicamente puestos en remoto, usa AlmostHired.
¿Cómo sé si encajo en esta oferta?
Sube tu CV — nuestra IA compara tu perfil con los requisitos del puesto y te da una puntuación de coincidencia precisa, con habilidades coincidentes y faltantes.