Description du poste
-Data Ingénieur Alternant H/FContrat : AlternanceDate de prise de fonction : 01/10/Lieu : LE KREMLIN-BICETREService : Pole Gestion de la DonnéeUnicancer est l'unique réseau hospitalier français dédié à 100 % à la lutte contre le cancer et la seule fédération hospitalière nationale dédiée à la cancérologie. Il réunit 18 Centres de lutte contre le cancer (CLCC), établissement de santé privé à but non lucratif, répartis sur 20 sites hospitaliers en France. patients par an sont pris en charge dans le réseau Unicancer, plus de femmes et hommes sont engagés, au quotidien, dans une quête permanente d'excellence en matière de soins, de recherche et d'enseignement supérieur.Unicancer est aussi le premier promoteur académique d'essais cliniques, en oncologie, à l'échelle européenne. Reconnu comme leader de la recherche en cancérologie en France, le réseau Unicancer bénéficie d'une réputation mondiale avec la production d'un tiers des publications internationales en oncologie. Les 18 CLCC et l'activité R&D d'Unicancer sont certifiés ISO pour leur recherche clinique.FINALITES DU POSTEActeur majeur dans la construction de pipelines de données évolutifs pour traiter des données structurées et non structurées (données de santé de vie réelle).Développer, maintenir et améliorer les solutions et infrastructures datas nécessaires à la collecte, la centralisation, le stockage et l'accès aux données de santé collectées auprès des établissements de soins contributeurs et mises à disposition des équipes scientifiques.MISSIONS ET ACTIVITES
Assister les Data Ingénieurs pour :
Concevoir efficacement et maintenir des flux d'intégration (collecte, Ingestion, Stockage) permettant de centraliser les données issues de plusieurs établissements de santé (et de plusieurs sources de données pour chaque établissement) dans un entrepôt de données de santé tout en garantissant une qualité de données.
Mettre en place des pipelines de données sécurisées qui seront traitées et nettoyées par les data managers pour délivrer des bases « gelées » mises à disposition des experts scientifiques, biostatisticiens et data scientistes.
Concevoir et mettre en oeuvre un process et un data pipeline permettant de valider la qualité des données intégrées automatiquement dans les Bases et entrepôts de données, par confrontation avec les données intégrées à partir de collecte manuelle.
Assister des prestataires externes spécialistes de la structuration de données non structurées issues de compte-rendu médicaux ou fiche RCP (Réunion de Concertation Pluridisciplinaire) ou documents du DPI, avec des solutions de type Natural Language Processing (NLP).
Rédiger et mettre à disposition la documentation (guide de procédure, documents utilisateurs, référentielsdans le respect du système de Management de la Qualité en place (SMQ - Certification ISO )