Arrow Left Home

Gefedereerde analyse

Stel je voor; Je bent onderzoeker en weet dat de Universiteit van Maastricht hele interessante data heeft voor jouw onderzoek. Je achterhaalt wie de beheerder van de data is, belt hem of haar op en vraagt of je toegang mag hebben tot de data. Omdat het niet mogelijk is de data te versturen, stelt de beheerder voor dat je een keer langskomt en dat hij dan wat vragen over de data kan beantwoorden. Je neemt de trein naar Maastricht en meld je bij de receptie. Daar vertel je wie je bent en dat je een afspraak hebt met de beheerder van de data. Deze haalt je op en samen gaan jullie naar de data kijken. Je vertelt waar je de informatie voor wil gebruiken en stelt je vragen. De beheerder draait ter plekke een analyse en geeft je de antwoorden en je gaat tevreden weer naar huis om de resultaten voor je onderzoek te gebruiken.

Het bovenstaande verhaal is een voorbeeld van een gefedereerde analyse. De data mag niet de omgeving van de beheerder verlaten en daarom reist de onderzoeker naar de data toe. Om toegang te krijgen tot het pand moet hij zich identificeren en hij moet uitleggen wat hij met de data wil doen. Uiteindelijk kan hij de vragen stellen die hij wil stellen en krijgt hij de antwoorden (niet de data zelf) mee naar huis. Wanneer je dit verhaal vertaalt naar een technische infrastructuur zie je dat je afspraken met elkaar moet maken en technische bouwblokken moet hebben om dit mogelijk te maken. Maar je ziet ook dat het hierbij altijd de beheerder van data is die bepaalt of iemand de data mag zien of niet.

Wat is federatieve analyse

Een federatie is een verbond van samenwerkende organisaties. In het geval van federatieve analyse hebben we het dan over organisaties die hun data beschikbaar willen stellen voor analyse maar niet de data willen of kunnen overdragen. De analyse vindt dus niet plaats bij de gebruiker van de data, maar bij de datahouder. Federatieve analyse is daarmee het uitvoeren van een analyse op data die je zelf niet ziet. De data blijft bij de bron (of een plek die de datahouder heeft aangewezen) en alleen de analyse komt bij de data. De datagebruiker ontvangt alleen de resultaten van de analyse en niet de data zelf.

Waarom federatieve analyse

Het is voor de datagebruiker vaak niet eenvoudiger om de analyse gefedereerd uit te voeren. Je ziet de data niet, moet op andere manieren valideren of deze bruikbaar is (heeft de data geen bias?) en ook de repliceerbaarheid van een analyse is anders (je hebt de data niet, alleen een tijdstip waarop je de analyse hebt uitgevoerd). Er zijn echter een aantal grote voordelen en daarmee redenen om federatieve analyse uit te voeren.

  • Privacy; als data persoonsgegevens bevat is het een groot voordeel dat de datagebruiker de data zelf niet ziet, maar alleen de resultaten van een analyse. Hierdoor blijven de persoonsgegevens beter beschermd.
  • Data minimalisatie; je wisselt in principe geen brondata uit, maar alleen overeengekomen resultaten van de analyse. Daarmee minimaliseer je de hoeveelheid gegevens die gedeeld worden.
  • Data is te groot om te verplaatsen; in bepaalde situaties kan het uitwisselen van data niet praktisch zijn vanwege de grootte van de data. Hiervan kan bijvoorbeeld sprake zijn bij het gebruik van grote hoeveelheden beeldmateriaal.

In de praktijk is de wens om gebruik te maken van gefedereerde analyse steeds groter vanwege de hierboven genoemde redenen.

Vormen van federatieve analyse

Er zijn verschillende vormen van de implementatie van federatieve analyse. Dit kan omdat de data anders zijn, zoals tekst versus beeld. Dit kan ook zijn omdat de vraagstelling van de datagebruiker verschilt. De ene afnemer heeft een eenvoudige vraag terwijl een andere afnemer een complex algoritme wil uitvoeren.

  • Verschillende type data: er zijn verschillende datatypen die een andere manier van analyseren vereisen. Voor beeldmateriaal moet een analyse anders worden opgesteld dan een analyse voor gestructureerde klinische diagnoses.
  • Verschillende complexiteit van analyse: soms is een relatief eenvoudige vraag voldoende. Hiervoor kan een query opgesteld worden die aan de bron uitgevoerd wordt. In andere gevallen wil je een complexere analyse (algoritme) uitvoeren waarvoor je een script stuurt dat meer computerkracht vereist. Bij dit laatste kan je denken aan machine learning algoritmes.
  • Verschillende opdelingen van data: in veel gevallen is hetzelfde type data voor verschillende patiënten verdeeld over meerdere bronnen. Hier kan je dezelfde analyse een aantal keren uitvoeren zonder problemen. In andere gevallen moet je individuele patiënten volgen over meerdere bronnen, bijvoorbeeld als een patiënt meerdere ziekenhuizen heeft bezocht. Hiervoor is het nodig om te kunnen koppelen op patiëntniveau en het vereist andere technieken om dit op een vertrouwde manier te kunnen doen (denk hierbij aan MPC - multi-party computation).

De technologische ontwikkelingen rondom gefedereerde analyse zijn volop in ontwikkeling.

Health‑RI heeft in de periode 2018–2022 een belangrijke, organiserende rol gespeeld in de ontwikkeling en opschaling van het Personal Health Train (PHT)‑programma in Nederland. Samen met publieke en private partners heeft Health‑RI bijgedragen aan de opbouw van het PHT‑netwerk en aan de ontwikkeling van afspraken, standaarden en governance voor privacy‑beschermende, gefedereerde data‑analyse. Het PHT‑programma heeft daarmee aan de basis gestaan van veel van de huidige gefedereerde analyse‑toepassingen in de zorg, waarin het principe centraal staat dat data bij de bron blijft en analyses naar de data worden gebracht. Vanuit de PHT‑praktijk is het federated‑analysis gedachtegoed verder doorontwikkeld en geconcretiseerd, onder andere in open‑source oplossingen zoals vantage6, die tegenwoordig breed wordt gezien als een best practice voor gefedereerde analyse. 

Bekijk de afsprakenset van het Personal Health Train programma hier!

Bij Health-RI richten we ons vooral op de afspraken en bouwblokken die voor gefedereerde analyse nodig zijn. Het gaat dan om voldoende vertrouwen te hebben met elkaar in de gefedereerde analyse. Bij deze afspraken en bouwblokken kan je bijvoorbeeld denken aan:

  • Waar vind ik de databronnen die geschikt zijn voor gefedereerde analyse?
  • Hoe regel ik de toegang tot de databronnen (authenticatie en autorisatie)?
  • Wat moet ik doen om een analyse aan te vragen?
  • Welke methoden van analyse spreken we af (welke query's of algoritmes kan ik sturen)?

Kortom; gefedereerde analyse zijn volop in ontwikkeling en kunnen databronnen toegankelijk maken waar het versturen van data niet mogelijk is. Zo maakt federatieve analyse een breder gebruik van gezondheidsdata voor onderzoek en innovatie mogelijk. 

Share this page…