Syntetisk datasett kan beskytte personvernet

Feb 20, 2019

Legg igjen en beskjed

Syntetisk nettverk kan øke tilgjengeligheten av data mens de fortsatt beskytter individuelle eller institusjonelle privatliv, ifølge Penn State statistiker.


"Min nøkkel interesse er å utvikle metoder som vil gi bredere dele konfidensielle data på en måte som kan hjelpe med vitenskapelige funn," sa Aleksandra Slavkovic, professor i statistikk og associate dean for utdannet utdanning, Eberly College of Vitenskap, Penn State. "Å kunne dele konfidensiell data med minimal kvantifiserbare risiko for oppdagelse av sensitiv informasjon og fremdeles sikre statistiske nøyaktighet og integritet, er målet."


Slavkovic har funnet løsninger på dette data personvern problemet gjennom tverrfaglig samarbeid, spesielt med datamaskinen og samfunnsvitere. Hennes forskning fokuserer på ulike data, inkludert nettverksdata som fange Relasjonsinformasjon mellom enheter som personer eller institusjoner. Hun rapporterte hennes tilnærminger til å gi syntetiske nettverk som oppfyller en forestilling av differensial personvern i dag (16 februar) under 2019 årsmøtet i American Association for Advancement of Science i Washington, DC


Differensial personvern gir en matematisk beviselig garanti for hvilket personvern tap til enkeltpersoner.


Forskere vil ha tilgang til data som samles inn av andre for sin forskning, men slik tilgang kan også svekke personvern, selv etter fjerning av såkalte personopplysninger.


"En overflod av ekstra data er det hovedavdeling gjerningsmannen," sa Slavkovic. "Med metodiske og teknologiske fremskritt innen datainnsamling og registrere linkage, enklere tilgang til ulike datakilder som kan kobles med et datasett i hånden og finansiering etater krav dele data, øker risikoen for datavern. Men å finne gode løsninger for håndtering personvern tap er avgjørende for å aktivere lyd vitenskapelige funn."


Offentlig tilgjengelig informasjon fra en stoffet prøveperioden på en HIV narkotika, for eksempel vil angi som var i gruppen behandling og som var i kontrollgruppen. Behandlingsgruppe inneholder bare personer diagnostisert med HIV, og selv om data eierne tilbakeholdt personlige opplysninger fra det datasettet, noen opplysninger ville forbli. Fordi så mye informasjon er i dag tilgjengelig online sosiale medier og andre datasett, er det mulig å koble prikkene og identifisere personer, potensielt avsløre HIV status.


"Teknikker for å koble to datasett, sier velgeroppslutning poster og helseforsikring data, har sterkt forbedret," sa Slavkovic. "I en av de tidligste funnene, Latanya Sweeny (nå ved Harvard) viste at ved å koble disse typer data, kan du identifisere 87 prosent av befolkningen i USA Census fra 1990 basert på datoen for fødselen, 5-sifret postnummer og kjønn. Nylig forskere brukes tweets og tilhørende Twitter metadata for å vise at de kan identifisere brukere med 96.7 prosent nøyaktighet."


Slavkovic bemerker at det ikke er bare personer eller institusjoner data finnes i databaser, men at folk utenfor databasen kan også lider av invasjonen av personvernet, direkte eller av foreningen. Sammenhengene mellom informasjon i et datasett og informasjon om sosiale medier kan føre til en alvorlig personvern breech – noe som HIV status eller seksuell orientering kan ha alvorlige konsekvenser hvis avslørt.


Mens personvernet er viktig, samlet datasett utgjør en viktig kilde til informasjon for forskere. For tiden i noen tilfeller må når dataene er svært følsom, forskere fysisk gå til data repositories å gjøre sin forskning gjør undersøkelser mer vanskelig og dyrt.


Slavkovic er interessert i nettverket. Som viser forhaldet av personer eller institusjoner-noder, og forbindelsene mellom nodene. Hennes tilnærming er å skape litt annerledes, speilet nettverk datasett med noen noder flyttet, tilkoblinger flyttet eller kanter endret.


"Målet er å skape nye nettverk som tilfredsstiller de strenge differensial kravene og samtidig fange mest av de statistiske funksjonene fra opprinnelige nettverket," sa Slavkovic.


Disse syntetiske datasett kan være tilstrekkelig for noen forskere å tilfredsstille deres behov. For andre, ville det være tilstrekkelig til å teste sine tilnærminger og hypotesen før måtte gå til webområdet for data lagring. Forskere kan teste koden, gjøre utforskende forskning og kanskje grunnleggende analyse stund venter for tillatelse til å bruke de opprinnelige dataene i depotet området.


"Vi ikke kan tilfredsstille krav til alle statistisk analyse med samme type endrede data," sier Slavkovic. "Noen mennesker trenger de opprinnelige dataene, men andre kan gå en lang vei med syntetisk data som syntetisk nettverk."

Sende bookingforespørsel