Skip to content

Obdelava podatkov

Zadnja sprememba:

Ko smo zbrane oz. ustvarjene podatke organizirali in dokumentirali, sledi proces obdelave. Obdelava podatkov lahko pomeni vsakršno ravnanje s podatki, v tem priročniku pa s pojmom obdelava opredeljujemo zlasti ustrezno pripravo podatkov oziroma podatkovnih datotek, potem ko so že bili zbrani in preden so predmet analize in objave. Gre za preoblikovanje t. i. surovih podatkov, ki jih pridobimo bodisi ročno ali z napravami.

Obdelava podatkov

Obdelava podatkov lahko vključuje različne vidike preoblikovanja surovih podatkov:

  • vnos podatkov,
  • različne oblike razvrščanja, umeščanja, združevanja podatkov,
  • urejanje podatkov (npr. izvedemo čiščenje podatkov, odkrijemo in odpravimo napake),
  • izpeljava, lahko se oblikujejo nove spremenljivke,
  • združevanje različnih datotek, dodajo se lahko nove informacije iz zunanjih virov,
  • uteževanje ali druge statistične metode,
  • spremenijo se lahko formati datotek,
  • in drugo.

Ne glede na to, ali podatke obdelujemo ročno ali strojno, ustrezna in pravočasna obdelava podatkov prispevata k večji kakovosti raziskovalnih rezultatov.

📌Primer: Obdelava podatkov posnetega pogovora

Zamislimo si metodo intervjuja. V intervjuju raziskovalka od udeleženca pridobi pomembne informacije, s katerimi dopolni svojo zbirko podatkov. Pogovor je raziskovalka posnela na telefon, vendar mora pred analizo pridobljeno gradivo ustrezno obdelati. To vključuje naslednje korake:

  • zvočni posnetek (format .mp3) raziskovalka pretvori v besedilne podatke, to je opravila ročno s prepisovanjem, saj oprema za strojno transkripcijo ni bila na voljo;
  • transkripcijo, shranjeno v besedilni datoteki (format .docx), je še enkrat preverila ter odpravila odstopanja od govorjene besede;
  • v skladu s pridobljenim soglasjem, ki predstavlja podlago za obdelavo podatkov, je transkripcijo očistila (npr. zakrila občutljive podatke, za katere ji udeleženec ni dal soglasja za deljenje), več o anonimizaciji na strani ZAŠČITA PODATKOV;
  • transkripcijo vsakega intervjuja je opremila z informacijami oz. metapodatki, v skladu s priporočili področnega repozitorija (primer: Priročnik za ravnanje s kvalitativnimi podatki za potrebe arhiviranja in objave v ADP);
  • poskrbela je, da so vse transkripcije v zbirki intervjujev urejene po istih načelih oz. navodilih repozitorija in v skladu z načeli FAIR,
  • uredila je spremno dokumentacijo: protokol intervjuja, vprašalnik, šifrant, zadnje verzije dopisov, soglasja ipd.

Za potrebe objave v repozitoriju bo raziskovalka morala pripraviti še opis raziskave. Več o tem na strani ORGANIZIRANJE IN DOKUMENTIRANJE ter OBJAVA PODATKOV.

Podpora pri obdelavi

Kdo nam lahko pomaga pri obdelavi, je odvisno od praks na raziskovalnem področju, pa tudi razpoložljivih zmogljivosti. Včasih za zbiranje, organiziranje in obdelavo skrbi zunanja agencija ali raziskovalna skupina, ki ima potrebna specifična znanja, drugič za obdelavo najamemo zunanje osebje, ki lahko opravi manj zahtevna dela. Nemalokrat pa celotno raziskavo izvede raziskovalec ali raziskovalka sama.

Verodostojnost podatkov

Z obdelavo podatkov lahko pride do več vrst sprememb. Da bi lahko sledili spremembam, je pomembno, da se postopki dokumentirajo in da se ob spremembah ustvarijo nove verzije podatkovnih datotek, hkrati pa ohranjamo prejšnje, da bi lahko zagotovili sledljivost.

Pomembno je, da o postopkih obdelave pripravimo navodila in protokole, ki jim bodo sledili vsi sodelujoči v raziskovalnem procesu ali mi sami. Z načrtovanjem in sistematičnim pristopom zmanjšamo tveganje za napake.

Z razvojem strojnega oziroma avtomatskega dela se sicer praviloma zmanjša število napak, ki bi jih napravili ročno, pojavijo pa se lahko nove napake, ki jih zakrivi strojno procesiranje. Npr. v javno objavljeni programski kodi pride do spremembe, s katero nismo bili seznanjeni, posledično avtomatska obdelava privede do drugačnih rezultatov. V obeh pristopih je zato pomemben del obdelave preverjanje točnosti podatkov in sledljivosti postopkov. Več v poglavju 3. Process Data authenticity učbenika CESSDA DMEG.

📌Primer: Verodostojnost podatkov

V britanskem UK Data Archive so pripravili praktična navodila za ohranjanje verodostojnosti podatkov:

  • Uredimo matično datoteko podatkov. V raziskavi je lahko tudi več matičnih datotek, če imamo več nizov podatkov.
  • Odgovornost za matične datoteke dodelimo enemu članu ali članici projektne skupine.
  • Reguliramo dostop do pisanja različic matičnih datotek.
  • Beležimo vse spremembe, opravljene v/na matičnih datotekah.
  • Ohranimo matične datoteke za zagotavljanje sledljivosti.
  • V rednih časovnih presledkih arhiviramo kopije glavnih datotek.
  • Določimo uradni postopek za morebitno uničenje matičnih datotek.

Zaključek obdelave

Obdelane podatke organiziramo in shranimo v dokumentu z imenom, ki jasno označuje, da gre za končno verzijo podatkovne datoteke, ta bo uporabljena za vse nadaljnje analize ali tehnike strojnega učenja (glej stran ORGANIZIRANJE IN DOKUMENTIRANJE). Oseba, v projektu zadolžena za ravnanje s podatki, mora poskrbeti, da bodo vsi v raziskovalni skupini obveščeni, da je podatkovna datoteka obdelana in pripravljena za analizo. Tako pripravljeno datoteko predamo v repozitorij za namen podatkovne objave. Kot pri drugih vidikih ravnanja z raziskovalnimi podatki, tudi tukaj obstajajo razlike med znanstvenimi področji in je priporočljivo, da se pravočasno pozanimamo o naprednih dobrih praksah.

V nadaljevanju sta predstavljena primera, ki kažeta na pomembnost pravočasnega načrtovanja ravnanja z raziskovalnimi podatki in sprotno izvajanje vseh korakov, predvidenih v življenjskem krogu podatkov.

📌Primer: Slabe in dobre prakse

Iz preteklih izkušenj poznamo primer slabe prakse, ko so raziskovalke in raziskovalci izvedli analizo podatkov, objavili znanstveni članek in poročilo o raziskavi za financerja. Ob koncu projekta so poskrbeli še za podatkovno objavo. V procesu objavljanja v področnem repozitoriju se je izkazalo, da verzija, namenjena objavi, ni bila zadostno obdelana, zato so raziskovalke in raziskovalci dodatno obdelali podatke. Z novo obdelavo pa ni bilo več mogoče priti do enakih rezultatov, kot so jih dobili z analizo prejšnje verzije. Podatkovna objava je posledično pokazala napake v rezultatih, objavljenih v znanstvenem članku in projektnem poročilu.

Primer dobre prakse in izpolnjevanja načel odprte znanosti je, da podatkovno datoteko, na kateri bomo izvedli analizo, objavimo v ustreznem repozitoriju. To verzijo pripravljene datoteke in dokumentacije nato v analizah uporabljamo sami in člani ter članice raziskovalne skupine. Podatkovno objavo navedemo med viri v znanstveni publikaciji in jo citiramo na ustreznih mestih v publikaciji ter navedemo v razdelku o dostopnosti podatkov (t. i. Data availability statement) za znanstveno revijo. Več na strani OBJAVA PODATKOV.


📝 Izpolni svoj NRRP


🕮 Dodatni viri