Big data (suomeksi myös massadata tai iso data) tarkoittaa dataa, jota on paljon, jota tulee nopeasti lisää ja joka on muodoltaan vaihtelevaa. Kaikkien kolmen tunnusmerkin ei tarvitse täyttyä äärimmäisenä yhtä aikaa – oleellista on, että perinteinen tietokanta ja totutut analyysitavat alkavat käydä riittämättömiksi.

TunnusmerkkiMitä se tarkoittaaArkiesimerkki
Paljon (volyymi)Datamäärä on niin suuri, ettei sitä voi käsin selata tai avata kokonaisuudessaan tavanomaisella ohjelmallaIson verkkokaupan koko vuoden klikkaus- ja ostodata yhdessä paketissa
Kertyy nopeasti (nopeus)Uutta dataa syntyy jatkuvasti, usein reaaliajassa, eikä sen käsittely voi odottaaLiikenteen sensoridata, joka päivittyy sekunnin välein risteyksessä
Vaihtelevaa (moninaisuus)Data ei ole yhdessä siistissä muodossa, vaan sekoitus tekstiä, kuvia, lukuja ja mittaustietoaAsiakaspalvelun chat-viestit, puhelutallenteet ja tilaustiedot samassa järjestelmässä

Mikä on big data?

Big data on data, jota on paljon, jota tulee nopeasti lisää ja joka on muodoltaan vaihtelevaa – tämä on suomen kielen virallinen, Sanastokeskuksen TEPA-termipankin kirjaama määritelmä termille massadata/iso data. Määritelmä on tarkoituksella suhteellinen: se ei anna tarkkaa rajaa gigatavuissa tai riveissä, vaan kuvaa tilannetta, jossa datan luonne – ei vain sen koko – tekee siitä hankalan käsitellä totutuin keinoin.

Tästä syystä big data ei ole kiinteä raja, jonka data ylittää tai alittaa, vaan pikemminkin jatkumo. Sama datamäärä, joka on aivan tavallinen suurelle kansainväliselle palvelulle, voi olla ylivoimainen pienelle yritykselle ilman oikeita työkaluja – ja toisin päin, hyvin järjestelty data voi pysyä hallittavana, vaikka sitä olisi paljon, jos se on siistissä, yhtenäisessä muodossa.

Kolme tunnusmerkkiä kannattaa ymmärtää yhdessä, ei erikseen. Pelkkä suuri datamäärä ei vielä tee datasta “bigiä” tässä mielessä – esimerkiksi vuosikymmenten arkistoitu, siististi taulukoitu kirjanpitoaineisto voi olla valtava, mutta silti täysin hallittavissa tavallisella tietokannalla, koska se ei kerry nopeasti eikä vaihtele muodoltaan. Vasta kun useampi tunnusmerkki yhdistyy – data on sekä paljon että nopeasti kertyvää että moninaista – totutut työkalut alkavat pettää.

Yleinen väärinkäsitys on, että “big data” tarkoittaisi mitä tahansa suurta tietomäärää, esimerkiksi ison yrityksen koko asiakasrekisteriä. Tunnusmerkkien mukaan kyse on kuitenkin nimenomaan datan luonteesta yhdessä – ei pelkästä koosta. Siisti, hitaasti kasvava ja yhdenmuotoinen asiakasrekisteri, vaikka siinä olisi miljoonia rivejä, hoituu useimmiten aivan tavallisella tietokannalla ilman erikoisjärjestelyjä.

Milloin data on big dataa?

Data muuttuu “bigiksi” käytännössä siinä vaiheessa, kun jokin totutuista työkaluista alkaa pettää:

  1. Tavallinen taulukkolaskentaohjelma hidastuu tai kaatuu, kun rivimäärä kasvaa liian suureksi.
  2. Yhden koneen muisti tai tallennustila ei riitä datan käsittelyyn kerralla, ja työ pitää hajauttaa useammalle koneelle.
  3. Data tulee sisään nopeammin kuin sitä ehditään käsitellä vanhalla, eräajopohjaisella tavalla – tarvitaan jatkuvaa, reaaliaikaista käsittelyä.
  4. Samassa järjestelmässä pitää yhdistää useita erimuotoisia tietolähteitä (tekstiä, kuvia, mittaustietoa) yhden analyysin alle, eikä yksi siisti taulukko riitä kuvaamaan kaikkea.

Käytännön nyrkkisääntö: jos kysymys “mahtuuko tämä yhteen laskentataulukkoon, jonka yksi ihminen voi avata ja ymmärtää” vastataan selvästi “ei”, ollaan lähempänä big dataa kuin tavallista tietokantatehtävää. Nyrkkisääntö toimii myös toiseen suuntaan: jos data mahtuu yhteen taulukkoon ja yksi ihminen voi vielä hahmottaa sen kokonaisuutena, kyse ei todennäköisesti ole big datasta, vaikka rivejä olisi tuhansia tai kymmeniä tuhansia. Tämä nyrkkisääntö on tarkoituksella yksinkertainen – sen tarkoitus ei ole antaa tarkkaa teknistä rajaa, vaan auttaa erottamaan tavallinen tietokantatehtävä tilanteesta, joka vaatii kokonaan toisenlaisen lähestymistavan. Tavallinen yritystoiminnan data – asiakasrekisteri, laskutus, varasto – ei useimmiten täytä näitä tunnusmerkkejä, vaikka sitä kutsuttaisiin arkikielessä “isoksi dataksi”.

Hyvä tapa hahmottaa raja on verrata kahta esimerkkiä samasta toimialasta. Pienen kaupan koko historian myyntitapahtumat mahtuvat helposti yhteen tavalliseen tietokantaan, ja niitä voi analysoida tavallisilla työkaluilla vielä vuosienkin jälkeen. Ison, kansainvälisen verkkokaupan sekunnin välein kertyvä klikkaus-, haku- ja ostodata sen sijaan kasvaa niin nopeasti ja niin moninaiseksi (tekstihakuja, kuvien katseluita, ostotapahtumia, asiakaspalvelukeskusteluja), että sen käsittely vaatii jo alusta asti eri lähestymistapaa. Ero ei ole toimialassa, vaan datan kertymisnopeudessa ja moninaisuudessa.

Miten suurta datamäärää käsitellään teknisesti?

Kun data ei mahdu tai käsity yhdellä koneella, ratkaisu on lähes aina hajauttaminen: sama tallennus- ja laskentatyö jaetaan monelle koneelle yhtä aikaa sen sijaan, että yksi kone yrittäisi tehdä kaiken peräkkäin. Käytännössä tämä tarkoittaa, että:

  • Data tallennetaan pieninä osina useammalle levylle tai koneelle sen sijaan, että kaikki olisi yhdessä paikassa.
  • Laskentatehtävä (esimerkiksi “laske kaikkien asiakkaiden keskimääräinen ostoskori”) jaetaan osiin, jotka eri koneet laskevat samanaikaisesti, minkä jälkeen osatulokset yhdistetään.
  • Järjestelmä on suunniteltu sietämään sitä, että yksittäinen kone voi hetkellisesti kaatua – työ jatkuu silti muilla koneilla.

Tämä on tekninen syy sille, miksi big datan käsittely eroaa tavallisen tietokannan käytöstä: kyse ei ole vain suuremmasta versiosta samasta työkalusta, vaan eri tavasta jakaa ja koordinoida työtä usean koneen kesken.

Mihin big dataa käytetään?

Big dataa kerätään ja säilötään sitä varten rakennetuissa järjestelmissä, mutta itse hyöty syntyy vasta, kun sitä analysoidaan. Yleisimpiä käyttötapoja:

  • Kuvioiden ja trendien löytäminen valtavasta datamäärästä, jota ihminen ei pystyisi käymään läpi käsin – esimerkiksi asiakaskäyttäytymisen muutosten havaitseminen ennen kuin ne näkyvät myyntiluvuissa.
  • Koneoppimismallien kouluttaminen. Moni koneoppimismalli tarvitsee toimiakseen kunnolla suuren, monipuolisen datajoukon – katso koneoppiminen siitä, miten tämä käytännössä tapahtuu.
  • Reaaliaikainen seuranta ja hälytykset, esimerkiksi laitteiden kunnonvalvonta, jossa poikkeama pitää huomata sekunneissa, ei viikon raportissa.
  • Laajan mittakaavan data-analytiikka, jossa perinteiset analyysimenetelmät joutuvat mukautumaan datamäärän ja -nopeuden mukaan.

Big data ei korvaa tavallista tietokantaa tai tiedonhallintaa – se pikemminkin rakentuu niiden päälle, kun perusratkaisut alkavat käydä riittämättömiksi datan luonteen vuoksi. Käytännössä tämä tarkoittaa usein useiden koneiden yhteenliittämää tallennus- ja laskentaympäristöä, joka on erikseen suunniteltu kestämään suurta, nopeasti muuttuvaa ja moninaista dataa – yksi kone ei enää riitä, vaan työ ja data hajautetaan monelle koneelle yhtä aikaa.

Big datan hyöty syntyy siis kuvioiden löytämisestä yksittäisten tapahtumien sijaan, mutta tämä sama piirre on myös sen suurin riski: kun eri lähteistä kertynyttä dataa yhdistellään laajasti, myös yksittäisen ihmisen tunnistaminen datasta voi käydä helpommaksi kuin kukaan yksittäistä tietolähdettä tarkastellessa arvaisi. Tämä on yksi syy, miksi henkilötietojen käsittelyä koskevat säännöt (katso tekoäly ja tietosuoja) koskevat myös big data -hankkeita, ei vain yksittäisiä tietokantoja.

Toimialoittain big data näkyy hyvin eri tavoin. Terveydenhuollossa se voi tarkoittaa kuvantamisdatan, potilastietojen ja anturidatan yhdistämistä. Liikenteessä se on jatkuvasti kertyvää sijainti- ja aikataulutietoa, jota käytetään ruuhkien ennakointiin. Verkkokaupassa se on jokaisen klikkauksen, haun ja ostotapahtuman tallentamista sen selvittämiseksi, mitä asiakas todennäköisesti haluaa seuraavaksi. Yhteistä kaikille on, ettei yksittäistä tapahtumaa analysoida erikseen – arvo syntyy vasta, kun valtava määrä tapahtumia yhdistetään ja niistä etsitään yhteisiä kuvioita.

Suuren mittakaavan tallennus- ja laskentaympäristöt kuluttavat myös huomattavasti energiaa ja jäähdytystä – tätä puolta big datasta käsitellään tarkemmin sivulla tekoälyn ympäristövaikutukset, koska sama infrastruktuuri palvelee usein sekä big dataa että koneoppimismallien kouluttamista.

Muista tämä big datasta

  • Se ei ole yksi tuote tai tekniikka, vaan kuvaus datan luonteesta – paljon, nopeasti kertyvää ja vaihtelevaa.
  • Se ei ole automaattisesti sama asia kuin tekoäly, vaikka niitä käsitellään usein samassa yhteydessä.
  • Suurimmalla osalla tavallisista yrityksistä oma data ei täytä big datan tunnusmerkkejä – tavallinen tietokanta ja huolellinen tiedonhallinta riittävät.
  • Kun data täyttää tunnusmerkit, ratkaisu on harvoin “ostetaan lisää tallennustilaa” – kyse on yleensä myös käsittelytavan muuttamisesta.

Lähteet

Usein kysyttyä

Onko big data sama asia kuin tekoäly?

Ei. Big data kuvaa pelkkää dataa – sitä, että sitä on paljon, sitä kertyy nopeasti ja sen muoto vaihtelee. Tekoäly ja koneoppiminen ovat menetelmiä, joilla sellaista dataa voidaan analysoida, mutta big dataa käsitellään myös perinteisin, ei-tekoälypohjaisin menetelmin.

Tarvitseeko pieni yritys huolehtia big datasta?

Yleensä ei suoraan. Pienen yrityksen oma data on harvoin niin suurta, nopeasti kertyvää ja vaihtelevaa, että se täyttäisi big datan tunnusmerkit. Pieni yritys voi silti hyötyä välillisesti big datasta esimerkiksi silloin, kun se käyttää palvelua, joka on koulutettu suurella datamäärällä muualla.

Onko 'big data' ja 'massadata' sama asia?

Kyllä. Suomen kielen termipankki (TEPA) käyttää englanninkielisen 'big data' -termin rinnalla suomenkielisiä vastineita 'massadata' ja 'iso data', ja kaikki kolme viittaavat samaan määritelmään: dataan, jota on paljon, jota kertyy nopeasti ja jonka muoto vaihtelee.