Hopp til innhold
Vevano

Hvorfor en dataplattform

Hvorfor beslutninger blir bedre når dataene har ett hjem.

De fleste virksomheter mangler ikke data. De mangler ett sted der dataene er til å stole på — og dermed et grunnlag å beslutte på. Hvilke kunder kommer tilbake? Hvor forsvinner marginen? Hva skjer om vi setter prisen ned?

En dataplattform er det felles grunnlaget under dette: der data lander én gang, beskrives én gang og brukes av mange. Da er den ikke et rapporteringssystem noen besøker ved månedsslutt, men stedet virksomheten styres fra: økonomi, drift, produkt og salg leser de samme tallene, og det som skjer i én del av virksomheten, er synlig i en annen mens det skjer. Samme tall gjelder for ledelsen og for den som sitter med saken.

Det er dette det betyr å bli datadrevet: spørsmål kan stilles og besvares mens de fortsatt betyr noe. Atferden som går forut for at en kunde slutter, er synlig mens dere ennå kan gjøre noe med den; kostnaden som alltid følger en bestemt type ordre, kan pekes på og ikke bare mistenkes. Verktøyene kan alle kjøpe — historikken deres er deres egen, og det er den som gir forsprang.

Og det er forutsetningen for KI. Grunnlaget kommer før modellen, ikke etter: en modell kan ikke bli bedre enn dataene den bygger på, og uten ett sted med entydige data, tydelig tilgang og historikk blir svaret noe ingen kan forklare eller forsvare. Dataene først, modellen etter — den rekkefølgen er ikke til å diskutere.

ett grunnlag, to lesere

01

Klar for KI

En agent leter etter data på samme måte som et menneske. Finner den dem ikke, kan ingen andre gjøre det heller.

Det meste av KI i drift handler ikke om modellen. Det handler om dataene: hvor de kommer fra, hvem som har lov til å bruke dem, og om svaret kan spores tilbake.

En agent leter etter data på samme måte som et menneske: den må finne den rette tabellen, forstå hva feltene betyr, og stole på at tallet holder. Kan ikke dere finne og stole på dataene i virksomheten, kan ingen agent gjøre det heller.

En modell som søker i virksomhetens egne data, arver kvaliteten deres. Finner den tre kopier av samme kunde med tre adresser, svarer den med én av dem, og ingen kan si hvilken. Plattformen gjør dataene entydige før spørsmålet blir stilt.

Tilgang er den andre halvdelen. Et grensesnitt der noen kan spørre seg fram til noe de ikke har lov til å se, er ikke en snarvei. Det er en lekkasje. Svaret bør følge de samme reglene som en rapport, og det bør finnes et spor som viser hvilke felt som ble brukt.

Det er også dette som gjør svaret verdt å stole på: når dataene har opphav og historikk, kan det modellen foreslo, kontrolleres mot det som faktisk lå der.

fra mange koblinger til én kilde

02

Fra siloer til én kilde

Hvorfor «hvilket tall er riktig?» blir et møte, og hva som endrer det.

Det begynner uskyldig. Én kobling mellom to systemer er billig, rask og helt riktig. Problemet er at koblingene vokser raskere enn systemene: hver nye kilde som skal inn i hver rapport, blir nok en kopi som kan gå ut på dato.

Kopien får egne definisjoner. «Aktiv kunde» betyr én ting i CRM-et, noe annet i økonomisystemet, og noe tredje i rapporten noen laget i fjor. Da er ikke «hvilket tall er riktig?» lenger et oppslag. Det er et møte — og i det møtet vinner den som snakker høyest.

Plattformen snur retningen på koblingene: kildene kobles til plattformen i stedet for til hverandre. Én landing, én definisjon per begrep, og en linje tilbake til kilden for hvert tall som vises.

Ikke alt skal flyttes. Data som bare brukes av ett system, har det best der. Plattformen samler det som skal brukes på tvers — og lar resten være i fred.

filer, logg, hvilken som helst leser

03

Åpne tabellformater

Delta Lake og Apache Iceberg: filene ligger i deres egen lagring.

Objektlagring gjorde lagring kjedelig: nesten ubegrensede mengder data, billig per gigabyte. Det som manglet, var tabellen.

Et åpent tabellformat gir den tilbake: tabellen er Parquet-filer med en transaksjonslogg, i deres egen lagring. Da får objektlagringen det bare databaser hadde: transaksjoner, håndhevet skjema, versjoner, og tidspunkt å gå tilbake til.

Det er to åpne formater som har blitt de to navnene å forholde seg til: Delta Lake og Apache Iceberg. Begge bygger på de samme prinsippene og leses av et bredt spekter av motorer, begge utvikles åpent — og de nærmer seg hverandre år for år. Apache Hudi er den tredje i samme familie. Kategorien betyr derfor mer enn enkeltverktøyet: et åpent format er et valg som ikke låser resten.

Det praktiske er at leseren ikke bestemmer. En skriving blir hel eller ingen, en leser ser et konsistent bilde mens det skrives, og hver skriving er en versjon med tidsstempel. Historikk og strøm kan ligge i samme tabell, og alle lesere ser den samme sannheten — med Delta eller med Iceberg.

Derfor betyr formatet mer enn det høres ut som. Dataene er filer, i deres lagring, i et offentlig beskrevet format. De kan åpnes med et annet verktøy enn plattformens, og flyttes uten at noen må spørres først. Den dagen et leverandørforhold tar slutt, tar ikke dataene slutt med det.

eier, tilgang, opphav, kvalitet

04

Governance og tillit

Hvem eier dataene, hvem får se dem, og hvorfor stoler vi på dem?

Governance har fått et papirskjær over seg. Det handler egentlig om fire spørsmål plattformen må svare på i løpet av sekunder: Hvem eier dette? Hvem får se det? Hvor kom det fra? Hva har skjedd med det?

Det første svaret er en katalog: ett sted der datasettene er beskrevet og søkbare, generert fra plattformen og ikke fra et regneark som holdes ved siden av. Det andre er en eier per datasett. En person, ikke en komité — og noen som faktisk vet hva dataene betyr.

Det tredje er tilgang, satt per datasett, kolonne og rad, med maskering der noen skal kunne se at en person finnes uten å se hvem det er. Regelen bør være enkel: tilgang gis fordi noen skal bruke dataene, ikke fordi ingen har sagt nei.

Det fjerde er opphavet: hvilke kilder og hvilke steg som førte fram til tallet, og hvem som leste eller endret det, og når. Kvalitet hører til samme sted — forventninger til et datasett, som påkrevde felt, riktig format og unike nøkler, testet og rapportert. Et brudd skal oppdages av systemet, ikke av regnskapet.

To år senere er «hvilke felt gikk inn i den beslutningen?» et oppslag, ikke en fortelling. En regel ingen kan håndheve, er bare en intensjon — og derfor hører styringen til i plattformen, ikke i et dokument ved siden av.

nå, og hvert punkt bakover

05

Nå og da, i samme tabell

Historikk og sanntid er ikke to prosjekter når formatet tillater begge.

Historikk og sanntid høres ut som to løsninger med hvert sitt budsjett. Med et format som fører versjoner, er de to sider av samme tabell: det siste øyeblikket for den som følger med, og et hvilket som helst tidligere punkt for den som skal forklare.

Det gir en egenskap som er lett å undervurdere. En rapport kan leses slik den faktisk var. Retter noen et tall i dag, kan begge versjonene hentes fram og stilles ved siden av hverandre — og da er «hvorfor endret det seg?» besvart, ikke bortforklart.

Sanntid handler mindre om hastighet enn om avstand: hvor langt etter er tallet? Noen beslutninger tåler et døgn, andre tåler minutter. Det viktige er at valget tas per datastrøm og skrives ned — ikke at alt skal være øyeblikkelig.

én kopi, og flyttbar

06

Kostnad og eiendomsrett

Én kopi i stedet for mange, og en kostnad dere kan lese ut av bruken.

En plattform koster to ganger: for lagring og databehandling, og den dagen noe går galt. Den andre posten er den største, og den blir ikke borte av at verktøyene er billige.

Én kopi i stedet for fem gjør regnestykket lesbart. Dere betaler for lagringen dere faktisk bruker, og databehandling kan prises per spørsmål. Ingen måling per sete eller per oppslag — ingen regning som vokser fordi flere tok jobben i bruk.

Det viktigste står likevel i kontrakten den dagen noen vil videre. Åpne formater og standarder betyr at dataene kan leses uten det opprinnelige verktøyet, og at plattformen kan settes opp et annet sted uten å bygges på nytt. Låst data er dyrere enn dyre verktøy.

Vi sier ikke at dette er billigere enn noe annet. Vi sier at kostnaden er noe dere kan lese ut av deres egen bruk — og at den ikke vokser av seg selv.

Testen

Seks spørsmål du kan stille

  • 01

    Kan vi lese dataene uten leverandøren?

    Spør om formatet, ikke om forsikringer. Filene skal kunne åpnes av et annet verktøy enn det plattformen bruker.

  • 02

    Kan vi flytte det?

    En plattform som kan settes opp et annet sted uten å bygges på nytt, er den eneste som kan forlates.

  • 03

    Vet vi hvem som har sett hva?

    Tilgang og revisjonsspor per datasett, ikke per system.

  • 04

    Kan vi forklare et tall?

    Fra kilden, gjennom stegene, til rapporten eller modellen. I dag, ikke som en fortelling i ettertid.

  • 05

    Hva skjer om noen slutter?

    Dokumentasjon, kode og tilganger skal være deres. En plattform som bare virker med én person til stede, er en risiko.

  • 06

    Kan vi si nei til et datasett?

    Styring som ikke kan nekte tilgang, er ikke styring. Det skal være mulig å holde noe utenfor.

Neste steg

Ta en prat med oss

Fortell oss kort hva dere trenger. Vi svarer med hvordan vi kan hjelpe — eller med hvem som kan hjelpe bedre.