AI og dataHafsteinn Runarsson · AI Konsulent01 Oct 2026 · 11 min
Synthetic data: Slik bruker du syntetiske data trygt
Synthetic data, på norsk syntetiske data, er kunstig genererte data som etterligner relevante mønstre, strukturer og sammenhenger i virkelige data. De kan brukes til å trene og teste KI-systemer, dekke sjeldne hendelser og gi team et tryggere arbeidsgrunnlag når ekte data er knappe eller sensitive.
Men syntetiske data er ikke automatisk korrekte, representative eller anonyme. De må vurderes mot formålet de skal brukes til, testes mot virkelige data og behandles som et styrt dataprodukt med tydelig opphav, versjon og ansvar.
Kort fortalt:
- Bruk syntetiske data for å fylle konkrete datagap — ikke som en generell erstatning for virkeligheten.
- Velg genereringsmetode etter datatype, risiko og hva datasettet skal brukes til.
- Skill mellom realisme, nytte og personvern. Et datasett kan se ekte ut uten å være nyttig eller trygt.
- Valider på tre nivåer: statistiske egenskaper, ytelse i den faktiske oppgaven og risiko for lekkasje eller skjevhet.
- Behold virkelige data til uavhengig testing når beslutningen har reelle konsekvenser.
Hva er syntetiske data?
Syntetiske data er nye datapunkter laget av regler, simuleringer eller generative modeller, slik at de gjenskaper egenskaper som er viktige for et bestemt formål. De er ikke direkte observasjoner av virkelige personer, hendelser eller objekter.
Et syntetisk datasett kan for eksempel bestå av:
- tabellrader som ligner kundetransaksjoner uten å representere faktiske kunder
- bilder av produksjonsfeil som er sjeldne i en ekte bildestrøm
- teksthenvendelser som dekker ulike formuleringer av samme brukerbehov
- tidsserier fra simulerte sensorer eller maskiner
- scenarioer og verktøyresultater som tester hvordan en KI-agent oppfører seg
SAS beskriver syntetiske data som algoritmisk genererte data som etterligner virkelige data, og skiller mellom blant annet strukturerte data, bilder, tekst og tidsserier. Det sentrale er ikke at dataene ser tilfeldige eller realistiske ut. De må bevare de egenskapene som er relevante for oppgaven.
Hvis formålet er å teste en kredittmodell, kan sammenhenger mellom variabler være avgjørende. Hvis formålet er å teste en KI-agent, er det viktigere at scenarioene dekker realistiske intensjoner, feiltilstander, tillatelser og forventede handlinger. «Realistisk» betyr derfor noe forskjellig fra prosjekt til prosjekt.
Syntetiske, anonymiserte og dummydata er ikke det samme
Forskjellen ligger i hvordan dataene blir laget, og hvilke egenskaper de skal bevare. Begrepene bør ikke brukes om hverandre.
- Virkelige data kommer fra faktiske personer, systemer, sensorer eller hendelser.
- Anonymiserte data starter som virkelige data og blir bearbeidet for å redusere muligheten for å identifisere noen. De kan fortsatt inneholde reelle rader og mønstre.
- Syntetiske data er nye datapunkter generert for å etterligne utvalgte egenskaper ved et virkelig eller modellert datagrunnlag.
- Dummydata er enkle testverdier laget for å få et skjema eller en funksjon til å virke. De trenger vanligvis ikke å ha realistiske fordelinger eller sammenhenger.
- Dataaugmentering endrer eksisterende eksempler, for eksempel ved å rotere et bilde eller omskrive en setning. Det er en nærliggende teknikk, men skaper ikke nødvendigvis et helt nytt datasett fra en lært fordeling eller simulert verden.
Denne avgrensningen er viktig for personvern. Syntetiske data kan redusere behovet for å dele rådata, men de er ikke automatisk anonyme. En generator kan lære detaljer for godt, sjeldne kombinasjoner kan peke tilbake på enkeltpersoner, og eksterne datasett kan gjøre koblingsangrep mulig. IBMs gjennomgang av syntetiske data viser hvorfor både deanonymisering, memorering og falsk trygghet må inngå i risikovurderingen.
Når er syntetiske data nyttige?
Syntetiske data er mest nyttige når teamet kan beskrive et konkret gap og måle om de genererte dataene faktisk fyller det. «Vi trenger mer data» er ikke presist nok.
Gode bruksområder er:
- Sjeldne hendelser og edge cases: Lag kontrollerte eksempler på feil, avvik eller kombinasjoner som forekommer for sjelden i historiske data.
- Ubalanserte datasett: Suppler en underrepresentert klasse slik at modellen får flere relevante trenings- eller testeksempler.
- Tidlig produktutvikling: Test datamodeller, integrasjoner og brukerflyter før et nytt produkt har samlet et stort produksjonsgrunnlag.
- Programvaretesting: Generer gyldige, ugyldige og ekstreme input uten å kopiere produksjonsdata inn i utviklingsmiljøet.
- Trening av KI-modeller: Suppler ekte data med varierte eksempler, etiketter eller simulerte miljøer.
- Evaluering av KI-agenter og copiloter: Bygg scenarioer som tester intensjoner, verktøybruk, sikkerhetsgrenser og eskalering.
- Analyse og deling: Lag et arbeidsgrunnlag som kan være enklere å dele, forutsatt at personvern og nytte er testet eksplisitt.
Syntetiske data passer dårlig når ukjente fenomener i virkeligheten er selve poenget. En generator kan bare bygge på regler, simuleringer og mønstre den har fått tilgang til. Hvis kildedataene mangler en viktig gruppe eller hendelse, kan det syntetiske datasettet gjøre den samme blindsonen større i stedet for å reparere den.
Slik genereres syntetiske data
Riktig metode er den enkleste metoden som gjenskaper egenskapene oppgaven krever. Mer avansert modellering gir ikke automatisk bedre data.
Regelbasert generering
Regler og skjemaer passer godt til programvaretesting og kjente forretningsbetingelser. Et team kan definere lovlige verdiområder, relasjoner mellom felter og bevisste feiltilstander.
Fordelen er kontroll og sporbarhet. Ulempen er at mennesker må kjenne variasjonen på forhånd. Regelsettet gjenskaper sjelden uventede mønstre som oppstår i virkeligheten.
Statistisk generering
Statistiske metoder estimerer fordelinger og sammenhenger i et eksisterende datasett og trekker nye datapunkter fra modellen. Enkle fordelinger kan fungere når datastrukturen er oversiktlig, mens mer sammensatte metoder trengs når variablene avhenger sterkt av hverandre.
Metoden kan gi god kontroll, men den kan også glatte bort små grupper og sjeldne hendelser. Derfor må teamet teste både helheten og relevante delgrupper.
Simulering
Simulering bygger en modell av et miljø eller en prosess og lar regler skape hendelser over tid. Det brukes blant annet for sensordata, logistikk, trafikk, robotikk og digitale tvillinger.
Styrken er at teamet kan endre forhold og fremprovosere scenarioer. Begrensningen er at simulatoren alltid forenkler virkeligheten. Resultatet er bare så troverdig som antakelsene i modellen.
Dataaugmentering
Augmentering lager variasjoner av eksisterende eksempler. For bilder kan det være utsnitt, lysendringer eller rotasjon. For tekst kan det være omskrivinger, språkvarianter eller variasjoner i tone og lengde.
Dette er nyttig når grunnmaterialet er relevant, men for ensartet. Augmentering må ikke endre etiketten eller meningen ved et uhell.
Generative modeller
Generative modeller lærer mønstre fra et datagrunnlag og lager nye eksempler. GAN-er og variational autoencoders brukes i flere datatyper, mens transformere og språkmodeller kan generere tekst, logger, strukturerte rader og samtaleforløp. Averroes’ oversikt dekker statistisk sampling, simulering, agentbasert modellering, augmentering og generative modeller.
Denne fleksibiliteten gjør metoden nyttig for komplekse data, men vanskeligere å kontrollere. Modellen kan produsere plausible feil, kopiere trekk fra kildedata eller gi for lite variasjon. Derfor må genererte eksempler gjennom de samme kvalitetsportene som andre datakilder.
Hvordan validere syntetiske data
Et syntetisk datasett er godt bare hvis det fungerer til den avtalte oppgaven uten uakseptabel risiko. Kvalitet bør vurderes langs tre separate akser: fidelity, utility og privacy.
- Fidelity — likhet: Bevarer dataene relevante fordelinger, sammenhenger, sekvenser og delgrupper?
- Utility — nytte: Gir dataene et bedre trenings-, test- eller analyseutfall i den faktiske oppgaven?
- Privacy — personvern: Kan rader, egenskaper eller medlemskap kobles tilbake til personer eller kildedata?
NISTs verktøy for rapportering på syntetiske data vurderer både nytte og personvern. Det er en god påminnelse om at én realismescore ikke er nok.
En praktisk valideringsplan kan se slik ut:
- Lås formålet: Skriv ned hvilken beslutning, modell eller test datasettet skal støtte.
- Definer kvalitetsmål: Velg målinger før generering. Det kan være fordelinger, feilrate i en oppgave, dekningsgrad for scenarioer eller ytelse per delgruppe.
- Hold av virkelige data: Bruk et separat, representativt datasett som generatoren ikke får se, til sluttkontroll.
- Test statistisk likhet: Sammenlign fordelinger, korrelasjoner, sekvenser og viktige grupper. Ikke stopp ved gjennomsnittet.
- Test oppgaven: Tren eller test systemet på syntetiske data og mål utfallet på virkelige holdout-data.
- Test personvern: Se etter duplikater, nærkopier, medlemskapslekkasje og mulige koblinger mot andre datasett.
- Gjør faglig kontroll: La domeneeksperter vurdere om eksemplene er mulige, meningsfulle og riktig merket.
- Dokumenter begrensninger: Registrer hvilke grupper, hendelser og bruksområder datasettet ikke dekker.
Resultater bør måles per relevant delgruppe. Et datasett kan være presist i gjennomsnitt og samtidig svikte en sjelden gruppe som var hele grunnen til at det ble laget.
Syntetiske data for evaluering av KI-agenter
For KI-agenter er syntetiske data særlig nyttige som et kontrollert evalsett, ikke som bevis på at agenten virker i produksjon. Scenarioene kan gjentas etter hver endring og gjøre feil målbare før agenten får større ansvar.
Et godt syntetisk agent-scenario inneholder:
- brukerens mål og nødvendig kontekst
- tilgjengelige verktøy og tillatelser
- simulerte svar fra API-er eller databaser
- forventet handling eller sluttresultat
- handlinger agenten ikke har lov til å utføre
- kriterier for godkjenning, avvisning eller menneskelig eskalering
- variasjoner som tvetydighet, manglende data, tidsavbrudd og motstridende instruksjoner
Bygg scenarioene som en matrise, ikke som en bunke tilfeldige samtaler. Kryss for eksempel brukerintensjon med datakvalitet, verktøyfeil og risikonivå. Da blir det synlig hvilke kombinasjoner evalsettet mangler.
Generative modeller kan hjelpe med å lage omskrivinger og variasjoner, men de bør ikke alene definere fasiten. Forretningsregler, produkteier og fagpersoner må fastsette forventet utfall. Hold også trening og evaluering adskilt, slik at agenten ikke blir optimalisert mot de samme eksemplene som skal måle kvaliteten.
Risikoer du må styre
Den største feilen er å behandle syntetiske data som risikofrie fordi de er kunstig generert. De flytter risiko; de fjerner den ikke.
Vurder minst disse risikoene:
- Skjevhet: Generatoren kan kopiere eller forsterke skjevheter fra kildedata og regler.
- Manglende variasjon: Datasettet kan dekke vanlige mønstre godt, men overse sjeldne kombinasjoner.
- Plausible feil: Genererte rader, bilder eller tekster kan se troverdige ut uten å være faglig mulige.
- Personvernlekkasje: Modellen kan memorere kildedata, lage nærkopier eller bevare identifiserende kombinasjoner.
- Feil trygghet: Høy ytelse på syntetiske tester kan skjule svak ytelse i virkelige omgivelser.
- Uklart opphav: Uten versjon, generator, parametere og kildereferanse blir datasettet vanskelig å reprodusere og revidere.
- Tilbakematingssløyfer: Hvis modellgenererte data stadig brukes som nytt grunnlag uten kontroll mot virkeligheten, kan feil og forenklinger hope seg opp.
Mottiltakene er konkrete: minst mulige tilganger til kildedata, isolerte miljøer, versjonering, personverntesting, delgruppeanalyse, menneskelig fagkontroll og en endelig test mot virkelige data. IBM fremhever at sluttvurdering av ytelse og sikkerhet fortsatt må skje i den virkelige verden.
En praktisk arbeidsflyt fra behov til godkjent datasett
Et godt syntetisk datasett bør utvikles som et produkt med krav, eierskap og kvalitetsporter. Denne arbeidsflyten holder prosjektet knyttet til et faktisk behov:
- Beskriv beslutningen: Hva skal dataene gjøre mulig, og hva skjer hvis de er feil?
- Kartlegg datagapet: Mangler dere volum, sjeldne hendelser, tilgang, etiketter eller testvariasjon?
- Velg minste tilstrekkelige metode: Start med regler eller simulering hvis problemet ikke krever en kompleks generator.
- Avgrens kildedata: Bruk bare nødvendige felter og dokumenter behandlingsgrunnlag, tilgang og lagring.
- Lag en første versjon: Behold generatorens kode, modell, parametere, seed og dato sammen med datasettet.
- Valider likhet, nytte og personvern: Bruk forhåndsdefinerte terskler og et separat virkelig testgrunnlag.
- Kjør faglig gjennomgang: Kontroller etiketter, sjeldne kombinasjoner og uventede mønstre.
- Godkjenn per bruksområde: Et datasett godkjent for programvaretesting er ikke automatisk godkjent for modelltrening eller analyse.
- Overvåk etter lansering: Sammenlign syntetiske antakelser med nye virkelige data og oppdater når verden eller produktet endrer seg.
Denne prosessen gjør det mulig å stoppe tidlig. Hvis syntetiske data ikke forbedrer den faktiske oppgaven, bør teamet heller investere i bedre innsamling, mer presise etiketter eller en enklere løsning.
Når bør du ikke bruke syntetiske data?
Ikke bruk syntetiske data som hovedgrunnlag når du mangler nok virkelighetskontakt til å validere dem. Et generert datasett kan ikke bevise sin egen kvalitet.
Velg heller virkelige data, en pilot eller kontrollert innsamling når:
- ukjente menneskelige reaksjoner er det du prøver å forstå
- små avvik kan få store sikkerhetsmessige eller juridiske konsekvenser
- du ikke har et representativt datasett til uavhengig testing
- domenet endrer seg raskere enn generatoren kan oppdateres
- viktige minoritetsgrupper eller sjeldne hendelser mangler i kildematerialet
- beslutningen krever dokumentasjon av faktiske hendelser, ikke simulerte mønstre
Ofte er den beste løsningen en kombinasjon: syntetiske data for bredde og kontrollerte edge cases, virkelige data for kalibrering og sluttkontroll.
Er syntetiske data anonyme?
Nei, ikke automatisk. Risikoen avhenger av kildedata, genereringsmetode, hvor mye modellen har memorert, hvilke eksterne data en mottaker kan koble mot, og hvordan resultatet deles.
Behandle derfor anonymitet som en påstand som må testes og dokumenteres. Hvis generatoren trenes på personopplysninger, må behandlingen av kildedataene også vurderes selv om det ferdige datasettet ser kunstig ut.
Kan syntetiske data erstatte virkelige data?
Som regel bør de supplere virkelige data, ikke erstatte dem helt. Syntetiske data kan gi variasjon, dekke sjeldne scenarioer og gjøre testing repeterbar, men virkelige data trengs for å kontrollere at modellen eller analysen fortsatt stemmer med verden.
Hvordan vet du om syntetiske data er gode nok?
De er gode nok når de består avtalte tester for den konkrete oppgaven, relevante delgrupper og personvern — og når resultatet holder på et separat virkelig datasett. Visuell realisme eller statistisk likhet alene er ikke tilstrekkelig.
Kan en språkmodell lage et evalsett for en KI-agent?
Ja, en språkmodell kan foreslå scenarioer, omskrivinger og variasjoner. Men mennesker må definere risikokategorier, forventede handlinger og fasit. Ellers kan den samme typen modell både skrive prøven og bestemme hva som teller som riktig svar.
Hvor mye virkelige data trenger du?
Det finnes ikke ett generelt antall. Behovet styres av variasjonen i domenet, risikoen ved feil og hvor presist du må kunne evaluere ulike grupper og edge cases. Start med krav til dekningsgrad og usikkerhet, ikke et tilfeldig radmål.
Fra syntetiske data til et tryggere KI-produkt
Syntetiske data skaper verdi når de kobles til en tydelig beslutning, et målbart evaloppsett og reell sluttkontroll. De beste prosjektene begynner derfor ikke med valg av generator. De begynner med å definere hvilket datagap som blokkerer produktet, hvordan kvalitet skal måles og hvilken risiko virksomheten kan akseptere.
Daia bygger AI-agenter, copiloter og full-stack produkter for produksjon. Hvis dere vil avklare om syntetiske data passer i trenings-, test- eller evaloppsettet deres, kan dere starte en samtale.