Søgning » Folketingets dokumenter - træningsdata
Aflevering 14004
Ukendt

Folketingets dokumenter - træningsdata (1849-2025)


Skabt af ?
Formål ?

Datasættet består af omkring 125.000 dokumenter fra Folketingets arkiv (1849-2025):
• Lovtekster fra Folketinget 2008 2025
• Referater fra Folketingstidende 2008/9-2024
• Referater fra Folketingstidende 1850-2008/9
• §20-spørgsmål 2008-2024. Datasættet er skabt i samarbejde mellem Folketinget og Rigsarkivet, men defineret af Digitaliseringsstyrelsen med henblik på træning af danske sprogmodeller og forskning. Tilsammen indeholder datasættet næsten 1,2 milliarder ord. Nyere tekster produceret af Folketinget (2004-2025) er i overvejende grad født digitale, mens den ældre del af samlingen (1849-2008) er trykte tekster, som efterfølgende er blevet digitaliseret og OCR-behandlet. Denne behandling er foretaget forud for skabelsen af dette datasæt og OCR-kvaliteten vurderes ved øjesyn at variere markant med materialets udgivelsestidspunkt. Materiale fra det 19. og det tidlige 20. århundrede, der primært er sat med ældre (herunder gotisk) typografi, er præget af betydelige OCR-unøjagtigheder: fejllæste tegn, fragmenteret tegnsætning, samt forekomster af 홢-pladsholdertegn dér, hvor det enkelte tegn ikke har kunnet identificeres. I den tidlige periode anvendtes desuden meget tyndt papir, hvilket gav udfordringer med gennemlysning under indscanningen. I løbet af det 20. århundrede forbedres kvaliteten gradvist, og materiale fra omkring 1970'erne og frem fremstår overvejende som læselig og semantisk sammenhængende tekst, om end titler og overskrifter fortsat kan optræde fragmenteret. OCR-teksterne er videreført i den form, hvori de er modtaget fra Folketinget. I nærværende tekstdataindsamling er der ikke foretaget efterbehandling med henblik på fejlrensning. Det har ikke været muligt at skaffe maskinproducerede OCR-konfidenstal til at beskrive OCR-kvaliteten. Folketingets arkiv opbevarer originalindscanningerne i TIFF-format. Alle tekster (både nye og gamle) er pseudonymiseret. Konkret betyder det, at personnavne og andre personrelaterbare oplysninger er forsøgt erstattet med fiktive værdier, så enkeltpersoner ikke umiddelbart kan identificeres i teksten. Pseudonymiseringen er ikke fuldstændig - det må forventes, at nogle navne og oplysninger ikke er blevet identificeret - men det vurderes, at en betydelig del af de personidentificerende værdier er detekteret og erstattet. Erstatningerne er konsistente, så det samme navn altid bliver erstattet med det samme fiktive navn på tværs af hele datasættet. Enkelte dokumenter er i denne forbindelse frasorteret. Det drejer sig om dokumenter omhandlende indfødsretsstatus og statsborgerskab, da dokumenterne indeholder udenlandske navne, hvor det med den anvendte model ikke har været muligt at pseudoanonymisere alle navne. Teksterne er skrevet på dansk. Datasættet er i parquet-format.

Indhold ?

Der findes ingen beskrivelse.

Tabeller ?

Der er ingen tilgængelig information om tabeller.
Du kan søge om adgang til tabeloplysninger ved at klikke på 'Søg om adgang'.

Dokumentation ?

Der er ingen tilgængelig information om dokumentation.
Du kan søge om adgang til dokumentation ved at klikke på 'Søg om adgang'.

Emneord ?
Dækker perioden ?

Fra 01-01-1849 til 31-12-2025.

ID-oplysninger i data ?
  • Ingen