Før data uploades til EnergyDataDK, skal dataejere angive specifikke oplysninger om deres data.
Disse oplysninger er afgørende for at sikre en gnidningsfri brug af data for både brugere og dataejere.
De fleste af oplysningerne er – medmindre andet er angivet – synlige for alle brugere.
Denne vejledning består af to dele:
Et datasæt er i bund og grund en samling af indbyrdes forbundne datastrømme. Derfor er der ikke behov for mange oplysninger for at oprette et. Datasættet skal naturligvis have et navn, så det kan identificeres, et MQTT-emnepræfiks, for at identificere datasættet for en databroker, en beskrivelse, for at specificere detaljer om de data, der er indeholdt i datasættet, og endelig kan et billede tilføjes for at gøre datasættet visuelt lettere at identificere i datasætoversigten.
Datasæt skal have et unikt navn og et præfiks til MQTT-emnet (MQTT topic prefix). Sidstnævnte udgør i bund og grund det første niveau i et hierarki.
I dette eksempel på et MQTT-emne denmark/hovedstaden/lyngby, ville præfikset være: denmark.
Præfikset må udelukkende bestå af bindestreger, understregninger og alfanumeriske tegn.
Datasæt skal desuden have en fyldestgørende beskrivelse, der oplyser om kilde, tidsperiode, uregelmæssigheder, anvendelse og en kontaktperson.
Der er mulighed for at uploade et billede, der visuelt repræsenterer datasættet.
Navnet på datasættet vil være den primære måde, hvorpå EnergyDataDK-brugere kan identificere, hvilke data datasættet indeholder. Navnet bør være intuitivt for dataejeren samt for interne og eksterne brugere. Vi foreslår at inkludere navnet på et projekt, en virksomhed eller et laboratorium samt oplysningstypen. Her er nogle eksempler:
MQTT-emner er en fundamental del af, hvordan MQTT-protokollen sender beskeder mellem udgivere og abonnenter. De fungerer som “adresser”, der definerer, hvor hver besked skal leveres. MQTT-emner er hierarkiske og har niveauer adskilt med skråstreger (/). Så du kan betragte præfikset som det første niveau i hierarkiet.
For eksempel, hvis dette ville være vores MQTT-emne: usa/california/san-francisco/silicon-valley, så ville usa være vores MQTT topic præfiks.
Et topic præfiks er en enkelt streng af alfanumeriske tegn, understregninger og bindestreger. Da MQTT topics desuden skelner mellem store og små bogstaver, anbefales det kun at bruge små bogstaver. Topic præfikset er kun synligt for datasætsejere. Du kan læse mere om dets brug i API-beskrivelsen.
Beskrivelsen af datasættet kan redigeres af dataejere, efter at datasættet er oprettet, og bør opdateres hurtigst muligt, når ovennævnte oplysninger foreligger, eller hvis der sker ændringer.
Datasættet består af syntetiske data genereret til demonstrationsformål. Det indeholder tilfældigt genererede poster, der repræsenterer forskellige datatyper, der almindeligvis anvendes i strukturerede datasæt. Datasæt struktur:Datasættet indeholder 100 registreringer, der dækker perioden fra den 1. april 2023 til den 5. april 2023. Der mangler værdier i tidsrummet mellem kl. 14.00 og 18.00 den 4. april som følge af servervedligeholdelse, der blev udført på det tidspunkt. Data registreres med timers mellemrum. For at bruge datasættet skal brugeren underskrive en fortrolighedsaftale. For yderligere oplysninger vedrørende datasættet og fortrolighedsaftalen, kontakt venligst: example@email.com
- Alphanumeric Data: 2 independent datastreams containing randomly generated text strings.
- Heltalsdata: 3 uafhængige datastrømme med tilfældigt genererede tal.
- Booleske værdier: 1 datastrøm, der repræsenterer sand/falsk-værdier.
Det er valgfrit at tilføje et billede, men det gør det lettere at identificere datasæt.
Hvis du har mange datasæt, bør du undgå at bruge det samme billede til dem alle, da det ville modvirke formålet.
Billedet bør være intuitivt, både for dataejeren og for brugere med adgang til dataene.
En datastrøm er i bund og grund en kanal, hvor der modtages data fra en sensor, en måleenhed eller lignende.
Alle observationer i kanalen består af et sæt (en tupel) med et tidsstempel, der angiver tidspunktet for observationen, samt den målte værdi.
Alle tidsstempler i EnergyDataDK er angivet i UTC-tid.
Hver datastrøm tildeles et navn, et MQTT-emnesuffiks og en datatype, og den beskrives af en række obligatoriske tags (metadata), der kvalificerer dataene.
Datastreams skal have et unikt navn og et MQTT-emnesuffiks. Sidstnævnte er i bund og grund den del af MQTT-emnet, der ligger ud over præfikset (første niveau) i den hierarkiske struktur. Så i dette eksempel: denmark/hovedstaden/lyngby, ville suffiksen være hovedstaden/lyngby.
The suffix must only consist of hyphens, underscores, slashes and alphanumeric characters.
The type of data (integer, double, or string) in the datastream must be declared.
There are a fixed number of mandatory fields which must be filled out, and you can add additional custom properties up to a total of 100 metadata fields.
Ligesom med datasættet er det vigtigt at vælge et navn omhyggeligt, der gør det nemt for enhver bruger at forstå, hvilke data der registreres i strømmen.
usa/california/san-francisco/silicon-valley, så vil california/san-francisco/silicon-valley være vores MQTT-emne suffiks. Hver datastrøm har et antal obligatoriske felter, der kvalificerer de indeholdte data.
Du kan også tilføje et stort set ubegrænset antal brugerdefinerede felter.
Her skal du indtaste mere detaljerede oplysninger om datastrømmen, som ikke allerede fremgår af dens navn.
Hvis du er usikker hvilken licens er passende kan du bruge dette flowdiagram:
Hvis du stadig ikke er sikker, og du ikke har noget imod at din data kan tilgås uden restriktioner kan du bruge CC0.
Selvom GDPR ikke pålægger en specifik klassificeringspolitik, kræver den, at organisationer kategoriserer og beskytter data på passende vis baseret på følsomhed og risiko. Der er flere kategorier af data.
De geografiske koordinater for det sted, hvor dataene er indsamlet. Du kan blot indtaste en region eller adresse i tekstfeltet, så vil systemet tilbyde matchende resultater til din forespørgsel med deres tilsvarende geolokationskoordinater.
Navnet på den installation, hvor dataindsamlingen finder sted.
Navnet på den organisation, der er ansvarlig for dataindsamlingen.
Navnet på det projekt, som dataene indsamles til.
Dette kategoriserer datastrømmen ved dets emne. Da dette sandsynligvis vil primært blive brugt som søgeord burde det være en term man sandsynligvis ville bruge for at finde datastrømmen.
Her er nogle eksempler: “Sol energi”, “CO2 udstød”, “byvarme”, osv.
Måleenheden for dataene i datastrømmen. Systemet vil foreslå en mulighed baseret på dit input.
Du kan til føje yderlige brugerdefinerede egenskaber til din datastrøm, ud over de obligatoriske You have the option of adding additional custom properties to your datastream, besides the mandatory ones. This could be anything you or other users may find relevant.
A datastream can have up to 100 total properties.
Keep in mind that the naming must be very clear and intuitive, since these will be nonstandard fields. You may also want to consider adding some documentation about these metadata fields in the description of the dataset.