Hvad er datalogi? Introduktion, Concepts & Proces
โก Smart opsummering
Datavidenskab f.eks.tracindsigt fra store mรฆngder struktureret og ustruktureret data ved hjรฆlp af statistik, visualisering og maskinlรฆring. Dens seks-trinsproces, kernejobroller, vรฆrktรธjsstak og primรฆre forretningsapplikationer er beskrevet nedenfor.
Hvad er datavidenskab?
data, Science er det studieomrรฅde, der involverer f.eks.tracat fรฅ indsigt fra enorme mรฆngder data ved hjรฆlp af forskellige videnskabelige metoder, algoritmer og processer. Det hjรฆlper dig med at opdage skjulte mรธnstre i rรฅdata. Begrebet datavidenskab er opstรฅet pรฅ grund af udviklingen af โโmatematisk statistik, dataanalyse og big data.
Datavidenskab er et tvรฆrfagligt felt, der giver dig mulighed for attracviden fra strukturerede eller ustrukturerede data. Datavidenskab gรธr det muligt at oversรฆtte et forretningsproblem til et forskningsprojekt og derefter omsรฆtte det tilbage til en praktisk lรธsning.
Hvorfor Data Science?
Her er vรฆsentlige fordele ved at bruge dataanalyseteknologi:
- Data er olien i verden i dag. Med de rigtige vรฆrktรธjer, teknologier og algoritmer kan vi bruge data og omdanne dem til en klar forretningsfordel.
- Data Science kan hjรฆlpe dig med at opdage svindel ved hjรฆlp af avancerede maskinlรฆringsalgoritmer
- Det hjรฆlper dig med at forhindre betydelige รธkonomiske tab
- Giver dig mulighed for at indbygge intelligens i maskiner
- Du kan udfรธre sentimentanalyse for at mรฅle kundemรฆrkeloyalitet
- Det giver dig mulighed for at tage bedre og hurtigere beslutninger
- Det hjรฆlper dig med at anbefale det rigtige produkt til den rigtige kunde for at forbedre din forretning
Tidslinjen nedenfor viser, hvordan disciplinen voksede ud af statistik og analyse.

Datavidenskabskomponenter
Diagrammet nedenfor opsummerer de fire byggesten.
Statistik
Statistik er den mest kritiske enhed af datavidenskabens grundlรฆggende principper, og det er metoden eller videnskaben til at indsamle og analysere numeriske data i store mรฆngder for at fรฅ nyttig indsigt.
Visualisering
Visualiseringsteknik hjรฆlper dig med at fรฅ adgang til enorme mรฆngder data i letforstรฅelige og fordรธjelige billeder.
Maskinelรฆring
Maskinelรฆring udforsker opbygningen og studiet af algoritmer, der lรฆrer at lave forudsigelser om uforudsete eller fremtidige data. Det opdeles bredt i overvรฅget og uden opsyn teknikker.
Deep Learning
Deep Learning er en maskinlรฆringsmetode, hvor lagdelte neurale netvรฆrk selv lรฆrer funktionerne at kende, sรฅ algoritmen vรฆlger den analysemodel, der skal fรธlges.
Data Science proces
Nu i dette Data Science Tutorial, vil vi lรฆre om datavidenskabsprocessen. De seks trin nedenfor afholdes i den viste rรฆkkefรธlge:
1. Opdagelse
Opdagelsestrinet involverer indhentning af data fra alle de identificerede interne og eksterne kilder, hvilket hjรฆlper dig med at besvare forretningsspรธrgsmรฅlet.
Dataene kan vรฆre:
- Logs fra webservere
- Data indsamlet fra sociale medier
- Folketรฆllingsdatasรฆt
- Data streamet fra onlinekilder ved hjรฆlp af API'er
2. Forberedelse
Data kan have mange uoverensstemmelser, sรฅsom manglende vรฆrdier, tomme kolonner og et forkert dataformat, som alle skal renses. Du skal bearbejde, udforske og konditionere data, fรธr du modellerer. Jo renere dine data er, desto bedre er dine forudsigelser.
3. Modelplanlรฆgning
I denne fase skal du bestemme metoden og teknikken til at tegne sammenhรฆngen mellem inputvariabler. Planlรฆgning af en model udfรธres ved at bruge forskellige statistiske formler og visualiseringsvรฆrktรธjerSQL-analysetjenester, R og SAS/ACCESS er nogle af de vรฆrktรธjer, der bruges til dette formรฅl.
4. Modelbygning
I dette trin starter den egentlige modelbygningsproces. Her opdeler datalogen datasรฆttet i trรฆnings- og testundersรฆt. Teknikker som association, klassificering og klyngedannelse anvendes pรฅ trรฆningsdatasรฆttet. Nรฅr modellen er udarbejdet, testes den mod "test"-datasรฆttet.
5. Operationalisere
I denne fase leverer du den endelige baseline-model med rapporter, kode og tekniske dokumenter. Modellen implementeres i et realtidsproduktionsmiljรธ efter grundig testning.
6. Kommuniker resultater
I denne fase kommunikeres de vigtigste resultater til alle interessenter. Dette hjรฆlper dig med at beslutte, om projektresultaterne er en succes eller en fiasko baseret pรฅ input fra modellen.
Data Science jobroller
De mest fremtrรฆdende jobtitler for Data Scientist er:
- Dataforsker
- Data Engineer
- Data Analytiker
- statistiker
- Data Architect
- Data Admin
- Business Analyst
- Data/Analytics Manager
Lad os lรฆre, hvad hver rolle indebรฆrer i detaljer:
Dataforsker
Rolle: En dataforsker er en professionel, der administrerer enorme mรฆngder data for at komme med overbevisende forretningsvisioner ved at bruge forskellige vรฆrktรธjer, teknikker, metoder, algoritmer osv.
Sprog: R, SAS, Python, SQL, Hive, MATLAB, Pig, Spark
Data Engineer
roller: Rollen som en dataingeniรธr arbejder med store mรฆngder data. De udvikler, konstruerer, tester og vedligeholder arkitekturer sรฅsom store behandlingssystemer og databaser.
SprogSQL, Hive, R, SAS, MATLAB Python, Java, Rubin, C++og Perl
Data Analytiker
rollerEn dataanalytiker er ansvarlig for at udvinde store mรฆngder data. De vil lede efter sammenhรฆnge, โโmรธnstre og tendenser i data. Later De vil levere overbevisende rapportering og visualisering til analyse af data for at trรฆffe de mest holdbare forretningsbeslutninger.
Sprog:R, Python, HTML, JS, C, C++, SQL
statistiker
roller: Statistikeren indsamler, analyserer og forstรฅr kvalitative og kvantitative data ved hjรฆlp af statistiske teorier og metoder.
SprogSQL, R, MATLAB, Tableau Python, Perl, Spark, og Hive
Dataadministrator
roller: Dataadministrator skal sikre, at database er tilgรฆngelig for alle relevante brugere. De sikrer ogsรฅ, at den fungerer korrekt, og beskytter den mod hacking.
Sprog: Ruby on Rails, SQL, Java, C# og Python
Business Analyst
roller: Denne professionelle skal forbedre forretningsprocesser. Han/hun er en mellemmand mellem virksomhedsledelsen og IT-afdelingen.
SprogSQL, Tableau, Power BI og Python
Lรฆs ogsรฅ vores Spรธrgsmรฅl og svar til jobsamtaler inden for datalogi til รธvelse inden en jobsamtale.
Vรฆrktรธjer til datavidenskab
Vรฆrktรธjerne er opdelt i fire grupper, som vist nedenfor.
| Dataanalyse | Datavarehousing | Datavisualisering | Maskinelรฆring |
|---|---|---|---|
| R, Spark, Python og SAS | Hadoop, SQL, Hive | R, Tableau, Rรฅ | Spark, Azure ML Studio, Mahout |
Forskellen mellem Data Science med BI (Business Intelligence)
Tabellen nedenfor viser, hvordan de to adskiller sig.
| Driftsparametre | Business Intelligence | data, Science |
|---|---|---|
| Perception | Ser tilbage | Ser frem |
| Data Sources | Strukturerede data, primรฆrt SQL, og nogle gange et data warehouse | Strukturerede og ustrukturerede data. Som logfiler, SQL, NoSQL eller tekst |
| Tilgang | Statistik og visualisering | Statistik, Machine Learning og Graph |
| vรฆgt | Fortid & nutid | Analyse og naturlig sprogbehandling |
| Vรฆrktรธjer | Pentaho, Microsoft BI, QlikView | R, TensorFlow |
Lรฆs ogsรฅ forskellen pรฅ Datavidenskab og maskinlรฆring.
Anvendelser af datavidenskab
Nogle anvendelser af datalogi er:
Internetsรธgning
Google Sรธgning bruger datavidenskabelig teknologi til at sรธge efter et specifikt resultat inden for en brรธkdel af et sekund.
Anbefalingssystemer
At oprette et anbefalingssystem. For eksempel "foreslรฅede venner" pรฅ Facebook eller "foreslรฅede videoer" pรฅ YouTube, alt sker ved hjรฆlp af Data Science.
Billed- og talegenkendelse
Talegenkendelsessystemer som Siri, Google Assistent og Alexa bruger datavidenskab som teknik. Derudover genkender Facebook din ven, nรฅr du uploader et billede med dem, ved hjรฆlp af datavidenskab.
Gaming verden
EA Sports, Sony, Nintendo bruger datavidenskabsteknologi. Dette forbedrer din spiloplevelse. Spil er nu udviklet ved hjรฆlp af Machine Learning-teknikker, og de kan opdatere sig selv, nรฅr du flytter til hรธjere niveauer.
Online prissammenligning
PriceRunner, Junglee, Shopzilla arbejder pรฅ datavidenskabsmekanismen. Her hentes data fra de relevante hjemmesider ved hjรฆlp af API'er.
Udfordringer ved datavidenskabsteknologi
- Et stort udvalg af information og data er pรฅkrรฆvet for nรธjagtig analyse
- En tilstrรฆkkelig pulje af datavidenskabelige talenter er ikke tilgรฆngelig
- Ledelsen yder ikke รธkonomisk stรธtte til et datavidenskabsteam
- Manglende eller vanskelig adgang til data
- Beslutningstagere i virksomheder bruger ikke datavidenskabelige resultater effektivt
- Det er svรฆrt at forklare datavidenskab til andre
- Privatlivsproblemer
- Mangel pรฅ en betydelig domรฆneekspert
- Hvis en organisation er meget lille, kan den ikke have et data science-team



