Mis on andmeteadus? Sissejuhatus Concepts & Protsess

⚡ Nutikas kokkuvõte

Andmeteaduse äsjatracts annab statistika, visualiseerimise ja masinõppe abil ülevaate suurtest struktureeritud ja struktureerimata andmemahtudest. Selle kuueetapiline protsess, peamised tööülesanded, tööriistariba ja peamised ärirakendused on esitatud allpool.

  • 🔘 Määratlus: Interdistsiplinaarne valdkond, mis muudab toorandmed teadmisteks, mille põhjal ettevõte saab tegutseda.
  • ☑️ Neli komponenti: Iga projekti aluseks on statistika, visualiseerimine, masinõpe ja süvaõpe.
  • Kuus etappi: Tulemuste avastamine, ettevalmistamine, mudeli planeerimine, mudeli loomine, rakendamine ja edastamine.
  • 🧪 Rollid: Andmeteadlane, insener, analüütik, statistik, arhitekt, administraator, ärianalüütik ja analüütikajuht.
  • 🛠️ tööriistad: R, Python, SAS ja Spark analüüsiks; Hadoop ja Hive salvestamiseks; Tableau visuaalide jaoks.
  • ⚠️ Piirang: Talentide puudus, piiratud juurdepääs andmetele ja privaatsusreeglid piiravad meeskondade pakutavat.

Mis on andmeteadus

Mis on andmeteadus?

andmed Science on uurimisvaldkond, mis hõlmab näitekstrac...suurtest andmemahtudest teadmiste ammutamine erinevate teaduslike meetodite, algoritmide ja protsesside abil. See aitab teil avastada toorandmetes peidetud mustreid. Mõiste andmeteadus on tekkinud matemaatilise statistika, andmeanalüüsi ja ... arengu tõttu. suur andmed.

Andmeteadus on interdistsiplinaarne valdkond, mis võimaldab teil uuridatracstruktureeritud või struktureerimata andmetest saadud teadmised. Andmeteadus võimaldab teil äriprobleemi tõlkida uurimisprojektiks ja seejärel selle tagasi praktiliseks lahenduseks tõlkida.

Miks andmeteadus?

Siin on andmeanalüüsi tehnoloogia kasutamise olulised eelised:

  • Andmed on tänapäeva maailma nafta. Õigete tööriistade, tehnoloogiate ja algoritmide abil saame andmeid kasutada ja muuta need selgeks ärieeliseks.
  • Andmeteadus aitab teil täiustatud masinõppe algoritme kasutades pettusi tuvastada
  • See aitab teil vältida olulisi rahalisi kahjusid
  • Võimaldab masinatesse intelligentsust sisse ehitada
  • Kliendi brändilojaalsuse mõõtmiseks saate läbi viia sentimentanalüüsi
  • See võimaldab teil teha paremaid ja kiiremaid otsuseid
  • See aitab teil soovitada õigele kliendile õiget toodet, et oma äri edendada

Allolev ajajoon näitab, kuidas see distsipliin kasvas välja statistikast ja analüütikast.

Ajajoon, mis näitab andmeteaduse arengut statistikast suurandmeteni
Andmeteaduse areng

Andmeteaduse komponendid

Allolev diagramm võtab kokku neli ehitusplokki.

Andmeteaduse neli komponenti: statistika, visualiseerimine, masinõpe ja süvaõpe

Statistika

Statistika on andmeteaduse aluste kõige kriitilisem üksus ning see on meetod või teadus, mille abil kogutakse ja analüüsitakse arvulisi andmeid suurtes kogustes, et saada kasulikke teadmisi.

Visualiseerimine

Visualiseerimistehnika aitab teil hõlpsasti arusaadava ja seeditava visuaalina juurde pääseda tohututele andmetele.

Masinõpe

Masinõpe uurib algoritmide loomist ja uurimist, mis õpivad tegema ennustusi ettenägematute või tulevaste andmete kohta. See jaguneb laias laastus järgmisteks osadeks: kontrollitud ja järelevalveta tehnikaid.

Sügav õppimine

Sügav õppimine on masinõppe lähenemisviis, mille puhul kihilised närvivõrgud õpivad ise tunnuseid, seega valib algoritm järgitava analüüsimudeli.

Andmeteaduse protsess

Nüüd selles Andmeteaduse õpetus, õpime tundma andmeteaduse protsessi. Allpool olevad kuus etappi toimivad näidatud järjekorras:

Kuueastmeline andmeteaduse protsess avastamisest tulemuste edastamiseni

1. Avastus

Avastamisetapp hõlmab andmete hankimist kõigist tuvastatud sise- ja välisallikatest, mis aitab teil äriküsimusele vastata.

Andmed võivad olla:

  • Logid veebiserveritest
  • Sotsiaalmeediast kogutud andmed
  • Loenduse andmestikud
  • Andmed voogesitatakse Interneti-allikatest API-de abil

2. Ettevalmistus

Andmetes võib olla palju vastuolusid, näiteks puuduvad väärtused, tühjad veerud ja vale andmevorming, mis kõik vajavad puhastamist. Enne modelleerimist tuleb andmeid töödelda, uurida ja tingimustega varustada. Mida puhtamad on teie andmed, seda paremad on teie ennustused.

3. Mudelplaneerimine

Selles etapis peate määrama meetodi ja tehnika sisendmuutujate vahelise seose loomiseks. Mudeli planeerimine toimub erinevate statistiliste valemite ja visualiseerimisvahendidSelleks otstarbeks kasutatavate tööriistade hulka kuuluvad SQL-analüüsi teenused, R ja SAS/ACCESS.

4. Mudeli ehitamine

Selles etapis algab tegelik mudeli loomise protsess. Siin jagab andmeteadlane andmekogumi treening- ja testimisalamhulkadeks. Treeningandmekogumile rakendatakse selliseid tehnikaid nagu seostamine, klassifitseerimine ja klasterdamine. Pärast ettevalmistatud mudelit testitakse „testimisandmekogumi” suhtes.

5. Operanatsionaliseerida

Selles etapis esitate lõpliku baasmudeli koos aruannete, koodi ja tehniliste dokumentidega. Pärast põhjalikku testimist juurutatakse mudel reaalajas tootmiskeskkonda.

6. Tulemustest teavitamine

Selles etapis edastatakse peamised tulemused kõigile sidusrühmadele. See aitab teil mudelist saadud sisendite põhjal otsustada, kas projekti tulemused on edukad või ebaõnnestunud.

Andmeteaduse töörollid

Kõige silmapaistvamad Data Scientisti ametinimetused on:

  • Andmete teadlane
  • Andmete insener
  • Andmed Analüütik
  • Statistik
  • kuupäev Architect
  • Andmeadministraator
  • Business Analyst
  • Andme-/analüütikahaldur

Vaatame üksikasjalikult, mida iga roll endast kujutab:

Andmete teadlane

Roll: Andmeteadlane on professionaal, kes haldab tohutul hulgal andmeid, et tulla välja mõjuvate ärivisioonidega, kasutades erinevaid tööriistu, tehnikaid, metoodikaid, algoritme jne.

Keeled: R, SAS, Python, SQL, Hive, MATLAB, Pig, Spark

Andmete insener

Roll: Roll a andmeinsener töötab suurte andmemahtudega. Nad arendavad, ehitavad, testivad ja hooldavad arhitektuure, näiteks suuremahulisi töötlussüsteeme ja andmebaase.

KeeledSQL, Hive, R, SAS, MATLAB Python, Java, Rubiin, C++ja Perli

Andmed Analüütik

RollAndmeanalüütik vastutab tohutu hulga andmete kaevandamise eest. Ta otsib andmetes seoseid, mustreid ja trende. Later Nad pakuvad kaasahaaravat aruandlust ja visualiseeringut andmete analüüsimiseks, et teha kõige elujõulisemaid äriotsuseid.

Keeled: R, Python, HTML, JS, C, C++, SQL

Statistik

Roll: Statistik kogub, analüüsib ja mõistab kvalitatiivseid ja kvantitatiivseid andmeid statistiliste teooriate ja meetodite abil.

KeeledSQL, R, MATLAB, Tableau Python, Perl, Sparkja Taru

Andmehaldur

Roll: Andmeadministraator peaks tagama, et andmebaas on ligipääsetav kõigile asjaosalistele kasutajatele. Samuti tagavad nad selle korrektse toimimise ja kaitsevad seda rünnakute eest. häkkimine.

Keeled: Ruby on Rails, SQL, Java, C# ja Python

Business Analyst

Roll: see professionaal peab äriprotsesse täiustama. Ta on vahendaja ettevõtte juhtkonna ja IT-osakonna vahel.

KeeledSQL, Tableau, Power BI ja Python

Lugege ka meie Andmeteaduse intervjuuküsimused ja vastused harjutamiseks enne intervjuud.

Andmeteaduse tööriistad

Tööriistad jagunevad nelja rühma, mis on näidatud allpool.

Andmeteaduse tööriistade kategooriad analüüsi, ladustamise, visualiseerimise ja masinõppe jaoks

Andmete analüüs Andmete ladustamine Andmete visualiseerimine Masinõpe
R, Spark, Python ja SAS hadoop, SQL, Mesilaspere R, Elav pilt, Toores Spark, Azure ML Stuudio, Mahout

Erinevus andmeteaduse ja BI (äriteabe) vahel

Allolev tabel näitab, kuidas need kaks erinevad.

parameetrid Ärianalüüs andmed Science
Taju tagasi vaatama Ootan
Andmeallikad Struktureeritud andmed, enamasti SQL ja mõnikord andmeladu Struktureeritud ja struktureerimata andmed.
Nagu logid, SQL, NoSQL või tekst
Lähenemine Statistika ja visualiseerimine Statistika, masinõpe ja graafik
Rõhk Minevik ja olevik Analüüs ja loomuliku keele töötlemine
TÖÖRIISTAD Pentaho Microsoft Ärianalüüs, QlikView R, TensorFlow

Loe ka, mis vahe on Andmeteadus ja masinõpe.

Andmeteaduse rakendused

Mõned andmeteaduse rakendused on:

Interneti-otsing

Google Otsing kasutab andmeteaduse tehnoloogiat, et otsida konkreetset tulemust sekundi murdosa jooksul.

Soovitussüsteemid

Soovitussüsteemi loomiseks. Näiteks „soovitatud sõbrad” Facebookis või „soovitatud videod” YouTube, kõik tehakse Data Science’i abiga.

Kujutise ja kõnetuvastus

Kõnetuvastussüsteemid nagu Siri Google Assistant ja Alexa kasutavad andmeteaduse tehnikat. Lisaks tunneb Facebook teie sõbra andmeteaduse abil ära, kui laadite üles temaga koos foto.

Mängumaailm

EA Sports, Sony ja Nintendo kasutavad andmeteaduse tehnoloogiat. See parandab teie mängukogemust. Mänge arendatakse nüüd masinõppe tehnikaid kasutades ja need saavad end värskendada, kui liigute kõrgemale tasemele.

Interneti-hindade võrdlus

PriceRunner, Junglee, Shopzilla töötavad andmeteaduse mehhanismi kallal. Siin hangitakse andmed asjakohastelt veebisaitidelt API-de abil.

Andmeteaduse tehnoloogia väljakutsed

  • Täpse analüüsi jaoks on vaja suurt hulka teavet ja andmeid
  • Puudub piisav andmeteaduse talentide reserv
  • Juhtkond ei toeta andmeteaduse meeskonda rahaliselt
  • Andmete kättesaamatus või keeruline juurdepääs neile
  • Äriotsuste langetajad ei kasuta andmeteaduse tulemusi tõhusalt
  • Andmeteaduse teistele selgitamine on keeruline
  • Privaatsus probleemid
  • Olulise valdkonnaeksperdi puudumine
  • Kui organisatsioon on väga väike, ei saa tal olla andmeteaduse meeskonda.

KKK

Andmeanalüütika uurib olemasolevaid andmeid, et selgitada, mis juhtus ja miks, tavaliselt aruandluse ja juhtpaneelide kaudu. Andmeteadus loob mudeleid, mis ennustavad, mis edasi juhtub, ning toetub rohkem programmeerimisele, statistikale ja masinõppele.

Tööandjad otsivad kvantitatiivset kraadi või sellele vastavat portfooliot, sujuvust Python või R, SQL ja statistika. Valdkonna tundmine on sageli sama oluline kui volitus.

Python on turvalisem esimene valik, kuna see hõlmab ka inseneritööd, juurutamist ja süvaõpet. R jääb tugevamaks klassikalise statistika ja akadeemilise uurimistöö puhul. Enamik töörühmi loeb mõlemat.

Teil on vaja kirjeldavat statistikat, tõenäosusteooriat, hüpoteeside testimist ja lineaaralgebrat. Arvutus on oluline peamiselt mudelite kavandamisel või häälestamisel. Tõestused on haruldased, kuid valemid peavad olema teile loetavad.

Toorandmed saabuvad puuduvate väljade, duplikaatide, vastuoluliste ühikute ja valede tüüpidega. Iga viga kandub edasi mudelisse, seega kulutavad meeskonnad suure osa ajast nende esmasele parandamisele.

Andmeteadlane sõnastab küsimuse, uurib andmeid ja valideerib mudeleid uurimiskeskkonnas. Masinõppe insener võtab valideeritud mudeli ja paneb selle tootmises usaldusväärselt tööle, pidades silmas jälgimist, ümberõpet ja skaleerimist.

Generatiivne tehisintellekt koostab uurimusliku koodi, võtab kokku andmekogumid ja pakub välja funktsioone, tihendades rutiinset analüüsi. Otsustusõigus selle kohta, millist küsimust esitada ja kas tulemust saab usaldada, jääb inimese teha.

GitHubi koopia Täidab automaatselt pandasid, scikit-learni ja joonistab koodi sees Jupyter ja VS Codeja selgitab tundmatuid funktsioone. Kontrollige iga soovitust oma andmete suhtes – see ei näe teie veerge ega nende tähendust.

Võta see postitus kokku järgmiselt: