Zelfstudie over machine learning voor beginners: wat is de basis van ML
โก Slimme samenvatting
Machine learning is een verzameling computeralgoritmen die leren van voorbeelden in plaats van expliciet te worden geprogrammeerd. Ze combineren data met statistische hulpmiddelen om resultaten te voorspellen die mensen kunnen omzetten in concrete beslissingen.
Wat is machinaal leren?
Machine leren Machine learning is een systeem van computeralgoritmen dat kan leren van voorbeelden door middel van zelfverbetering, zonder dat het expliciet door een programmeur hoeft te worden gecodeerd. kunstmatige intelligentie waarbij data wordt gecombineerd met statistische instrumenten om een โโuitkomst te voorspellen die kan worden gebruikt om bruikbare inzichten te verkrijgen.
De doorbraak komt voort uit het idee dat een machine zelfstandig kan leren van data (oftewel voorbeelden) om nauwkeurige resultaten te produceren. Machine learning is nauw verwant aan... datamining en Bayesiaanse voorspellingsmodellen. De machine ontvangt gegevens als invoer en gebruikt een algoritme om antwoorden te formuleren.
Een typische machine learning-taak is het geven van een aanbeveling. Voor degenen die beschikken over een Netflix Op basis van het account zijn alle aanbevelingen voor films of series gebaseerd op de historische gegevens van de gebruiker. Technologiebedrijven gebruiken zonder toezicht leren Om de gebruikerservaring te verbeteren door aanbevelingen te personaliseren.
Machine learning wordt ook gebruikt voor diverse taken, zoals fraudedetectie, voorspellend onderhoud, portfolio-optimalisatie en taakautomatisering.
Machine learning versus traditioneel programmeren
Traditioneel programmeren verschilt aanzienlijk van machine learning. Bij traditioneel programmeren codeert een programmeur alle regels in overleg met een expert uit de branche waarvoor de software wordt ontwikkeld. Elke regel is gebaseerd op een logische basis; de machine produceert een output door de logische bewering te volgen. Naarmate het systeem complexer wordt, moeten er meer regels worden geschreven en kan het al snel onhoudbaar worden om te onderhouden. Het onderstaande diagram laat die workflow zien, waarbij data en handgeschreven regels erin gaan en antwoorden eruit komen.

Machine learning is bedoeld om dit probleem op te lossen. De machine leert hoe de input- en outputgegevens met elkaar samenhangen en schrijft zelf de regel. Programmeurs hoeven niet telkens nieuwe regels te schrijven wanneer er nieuwe gegevens zijn. De algoritmen passen zich aan op basis van nieuwe gegevens en ervaringen om de effectiviteit in de loop van de tijd te verbeteren. Het tweede diagram is het omgekeerde van het eerste: gegevens en bekende antwoorden gaan erin, en de regel komt eruit.
Hoe werkt machinaal leren?
Met dat contrast in gedachten, is de volgende vraag wat er precies gebeurt tijdens de leerfase.
Machine learning is het brein waar al het leren plaatsvindt. De manier waarop een machine leert, is vergelijkbaar met hoe een mens leert. Mensen leren van ervaring: hoe meer we weten, hoe gemakkelijker we kunnen voorspellen. Bij een onbekende situatie is de kans op succes kleiner dan in een bekende situatie. Machines worden op dezelfde manier getraind. Om een โโaccurate voorspelling te doen, ziet de machine een voorbeeld. Wanneer we de machine een vergelijkbaar voorbeeld geven, kan ze de uitkomst bepalen. Net als een mens heeft de machine echter moeite met voorspellen als ze een voorbeeld krijgt dat ze nog niet eerder heeft gezien.
De kerndoelen van machine learning zijn leren en inferentie. Allereerst leert de machine door het ontdekken van patronen, en die ontdekking wordt mogelijk gemaakt door de data. Een cruciaal onderdeel van het werk van de data scientist is het zorgvuldig selecteren van de data die aan de machine wordt aangeboden. De lijst met attributen die worden gebruikt om een โโprobleem op te lossen, wordt een kenmerkende vectorJe kunt een featurevector zien als een subset van gegevens die gebruikt wordt om een โโprobleem op te lossen.
De machine gebruikt algoritmen om de werkelijkheid te vereenvoudigen en deze ontdekking om te zetten in een model. De leerfase wordt daarom gebruikt om de gegevens te beschrijven en samen te vatten in een model, zoals hieronder geรฏllustreerd.
De machine probeert bijvoorbeeld de relatie te begrijpen tussen het loon van een individu en de kans dat hij of zij naar een chique restaurant gaat. Het blijkt dat de machine een positieve relatie vindt tussen loon en een bezoek aan een luxe restaurant: dit is het model.
Afleiden
Zodra het model is gebouwd, is het mogelijk om de kracht ervan te testen met nog nooit eerder gebruikte data. De nieuwe data wordt omgezet in een featurevector, verwerkt het model en geeft een voorspelling. Dit is het waardevolle aspect van machine learning. Het is niet nodig om de regels aan te passen of het model opnieuw te trainen โ je kunt het eerder getrainde model gebruiken om een โโinferentie te maken op nieuwe data, precies zoals het onderstaande diagram laat zien.
Het leven van een machine learning-programma is eenvoudig en kan worden samengevat in de volgende punten:
- Definieer een vraag
- Data verzamelen
- Gegevens visualiseren
- Trein algoritme
- Test het algoritme
- Feedback verzamelen
- Verfijn het algoritme
- Herhaal stap 4 tot en met 7 totdat het resultaat bevredigend is.
- Gebruik het model om een โโvoorspelling te doen
Zodra het algoritme goed is in het trekken van de juiste conclusies, past het die kennis toe op nieuwe datasets.
Machine leren Algorithms en waar worden ze gebruikt?
De onderstaande tabel groepeert de meest voorkomende algoritmen op basis van het soort taak dat ze oplossen.
Machine learning kan worden onderverdeeld in twee brede leertaken: toezicht en ongecontroleerdTussen en voorbij hen bevinden zich nog twee andere leerfamilies: semi-begeleid leren, waarbij een kleine set met labels wordt gemengd met een grote set zonder labels, en versterking van lerenwaarbij een agent leert van beloningen in plaats van van gelabelde antwoorden.
Leren onder toezicht
Een algoritme gebruikt trainingsgegevens en feedback van mensen om de relatie tussen bepaalde inputs en een bepaalde output te leren. Een professional kan bijvoorbeeld marketingkosten en de weersvoorspelling als inputgegevens gebruiken om de verkoop van blikjes te voorspellen.
Je kunt gebruiken leren onder toezicht Wanneer de uitvoergegevens bekend zijn, zal het algoritme vervolgens een voorspelling doen op basis van nieuwe gegevens.
Er zijn twee categorieรซn van begeleid leren:
- Classificatie taak
- Regressie taak
Classificatie
Stel je voor dat je het geslacht van een klant wilt voorspellen voor een reclame. Je begint met het verzamelen van gegevens over lengte, gewicht, beroep, salaris, bestedingspatroon, enzovoort, uit je klantendatabase. Je weet het geslacht van elke klant, en dat kan alleen man of vrouw zijn. Het doel van de classificator is om een โโwaarschijnlijkheid toe te kennen dat iemand man of vrouw is (oftewel het label) op basis van de verzamelde informatie (de kenmerken). Zodra het model heeft geleerd hoe het man of vrouw moet herkennen, kun je nieuwe gegevens gebruiken om een โโvoorspelling te doen. Stel, je hebt net nieuwe informatie ontvangen van een onbekende klant en je wilt weten of die klant man of vrouw is. Als de classificator voorspelt dat het een man is met een waarschijnlijkheid van 70%, betekent dit dat het algoritme er 70% zeker van is dat deze klant man is en 30% zeker dat de klant vrouw is.
Een label kan twee of meer klassen hebben. Het bovenstaande machine learning-voorbeeld heeft slechts twee klassen, maar als een classificator objecten moet voorspellen, kan deze tientallen klassen hebben (bijvoorbeeld glas, tafel, schoenen โ elk object vertegenwoordigt een klasse).
Regressie
Wanneer de uitvoer een continue waarde is, spreken we van een regressieanalyse. Een financieel analist moet bijvoorbeeld de waarde van een aandeel voorspellen op basis van verschillende kenmerken, zoals de aandelenkoers, eerdere prestaties van het aandeel en macro-economische indicatoren. Het systeem wordt getraind om de prijs van het aandeel met de laagst mogelijke foutmarge te schatten.
De onderstaande tabel geeft een overzicht van de meest voorkomende supervised learning-algoritmen en de taak waarvoor elk algoritme geschikt is.
| Algoritme | Beschrijving | Type |
|---|---|---|
| Lineaire regressie | Vindt een manier om elke functie te correleren met de uitvoer om toekomstige waarden te helpen voorspellen. | Regressie |
| Logistische regressie | Een uitbreiding van lineaire regressie die wordt gebruikt voor classificatietaken. De uitvoervariabele is binair (bijvoorbeeld alleen zwart of wit) in plaats van continu (bijvoorbeeld een oneindige lijst met mogelijke kleuren). | Classificatie |
| Beslissingsboom | Uiterst interpreteerbaar classificatie- of regressiemodel dat waarden van gegevenskenmerken opsplitst in vertakkingen op beslissingsknooppunten (als een kenmerk bijvoorbeeld een kleur is, wordt elke mogelijke kleur een nieuwe vertakking) totdat er een definitieve beslissing wordt genomen | Regressie Classificatie |
| Naรฏeve Bayes | De Bayesiaanse methode is een classificatiemethode die gebruik maakt van de Bayesiaanse stelling. De stelling werkt de voorkennis van een gebeurtenis bij met de onafhankelijke waarschijnlijkheid van elk kenmerk dat de gebeurtenis kan beรฏnvloeden. | Regressie Classificatie |
| Ondersteuning van vector machine | Support Vector Machine, ofwel SVM, wordt doorgaans gebruikt voor classificatietaken. Het SVM-algoritme vindt een hypervlak dat de klassen optimaal verdeelt. Het werkt het beste in combinatie met een niet-lineaire oplosser. | Regressie (niet erg gebruikelijk) Classificatie |
| Willekeurig bos | Het algoritme is gebaseerd op een beslissingsboom om de nauwkeurigheid drastisch te verbeteren. Random Forest genereert veel eenvoudige beslissingsbomen en gebruikt de 'meerderheidsstem'-methode om te bepalen welk label moet worden geretourneerd. Voor de classificatietaak is de uiteindelijke voorspelling die met de meeste stemmen; voor de regressietaak is de gemiddelde voorspelling van alle bomen de uiteindelijke voorspelling. | Regressie Classificatie |
| AdaBoost | Classificatie- of regressietechniek die een groot aantal modellen gebruikt om tot een beslissing te komen, maar deze weegt op basis van hun nauwkeurigheid bij het voorspellen van de uitkomst | Regressie Classificatie |
| Bomen die het verloop bevorderen | Gradient-boosting trees is een geavanceerde classificatie-/regressietechniek. Het richt zich op de fouten die door de voorgaande bomen zijn gemaakt en probeert deze te corrigeren. | Regressie Classificatie |
Niet-gecontroleerd leren
Bij onbegeleid leren onderzoekt een algoritme invoergegevens zonder dat er een expliciete uitvoervariabele wordt gegeven (bijvoorbeeld, het onderzoekt demografische klantgegevens om patronen te identificeren).
Je kunt het gebruiken wanneer je niet weet hoe je de data moet classificeren en je wilt dat het algoritme de patronen vindt en de data voor je groepeert. De belangrijkste onbegeleide algoritmen worden hieronder samengevat.
| Naam algoritme | Beschrijving | Type |
|---|---|---|
| K-betekent clustering | Plaatst gegevens in een aantal groepen (k) die elk gegevens bevatten met vergelijkbare kenmerken (zoals bepaald door het model, niet vooraf door mensen) | ClusterING |
| Gaussiaans mengselmodel | Een generalisatie van k-means clustering die meer flexibiliteit biedt in de grootte en vorm van groepen (clusters) | ClusterING |
| Hiรซrarchische clustering | Deelt clusters op langs een hiรซrarchische boom om een โโclassificatiesysteem te vormen. Kan worden gebruikt om klanten met een klantenkaart te clusteren. | ClusterING |
| Aanbevelingssysteem: | Helpt bij het definiรซren van de relevante gegevens voor het doen van een aanbeveling. | ClusterING |
| PCA/t-SNE | Meestal gebruikt om de dimensionaliteit van de data te verminderen. De algoritmes verminderen het aantal features tot 3 of 4 vectoren met de hoogste variantie. | Dimensievermindering |
Hoe u een machine learning-algoritme kiest
Er bestaan โโtalloze machine learning-algoritmen, en de keuze voor een algoritme wordt bepaald door het doel, niet door een modetrend.
In het onderstaande machine learning-voorbeeld is de taak om het type bloem te voorspellen aan de hand van drie variรซteiten. De voorspellingen zijn gebaseerd op de lengte en de breedte van de bloemblaadjes. De afbeelding toont de resultaten van tien verschillende algoritmen. De afbeelding linksboven is de dataset zelf, waarbij de gegevens zijn ingedeeld in drie categorieรซn: rood, lichtblauw en donkerblauw. Sommige groepen...pingDe verschillen zijn zichtbaar. In de tweede afbeelding bijvoorbeeld, behoort alles linksboven tot de rode categorie, het middelste deel bevat een mix van onzekerheid en lichtblauw, terwijl de onderkant overeenkomt met de donkere categorie. De andere afbeeldingen laten zien hoe verschillende algoritmen proberen dezelfde gegevens te classificeren.
Zodra een kandidaat is gekozen, wordt de kwaliteit ervan beoordeeld op basis van gegevens die de kandidaat nog nooit heeft gezien, meestal met behulp van een verwarring matrix en de daaruit afgeleide cijfers voor nauwkeurigheid, precisie en recall.
Uitdagingen en beperkingen van machinaal leren
De grootste uitdaging van machine learning is het gebrek aan data, ofwel het gebrek aan diversiteit binnen de dataset. Een machine kan niet leren als er geen data beschikbaar is. Een dataset die weinig diversiteit biedt, maakt het de machine ook moeilijk, omdat een machine heterogeniteit nodig heeft om een โโbetekenisvol inzicht te verkrijgen. Het is zeldzaam dat een algoritme...tract-informatie wanneer er geen of weinig variaties zijn. Een algemene vuistregel is om minstens 20 observaties per groep te hebben om de machine te helpen leren; daaronder lijden zowel de evaluatie als de voorspelling.
De hoeveelheid data is niet de enige beperking. Modellen die getraind zijn op vertekende historische gegevens reproduceren die vertekening, complexe modellen zijn moeilijk uit te leggen aan een toezichthouder of een klant, en elk model presteert minder goed naarmate de wereld waarop het getraind is verandert.
Toepassing van machinaal leren
De bovenstaande technieken worden al in de meeste industrieรซn toegepast. De onderstaande voorbeelden gaan van algemene ondersteuning naar specifieke sectoren.
Vergroting: Machine learning helpt mensen bij hun dagelijkse taken, zowel privรฉ als zakelijk, zonder dat ze de uitkomst volledig kunnen bepalen. Dergelijke machine learning wordt op verschillende manieren gebruikt, bijvoorbeeld in virtuele assistenten, data-analyse en softwareoplossingen. Het voornaamste doel is het verminderen van fouten die worden veroorzaakt door menselijke vooringenomenheid.
Automatisering: Machine learning werkt volledig autonoom in elk vakgebied, zonder menselijke tussenkomst. Robots voeren bijvoorbeeld essentiรซle processtappen uit in productiebedrijven.
Financiรซle sector: Machine learning wint aan populariteit in de financiรซle sector. Banken gebruiken ML voornamelijk om patronen in data te ontdekken, maar ook om fraude te voorkomen.
Overheidsorganisaties: Overheden maken gebruik van machine learning om de openbare veiligheid en nutsvoorzieningen te beheren. Neem bijvoorbeeld China en zijn grootschalige gezichtsherkenningsprogramma, waar toepassingen voor kunstmatige intelligentie worden gebruikt om voetgangers die de verkeersregels overtreden te identificeren.
Zorgsector: De gezondheidszorg was een van de eerste sectoren die machine learning gebruikte, te beginnen met beeldherkenning.
marketing: Dankzij de overvloed aan data wordt AI steeds vaker ingezet in marketing. Vรณรณr het tijdperk van massale data-explosie ontwikkelden onderzoekers geavanceerde wiskundige instrumenten zoals Bayesiaanse analyse om de waarde van een klant te schatten. Met de explosieve groei van data vertrouwen marketingafdelingen nu op AI om klantrelaties en marketingcampagnes te optimaliseren.
Voorbeeld van machinaal leren in de toeleveringsketen
Machine learning levert sterke resultaten op voor visuele patroonherkenning, waardoor veel potentiรซle toepassingen mogelijk worden bij fysieke inspectie en onderhoud in de gehele toeleveringsketen.
Ongecontroleerd leren kan snel vergelijkbare patronen in een diverse dataset vinden. Vervolgens kan de machine kwaliteitscontroles uitvoeren in het logistieke centrum en zendingen met schade en slijtage signaleren.
Bijvoorbeeld, IBMHet Watson-platform van 's kan schepen bepalenping containerschade. Watson combineert visuele en systeemgebaseerde data om track, rapporteer en doe aanbevelingen in realtime.
In het verleden vertrouwden voorraadbeheerders grotendeels op handmatige methoden om de voorraad te evalueren en te voorspellen. Door big data en machine learning te combineren, worden betere voorspellingstechnieken mogelijk, met gerapporteerde verbeteringen van 20 tot 30 procent ten opzichte van traditionele voorspellingsmethoden. Qua omzet vertaalt zich dat in een stijging van 2 tot 3 procent dankzij de potentiรซle verlaging van de voorraadkosten.
Voorbeeld van machinaal leren in de Google Auto
Iedereen kent de Google De auto is volledig bedekt met lasers op het dak, die de auto vertellen waar hij zich bevindt ten opzichte van de omgeving. Aan de voorkant zit een radar die de auto informeert over de snelheid en beweging van alle auto's in de omgeving. De auto gebruikt al die gegevens niet alleen om te bepalen hoe hij moet rijden, maar ook om te voorspellen wat de bestuurders om hem heen gaan doen. Indrukwekkend is dat de auto bijna een gigabyte aan data per seconde verwerkt.
Waarom is machinaal leren belangrijk?
Machine learning is tot nu toe het beste instrument om data te analyseren, te begrijpen en patronen erin te herkennen. Een van de belangrijkste ideeรซn achter machine learning is dat een computer getraind kan worden om taken te automatiseren die voor een mens uitputtend of onmogelijk zouden zijn. Het duidelijke verschil met traditionele analyses is dat machine learning beslissingen kan nemen met minimale menselijke tussenkomst.
Neem bijvoorbeeld het volgende: een makelaar kan de prijs van een huis inschatten op basis van persoonlijke ervaring en kennis van de markt.
Een machine kan worden getraind om de kennis van die expert om te zetten in kenmerken. Die kenmerken zijn alle eigenschappen van een huis, de buurt, de economische omgeving, enzovoort, die de prijs beรฏnvloeden. Voor de expert heeft het waarschijnlijk jaren geduurd om de kunst van het prijsinschatten van een huis onder de knie te krijgen, en die expertise verbetert na elke verkoop.
Voor de machine zijn miljoenen datapunten (oftewel voorbeelden) nodig om deze kunst te beheersen. Aan het begin van het leerproces maakt de machine fouten, net als een beginnende verkoper. Zodra de machine voldoende voorbeelden heeft gezien, beschikt ze over genoeg kennis om een โโinschatting te maken, en dat met grote nauwkeurigheid. De machine is ook in staat om haar fouten te corrigeren naarmate er nieuwe verkopen binnenkomen.
De meeste grote bedrijven hebben de waarde van machine learning en het bewaren van data ingezien. Het McKinsey Global Institute schatte de jaarlijkse waarde van alle analysetechnieken op $9.5 biljoen tot $15.4 biljoen en schreef ongeveer 40 procent daarvan โ zo'n $3.5 biljoen tot $5.8 biljoen per jaar โ toe aan geavanceerde AI-technieken gebaseerd op diepe neurale netwerken, zoals uiteengezet in hun rapport. Aantekeningen van de AI-grens Onderzoek.
Wanneer regels bekend maar onnauwkeurig zijn in plaats van afwezig, kan een op regels gebaseerde aanpak zoals fuzzy logic Een zelfontwikkeld model kan beter aansluiten dan een aangeleerd model, daarom worden de twee technieken vaak vergeleken voordat een project van start gaat.




