초보자를 위한 머신러닝 튜토리얼: ML이란 무엇인가?
⚡ 스마트 요약
머신 러닝은 명시적인 코딩 대신 예제를 통해 개선되는 컴퓨터 알고리즘의 한 종류로, 데이터와 통계 도구를 결합하여 사람들이 실행 가능한 결정으로 이어질 수 있는 결과를 예측합니다.
머신 러닝이란 무엇입니까?
머신 러닝 머신러닝은 프로그래머가 명시적으로 코딩하지 않고도 예제를 통해 스스로 학습하고 개선할 수 있는 컴퓨터 알고리즘 시스템입니다. 머신러닝은 컴퓨터 과학의 한 분야입니다. 인공 지능 데이터와 통계 도구를 결합하여 실행 가능한 통찰력을 도출하는 데 사용할 수 있는 결과를 예측하는 시스템입니다.
이 획기적인 발전은 기계가 데이터(즉, 예시)로부터 스스로 학습하여 정확한 결과를 도출할 수 있다는 아이디어에서 비롯되었습니다. 머신 러닝은 다음과 밀접한 관련이 있습니다. 데이터 마이닝 베이지안 예측 모델링을 사용합니다. 기계는 데이터를 입력으로 받아 알고리즘을 사용하여 답을 도출합니다.
일반적인 머신러닝 작업 중 하나는 추천을 제공하는 것입니다. 다음과 같은 정보를 가진 사람들을 위해 Netflix 계정의 경우, 영화나 시리즈에 대한 모든 추천은 사용자의 과거 데이터를 기반으로 합니다. 기술 기업들은 이를 활용합니다. 비지도 학습 개인 맞춤형 추천을 통해 사용자 경험을 개선합니다.
머신러닝은 사기 탐지, 예측 유지보수, 포트폴리오 최적화, 작업 자동화 등 다양한 분야에도 활용됩니다.
기계 학습과 기존 프로그래밍
전통적인 프로그래밍 방식은 머신 러닝과 상당히 다릅니다. 전통적인 프로그래밍에서는 프로그래머가 소프트웨어 개발 대상 산업 분야의 전문가와 협의하여 모든 규칙을 직접 코딩합니다. 각 규칙은 논리적 기반 위에 세워지며, 머신은 이러한 논리적 명제를 따라 결과를 도출합니다. 시스템이 복잡해질수록 더 많은 규칙을 작성해야 하므로 유지 관리가 어려워질 수 있습니다. 아래 그림은 데이터와 직접 작성한 규칙이 입력되어 결과가 출력되는 과정을 보여줍니다.

머신 러닝은 이러한 문제를 해결하기 위해 고안되었습니다. 기계는 입력 데이터와 출력 데이터 간의 상관관계를 학습하고 스스로 규칙을 만듭니다. 프로그래머는 새로운 데이터가 들어올 때마다 새로운 규칙을 작성할 필요가 없습니다. 알고리즘은 새로운 데이터와 경험에 따라 적응하여 시간이 지남에 따라 효율성을 향상시킵니다. 두 번째 다이어그램은 첫 번째 다이어그램을 반전시킨 것입니다. 데이터와 알려진 답이 입력되면 규칙이 출력됩니다.
머신러닝은 어떻게 작동하나요?
이러한 대조를 바탕으로 다음 질문은 학습 단계 내부에서 실제로 무슨 일이 일어나는가입니다.
머신 러닝은 모든 학습이 이루어지는 두뇌와 같습니다. 기계가 학습하는 방식은 인간의 학습 방식과 유사합니다. 인간은 경험을 통해 학습합니다. 아는 것이 많을수록 예측이 쉬워집니다. 비유하자면, 미지의 상황에 직면했을 때 성공 확률은 익숙한 상황보다 낮습니다. 기계도 같은 방식으로 훈련됩니다. 정확한 예측을 하기 위해 기계는 예시를 학습합니다. 기계에 유사한 예시를 제공하면 결과를 예측할 수 있습니다. 하지만 인간과 마찬가지로, 이전에 본 적 없는 예시를 제공하면 기계는 예측에 어려움을 겪습니다.
머신러닝의 핵심 목표는 학습과 추론입니다. 우선, 기계는 패턴을 발견함으로써 학습하며, 이러한 패턴 발견은 데이터에 의해 가능해집니다. 데이터 과학자의 중요한 역할 중 하나는 기계에 제공할 데이터를 신중하게 선택하는 것입니다. 문제를 해결하는 데 사용되는 속성 목록을 데이터셋이라고 합니다. 특징 벡터특징 벡터는 문제를 해결하는 데 사용되는 데이터의 부분 집합으로 생각할 수 있습니다.
이 기계는 알고리즘을 사용하여 현실을 단순화하고 이러한 발견을 모델로 변환합니다. 따라서 학습 단계는 아래 그림과 같이 데이터를 설명하고 모델로 요약하는 데 사용됩니다.
예를 들어, 기계는 개인의 임금과 고급 레스토랑에 갈 가능성 사이의 관계를 이해하려고 합니다. 결과적으로 기계는 임금과 고급 레스토랑 방문 사이에 양의 상관관계가 있음을 발견합니다. 이것이 바로 모델입니다.
추론
모델이 구축되면 이전에 본 적 없는 데이터로 모델의 성능을 테스트할 수 있습니다. 새로운 데이터는 특징 벡터로 변환되어 모델을 통과하고 예측 결과를 제공합니다. 이것이 머신 러닝의 핵심입니다. 규칙을 업데이트하거나 모델을 다시 학습시킬 필요 없이, 이전에 학습된 모델을 사용하여 새로운 데이터에 대한 추론을 수행할 수 있습니다. 아래 그림이 바로 그 예입니다.
머신러닝 프로그램의 수명 주기는 간단하며 다음과 같은 몇 가지 사항으로 요약할 수 있습니다.
- 질문 정의
- 데이터 수집
- 데이터 시각화
- 학습 알고리즘
- 알고리즘 테스트
- 피드백 수집
- 알고리즘 개선
- 결과가 만족스러울 때까지 4단계부터 7단계까지를 반복합니다.
- 모델을 사용하여 예측하기
알고리즘이 올바른 결론을 도출하는 데 익숙해지면, 그 지식을 새로운 데이터 집합에 적용합니다.
머신 러닝 Algorithms 그리고 어디에 사용되나요?
아래 표는 가장 일반적인 알고리즘들을 해결하는 작업 유형별로 분류한 것입니다.
머신러닝은 크게 두 가지 학습 작업으로 분류할 수 있습니다. 감독 감독되지 않은그 사이에 그리고 그 너머에는 두 가지 다른 학습 방식이 더 있는데, 하나는 레이블이 지정된 작은 데이터 세트와 레이블이 지정되지 않은 큰 데이터 세트를 혼합하는 준지도 학습이고, 다른 하나는 강화 학습여기서 에이전트는 레이블이 지정된 답변이 아닌 보상을 통해 학습합니다.
감독 학습
알고리즘은 훈련 데이터와 사람의 피드백을 사용하여 주어진 입력값과 출력값 사이의 관계를 학습합니다. 예를 들어, 실무자는 마케팅 비용과 일기 예보를 입력 데이터로 사용하여 캔 판매량을 예측할 수 있습니다.
당신이 사용할 수 지도 학습 출력 데이터가 알려지면 알고리즘은 새로운 데이터를 기반으로 예측을 수행합니다.
지도 학습에는 두 가지 범주가 있습니다.
- 분류과제
- 회귀 작업
분류
광고 촬영을 위해 고객의 성별을 예측한다고 가정해 보겠습니다. 먼저 고객 데이터베이스에서 키, 몸무게, 직업, 급여, 구매 품목 등의 데이터를 수집합니다. 각 고객의 성별은 남성 또는 여성으로만 알려져 있습니다. 분류기의 목표는 수집된 정보(즉, 특징)를 기반으로 고객이 남성일 확률(즉, 여성)을 나타내는 레이블을 지정하는 것입니다. 모델이 남성과 여성을 구분하는 방법을 학습하면 새로운 데이터를 사용하여 예측할 수 있습니다. 예를 들어, 알 수 없는 고객으로부터 새로운 정보를 받았고, 이 고객이 남성인지 여성인지 알고 싶다고 가정해 보겠습니다. 분류기가 남성일 확률을 70%로 예측했다면, 알고리즘은 이 고객이 남성일 확률이 70%이고 여성일 확률이 30%라는 의미입니다.
레이블은 두 개 이상의 클래스를 가질 수 있습니다. 위의 머신러닝 예시에는 두 개의 클래스만 있지만, 분류기가 객체를 예측해야 하는 경우 수십 개의 클래스가 있을 수 있습니다(예: 유리잔, 테이블, 신발 - 각 객체는 하나의 클래스를 나타냅니다).
리그레션
출력값이 연속형 값일 경우, 이는 회귀 분석 문제입니다. 예를 들어, 금융 분석가는 시가총액, 과거 주가 실적, 거시 경제 지표 등 다양한 변수를 기반으로 주식 가치를 예측해야 할 수 있습니다. 시스템은 가능한 한 오차를 최소화하면서 주가를 예측하도록 훈련됩니다.
아래 표는 여러분이 가장 자주 접하게 될 지도 학습 알고리즘과 각 알고리즘에 적합한 작업을 나열합니다.
| 암호알고리즘 | 기술설명 | 타입 |
|---|---|---|
| 선형 회귀 | 미래 값을 예측하는 데 도움이 되도록 각 기능을 출력과 연관시키는 방법을 찾습니다. | 리그레션 |
| 로지스틱 회귀 | 분류 작업에 사용되는 선형 회귀의 확장입니다. 출력 변수는 연속형(예: 무한한 색상 목록)이 아닌 이진형(예: 검정색 또는 흰색)입니다. | 분류 |
| 의사 결정 트리 | 최종 결정 출력이 이루어질 때까지 데이터 특성 값을 결정 노드에서 분기로 분할하는(예: 특성이 색상인 경우 가능한 각 색상이 새 분기가 됨) 해석하기 쉬운 분류 또는 회귀 모델 | 리그레션 분류 |
| 나이브 베이 즈 | 베이지안 방법은 베이지안 정리를 이용한 분류 방법입니다. 정리는 이벤트에 영향을 미칠 수 있는 각 기능의 독립적인 확률로 이벤트의 사전 지식을 업데이트합니다. | 리그레션 분류 |
| 서포트 벡터 머신 | 서포트 벡터 머신(SVM)은 일반적으로 분류 작업에 사용됩니다. SVM 알고리즘은 클래스를 최적으로 분할하는 초평면을 찾습니다. 비선형 솔버와 함께 사용할 때 가장 효과적입니다. | 회귀(흔하지 않음) 분류 |
| 랜덤 포레스트 | 이 알고리즘은 정확도를 획기적으로 향상시키기 위해 의사결정 트리를 기반으로 구축되었습니다. 랜덤 포레스트는 여러 개의 간단한 의사결정 트리를 생성하고 '다수결' 방식을 사용하여 어떤 레이블을 반환할지 결정합니다. 분류 작업의 경우, 최종 예측은 가장 많은 표를 얻은 트리가 되며, 회귀 작업의 경우 모든 트리의 예측 평균이 최종 예측이 됩니다. | 리그레션 분류 |
| 에이다부스트 | 다수의 모델을 사용하여 결정을 내리지만 결과 예측의 정확성을 기준으로 가중치를 부여하는 분류 또는 회귀 기술입니다. | 리그레션 분류 |
| 그라디언트 부스팅 트리 | 그래디언트 부스팅 트리는 최첨단 분류/회귀 기법입니다. 이 기법은 이전 트리들이 저지른 오류에 초점을 맞춰 이를 수정하려고 합니다. | 리그레션 분류 |
감독되지 않은 학습
비감독 학습에서 알고리즘은 명시적인 출력 변수를 제공받지 않고 입력 데이터를 탐색합니다(예: 고객 인구 통계 데이터를 탐색하여 패턴을 식별).
데이터를 어떻게 분류해야 할지 모를 때, 알고리즘이 패턴을 찾아 데이터를 그룹화해 주기를 원할 경우 비지도 학습을 사용할 수 있습니다. 주요 비지도 학습 알고리즘은 아래에 요약되어 있습니다.
| 알고리즘 이름 | 기술설명 | 타입 |
|---|---|---|
| K- 평균 클러스터링 | 유사한 특성을 가진 데이터를 포함하는 일부 그룹(k)에 데이터를 넣습니다(사람이 미리 결정하는 것이 아니라 모델에 의해 결정됨). | ClusterING |
| 가우시안 혼합 모델 | 그룹(클러스터)의 크기와 모양에 더 많은 유연성을 제공하는 k-평균 클러스터링의 일반화 | ClusterING |
| 계층 적 클러스터링 | 계층적 트리 구조를 따라 클러스터를 분할하여 분류 시스템을 구축합니다. 로열티 카드 고객을 클러스터링하는 데 사용할 수 있습니다. | ClusterING |
| 추천 시스템 | 권장 사항을 제시하는 데 필요한 관련 데이터를 정의하는 데 도움이 됩니다. | ClusterING |
| PCA/t-SNE | 주로 데이터의 차원을 줄이는 데 사용됩니다. 알고리즘은 특징 수를 가장 높은 분산을 가진 3개 또는 4개 벡터로 줄입니다. | 치수 감소 |
기계 학습 알고리즘을 선택하는 방법
머신러닝 알고리즘은 매우 다양하며, 알고리즘 선택은 유행보다는 목표에 따라 결정됩니다.
아래 머신러닝 예시에서는 세 가지 꽃 종류 중 어떤 꽃인지 예측하는 것이 목표입니다. 예측은 꽃잎의 길이와 너비를 기반으로 합니다. 그림은 10가지 알고리즘의 결과를 보여줍니다. 왼쪽 상단 그림은 데이터셋 자체이며, 데이터는 빨강, 연한 파랑, 진한 파랑의 세 가지 범주로 분류되어 있습니다.ping분류 결과가 명확하게 나타납니다. 예를 들어, 두 번째 이미지에서 왼쪽 상단은 모두 빨간색 범주에 속하고, 중간 부분은 불확실성과 밝은 파란색이 혼합되어 있으며, 하단은 어두운 범주에 해당합니다. 다른 이미지들은 서로 다른 알고리즘들이 동일한 데이터를 분류하려고 시도하는 방식을 보여줍니다.
후보자가 선정되면, 일반적으로 이전에 본 적 없는 데이터를 기반으로 해당 후보자의 품질을 평가합니다. 혼란 매트릭스 그리고 그로부터 도출된 정확도, 정밀도 및 재현율 수치입니다.
머신러닝의 과제와 한계
머신러닝의 주요 과제는 데이터 부족, 즉 데이터셋 내 다양성 부족입니다. 데이터가 없으면 기계는 학습할 수 없습니다. 다양성이 부족한 데이터셋 또한 기계 학습에 어려움을 초래하는데, 기계는 의미 있는 통찰력을 학습하기 위해 이질성이 필요하기 때문입니다. 알고리즘이 이러한 모든 요소를 완벽하게 충족하는 경우는 드뭅니다.trac변동성이 없거나 적을 때는 정보가 부족합니다. 일반적으로 머신 러닝을 돕기 위해 그룹당 최소 20개의 관측치가 필요합니다. 그보다 적으면 평가와 예측 모두 성능이 저하됩니다.
데이터 양만이 유일한 제약 조건은 아닙니다. 편향된 과거 기록으로 학습된 모델은 그 편향을 그대로 재현하고, 복잡한 모델은 규제 기관이나 고객에게 설명하기 어려우며, 모든 모델은 학습에 사용된 환경이 변화함에 따라 성능이 저하됩니다.
머신러닝의 응용
위의 기술들은 이미 대부분의 산업 분야에서 실제로 활용되고 있습니다. 아래 예시들은 일반적인 지원에서 특정 산업 분야로의 적용 범위를 보여줍니다.
증가: 머신러닝은 인간의 일상적인 업무, 개인적 또는 상업적 활동을 지원하지만, 결과물을 완전히 통제할 수는 없습니다. 이러한 머신러닝은 가상 비서, 데이터 분석, 소프트웨어 솔루션 등 다양한 분야에서 활용됩니다. 주된 목적은 인간의 편견으로 인한 오류를 줄이는 것입니다.
자동화 : 머신러닝은 인간의 개입 없이 어떤 분야에서든 완전히 자율적으로 작동합니다. 예를 들어, 로봇은 제조 공장에서 필수적인 공정 단계를 수행합니다.
금융 산업: 머신러닝은 금융 산업에서 점점 인기를 얻고 있습니다. 은행들은 주로 데이터 내에서 패턴을 찾는 데 머신러닝을 사용하지만, 사기를 방지하는 데에도 활용합니다.
정부 기관: 정부들은 공공 안전 및 공공 시설 관리를 위해 머신러닝을 활용합니다. 중국의 대규모 얼굴 인식 프로그램을 예로 들 수 있습니다. 인공 지능 응용 프로그램 무단횡단자를 식별하는 데 사용됩니다.
의료 산업: 의료 산업은 이미지 감지를 시작으로 머신 러닝을 가장 먼저 활용한 산업 중 하나입니다.
마케팅 : 방대한 데이터에 대한 접근성이 높아짐에 따라 마케팅 분야에서 인공지능(AI)이 광범위하게 활용되고 있습니다. 대규모 데이터 시대 이전에는 연구자들이 베이지안 분석과 같은 고급 수학적 도구를 개발하여 고객 가치를 추정했습니다. 하지만 데이터가 폭발적으로 증가하면서 마케팅 부서는 고객 관계 및 마케팅 캠페인 최적화를 위해 AI에 크게 의존하고 있습니다.
공급망 관리에 머신러닝을 적용한 사례
머신러닝은 시각적 패턴 인식에서 뛰어난 결과를 보여주며, 전체 공급망 네트워크에 걸친 물리적 검사 및 유지보수에 많은 잠재적 응용 분야를 열어줍니다.
비감독 학습은 다양한 데이터 세트에서 유사한 패턴을 신속하게 찾아낼 수 있습니다. 이를 통해 기계는 물류 허브 전반에 걸쳐 품질 검사를 수행하고 손상이나 마모가 있는 화물을 식별할 수 있습니다.
예를 들어, IBMWatson 플랫폼은 선박을 판별할 수 있습니다.ping 컨테이너 손상. 왓슨은 시각적 데이터와 시스템 기반 데이터를 결합하여 track, 실시간으로 보고하고 권장 사항을 제시합니다.
과거에는 재고 관리자들이 재고 평가 및 예측에 주로 수작업에 의존했습니다. 하지만 빅데이터와 머신러닝을 결합하면 기존 예측 도구 대비 20~30% 향상된 예측 정확도를 보이는 등 더욱 정교한 예측이 가능해집니다. 이는 재고 비용 절감을 통해 매출을 2~3% 증가시킬 수 있는 잠재력을 의미합니다.
머신러닝의 예시 Google 차
모두가 알고 있다 Google 이 자동차는 지붕 전체에 레이저 센서가 장착되어 있어 주변 환경과의 상대적인 위치를 파악합니다. 전면에는 레이더가 있어 주변 차량들의 속도와 움직임을 감지합니다. 이 모든 데이터를 활용하여 자신의 주행 방식을 결정할 뿐만 아니라 주변 차량들의 움직임을 예측하기도 합니다. 놀라운 점은 이 자동차가 초당 거의 1기가바이트에 달하는 데이터를 처리한다는 것입니다.
머신러닝이 왜 중요한가요?
머신러닝은 현재까지 데이터를 분석하고 이해하며 패턴을 식별하는 데 가장 효과적인 도구입니다. 머신러닝의 핵심 아이디어 중 하나는 컴퓨터가 인간이 수행하기에는 힘들거나 불가능한 작업을 자동화하도록 훈련시킬 수 있다는 것입니다. 전통적인 분석 방식과의 명확한 차이점은 머신러닝이 인간의 개입을 최소화하면서 스스로 결정을 내릴 수 있다는 점입니다.
다음 예를 들어 보겠습니다. 부동산 중개인은 개인적인 경험과 시장에 대한 지식을 바탕으로 주택 가격을 추정할 수 있습니다.
기계는 전문가의 지식을 특징으로 변환하도록 훈련될 수 있습니다. 이러한 특징은 주택, 주변 환경, 경제 환경 등 가격에 영향을 미치는 모든 요소를 포함합니다. 전문가가 주택 가격을 예측하는 기술을 숙달하는 데는 아마 수년이 걸렸을 것이며, 거래를 할 때마다 전문성이 향상됩니다.
기계가 이러한 기술을 숙달하려면 수백만 개의 데이터 포인트(즉, 예시)가 필요합니다. 학습 초기에는 기계가 마치 초보 영업 사원처럼 실수를 저지릅니다. 하지만 충분한 예시를 접하게 되면 높은 정확도로 예측을 할 수 있는 지식을 갖추게 됩니다. 또한 새로운 판매 기회가 생길 때마다 오류를 수정할 수도 있습니다.
대부분의 대기업은 머신러닝과 데이터 보유의 가치를 이해하고 있습니다. 맥킨지 글로벌 연구소는 모든 분석 기술의 연간 가치를 9조 5천억 달러에서 15조 4천억 달러로 추산했으며, 그중 약 40%인 연간 3조 5천억 달러에서 5조 8천억 달러는 딥 뉴럴 네트워크 기반의 고급 AI 기술에서 비롯된다고 밝혔습니다. 인공지능 프론티어에서 전하는 소식 연구.
규칙이 알려져 있지만 불명확한 경우, 즉 규칙이 아예 없는 것이 아니라면, 규칙 기반 접근 방식이 효과적입니다. 퍼지 논리 모델 기반 접근 방식이 학습된 모델보다 더 적합할 수 있으므로 프로젝트 시작 전에 두 가지 기법을 비교하는 경우가 많습니다.




