지도 머신 러닝: Algorithms, 유형 및 예
⚡ 스마트 요약
지도 학습은 레이블이 지정된 예제를 사용하여 알고리즘을 훈련시켜 이전에 본 적 없는 데이터에 대한 결과를 예측할 수 있도록 합니다. 숫자형 목표에는 회귀 분석을 사용하고 스팸이나 사기와 같은 범주형 목표에는 분류 분석을 사용합니다.
지도 머신러닝이란 무엇입니까?
지도 학습은 레이블이 지정된 훈련 데이터를 사용하여 예측 불가능한 데이터에 대한 결과를 예측하는 알고리즘입니다. 지도 학습에서는 레이블이 잘 지정된 데이터를 사용하여 기계를 훈련합니다. 즉, 일부 데이터에는 이미 정답이 태그되어 있습니다. 이는 감독자나 선생님이 있는 환경에서 학습하는 것과 유사합니다.
정확한 지도 학습 모델을 성공적으로 구축, 확장 및 배포하려면 고도로 숙련된 데이터 과학자 팀의 시간과 기술 전문 지식이 필요합니다. 또한 데이터 과학자는 기본 데이터가 변경되더라도 모델에서 도출된 인사이트가 유효하게 유지되도록 주기적으로 모델을 재구축해야 합니다.
지도 학습의 작동 방식
지도 기계 학습은 훈련 데이터 세트를 사용하여 원하는 결과를 얻습니다. 이러한 데이터 세트에는 모델이 더 빠르게 학습하는 데 도움이 되는 입력과 올바른 출력이 포함되어 있습니다. 예를 들어, 직장에서 집으로 운전해서 가는 데 걸리는 시간을 예측하는 데 도움이 되도록 기계를 훈련하려고 합니다.
여기서는 레이블이 지정된 데이터 세트를 만드는 것부터 시작합니다. 이 데이터에는 다음이 포함됩니다.
- 기상 조건
- 하루 중 시간
- 휴가
- 선택된 경로
이 모든 세부 정보는 지도 학습 예제의 입력값입니다. 출력값은 아래 이미지에서 볼 수 있듯이 해당 날짜에 집으로 돌아오는 데 걸린 시간입니다.
본능적으로 비가 오면 집까지 운전하는 데 시간이 더 오래 걸릴 거라는 걸 알지만, 기계는 데이터와 통계가 필요합니다.
먼저 학습 데이터 세트를 만들어야 합니다. 이 세트에는 총 통근 시간과 날씨, 시간 등의 관련 요소가 포함됩니다. 이 학습 데이터 세트를 기반으로, 기계 학습 시스템은 강우량과 집에 도착하는 데 걸리는 시간 사이에 직접적인 상관관계가 있음을 학습할 수 있습니다.
따라서 비가 많이 올수록 집으로 돌아가는 데 걸리는 시간이 더 길어진다는 것을 알 수 있습니다. 또한 퇴근 시간과 운전 시간 사이의 연관성도 파악할 수 있습니다. 오후 6시에 가까울수록 집에 도착하는 데 더 오랜 시간이 걸립니다.
머신 러닝 도구는 레이블이 지정된 데이터와 일부 관계를 찾아낼 수 있습니다. 학습 단계는 아래와 같습니다.

이것이 데이터 모델의 시작입니다. 이 모델은 비가 사람들의 운전 방식에 어떤 영향을 미치는지, 그리고 특정 시간대에 더 많은 사람들이 이동한다는 사실을 기록하기 시작합니다.
지도형 기계 학습의 유형 Algorithms
다음은 지도 학습 알고리즘의 유형입니다.
리그레션
회귀 분석 기법은 훈련 데이터를 사용하여 단일 연속 출력값을 예측합니다.
예: 회귀를 사용하여 훈련 데이터에서 주택 가격을 예측할 수 있습니다. 입력 변수는 지역, 주택 크기 등입니다.
장점: 출력 결과를 해석하기 쉽고, 과적합을 방지하기 위해 알고리즘에 정규화를 적용할 수 있습니다.
단점: 선형 모델은 유연성이 부족하여 추가적인 특징 없이는 복잡한 관계를 포착할 수 없습니다.
회귀의 몇 가지 유형은 다음과 같습니다. Algorithms:
- 선형 회귀
- 다항식 회귀
- 릿지 및 라쏘 회귀
- 로지스틱 회귀 분석(분류용)
- 의사결정 트리 및 랜덤 포레스트 회귀
- 지원 벡터 회귀
로지스틱 회귀:
로지스틱 회귀는 주어진 독립 변수 집합을 기반으로 이산 값을 추정하는 데 사용됩니다. 데이터를 로짓 함수에 맞춰 특정 사건의 발생 확률을 예측하는 데 도움이 되므로 로짓 회귀라고도 합니다. 확률을 예측하기 때문에 출력값은 0에서 1 사이의 값을 가지며, 결정 경계가 여러 개이거나 비선형적인 경우 성능이 저하될 수 있습니다.
분류
분류란 결과를 하나의 클래스로 묶는 것을 의미합니다. 알고리즘이 입력값을 서로 다른 두 클래스로 분류하려고 하면 이진 분류라고 합니다. 두 개 이상의 클래스 중에서 선택하는 것은 다중 클래스 분류라고 합니다.
예시: 누군가가 대출금을 상환하지 못할 가능성이 있는지 판단하는 것.
장점: 분류 트리는 실제 사용 환경에서 매우 뛰어난 성능을 보여줍니다.
단점: 제약 조건이 없어 개별 트리가 과적합될 가능성이 높습니다.
다음은 몇 가지 분류 유형입니다. Algorithms:
- 나이브 베이 즈 분류기
- 의사 결정 트리
- 벡터 머신 지원
- K-가장 가까운 이웃
- 랜덤 포레스트와 그래디언트 부스팅
나이브 베이즈 분류기
The 나이브 베이 즈 이 모델은 구축하기 쉽고 대규모 데이터 세트에 매우 유용합니다. 이 방법은 하나의 부모 노드와 여러 개의 자식 노드로 구성된 방향성 비순환 그래프(DAG)를 사용합니다. 자식 노드들은 부모 노드와 분리되어 서로 독립적이라고 가정합니다.
의사 결정 트리
의사결정 트리는 특징 값에 따라 인스턴스를 정렬하여 분류합니다. 이 방법에서 각 노드는 분류해야 할 인스턴스의 특징을 나타내고, 각 가지는 노드가 취할 수 있는 값을 나타냅니다. 이는 분류에 널리 사용되는 기법입니다.
회귀 분석에도 동일한 구조가 적용됩니다. 회귀 트리는 실제 값(자동차 구매 비용, 통화 횟수, 월 총 매출액 등)을 추정하는 데 도움이 됩니다.
벡터 머신 지원
서포트 벡터 머신(SVM)은 1990년대에 소개된 학습 알고리즘의 한 종류입니다. 이 방법은 블라디미르 바프니크와 그의 동료들이 개발한 통계적 학습 이론의 결과를 기반으로 합니다.
SVM은 대부분의 학습 작업에서 핵심 개념인 커널 함수와도 밀접한 관련이 있습니다. 커널 프레임워크와 SVM은 멀티미디어 정보 검색, 생물정보학, 패턴 인식 등 다양한 분야에서 사용됩니다. 위에 언급된 각 추정기는 튜닝 매개변수와 함께 문서화되어 있습니다. 사이 킷 학습 참고.
지도 학습 기법과 비지도 학습 기법의 차이점
그 방법을 옆에 놓으면 비지도 학습 경계를 명확히 합니다.
| 기반 | 감독된 기계 학습 기술 | 비지도 머신러닝 기술 |
|---|---|---|
| 입력 데이터 | Algorithms 레이블이 지정된 데이터를 사용하여 훈련됩니다. | Algorithms 레이블이 지정되지 않은 데이터에 대해 사용됩니다. |
| 계산 복잡성 | 지도 학습은 더 간단한 방법입니다. | 비지도 학습은 계산적으로 복잡합니다 |
| 정확성 | 매우 정확하고 신뢰할 수 있는 방법입니다. | Less 정확하고 신뢰할 수 있는 방법입니다. |
| 일반적인 알고리즘 | 로지스틱 회귀, 의사결정 트리, SVM, 나이브 베이즈 | K-평균, 계층적 클러스터링, PCA |
| 결과 평가 방법 | 알려진 정답과 비교하여 점수를 매겼습니다(정확도, RMSE). | 내부 평가 및 인적 평가를 통해 평가됨 |
지도 학습의 과제
지도 머신러닝이 직면한 과제는 다음과 같습니다.
- 훈련 데이터에 관련 없는 입력 특징이 있으면 부정확한 결과가 나올 수 있습니다.
- 데이터 준비와 전처리는 항상 어려운 일입니다.
- 불가능하거나 가능성이 낮거나 불완전한 값이 훈련 데이터에 입력되면 정확도가 떨어집니다.
- 해당 전문가를 구할 수 없는 경우, 다른 접근 방식은 "무차별 대입"입니다. 즉, 기계를 학습시키는 데 사용할 특징(입력 변수)을 추측해야 하는데, 이 추측은 정확하지 않을 수 있습니다.
지도 학습의 장점
이러한 어려움에 맞서 지도 학습의 장점은 다음과 같습니다.
- 지도 학습 머신 러닝 이전 경험을 바탕으로 데이터를 수집하거나 데이터 출력을 생성할 수 있습니다.
- 경험을 활용하여 성과 기준을 최적화하는 데 도움이 됩니다.
- 지도 기계 학습은 다양한 유형의 실제 계산 문제를 해결하는 데 도움이 됩니다.
지도 학습의 단점
다음은 지도 학습의 단점입니다.
- 원하는 클래스에 포함시키고 싶은 예제가 훈련 데이터셋에 없다면 결정 경계가 과적합될 수 있습니다.
- 분류기를 훈련하는 동안 각 클래스에서 좋은 예를 많이 선택해야 합니다.
- 빅데이터를 분류하는 것은 정말 어려운 과제일 수 있습니다.
- 지도 학습을 위한 훈련에는 많은 계산 시간이 필요합니다.
지도 학습을 위한 최고의 사례
다음 순서는 프로젝트를 계속 진행합니다. track:
- 다른 작업을 시작하기 전에, 어떤 종류의 데이터를 훈련 세트로 사용할지 결정하세요.
- 학습할 함수의 구조와 학습 알고리즘을 결정하십시오.
- 인간 전문가 또는 측정값을 통해 상응하는 결과를 수집하십시오.
- 모델이 전혀 접하지 않는 테스트 데이터셋을 따로 따로 만들어 두고, 그 데이터셋에 대한 점수를 보고하세요.

