비지도 머신러닝: Algorithms유형 및 예시
⚡ 스마트 요약
비감독 학습은 레이블이 지정되지 않은 데이터를 사용하는 머신 러닝 기법으로, 모델이 사전에 제공된 답변에 의존하는 대신 클러스터링, 연관 규칙 및 차원 축소를 통해 스스로 구조를 발견하도록 합니다.
비지도 학습이란 무엇입니까?
비감독 학습은 사용자가 모델을 감독할 필요가 없는 머신 러닝 기법입니다. 모델이 스스로 작동하여 이전에 발견되지 않았던 패턴과 정보를 발견하도록 합니다. 주로 레이블이 지정되지 않은 데이터를 다룹니다.
비지도 학습 Algorithms
비지도 학습 Algorithms 사용자가 기존 방식보다 더 복잡한 처리 작업을 수행할 수 있도록 합니다. 지도 학습하지만 비지도 학습은 알려진 답을 기반으로 학습된 방법보다 예측하기 어려울 수 있습니다. 비지도 학습 알고리즘에는 클러스터링, 이상 탐지, 차원 축소 및 자기 조직화 신경망 등이 있습니다.
비지도 머신러닝의 예
아기와 가족 반려견을 대상으로 비지도 학습의 예를 들어 보겠습니다. 첫 번째 그림은 아기가 이미 알아보는 반려견입니다.
그녀는 이 개를 알고 알아봅니다. 몇 주 후, 가족 친구가 개를 데리고 와서 아기와 놀아주려고 합니다. 아래 사진은 그 두 번째, 낯선 개입니다.
아기는 이 개를 이전에 본 적이 없습니다. 하지만 두 귀, 눈, 네 발로 걷는 모습 등 여러 특징이 자신의 반려견과 비슷하다는 것을 알아챕니다. 그래서 아기는 이 새로운 동물을 개라고 인식합니다. 이것이 바로 비지도 학습입니다. 비지도 학습은 학습자가 직접 가르치는 것이 아니라, 데이터(이 경우에는 개에 대한 데이터)를 통해 스스로 학습하는 방식입니다. 만약 이것이 지도 학습이었다면, 위의 비지도 학습 예시에서처럼 가족 친구가 아기에게 이 동물이 개라고 알려줬을 것입니다.
왜 비지도 학습인가?
다음은 비감독 학습을 사용하는 주요 이유입니다. 머신 러닝:
- 비감독형 머신러닝은 데이터에서 알려지지 않은 온갖 종류의 패턴을 찾아냅니다.
- 비지도 방법은 분류에 유용할 수 있는 특징을 찾는 데 도움이 됩니다.
- 이 시스템은 데이터가 도착하는 즉시 실행되므로, 사람이 먼저 레이블을 지정할 필요 없이 들어오는 레코드를 분석하고 그룹화할 수 있습니다.
- 수동 개입이 필요한 레이블이 있는 데이터보다 컴퓨터에서 레이블이 없는 데이터를 얻는 것이 더 쉽습니다.
Cluster비지도 학습의 유형 Algorithms
비지도 학습 문제는 클러스터링, 연관 규칙 도출, 차원 축소 문제로 further 분류됩니다. Cluster그룹화는 유사한 레코드를 그룹화하고, 연관 분석은 함께 나타나는 항목을 찾고, 차원 축소는 많은 특징을 몇 개로 압축합니다.
ClusterING
Clustering은 비지도 학습에 있어서 중요한 개념입니다. 주로 분류되지 않은 데이터 모음에서 구조나 패턴을 찾는 것을 다룹니다. 비지도 학습 Cluster알고리즘은 데이터를 처리하여 데이터에 존재하는 자연스러운 클러스터(그룹)를 찾아냅니다. 알고리즘이 식별할 클러스터의 개수도 수정할 수 있으며, 이를 통해 그룹의 세분화 정도를 조정할 수 있습니다. 아래 다이어그램은 흩어져 있던 레코드들이 명확한 그룹으로 분류된 것을 보여줍니다.
활용할 수 있는 클러스터링 유형은 다음과 같습니다.
배타적(파티셔닝)
이 클러스터링 방법에서는 데이터가 하나의 레코드가 하나의 클러스터에만 속하도록 그룹화됩니다.
예: K- 평균
응집
이 클러스터링 기법에서는 모든 레코드가 처음에는 하나의 클러스터로 시작됩니다. 가장 가까운 두 클러스터를 반복적으로 합치면서 클러스터의 수가 줄어듭니다.
예: 계층적 클러스터링
중복ping
이 기술에서는, 퍼지 세트 클러스터링은 데이터를 분류하는 데 사용됩니다. 각 데이터 포인트는 서로 다른 소속 정도를 가지며 둘 이상의 클러스터에 속할 수 있습니다.
여기에서 데이터는 적절한 멤버십 값과 연결됩니다. 예: 퍼지 C-평균
확률 적
이 기법은 확률 분포를 사용하여 클러스터를 생성합니다.
예시: 다음 키워드
- “남자 신발.”
- “여성 신발.”
- “여성용 장갑.”
- “남자 장갑.”
신발과 장갑, 또는 남성용과 여성용처럼 두 가지 범주로 분류할 수 있습니다.
Cluster유형
다음은 비지도 머신러닝에서 가장 자주 접하는 알고리즘들입니다. 처음 두 개는 레코드를 그룹화하고, 마지막 세 개는 클러스터를 형성하기보다는 차원을 축소하며, K-NN은 K-means와 혼동되는 경우가 많아 목록에 포함시켰습니다.
- 계층적 클러스터링 — 클러스터링
- K-평균 클러스터링 — 클러스터링
- K-NN(k 최근접 이웃)은 지도 학습 분류기이지 클러스터링 방법이 아닙니다.
- 주성분 분석 — 차원 축소
- 특이값 분해 — 차원 축소
- 독립 성분 분석 — 차원 축소
계층 적 ClusterING
계층적 클러스터링은 클러스터의 계층 구조를 구축하는 알고리즘입니다. 모든 데이터를 하나의 클러스터에 할당하는 것으로 시작합니다. 이때, 서로 가까운 두 클러스터는 하나의 클러스터로 병합됩니다. 이 알고리즘은 하나의 클러스터만 남을 때까지 진행됩니다. 이 알고리즘은 별도로 언급할 가치가 있는 두 가지 개념을 정의합니다.
응집 클러스터링
이러한 상향식 계층적 클러스터링 방식은 클러스터 개수 K를 입력값으로 요구하지 않습니다. 병합 과정은 각 레코드를 하나의 클러스터로 형성하는 것부터 시작합니다.
이 방법은 거리 측정 방식을 사용하고 병합 과정을 통해 클러스터 수를 (반복마다 하나씩) 줄입니다. 최종적으로 모든 객체를 포함하는 하나의 큰 클러스터가 생성되며, 분석가는 적절한 그룹 수를 나타내는 높이에서 트리를 잘라냅니다.
덴드로그램
덴드로그램 클러스터링 방법에서 각 레벨은 가능한 클러스터를 나타냅니다. 덴드로그램의 높이는 결합된 두 클러스터 간의 유사성 수준을 보여줍니다. 높이가 덴드로그램 하단에 가까울수록 클러스터 간의 유사성이 높습니다. 최종 그룹을 정의하는 기준점을 선택하는 것은 자동화된 것이 아니라 대부분 주관적입니다.
K- 평균 ClusterING
K-평균은 반복적인 클러스터링 알고리즘으로, 그룹을 세분화합니다.ping 매 반복마다 클러스터링이 수행됩니다. 초기에는 원하는 클러스터 개수를 선택합니다. 이 클러스터링 방법에서는 데이터 포인트를 k개의 그룹으로 클러스터링해야 합니다. k 값이 클수록 더 세분화된 작은 그룹이 생성되고, k 값이 작을수록 덜 세분화된 큰 그룹이 생성됩니다.
알고리즘의 출력은 "레이블" 그룹입니다. 이 레이블은 각 데이터 포인트를 k개의 그룹 중 하나에 할당합니다. k-평균 클러스터링에서 각 그룹은 해당 그룹의 중심점을 생성함으로써 정의됩니다. 중심점은 클러스터의 심장과 같으며, 중심점에 가장 가까운 데이터 포인트들을 포착하여 클러스터에 추가합니다.
K- 가장 가까운 이웃
K-최근접 이웃(K-NN)은 모든 머신러닝 분류기 중에서 가장 간단합니다. 다른 머신러닝 기법과 달리 모델을 생성하지 않는다는 특징이 있습니다. K-NN은 사용 가능한 모든 사례를 저장하고 유사도 측정을 기반으로 새로운 인스턴스를 분류하는 간단한 알고리즘입니다. 레이블이 지정된 사례를 기준으로 분류해야 하므로 지도 학습 방식입니다. 여기서는 거리 기반 논리가 클러스터링과 유사하기 때문에 언급하는 것입니다.
이 방법은 예제들 사이에 의미 있는 거리가 있을 때 매우 효과적입니다. 하지만 훈련 데이터셋이 크고 거리 계산이 복잡할 경우에는 학습 속도가 느립니다.
주성분 분석
주성분 분석은 고차원 공간에서 새로운 기저를 선택합니다.ping 가장 중요한 점수만 추출합니다. 이 기준의 각 방향은 주성분이라고 합니다. 이렇게 추출한 부분 집합은 원래 공간에 비해 크기가 작은 새로운 공간을 구성합니다. 이를 통해 데이터의 복잡성을 최대한 유지할 수 있습니다.
협회
연관 규칙을 사용하면 대규모 데이터베이스 내의 데이터 객체 간의 연관성을 설정할 수 있습니다. 이 비지도 학습 기법은 대규모 데이터베이스에서 변수 간의 흥미로운 관계를 발견하는 데 중점을 두며, 핵심적인 학습 방법입니다. 데이터 마이닝예를 들어, 새 집을 사는 사람들은 새 가구를 살 가능성이 가장 높습니다.
다른 예 :
- 유전자 발현 측정값을 기준으로 분류된 암 환자 하위 그룹
- 쇼핑객들을 검색 및 구매 이력에 따라 그룹화합니다.
- 시청자들이 부여한 평점에 따라 영화들을 분류했습니다.
감독 및 비지도 기계 학습
다음은 주요 차이점입니다. 지도 학습과 비지도 학습:
| 파라미터 | 감독된 기계 학습 기술 | 비지도 머신러닝 기술 |
| 입력 데이터 | Algorithms 레이블이 지정된 데이터를 사용하여 훈련됩니다. | Algorithms 레이블이 지정되지 않은 데이터에 대해 사용됩니다. |
| 계산 복잡성 | 지도 학습은 더 간단한 방법입니다. | 비지도 학습은 계산적으로 복잡합니다 |
| 정확성 | 정확도는 알려진 라벨과 직접 비교하여 측정할 수 있습니다. | 정확도는 직접 측정할 수 없으며, 결과는 해석이 필요합니다. |
| 일반적인 출력 | 새로운 기록 각각에 대한 예측 | 그룹, 규칙 또는 압축된 기능 |
비지도 기계 학습의 응용
비지도 학습 기법의 몇 가지 응용 분야는 다음과 같습니다.
- Clustering는 유사성을 기준으로 데이터 세트를 자동으로 그룹으로 분할합니다.
- 이상 탐지는 데이터 세트에서 비정상적인 데이터 포인트를 발견할 수 있습니다. 사기 거래를 찾는 데 유용합니다.
- 연관 마이닝은 데이터 세트에서 자주 함께 나타나는 항목 세트를 식별합니다.
- 잠재변수 모델은 데이터셋의 특징 개수를 줄이거나 데이터셋을 여러 구성 요소로 분해하는 등 데이터 전처리 과정에 널리 사용됩니다.
비지도 학습의 단점
- 비지도 학습에 사용되는 데이터는 레이블이 지정되지 않았고 실제 그룹이 없기 때문에 데이터 정렬에 대한 정확한 정보를 얻을 수 없습니다.ping 알려지지 않았다
- Less 입력 데이터가 알려지지 않았고 사람이 사전에 라벨을 붙이지 않았기 때문에 결과의 정확도가 떨어집니다. 즉, 기계가 이 작업을 스스로 수행해야 합니다.
- 스펙트럼 클래스가 항상 정보 클래스와 일치하는 것은 아닙니다.
- 사용자는 분류 결과에 따라 나오는 클래스들을 해석하고 레이블을 지정하는 데 시간을 할애해야 합니다.
- 클래스의 스펙트럼 특성은 시간이 지남에 따라 변할 수 있으므로 한 이미지에서 다른 이미지로 이동하는 동안 동일한 클래스 정보를 유지할 수 없습니다.



