Học máy được giám sát: Algorithms, Các loại và ví dụ
⚡ Tóm tắt thông minh
Học máy có giám sát huấn luyện thuật toán trên các ví dụ đã được gắn nhãn để nó có thể dự đoán kết quả cho dữ liệu mà nó chưa từng thấy trước đây, sử dụng hồi quy cho các mục tiêu số và phân loại cho các mục tiêu thuộc loại như thư rác hoặc gian lận.

Học máy được giám sát là gì?
Học máy có giám sát là một thuật toán học từ dữ liệu huấn luyện đã được gắn nhãn để giúp bạn dự đoán kết quả cho dữ liệu chưa biết trước. Trong học có giám sát, bạn huấn luyện máy bằng cách sử dụng dữ liệu đã được "gắn nhãn" tốt. Điều đó có nghĩa là một số dữ liệu đã được gắn thẻ với các câu trả lời chính xác. Nó có thể được so sánh với việc học dưới sự giám sát của người hướng dẫn hoặc giáo viên.
Việc xây dựng, mở rộng và triển khai thành công các mô hình học máy có giám sát chính xác đòi hỏi thời gian và chuyên môn kỹ thuật từ một nhóm các nhà khoa học dữ liệu có tay nghề cao. Các nhà khoa học dữ liệu cũng phải định kỳ xây dựng lại các mô hình để đảm bảo những hiểu biết mà chúng tạo ra vẫn đúng khi dữ liệu cơ bản thay đổi.
Cách học có giám sát hoạt động
Học máy có giám sát sử dụng tập dữ liệu huấn luyện để đạt được kết quả mong muốn. Các bộ dữ liệu này chứa đầu vào và đầu ra chính xác giúp mô hình học nhanh hơn. Ví dụ: bạn muốn huấn luyện một cỗ máy giúp bạn dự đoán bạn sẽ mất bao lâu để lái xe từ nơi làm việc về nhà.
Tại đây, bạn bắt đầu bằng cách tạo một tập hợp dữ liệu được gắn nhãn. Dữ liệu này bao gồm:
- Điều kiện thời tiết
- Thời gian trong ngày
- Ngày lễ
- Tuyến đường đã chọn
Tất cả những chi tiết này là dữ liệu đầu vào trong ví dụ học có giám sát này. Kết quả đầu ra là thời gian cần thiết để lái xe về nhà vào ngày cụ thể đó, như hình ảnh bên dưới cho thấy.
Bạn theo bản năng biết rằng nếu trời mưa, bạn sẽ mất nhiều thời gian hơn để lái xe về nhà. Nhưng máy móc cần dữ liệu và số liệu thống kê.
Việc đầu tiên bạn cần làm là tạo một tập dữ liệu huấn luyện. Tập dữ liệu này sẽ bao gồm tổng thời gian di chuyển và các yếu tố tương ứng như thời tiết, thời gian, v.v. Dựa trên tập dữ liệu huấn luyện này, máy của bạn có thể nhận thấy có mối quan hệ trực tiếp giữa lượng mưa và thời gian bạn cần để về nhà.
Như vậy, điều này khẳng định rằng trời càng mưa nhiều, bạn càng mất nhiều thời gian lái xe để về nhà. Nó cũng có thể thấy mối liên hệ giữa thời gian bạn rời khỏi nơi làm việc và thời gian bạn bắt đầu di chuyển trên đường. Càng gần 6 giờ chiều, bạn càng mất nhiều thời gian để về nhà.
Máy của bạn có thể tìm ra một số mối quan hệ với dữ liệu đã được gắn nhãn. Giai đoạn học tập đó được thể hiện bên dưới.

Đây là bước khởi đầu của Mô hình Dữ liệu của bạn. Nó bắt đầu ghi lại tác động của mưa đến cách mọi người lái xe, và việc có nhiều người di chuyển hơn vào một thời điểm cụ thể trong ngày.
Các loại máy học được giám sát Algorithms
Sau đây là các loại thuật toán Học máy có giám sát:
Hồi quy
Kỹ thuật hồi quy dự đoán một giá trị đầu ra liên tục duy nhất bằng cách sử dụng dữ liệu huấn luyện.
Ví dụ: Bạn có thể sử dụng hồi quy để dự đoán giá nhà từ dữ liệu huấn luyện. Các biến đầu vào sẽ là địa phương, quy mô ngôi nhà, v.v.
Ưu điểm: Kết quả đầu ra dễ hiểu và thuật toán có thể được điều chỉnh để tránh hiện tượng quá khớp (overfitting).
Nhược điểm: Mô hình tuyến tính không linh hoạt, do đó không thể nắm bắt được các mối quan hệ phức tạp nếu không bổ sung thêm các tính năng.
Dưới đây là một số loại hồi quy Algorithms:
- Hồi quy tuyến tính
- Hồi quy đa thức
- Hồi quy Ridge và Lasso
- Hồi quy logistic (dùng cho phân loại)
- cây quyết định và hồi quy rừng ngẫu nhiên
- Hỗ trợ hồi quy vector
Hồi quy logistic:
Hồi quy logistic được sử dụng để ước tính các giá trị rời rạc dựa trên một tập hợp các biến độc lập cho trước. Nó giúp bạn dự đoán xác suất xảy ra của một sự kiện bằng cách khớp dữ liệu với một hàm logit. Do đó, nó cũng được gọi là hồi quy logit. Vì nó dự đoán xác suất, giá trị đầu ra của nó nằm giữa 0 và 1, và nó có thể hoạt động kém hiệu quả khi có nhiều ranh giới quyết định hoặc ranh giới không tuyến tính.
phân loại
Phân loại nghĩa là nhóm các kết quả đầu ra vào một lớp. Nếu thuật toán cố gắng gán nhãn đầu vào thành hai lớp riêng biệt, nó được gọi là phân loại nhị phân. Việc lựa chọn giữa nhiều hơn hai lớp được gọi là phân loại đa lớp.
Ví dụ: Xác định xem một người có khả năng vỡ nợ khoản vay hay không.
Ưu điểm: Cây phân loại hoạt động rất tốt trong thực tế.
Điểm yếu: Các cây quyết định riêng lẻ không bị ràng buộc dễ bị quá khớp (overfitting).
Dưới đây là một số kiểu phân loại Algorithms:
- Bộ phân loại Naive Bayes
- Cây quyết định
- Máy hỗ trợ vector
- K-Những người hàng xóm gần nhất
- Rừng ngẫu nhiên và tăng cường độ dốc
Bộ phân loại Naive Bayes
Vịnh Naive Mô hình này dễ xây dựng và rất hữu ích cho các tập dữ liệu lớn. Phương pháp này bao gồm các đồ thị có hướng không chu trình với một nút cha và nhiều nút con. Nó giả định sự độc lập giữa các nút con tách biệt khỏi nút cha của chúng.
Cây quyết định
Cây quyết định phân loại một trường hợp bằng cách sắp xếp nó dựa trên giá trị đặc trưng. Trong phương pháp này, mỗi nút là đặc trưng của trường hợp cần được phân loại, và mỗi nhánh đại diện cho một giá trị mà nút đó có thể nhận được. Đây là một kỹ thuật được sử dụng rộng rãi trong phân loại.
Cấu trúc tương tự cũng áp dụng cho hồi quy: cây hồi quy giúp bạn ước tính các giá trị thực (chi phí mua xe, số cuộc gọi, tổng doanh số hàng tháng, v.v.).
Máy hỗ trợ vector
Máy hỗ trợ vectơ (SVM) là một loại thuật toán học máy được giới thiệu vào những năm 1990. Phương pháp này dựa trên các kết quả từ lý thuyết học thống kê do Vladimir Vapnik và các đồng nghiệp phát triển.
Máy hỗ trợ vectơ (SVM) cũng có mối liên hệ chặt chẽ với các hàm nhân (kernel functions), một khái niệm trung tâm cho hầu hết các nhiệm vụ học máy. Khung nhân và SVM được sử dụng trong nhiều lĩnh vực, bao gồm truy xuất thông tin đa phương tiện, tin sinh học và nhận dạng mẫu. Mỗi bộ ước lượng nêu trên đều được mô tả chi tiết với các tham số điều chỉnh của nó trong tài liệu tham khảo. học hỏi tài liệu tham khảo.
Các kỹ thuật học máy có giám sát so với các kỹ thuật học máy không giám sát
Đặt phương pháp này bên cạnh học tập không giám sát Nó làm rõ ranh giới của mình.
| Dựa trên | Kỹ thuật học máy có giám sát | Kỹ thuật học máy không giám sát |
|---|---|---|
| Dữ liệu đầu vào | Algorithms được huấn luyện bằng cách sử dụng dữ liệu được dán nhãn. | Algorithms được sử dụng đối với dữ liệu không được gắn nhãn |
| Độ phức tạp tính toán | Học có giám sát là một phương pháp đơn giản hơn. | Học không giám sát phức tạp về mặt tính toán |
| tính chính xác | Phương pháp có độ chính xác cao và đáng tin cậy. | Less phương pháp chính xác và đáng tin cậy. |
| Thuật toán điển hình | Hồi quy logistic, cây quyết định, SVM, Naive Bayes | K-means, phân cụm phân cấp, PCA |
| Cách đánh giá kết quả | Được chấm điểm dựa trên các đáp án đã biết (độ chính xác, RMSE) | Được đánh giá dựa trên các biện pháp nội bộ và sự xem xét của con người. |
Những thách thức trong học máy có giám sát
Dưới đây là những thách thức phải đối mặt trong học máy có giám sát:
- Các đặc điểm đầu vào không liên quan trong dữ liệu huấn luyện có thể dẫn đến kết quả không chính xác.
- Việc chuẩn bị và tiền xử lý dữ liệu luôn là một thách thức.
- Độ chính xác sẽ bị ảnh hưởng khi các giá trị không thể xảy ra, không chắc chắn và không đầy đủ được nhập vào làm dữ liệu huấn luyện.
- Nếu chuyên gia liên quan không có mặt, thì phương pháp khác là "thử và sai". Điều đó có nghĩa là bạn phải đoán xem nên dùng những đặc điểm (biến đầu vào) nào để huấn luyện máy, và phỏng đoán đó có thể không chính xác.
Ưu điểm của việc học có giám sát
Trước những thách thức đó, đây là những ưu điểm của máy học có giám sát:
- Học tập có giám sát trong Machine Learning Cho phép bạn thu thập dữ liệu hoặc tạo ra dữ liệu đầu ra từ kinh nghiệm trước đó.
- Giúp bạn tối ưu hóa tiêu chí hiệu suất sử dụng kinh nghiệm
- Học máy được giám sát giúp bạn giải quyết nhiều loại vấn đề tính toán trong thế giới thực.
Nhược điểm của việc học có giám sát
Dưới đây là những nhược điểm của máy học có giám sát:
- Đường ranh giới quyết định có thể bị huấn luyện quá mức nếu tập dữ liệu huấn luyện của bạn không có các ví dụ mà bạn muốn có trong một lớp.
- Bạn cần chọn nhiều ví dụ hay từ mỗi lớp trong khi đào tạo bộ phân loại.
- Phân loại dữ liệu lớn có thể là một thách thức thực sự.
- Việc đào tạo học có giám sát cần rất nhiều thời gian tính toán.
Các phương pháp tốt nhất cho học có giám sát
Trình tự sau đây giúp dự án tiếp tục track:
- Trước khi làm bất cứ điều gì khác, hãy quyết định loại dữ liệu nào sẽ được sử dụng làm tập dữ liệu huấn luyện.
- Xác định cấu trúc của hàm được học và thuật toán học.
- Thu thập các kết quả tương ứng từ các chuyên gia hoặc từ các phép đo.
- Hãy giữ lại một tập dữ liệu kiểm thử mà mô hình không bao giờ nhìn thấy, và báo cáo điểm số trên tập dữ liệu đó.

