Aprendizado de máquina supervisionado: Algorithms, Tipos e exemplos
⚡ Resumo Inteligente
O aprendizado de máquina supervisionado treina um algoritmo com exemplos rotulados para que ele possa prever resultados para dados que nunca viu antes, usando regressão para alvos numéricos e classificação para alvos categóricos, como spam ou fraude.

O que é Aprendizado de Máquina Supervisionado?
O aprendizado de máquina supervisionado é um algoritmo que aprende com dados de treinamento rotulados para ajudar a prever resultados para dados não previstos. No aprendizado supervisionado, você treina a máquina usando dados que já estão bem "rotulados". Isso significa que alguns dados já estão etiquetados com respostas corretas. Pode ser comparado ao aprendizado na presença de um supervisor ou professor.
Construir, dimensionar e implementar com sucesso modelos de aprendizado de máquina supervisionado precisos exige tempo e conhecimento técnico de uma equipe de cientistas de dados altamente qualificados. Os cientistas de dados também devem reconstruir os modelos periodicamente para que as informações geradas permaneçam válidas à medida que os dados subjacentes mudam.
Como funciona a aprendizagem supervisionada
O aprendizado de máquina supervisionado usa conjuntos de dados de treinamento para alcançar os resultados desejados. Esses conjuntos de dados contêm entradas e a saída correta que ajudam o modelo a aprender mais rápido. Por exemplo, você deseja treinar uma máquina para ajudá-lo a prever quanto tempo levará para voltar do local de trabalho para casa.
Aqui, você começa criando um conjunto de dados rotulados. Esses dados incluem:
- Condições do tempo
- Hora do dia
- Férias
- Rota escolhida
Todos esses detalhes são as suas entradas neste exemplo de aprendizado supervisionado. A saída é o tempo que levou para voltar para casa dirigindo naquele dia específico, como mostra a imagem abaixo.
Você sabe instintivamente que, se estiver chovendo lá fora, levará mais tempo para chegar em casa dirigindo. Mas a máquina precisa de dados e estatísticas.
A primeira coisa que você precisa criar é um conjunto de treinamento. Ele conterá o tempo total de deslocamento e fatores correspondentes, como clima, horário, etc. Com base nesse conjunto de treinamento, sua máquina poderá perceber que existe uma relação direta entre a quantidade de chuva e o tempo que você levará para chegar em casa.
Portanto, isso demonstra que quanto mais chove, mais tempo você levará dirigindo para chegar em casa. Também pode indicar uma relação entre o horário em que você sai do trabalho e o tempo que passa na estrada. Quanto mais perto das 6h, mais tempo você levará para chegar em casa.
Sua máquina pode encontrar algumas das relações com seus dados rotulados. Essa fase de aprendizado é mostrada abaixo.

Este é o início do seu Modelo de Dados. Ele começa a registrar como a chuva impacta a forma como as pessoas dirigem e que mais pessoas viajam durante um determinado horário do dia.
Tipos de aprendizado de máquina supervisionado Algorithms
A seguir estão os tipos de algoritmos de aprendizado de máquina supervisionado:
Regressão
A técnica de regressão prevê um único valor de saída contínuo usando dados de treinamento.
Exemplo: você pode usar a regressão para prever o preço da casa a partir dos dados de treinamento. As variáveis de entrada serão localidade, tamanho da casa, etc.
Pontos fortes: Os resultados são fáceis de interpretar e o algoritmo pode ser regularizado para evitar sobreajuste.
Pontos fracos: Um modelo linear não é flexível, portanto não captura relações complexas sem recursos adicionais.
Aqui estão alguns tipos de regressão Algorithms:
- Regressão linear
- Regressão polinomial
- Regressão de crista e laço
- Regressão logística (para classificação)
- Regressão por árvore de decisão e floresta aleatória
- Regressão vetorial de suporte
Regressão Logística:
A regressão logística é usada para estimar valores discretos com base em um conjunto de variáveis independentes. Ela ajuda a prever a probabilidade de ocorrência de um evento ajustando os dados a uma função logit. Portanto, também é conhecida como regressão logística. Como prevê uma probabilidade, seu valor de saída fica entre 0 e 1, e seu desempenho pode ser inferior quando há múltiplas fronteiras de decisão ou quando estas não são lineares.
Classificação
Classificar significa agrupar a saída dentro de uma classe. Se o algoritmo tenta rotular a entrada em duas classes distintas, é chamado de classificação binária. Selecionar entre mais de duas classes é denominado classificação multiclasse.
Exemplo: Determinar se alguém irá ou não deixar de pagar o empréstimo.
Pontos fortes: As árvores de classificação têm um desempenho muito bom na prática.
Pontos fracos: Sem restrições, as árvores individuais são propensas a sobreajuste.
Aqui estão alguns tipos de classificação Algorithms:
- Classificadores Naive Bayes
- Árvores de decisão
- Máquina de vetores de suporte
- K-vizinhos mais próximos
- Floresta aleatória e reforço de gradiente
Classificadores Naive Bayes
O Baías ingénuas O modelo é fácil de construir e muito útil para grandes conjuntos de dados. Este método é composto por grafos acíclicos direcionados com um nó pai e vários nós filhos. Ele pressupõe a independência entre os nós filhos separados de seus respectivos nós pais.
Árvores de decisão
Árvores de decisão classificam uma instância ordenando-a com base no valor de sua característica. Nesse método, cada nó representa uma característica da instância a ser classificada, e cada ramo representa um valor que o nó pode assumir. É uma técnica amplamente utilizada para classificação.
A mesma estrutura funciona para regressão: uma árvore de regressão ajuda a estimar valores reais (custo de compra de um carro, número de chamadas, total de vendas mensais, etc.).
Máquina de vetores de suporte
A Máquina de Vetores de Suporte (SVM, na sigla em inglês) é um tipo de algoritmo de aprendizado introduzido na década de 1990. Esse método é baseado em resultados da teoria de aprendizado estatístico desenvolvida por Vladimir Vapnik e seus colegas.
As SVMs também estão intimamente ligadas às funções kernel, que são um conceito central para a maioria das tarefas de aprendizado. A estrutura kernel e as SVMs são usadas em diversas áreas, incluindo recuperação de informação multimídia, bioinformática e reconhecimento de padrões. Cada estimador acima é documentado com seus parâmetros de ajuste no [link para a documentação]. scikit-learn referência.
Técnicas de Aprendizado de Máquina Supervisionado vs. Não Supervisionado
Colocando o método ao lado aprendizado não supervisionado deixa seus limites bem claros.
| Baseado em | Técnica de aprendizado de máquina supervisionado | Técnica de aprendizado de máquina não supervisionado |
|---|---|---|
| Dados de entrada | Algorithms são treinados usando dados rotulados. | Algorithms são usados em dados que não estão rotulados |
| Complexidade computacional | A aprendizagem supervisionada é um método mais simples. | A aprendizagem não supervisionada é computacionalmente complexa |
| Precisão | Método altamente preciso e confiável. | Less método preciso e confiável. |
| Algoritmos típicos | Regressão logística, árvores de decisão, SVM, Naive Bayes | K-means, agrupamento hierárquico, PCA |
| Como os resultados são avaliados | Pontuação em relação às respostas conhecidas (precisão, RMSE) | Avaliado por critérios internos e revisão humana. |
Desafios no Aprendizado de Máquina Supervisionado
Aqui estão os desafios enfrentados no aprendizado de máquina supervisionado:
- Características de entrada irrelevantes nos dados de treinamento podem produzir resultados imprecisos.
- A preparação e pré-processamento de dados é sempre um desafio.
- A precisão é prejudicada quando valores impossíveis, improváveis e incompletos são inseridos como dados de treinamento.
- Se o especialista em questão não estiver disponível, a outra abordagem é a "força bruta". Isso significa que você precisa adivinhar quais características (variáveis de entrada) usar para treinar a máquina, e essa tentativa pode ser imprecisa.
Vantagens da aprendizagem supervisionada
Diante desses desafios, aqui estão as vantagens do aprendizado de máquina supervisionado:
- Aprendizagem supervisionada em Machine Learning Permite coletar dados ou gerar uma saída de dados a partir de experiências anteriores.
- Ajuda você a otimizar critérios de desempenho usando experiência
- O aprendizado de máquina supervisionado ajuda a resolver vários tipos de problemas de computação do mundo real.
Desvantagens da aprendizagem supervisionada
A seguir estão as desvantagens do aprendizado de máquina supervisionado:
- A fronteira de decisão pode estar sobreajustada se o seu conjunto de treinamento não contiver exemplos que você deseja ter em uma classe.
- Você precisa selecionar muitos bons exemplos de cada classe enquanto treina o classificador.
- Classificar grandes volumes de dados pode ser um verdadeiro desafio.
- O treinamento para aprendizagem supervisionada requer muito tempo de computação.
Melhores Práticas para Aprendizagem Supervisionada
A seguinte sequência mantém um projeto em andamento. track:
- Antes de mais nada, decida que tipo de dados serão usados como conjunto de treinamento.
- Defina a estrutura da função aprendida e o algoritmo de aprendizagem.
- Reúna os resultados correspondentes, seja por meio de especialistas humanos ou de medições.
- Reserve um conjunto de testes que o modelo nunca vê e relate a pontuação nele.

