O Panorama do Aprendizado de Máquina
O Aprendizado de Máquina (Machine Learning) é a ciência de programar computadores para que aprendam a partir de dados. Arthur Samuel (1959) definiu-o como o "campo de estudo que confere aos computadores a capacidade de aprender sem serem explicitamente programados". Tom Mitchell (1997) forneceu uma definição mais formal: "Diz-se que um programa de computador aprende a partir da experiência E com respeito a alguma tarefa T e alguma medida de desempenho P, se seu desempenho em T, conforme medido por P, melhora com a experiência E."
Os sistemas de AM são classificados pelo tipo de supervisão que recebem durante o treinamento. No aprendizado supervisionado, os dados de treinamento incluem as soluções desejadas (rótulos): classificação e regressão são as tarefas mais comuns, com algoritmos como k-Vizinhos Mais Próximos, Regressão Linear, Regressão Logística, SVMs, Árvores de Decisão, Florestas Aleatórias e redes neurais. O aprendizado não supervisionado lida com dados não rotulados: clusterização (k-Médias, DBSCAN, Análise de Agrupamento Hierárquico), detecção de anomalias e redução de dimensionalidade. O aprendizado semissupervisionado combina uma pequena quantidade de dados rotulados com uma grande quantidade de dados não rotulados. O aprendizado por reforço envolve um agente que aprende por meio de recompensas e penalidades em um ambiente.
O aprendizado pode ser em lote (offline) ou online (incremental). Os principais desafios incluem: quantidade insuficiente de dados de treinamento, dados de treinamento não representativos (viés de amostragem), dados de baixa qualidade, características irrelevantes, sobreajuste (a regularização ajuda) e subajuste (modelo simples demais). O Teorema do Almoço Grátis (No Free Lunch Theorem) afirma que nenhum algoritmo único é o melhor para todos os problemas — é preciso testar muitos modelos. A validação cruzada fornece estimativas de desempenho confiáveis.
Regressão Linear Interativa — Ajuste a reta
Mova os sliders para ajustar θ₀ (intercepto) e θ₁ (inclinação). Observe como o erro (MSE) muda. O objetivo é minimizar o MSE aproximando a reta dos pontos.
- O AM consiste em aprender a partir de dados para realizar previsões ou tomar decisões sem programação explícita
- Supervisionado (rotulado), não supervisionado (não rotulado), semissupervisionado e por reforço são os quatro paradigmas principais
- Aprendizado em lote vs. online determina como os dados são consumidos durante o treinamento
- Sobreajuste e subajuste constituem a tensão central — regularização e complexidade do modelo devem ser equilibradas
- Teorema do Almoço Grátis: nenhum modelo é universalmente superior; a experimentação é essencial
- A validação cruzada é o padrão-ouro para uma avaliação confiável do modelo