Font size
WorksheetsAvaliando Modelos de Regressão
Total questions: 11
Worksheet time: 2hrs 40mins
Qual é o principal objetivo de um problema de regressão no aprendizado de máquina?
Classificar dados em categorias distintas.
Prever uma variável numérica contínua.
Reduzir a dimensionalidade de um conjunto de dados.
Agrupar dados semelhantes em clusters.
No algoritmo KNN para regressão, como o valor de uma nova instância é previsto?
Pela classe mais frequente entre os vizinhos mais próximos.
Pela média dos valores dos vizinhos mais próximos.
Calculando a distância euclidiana para o centróide do cluster.
Atribuindo um valor aleatório baseado na distribuição dos dados.
O que um resíduo positivo indica em um modelo de regressão?
O modelo previu o valor com exatidão.
O modelo superestimou o valor real.
O modelo não conseguiu fazer uma previsão.
O modelo subestimou o valor real.
Qual das seguintes métricas de avaliação penaliza mais os erros grandes?
Erro Médio Quadrático (MSE)
Acurácia
Erro Percentual Médio Absoluto (MAPE)
Erro Médio Absoluto (MAE)
Qual é a principal vantagem de usar a Raiz do Erro Médio Quadrático (RMSE) em vez do MSE?
O RMSE sempre fornece um valor de erro menor.
O RMSE é mais fácil de calcular.
O RMSE é menos sensível a outliers.
O RMSE está na mesma unidade que a variável de destino.
Em uma regressão linear simples com a fórmula y=β0+β1x, o que o coeficiente β1 representa?
O valor de y quando x é igual a zero.
A correlação entre x e y.
A mudança média em y para um aumento de uma unidade em x.
O erro total do modelo de regressão.
O que significa se um modelo de regressão está 'super ajustado' (overfitting)?
O modelo não tem erro.
O modelo é muito simples e não captura a tendência dos dados.
O modelo tem um erro muito alto tanto nos dados de treinamento quanto nos de teste.
O modelo aprendeu o padrão dos dados de treinamento muito bem, incluindo o ruído, e tem dificuldade em generalizar para novos dados.
Qual das seguintes afirmações sobre o Erro Médio Absoluto (MAE) é VERDADEIRA?
É mais sensível a outliers do que o MSE.
É expresso como uma porcentagem.
Ele mede a média dos erros absolutos entre as previsões e os valores reais.
Seu valor é sempre maior que o do RMSE.
Por que a normalização dos dados é importante ao usar o KNN para regressão?
Para acelerar o treinamento do modelo LinearRegression.
Para converter o problema de regressão em um problema de classificação.
Não é importante para o KNN.
Para garantir que todas as características tenham a mesma influência no cálculo da distância.
Qual é a principal diferença entre regressão linear e regressão logística?
A regressão linear é usada para classificação e a regressão logística para prever valores numéricos.
Não há diferença; os termos são intercambiáveis.
A regressão linear sempre se ajusta a uma linha reta, enquanto a regressão logística se ajusta a uma curva polinomial.
A regressão linear modela uma variável de saída contínua, enquanto a regressão logística modela uma variável de saída categórica.
Contexto: Vamos trabalhar com o dataset "California Housing" (https://scikit-learn.org/stable/modules/generated/sklearn.datasets.fetch_california_housing.html), um conjunto de dados clássico para tarefas de regressão. O nosso objetivo é prever o valor mediano de uma casa (MedHouseVal) em um distrito da Califórnia, com base em características como a renda média dos moradores, a idade da casa, o número médio de quartos, etc.
Tarefa:
Seu desafio é seguir os passos abaixo para construir e comparar os dois modelos.
Seu desafio é seguir os passos abaixo para construir e comparar os dois modelos.
Carregar e Preparar os Dados:
Carregue o dataset fetch_california_housing do sklearn.datasets (https://scikit-learn.org/stable/modules/generated/sklearn.datasets.fetch_california_housing.html).
Divida os dados em conjuntos de treino e teste. Use 80% para treino e 20% para teste.
Pré-processamento (Scaling):
Como vimos na aula, a escala dos dados pode impactar o cálculo das distâncias, especialmente no KNN.
Use o StandardScaler do scikit-learn para normalizar as features. Importante: ajuste o scaler (.fit()) APENAS com os dados de treino e depois aplique a transformação (.transform()) tanto nos dados de treino quanto nos de teste.
Modelo 1: Regressão Linear
Crie e treine um modelo de LinearRegression com os dados de treino já normalizados.
Faça previsões para o conjunto de teste.
Calcule o MAE, MSE e RMSE para este modelo.
Modelo 2: KNN Regressor
Crie e treine um modelo KNeighborsRegressor. Comece com n_neighbors=7.
Use os mesmos dados de treino normalizados.
Faça previsões para o conjunto de teste.
Calcule o MAE, MSE e RMSE para o KNN.
Comparar e Concluir:
Imprima os resultados de ambos os modelos de forma organizada.
Em um comentário no código, responda: Qual modelo obteve o menor erro? O que o valor do RMSE (por exemplo) significa em termos práticos para o melhor modelo? (Lembre-se que o alvo está em centenas de milhares de dólares).
Entregável: Você deve entregar um Jupyter Notebook (.ipynb) contendo todo o código, as saídas de cada célula e suas análises escritas em células de Markdown. O notebook deve ser claro, bem organizado e contar a "história" da sua análise.
Qual modelo teve o melhor desempenho geral? Por que você acha que isso aconteceu?
Qual foi o impacto da otimização do hiperparâmetro k no modelo KNN?
Interpretando o RMSE do seu melhor modelo: o que esse valor significa em termos práticos? (Lembre-se que o valor alvo está em centenas de milhares de dólares). Se o RMSE foi, por exemplo, 0.65, qual é o erro médio em dólares?
Se você fosse apresentar uma solução para uma imobiliária, qual modelo você recomendaria e por quê? Quais seriam os próximos passos para melhorar ainda mais a previsão?
