wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Avaliando Modelos de Regressão

Total questions: 11

Worksheet time: 2hrs 40mins

Name
Class
Date
1.

Qual é o principal objetivo de um problema de regressão no aprendizado de máquina?

a)

Classificar dados em categorias distintas.

b)

Prever uma variável numérica contínua.

c)

Reduzir a dimensionalidade de um conjunto de dados.

d)

Agrupar dados semelhantes em clusters.

2.

No algoritmo KNN para regressão, como o valor de uma nova instância é previsto?

a)

Pela classe mais frequente entre os vizinhos mais próximos.

b)

Pela média dos valores dos vizinhos mais próximos.

c)

Calculando a distância euclidiana para o centróide do cluster.

d)

Atribuindo um valor aleatório baseado na distribuição dos dados.

3.

O que um resíduo positivo indica em um modelo de regressão?

a)

O modelo previu o valor com exatidão.

b)

O modelo superestimou o valor real.

c)

O modelo não conseguiu fazer uma previsão.

d)

O modelo subestimou o valor real.

4.

Qual das seguintes métricas de avaliação penaliza mais os erros grandes?

a)

Erro Médio Quadrático (MSE)

b)

Acurácia

c)

Erro Percentual Médio Absoluto (MAPE)

d)

Erro Médio Absoluto (MAE)

5.

Qual é a principal vantagem de usar a Raiz do Erro Médio Quadrático (RMSE) em vez do MSE?

a)

O RMSE sempre fornece um valor de erro menor.

b)

O RMSE é mais fácil de calcular.

c)

O RMSE é menos sensível a outliers.

d)

O RMSE está na mesma unidade que a variável de destino.

6.

Em uma regressão linear simples com a fórmula y=β0​+β1​x, o que o coeficiente β1​ representa?

a)

O valor de y quando x é igual a zero.

b)

A correlação entre x e y.

c)

A mudança média em y para um aumento de uma unidade em x.

d)

O erro total do modelo de regressão.

7.

O que significa se um modelo de regressão está 'super ajustado' (overfitting)?

a)

O modelo não tem erro.

b)

O modelo é muito simples e não captura a tendência dos dados.

c)

O modelo tem um erro muito alto tanto nos dados de treinamento quanto nos de teste.

d)

O modelo aprendeu o padrão dos dados de treinamento muito bem, incluindo o ruído, e tem dificuldade em generalizar para novos dados.

8.

Qual das seguintes afirmações sobre o Erro Médio Absoluto (MAE) é VERDADEIRA?

a)

É mais sensível a outliers do que o MSE.

b)

É expresso como uma porcentagem.

c)

Ele mede a média dos erros absolutos entre as previsões e os valores reais.

d)

Seu valor é sempre maior que o do RMSE.

9.

Por que a normalização dos dados é importante ao usar o KNN para regressão?

a)

Para acelerar o treinamento do modelo LinearRegression.

b)

Para converter o problema de regressão em um problema de classificação.

c)

Não é importante para o KNN.

d)

Para garantir que todas as características tenham a mesma influência no cálculo da distância.

10.

Qual é a principal diferença entre regressão linear e regressão logística?

a)

A regressão linear é usada para classificação e a regressão logística para prever valores numéricos.

b)

Não há diferença; os termos são intercambiáveis.

c)

A regressão linear sempre se ajusta a uma linha reta, enquanto a regressão logística se ajusta a uma curva polinomial.

d)

A regressão linear modela uma variável de saída contínua, enquanto a regressão logística modela uma variável de saída categórica.

11-14.

Contexto: Vamos trabalhar com o dataset "California Housing" (https://scikit-learn.org/stable/modules/generated/sklearn.datasets.fetch_california_housing.html), um conjunto de dados clássico para tarefas de regressão. O nosso objetivo é prever o valor mediano de uma casa (MedHouseVal) em um distrito da Califórnia, com base em características como a renda média dos moradores, a idade da casa, o número médio de quartos, etc.

Tarefa:

Seu desafio é seguir os passos abaixo para construir e comparar os dois modelos.

  1. Seu desafio é seguir os passos abaixo para construir e comparar os dois modelos.

    1. Carregar e Preparar os Dados:

      • Carregue o dataset fetch_california_housing do sklearn.datasets (https://scikit-learn.org/stable/modules/generated/sklearn.datasets.fetch_california_housing.html).

      • Divida os dados em conjuntos de treino e teste. Use 80% para treino e 20% para teste.

    2. Pré-processamento (Scaling):

      1. Como vimos na aula, a escala dos dados pode impactar o cálculo das distâncias, especialmente no KNN.

      2. Use o StandardScaler do scikit-learn para normalizar as features. Importante: ajuste o scaler (.fit()) APENAS com os dados de treino e depois aplique a transformação (.transform()) tanto nos dados de treino quanto nos de teste.

    3. Modelo 1: Regressão Linear

      1. Crie e treine um modelo de LinearRegression com os dados de treino já normalizados.

      2. Faça previsões para o conjunto de teste.

      3. Calcule o MAE, MSE e RMSE para este modelo.

    4. Modelo 2: KNN Regressor

      1. Crie e treine um modelo KNeighborsRegressor. Comece com n_neighbors=7.

      2. Use os mesmos dados de treino normalizados.

      3. Faça previsões para o conjunto de teste.

      4. Calcule o MAE, MSE e RMSE para o KNN.

    5. Comparar e Concluir:

      1. Imprima os resultados de ambos os modelos de forma organizada.

      2. Em um comentário no código, responda: Qual modelo obteve o menor erro? O que o valor do RMSE (por exemplo) significa em termos práticos para o melhor modelo? (Lembre-se que o alvo está em centenas de milhares de dólares).

    6. Entregável: Você deve entregar um Jupyter Notebook (.ipynb) contendo todo o código, as saídas de cada célula e suas análises escritas em células de Markdown. O notebook deve ser claro, bem organizado e contar a "história" da sua análise.

11.

Qual modelo teve o melhor desempenho geral? Por que você acha que isso aconteceu?

4 lines
12.

Qual foi o impacto da otimização do hiperparâmetro k no modelo KNN?

4 lines
13.

Interpretando o RMSE do seu melhor modelo: o que esse valor significa em termos práticos? (Lembre-se que o valor alvo está em centenas de milhares de dólares). Se o RMSE foi, por exemplo, 0.65, qual é o erro médio em dólares?

4 lines
14.

Se você fosse apresentar uma solução para uma imobiliária, qual modelo você recomendaria e por quê? Quais seriam os próximos passos para melhorar ainda mais a previsão?

4 lines