wayground logo

Free Printable Worksheets

Font size

S
M
L
XL
Worksheets

Feature Engineering

Total questions: 32

Worksheet time: 9mins

Name
Class
Date
1.

Aykırı Değer nedir?

a)

Veri setindeki en büyük veya en küçük değer.

b)

Veri setindeki tipik bir örnekten önemli ölçüde farklı olan değer.

c)

Veri setindeki en sık rastlanan değer.

2.

Eksik Veri Problemini Çözmek İçin Hangi Yöntem Kullanılabilir?

a)

Ortalama ile doldurma.

b)

Tüm sütunu silme.

c)

Rastgele değer atama.

3.

Aykırı Değerlerin Analize Etkisi Nedir?

a)

Analizin doğruluğunu artırır.

b)

Analizin sonuçlarını önemli ölçüde etkileyebilir.

c)

Analiz üzerinde hiçbir etkisi yoktur.

4.

Aykırı Değerleri Tespit Etmek İçin Hangi Yöntem Sıklıkla Kullanılır?

a)

Ortalama ve Standart Sapma

b)

Mod ve Medyan

c)

Z-Skoru

5.

Eksik Veriler İçin Kullanılan "Veri İmputasyonu" Ne Anlama Gelir?

a)

Veri setinden eksik verileri silmek.

b)

Eksik verileri rastgele değerlerle doldurmak.

c)

Eksik verileri tahmin ederek doldurmak.

6.

Hangisi, Aykırı Değerlerin Analizden Kaldırılmasının Potansiyel Dezavantajlarından Biri Değildir?

a)

Veri setinin gerçekçiliğinin azalması.

b)

Veri setinin boyutunun küçülmesi.

c)

Veri setinin daha homojen hale gelmesi.

7.

Bir veri setindeki aykırı değerleri belirlemek için kullanılan kutu grafiği (box plot), hangi ölçütleri esas alır?

a)

Ortalama ve medyan

b)

Maksimum, minimum, medyan, birinci ve üçüncü çeyrekler

c)

Standart sapma ve varyans

8.

"KNN İmputasyon" yöntemi, eksik verileri doldurmak için neye dayanır?

a)

Veri setindeki benzer örneklerin ortalaması

b)

Tüm veri setinin genel ortalaması

c)

Eksik verilerin sabit bir değerle değiştirilmesi

9.

IQR yöntemiyle aykırı değer tespiti yapılırken kullanılan formül nedir?

a)

IQR = 1. Çeyrek - 3. Çeyrek

b)

Üst sınır = 3. Çeyrek + (1.5 IQR),

Alt sınır = 1. Çeyrek - (1.5 IQR)

c)

Üst sınır = Ortalama + (2 Standart Sapma), Alt sınır = Ortalama - (2 Standart Sapma)

10.

Hangi ölçeklendirme yöntemi, verilerin ortalamasını 0 ve standart sapmasını 1 yapmak için kullanılır?

a)

Min-Max Scaling

b)

Standard Scaling

c)

Robust Scaling

11.

Kategorik değişkenleri sayısal verilere dönüştürmek için kullanılan "One-Hot Encoding" yöntemi ne sağlar?

a)

Kategorileri sıralı bir şekilde sayısal değerlere dönüştürür.

b)

Her kategori için bir sütun oluşturur ve ilgili sütunu 1, diğerlerini 0 yapar.

c)

Tüm kategorileri tek bir sayısal değere dönüştürür.

12.

"Robust Scaling" yöntemi, hangi durumlarda özellikle tercih edilir?

a)

Veri seti küçük olduğunda

b)

Veri setinde aykırı değerler çok olduğunda

c)

Veri seti büyük ve çeşitli olduğunda

13.

"Min-Max Scaling" yöntemi verileri hangi aralığa dönüştürür?

a)

0 ile 10 arasında

b)

0 ile 1 arasında

c)

-1 ile 1 arasında

14.

"Label Encoding" yöntemi ne tür bir dönüşüm yapar?

a)

Her bir kategoriyi benzersiz bir tam sayı ile etiketler.

b)

Kategorik verileri ikili formata dönüştürür.

c)

Kategorik verileri frekanslarına göre sıralar.

15.

Hangi ölçeklendirme yöntemi, aykırı değerlerden etkilenmeden verileri dönüştürür?

a)

Standard Scaling

b)

Min-Max Scaling

c)

Robust Scaling

16.

"Ordinal Encoding" ne zaman kullanılır?

a)

Kategorik verilerin sıralı bir ilişkisi olduğunda

b)

Kategorik verilerin sıralı bir ilişkisi olmadığında

c)

Kategorik verileri tamamen rastgele sayısal değerlere dönüştürmek için

17.

Feature Extraction (Özellik Çıkarımı) işlemi neyi amaçlar?

a)

Veri setindeki hatalı verileri düzeltmek.

b)

Veri setindeki özellik sayısını azaltarak, daha yönetilebilir ve etkili hale getirmek.

c)

Tüm özellikleri birebir koruyarak veri setini büyütmek.

18.

Feature Interactions (Özellik Etkileşimleri) analizinde ne tespit edilmeye çalışılır?

a)

Tekil özelliklerin veri seti üzerindeki bağımsız etkisi.

b)

Farklı özelliklerin birbirleriyle nasıl etkileşime girdiği ve sonuçları nasıl etkilediği.

c)

Veri setindeki eksik veya hatalı özellikler.

19.

Outlier Analizi İçin Kullanılan DBSCAN Algoritmasının Temel Özelliği Nedir?

a)

Yoğunluk tabanlı uzamsal kümeleme yaparak aykırı değerleri tanımlar.

b)

Ortalama ve varyans kullanarak aykırı değerleri belirler.

c)

Z-skoru hesaplayarak aykırı değerleri tespit eder.

20.

Principal Component Analysis (PCA) hangi durumda kullanışlı bir özellik çıkarımı yöntemidir?

a)

Kategorik veriler için etkileşimleri analiz etmek.

b)

Sayısal verilerde boyut azaltma ve özellik çıkarımı yapmak.

c)

Veri setindeki eksik verileri doldurmak.

21.

Z-score yöntemi hangi dağılım varsayımına dayanır?

a)

Normal (Gaussian) dağılım

b)

Üstel dağılım

c)

Poisson dağılımı

d)

Log-normal dağılım

22.

“Winsorization” işleminin temel amacı nedir?

a)

Aykırı değerleri tamamen kaldırmak yerine sınırlamak

b)

Modelin uç değerlerden etkilenmesini sağlamak

c)

Kategorik değişkenleri sayısallaştırmak

d)

Eksik değerleri ortalama ile doldurmak

23.

Outlier’ları kaldırmak yerine (a)   kullanmak, veriyi korurken aykırı değerlerin etkisini azaltır.

24.

Aşağıdakilerden hangileri outlier tespitinde kullanılabilir?

a)

Z-score

b)

IQR

c)

Boxplot

d)

One-hot encoding

25.

Eksik veri oranı %30’dan az ve eksiklik rastgele (MCAR) ise, genellikle (a)   işlemi tercih edilir.

26.

Tüm veri üzerinde scaling yapıp sonra train/test split etmek hangi soruna yol açar?

a)

Overfitting

b)

Underfitting

c)

Data Leakage

d)

Class Imbalance

27.

One-Hot Encoding'de drop_first=True parametresinin amacı nedir?

a)

İlk kategoriyi silmek

b)

Multicollinearity'yi azaltmak

c)

Bellek tasarrufu

d)

Eksik verileri atlamak

28.

Hangi durumda Target Encoding, One-Hot Encoding'den tercih edilir?

a)

Sıralı kategorilerde

b)

Binary sütunlarda

c)

Yüksek kardinaliteli (çok unique) kategoriklerde

d)

Eksik veri varsa

29.

Şu veri setine baksın:

  • age sütunu: 2000 satırdan 80 tanesinde NaN (%4 eksik)

  • income sütunu: 150 satırda NaN (%7.5 eksik)

  • education sütunu: 30 satırda NaN (%1.5 eksik)

Hangi doldurmayı tercih edersin?

a)

Tüm sütunları SimpleImputer(strategy='mean') ile doldur — hızlı ve basit

b)

age ve income için medyan,

education için mod + eksiklik flag'leri ekle

c)

KNN Imputer kullan tüm sütunlar için

d)

%5'den fazla eksiklik olan sütunları sil

30.

Bir e-ticaret veri setinde:

  • product_category: 8 kategori

  • customer_city: 150 şehir

  • payment_method: 5 yöntem

Her sütun için en uygun encoding hangisi?

a)

Hepsine One-Hot Encoding

b)

product_category → One-Hot,

customer_city → Target Encoding,

payment_method → One-Hot

c)

Hepsine Target Encoding

d)

product_category → Label Encoding,

customer_city → One-Hot,

payment_method → Ordinal

31.

Veri seti özellikleri:

  • age: 18-80, normal dağılım

  • salary: 20K-500K, sağa çarpık

  • credit_score: 300-850, aykırı değerler

  • transaction_count: 0-5000, ekstrem değerler

En uygun scaler tercihi hangisi?

a)

Tüm sütunlar için StandardScaler

b)

age → StandardScaler,

diğerleri → RobustScaler

c)

Tüm sütunlar için RobustScaler

d)

salary ve transaction_count → Log dönüşümü,

diğerleri → StandardScaler

32.

df['education'] = ['Lise', 'Üniversite', 'Yüksek Lisans', 'Doktora'] # Hedef: salary tahmin (Linear Regression)

Hangisini tercih edersin?

a)

One-Hot Encoding

b)

Ordinal Encoding (1,2,3,4)

c)

Label Encoding (0,1,2,3)

d)

Target Encoding