Font size
WorksheetsFeature Engineering
Total questions: 32
Worksheet time: 9mins
Aykırı Değer nedir?
Veri setindeki en büyük veya en küçük değer.
Veri setindeki tipik bir örnekten önemli ölçüde farklı olan değer.
Veri setindeki en sık rastlanan değer.
Eksik Veri Problemini Çözmek İçin Hangi Yöntem Kullanılabilir?
Ortalama ile doldurma.
Tüm sütunu silme.
Rastgele değer atama.
Aykırı Değerlerin Analize Etkisi Nedir?
Analizin doğruluğunu artırır.
Analizin sonuçlarını önemli ölçüde etkileyebilir.
Analiz üzerinde hiçbir etkisi yoktur.
Aykırı Değerleri Tespit Etmek İçin Hangi Yöntem Sıklıkla Kullanılır?
Ortalama ve Standart Sapma
Mod ve Medyan
Z-Skoru
Eksik Veriler İçin Kullanılan "Veri İmputasyonu" Ne Anlama Gelir?
Veri setinden eksik verileri silmek.
Eksik verileri rastgele değerlerle doldurmak.
Eksik verileri tahmin ederek doldurmak.
Hangisi, Aykırı Değerlerin Analizden Kaldırılmasının Potansiyel Dezavantajlarından Biri Değildir?
Veri setinin gerçekçiliğinin azalması.
Veri setinin boyutunun küçülmesi.
Veri setinin daha homojen hale gelmesi.
Bir veri setindeki aykırı değerleri belirlemek için kullanılan kutu grafiği (box plot), hangi ölçütleri esas alır?
Ortalama ve medyan
Maksimum, minimum, medyan, birinci ve üçüncü çeyrekler
Standart sapma ve varyans
"KNN İmputasyon" yöntemi, eksik verileri doldurmak için neye dayanır?
Veri setindeki benzer örneklerin ortalaması
Tüm veri setinin genel ortalaması
Eksik verilerin sabit bir değerle değiştirilmesi
IQR yöntemiyle aykırı değer tespiti yapılırken kullanılan formül nedir?
IQR = 1. Çeyrek - 3. Çeyrek
Üst sınır = 3. Çeyrek + (1.5 IQR),
Alt sınır = 1. Çeyrek - (1.5 IQR)
Üst sınır = Ortalama + (2 Standart Sapma), Alt sınır = Ortalama - (2 Standart Sapma)
Hangi ölçeklendirme yöntemi, verilerin ortalamasını 0 ve standart sapmasını 1 yapmak için kullanılır?
Min-Max Scaling
Standard Scaling
Robust Scaling
Kategorik değişkenleri sayısal verilere dönüştürmek için kullanılan "One-Hot Encoding" yöntemi ne sağlar?
Kategorileri sıralı bir şekilde sayısal değerlere dönüştürür.
Her kategori için bir sütun oluşturur ve ilgili sütunu 1, diğerlerini 0 yapar.
Tüm kategorileri tek bir sayısal değere dönüştürür.
"Robust Scaling" yöntemi, hangi durumlarda özellikle tercih edilir?
Veri seti küçük olduğunda
Veri setinde aykırı değerler çok olduğunda
Veri seti büyük ve çeşitli olduğunda
"Min-Max Scaling" yöntemi verileri hangi aralığa dönüştürür?
0 ile 10 arasında
0 ile 1 arasında
-1 ile 1 arasında
"Label Encoding" yöntemi ne tür bir dönüşüm yapar?
Her bir kategoriyi benzersiz bir tam sayı ile etiketler.
Kategorik verileri ikili formata dönüştürür.
Kategorik verileri frekanslarına göre sıralar.
Hangi ölçeklendirme yöntemi, aykırı değerlerden etkilenmeden verileri dönüştürür?
Standard Scaling
Min-Max Scaling
Robust Scaling
"Ordinal Encoding" ne zaman kullanılır?
Kategorik verilerin sıralı bir ilişkisi olduğunda
Kategorik verilerin sıralı bir ilişkisi olmadığında
Kategorik verileri tamamen rastgele sayısal değerlere dönüştürmek için
Feature Extraction (Özellik Çıkarımı) işlemi neyi amaçlar?
Veri setindeki hatalı verileri düzeltmek.
Veri setindeki özellik sayısını azaltarak, daha yönetilebilir ve etkili hale getirmek.
Tüm özellikleri birebir koruyarak veri setini büyütmek.
Feature Interactions (Özellik Etkileşimleri) analizinde ne tespit edilmeye çalışılır?
Tekil özelliklerin veri seti üzerindeki bağımsız etkisi.
Farklı özelliklerin birbirleriyle nasıl etkileşime girdiği ve sonuçları nasıl etkilediği.
Veri setindeki eksik veya hatalı özellikler.
Outlier Analizi İçin Kullanılan DBSCAN Algoritmasının Temel Özelliği Nedir?
Yoğunluk tabanlı uzamsal kümeleme yaparak aykırı değerleri tanımlar.
Ortalama ve varyans kullanarak aykırı değerleri belirler.
Z-skoru hesaplayarak aykırı değerleri tespit eder.
Principal Component Analysis (PCA) hangi durumda kullanışlı bir özellik çıkarımı yöntemidir?
Kategorik veriler için etkileşimleri analiz etmek.
Sayısal verilerde boyut azaltma ve özellik çıkarımı yapmak.
Veri setindeki eksik verileri doldurmak.
Z-score yöntemi hangi dağılım varsayımına dayanır?
Normal (Gaussian) dağılım
Üstel dağılım
Poisson dağılımı
Log-normal dağılım
“Winsorization” işleminin temel amacı nedir?
Aykırı değerleri tamamen kaldırmak yerine sınırlamak
Modelin uç değerlerden etkilenmesini sağlamak
Kategorik değişkenleri sayısallaştırmak
Eksik değerleri ortalama ile doldurmak
Outlier’ları kaldırmak yerine (a) kullanmak, veriyi korurken aykırı değerlerin etkisini azaltır.
Aşağıdakilerden hangileri outlier tespitinde kullanılabilir?
Z-score
IQR
Boxplot
One-hot encoding
Eksik veri oranı %30’dan az ve eksiklik rastgele (MCAR) ise, genellikle (a) işlemi tercih edilir.
Tüm veri üzerinde scaling yapıp sonra train/test split etmek hangi soruna yol açar?
Overfitting
Underfitting
Data Leakage
Class Imbalance
One-Hot Encoding'de drop_first=True parametresinin amacı nedir?
İlk kategoriyi silmek
Multicollinearity'yi azaltmak
Bellek tasarrufu
Eksik verileri atlamak
Hangi durumda Target Encoding, One-Hot Encoding'den tercih edilir?
Sıralı kategorilerde
Binary sütunlarda
Yüksek kardinaliteli (çok unique) kategoriklerde
Eksik veri varsa
Şu veri setine baksın:
age sütunu: 2000 satırdan 80 tanesinde NaN (%4 eksik)
income sütunu: 150 satırda NaN (%7.5 eksik)
education sütunu: 30 satırda NaN (%1.5 eksik)
Hangi doldurmayı tercih edersin?
Tüm sütunları SimpleImputer(strategy='mean') ile doldur — hızlı ve basit
age ve income için medyan,
education için mod + eksiklik flag'leri ekle
KNN Imputer kullan tüm sütunlar için
%5'den fazla eksiklik olan sütunları sil
Bir e-ticaret veri setinde:
product_category: 8 kategori
customer_city: 150 şehir
payment_method: 5 yöntem
Her sütun için en uygun encoding hangisi?
Hepsine One-Hot Encoding
product_category → One-Hot,
customer_city → Target Encoding,
payment_method → One-Hot
Hepsine Target Encoding
product_category → Label Encoding,
customer_city → One-Hot,
payment_method → Ordinal
Veri seti özellikleri:
age: 18-80, normal dağılım
salary: 20K-500K, sağa çarpık
credit_score: 300-850, aykırı değerler
transaction_count: 0-5000, ekstrem değerler
En uygun scaler tercihi hangisi?
Tüm sütunlar için StandardScaler
age → StandardScaler,
diğerleri → RobustScaler
Tüm sütunlar için RobustScaler
salary ve transaction_count → Log dönüşümü,
diğerleri → StandardScaler
df['education'] = ['Lise', 'Üniversite', 'Yüksek Lisans', 'Doktora'] # Hedef: salary tahmin (Linear Regression)
Hangisini tercih edersin?
One-Hot Encoding
Ordinal Encoding (1,2,3,4)
Label Encoding (0,1,2,3)
Target Encoding
