Worksheets機器學習與大數據分析技術
Total questions: 36
Worksheet time: 3hrs 0mins
機器學習與 AI、深度學習的關係為何?
深度學習是 AI 的一種,機器學習則不屬於 AI
機器學習包含 AI 與深度學習
AI 包含機器學習,機器學習又包含深度學習
AI 是機器學習的子集
若企業希望從財務報表與銷售數據中擷取商業洞察,應使用下列哪種技術?
深度學習(DL)
感測器資料分析
強化學習(RL)
機器學習(ML)
哪一個 Python 套件最適合用來處理結構化表格數據?
NumPy
Matplotlib
Pandas
scikit-learn
在 Pandas 中處理表格資料時,常使用哪種資料結構?
List
DataFrame
Array
Dictionary
下列哪一項屬於 scikit-learn 的功能?
網頁爬蟲
互動式圖表
多媒體處理
分類與迴歸演算法
若要查看 DataFrame 前五筆資料,應使用哪個 Pandas 函數?
Pandas 中哪個方法可以用來填補缺失值?
df.fillna()
df.remove_na()
df.drop_null()
df.complete()
在 Pandas 中使用哪個方法可以根據欄位值進行彙總?
下列程式碼會產生什麼樣的輸出?
np.random.seed(42)
print(np.random.rand(2))
每次執行都會有不同的結果
[0.37454012 0.95071431]
產生整數
程式會出錯
以下哪一行程式會正確印出 “Name” 欄的資料?
df = pd.DataFrame({'Name': ['Amy', 'Ben', 'Carl'], 'Age': [22, 35, 27]})
下列哪個方法可以用 0 取代 DataFrame 中的 NaN 值?
df.fillna(0)
df.replace(0)
df.dropna()
df.fillmissing(0)
對下列資料使用 df.groupby('Category').sum(),會對哪一欄進行加總?
data = {'Category': ['A', 'B', 'A', 'B'], 'Value': [100, 200, 150, 250]}
df = pd.DataFrame(data)
Category
Value
Index
無欄位被加總
要選取欄位 'Name',哪個語法正確?
df['Name']
df.loc[:, 'Name']
df.iloc[:, 0](若 'Name' 是第 0 欄)
以上皆可
df.iloc[1:4, 1] 會取出什麼?
第 1、2、3 列的第 1 欄
第 1 到第 4 列的第 1 欄
第 1 列到第 4 列的所有欄位
第 1 到 4 欄的第 1 列
在 EDA 中,以下哪一種圖表最適合用來檢查數值型資料的異常值?
長條圖(Bar Chart)
散點圖(Scatter Plot)
箱型圖(Box Plot)
折線圖(Line Chart)
使用以下哪個函數可以將類別型欄位轉換為 One-Hot Encoding?
LabelEncoder()
pd.get_dummies()
MinMaxScaler()
StandardScaler()
特徵交互(Feature Interaction)的目的為何?
將類別欄位轉成數值欄位
合併不同特徵以創造新特徵,增強模型能力
將資料轉換為常態分布
減少資料筆數以避免過擬合
在進行資料標準化時,以下哪個類別最常用於將資料轉換為平均值為 0、標準差為 1?
MinMaxScaler()
Normalizer()
Binarizer()
StandardScaler()
下列哪一項最符合監督式學習(Supervised Learning)的特徵?
模型使用帶有標籤的資料來學習輸入與輸出間的關係
模型透過與環境互動學習最佳策略
模型不需要標籤,自動學習資料結構
模型結合標籤資料與未標籤資料進行訓練
下列哪一個是回歸模型中常見的誤差評估指標?
Accuracy
Precision
Mean Squared Error (MSE)
F1 Score
在 Python 的線性回歸模型中,要取得模型的斜率(係數),應使用哪個屬性?
model.slope_
model.coef_
model.beta_
model.gradient_
若模型預測結果的 R2 值等於 1,這代表什麼?
模型與資料毫無關聯
模型效果不如隨機猜測
模型能完美解釋所有變異
模型出現過擬合
若使用 train_test_split(X, y, test_size=0.2),代表資料集的哪一部分用於測試集?
20%
80%
50%
42%
執行 model.predict(X_test) 的目的是?
建立模型
評估準確率
儲存模型
產出對新資料的預測結果
關於邏輯回歸(Logistic Regression)的敘述,下列何者正確?
是用來解決回歸問題的演算法
輸出值是一個離散的整數
是用來解決二元分類問題的演算法
一定需要標準化後才能使用
邏輯回歸中,以下哪一個函數負責將對數勝算(log-odds)轉換為機率?
ReLU
tanh
Sigmoid
Softmax
當我們希望模型不要漏掉任何正類樣本時,應提升哪一個指標?
Accuracy
Precision
Recall
F1 Score
當特徵分裂後的加權 Entropy 越小,代表?
該特徵無意義
分裂後的純度越高,資訊增益越大
分裂後的混亂越大
模型容易過擬合
決策樹演算法在選擇分裂點時,常用的純度衡量指標為何?
MSE
RMSE
ROC 曲線
基尼不純度(Gini Impurity)
在 DecisionTreeClassifier 中,哪個參數可以設定樹的最大深度?
depth_limit
max_level
tree_depth
max_depth
在分類模型中,ROC 曲線的 X 軸與 Y 軸分別為?
Recall / Accuracy
Precision / Recall
False Positive Rate / True Positive Rate
True Negative Rate / Precision
在分類任務中,隨機森林如何決定最終預測結果?
計算平均機率
使用最大機率法則
多數決(Majority Voting)
使用最小特徵數原則
若要取得分類模型的混淆矩陣,應使用哪一個函式?
confusion_matrix()
classification_matrix()
matrix_score()
confusion_score()
若在 K-means 中群中心仍持續變動,演算法會怎麼做?
停止訓練
回傳初始值
重複分群與更新中心直到收斂
重新指定群數 K
輪廓係數(Silhouette Score)越接近哪個數值表示分群品質越好?
-1
0
0.5
1
下列哪一個分群演算法能自動處理離群值(outliers)?
KMeans
Agglomerative Clustering
DBSCAN
Mini Batch KMeans
