NEW
Font size
S
M
L
XL
Worksheets1라운드
Total questions: 10
Worksheet time: 5mins
Name
Class
Date
1.
시퀀스 데이터(음성, 자연어 등)에서 현재 시점의 출력을 결정할 때 RNN이 반드시 고려하는 핵심 요소는 무엇인가?
a)
데이터의 잡음(Noise) 수준과 무작위성(Randomness)
b)
이전 시점까지의 데이터가 포함하는 문맥적 정보와 의존성
c)
입력 데이터의 절대적인 크기(Byte Size)와 메모리 사용량
d)
미래 시점의 데이터를 미리 예측하는 능력
2.
단순히 단어의 출현 빈도만 사용하는 BOW의 한계를 극복하기 위해, 특정 문서에만 자주 나타나고 다른 문서에는 드물게 나타나는 단어에 높은 가중치를 부여하는 방법은?
a)
Word2Vec
b)
TF-IDF (Term Frequency-Inverse Document Frequency)
c)
One-Hot Encoding
d)
N-gram
3.
한글 텍스트 데이터 전처리의 순서로 가장 적절한 것은?
a)
임베딩 → 토큰화 → 인코딩
b)
토큰화 → 임베딩 → 인코딩
c)
인코딩 → 토큰화 → 임베딩
d)
토큰화 → 인코딩 → 임베딩
4.
특정한 규칙을 가진 문자열의 집합을 표현하는 언어는?
a)
토큰
b)
말뭉치
c)
정규표현식
d)
모듈
5.
RNN이 주로 사용되는 분야는 무엇인가요?
a)
이미지 분류
b)
자연어 처리(NLP)
c)
데이터베이스 관리
d)
웹 페이지 디자인
6.
텍스트 마이닝 과정에서 TF-IDF(Term Frequency–Inverse Document Frequency) 기법을 사용하는 주요 목적은 무엇인가?
a)
1. 문서 내에서 자주 등장하는 단어를 무조건 높은 중요도로 판단하기 위해
b)
2. 모든 단어의 중요도를 동일하게 설정하기 위해
c)
3. 여러 문서에서 흔히 나타나는 단어의 중요도를 낮추고 특정 문서에서 상대적으로 중요한 단어를 강조하기 위해
d)
4. 텍스트 데이터의 감정(긍정/부정)을 자동으로 분류하기 위해
7.
다음 중 pickle의 기능을 설명한 것으로 가장 적절한 것은 무엇입니까?
a)
파이썬 객체를 바이트 스트림 형태로 직렬화하여 저장하거나 다시 로드할 수 있게 한다
b)
텍스트 데이터를 JSON 형식으로 자동 변환하는 도구이다
c)
텍스트 전처리 과정에서 불용어(stopword)를 제거하는 라이브러리다
d)
딥러닝 모델의 Weight를 저장할 수 있으나 DataFrame은 저장할 수 없다
8.
TF-IDF에 대한 설명으로 가장 적절한 것을 고르시오.
a)
TF가 높고, DF가 낮은 단어가 중요하다.
b)
TF는 Corpus 전체에서 특정 단어가 등장한 문서 수를 나타낸다.
c)
DF는 Corpus 전체에 자주 등장하는 단어일수록 가중치가 커지도록 만든다.
d)
Tf-idf에서 로그를 쓰는 이유는, 한 번만 등장한 단어의 가중치를 0으로 만들기 위함이다.
9.
딥러닝 모델의 입력 '임베딩' 벡터에 대한 설명으로 틀린 것은?
a)
1. 단어의 의미적 유사성을 벡터공간의 거리로 표현한다.
b)
2. 케라스 임베딩 레이어는 '원-핫 인코딩된 벡터를 입력으로 받아 임베딩 벡터로 변환하는 역할을 수행한다.
c)
Word2Vec 같은 사전학습된 임베딩은 전이학습에 유용하다.
d)
4. 학습 과정에서 역전파를 통해 최적화한다.
10.
한국어 텍스트 데이터를 딥러닝 모델에 학습시키기 위한 전처리 과정을 올바른 순서로 나열한 것은?
a)
인코딩 → 토큰화 → 임베딩
b)
토큰화 → 인코딩 → 임베딩
c)
임베딩 → 토큰화 → 인코딩
d)
토큰화 → 임베딩 → 인코딩
Reset
