NEW
Font size
WorksheetsДәріс 4
Total questions: 75
Worksheet time: 38mins
MapReduce парадигмасын кім әзірледі?
Google компаниясының зерттеушілері
Microsoft корпорациясы
IBM зертханасы
Facebook инженерлері
Oracle компаниясы
MapReduce парадигмасы алғаш қай жылы ұсынылды?
2004 жылы
2010 жылы
1998 жылы
2015 жылы
2000 жылы
MapReduce қандай негізгі екі кезеңнен тұрады?
Map (Карталау) және Reduce (Қысқарту)
Import және Export
Load және Save
Start және Finish
Copy және Paste
Map кезеңінде не орындалады?
Бастапқы деректер бөліктерге бөлініп, <кілт, мән> жұптары түзіледі
Барлық деректер сұрыпталады
Тек нәтиже дискке жазылады
Қысқарту операциялары жүреді
Репликация іске қосылады
Reduce кезеңінің негізгі мақсаты қандай?
Бірдей кілттер бойынша мәндерді жинақтау
Барлық деректерді дискіге жазу
Деректерді сұрыптау
Репликация жасау
Деректерді шифрлау
MapReduce архитектурасының негізгі компоненттері қандай?
JobTracker, TaskTracker және HDFS
Driver, Executor және Cluster Manager
Mapper, Compiler және Loader
Reader, Writer және Optimizer
Master, Worker және SQL Engine
JobTracker қызметі не істейді?
Тапсырмаларды жоспарлап, олардың орындалуын бақылайды
Файлдарды сақтау
Желі трафигін өлшеу
Деректерді шифрлау
Деректерді визуалдау
HDFS жүйесінің рөлі қандай?
Деректерді блоктарға бөліп, түйіндерге таратып сақтау
Деректерді шифрлау
SQL сұраныстарын орындау
Деректерді сығу
Репликацияны өшіру
MapReduce-тің басты артықшылықтарының бірі:
Масштабталу және ақауға төзімділік
Төмен өнімділік
Тек бір серверде жұмыс
Нақты уақыттағы өңдеу
Жаңағы тәуелділік
MapReduce жүйесінің басты шектеулерінің бірі:
Диске тәуелділігі жоғары
Репликация деңгейі төмен
Ақауға төзімділігі жоқ
Мәліметтерді жадта сақтау
Пайдаланушы интерфейсі күрделі
Неліктен MapReduce қайталанатын (iterative) есептер үшін тиімсіз?
A) Себебі әр фаза деректерді дискіге жазып, қайта оқиды
B) Себебі деректер тек жадында сақталады
C) Себебі бір ғана түйін қолданылады
D) Себебі желіге тәуелді
E) Себебі код көп жазады
MapReduce қандай өңдеу түріне негізделген?
Пакеттік (Batch) өңдеу
Ағындық (Streaming)
Реактивті (Reactive)
Интерактивті (Interactive)
Бұлттық (Cloud)
MapReduce жүйесінде кешігу (latency) неліктен жоғары?
Себебі әрбір тапсырма жаңа процесс ретінде іске қосылады
Себебі барлық деректер жадта сақталады
Себебі сервер саны аз
Себебі репликация өшірілген
Себебі желі баяу
MapReduce пен Apache Spark арасындағы негізгі айырмашылық неде?
Spark деректерді жадында (in-memory) өңдейді
MapReduce нақты уақытта жұмыс істейді
Spark тек SQL деректерімен жұмыс істейді
MapReduce жадта есептейді
Spark тек Hadoop-та қолданылады
MapReduce концепциясы неліктен маңызды болып қала береді?
Себебі ол Big Data жүйелерінің негізін қалайды
Себебі ол SQL жүйесін алмастырады
Себебі ол тек бір серверде жұмыс істейді
Себебі ол нақты уақытты өңдеуді қолданады
Себебі ол желі ақауларын болдырмайды
Apache Spark фреймворкі қай жылы және қай жерде әзірленді?
2009 жылы Калифорния университетінде (UC Berkeley)
2004 жылы Google-де
2015 жылы IBM-де
2012 жылы Microsoft-та
2018 жылы Amazon-та
Apache Spark не үшін жасалған?
MapReduce-тің шектеулерін жою және деректерді жылдамырақ өңдеу үшін
SQL серверін алмастыру үшін
Веб-қосымшалар жасау үшін
Машиналық аударма жүйесін құру үшін
Тек графикалық интерфейс үшін
Spark-тағы басты артықшылықтардың бірі қандай?
Деректерді жадында (in-memory) сақтап, тез өңдейді
Барлық деректерді тек дискіде сақтайды
Тек пакеттiк өңдеуді қолдайды
SQL сұраныстарын орындай алмайды
Бір түйінде ғана жұмыс істейді
Apache Spark архитектурасы қандай негізгі компоненттерден тұрады?
Driver, Cluster Manager және Executors
JobTracker, TaskTracker және NameNode
Loader, Mapper және Reducer
Client, Server және Database
FileManager, Scheduler және Optimizer
Spark-тағы Driver Program қандай қызмет атқарады?
Қолданбаның логикасын басқарып, тапсырмаларды бөледі
Барлық деректерді сақтау
Тек SQL сұраныстарын орындау
Серверді қайта іске қосу
Репликация жасау
RDD дегеніміз не?
Төзімді және таралған деректер жиынтығы
Репликацияланған деректер жүйесі
SQL сұраныс модулі
Графикалық визуализация құралы
Тек бір түйінде сақталатын кесте
RDD қандай негізгі қасиеттерге ие?
Таралған, ақауға төзімді және өзгермейтін
Тек SQL сұраныстарын орындайды
Серверді қайта іске қосады
Барлық деректерді дискіде сақтайды
Графикалық интерфейс ұсынады
DataFrame қандай құрылымға ұқсайды?
Реляциялық дерекқордағы кестеге
Бағандық NoSQL базаға
Мәтіндік құжатқа
JSON файлға
Excel парағына
Catalyst Optimizer не үшін қолданылады?
Есептеулерді ең тиімді орындауға мүмкіндік беру үшін
Репликация жасау үшін
Деректерді визуалдау үшін
Файлдарды сақтау үшін
Түйіндерді шифрлау үшін
Spark MapReduce-тен қалай ерекшеленеді?
Spark деректерді жадында өңдеп, жылдамырақ жұмыс істейді
Spark тек дискіде есептейді
Spark тек пакеттік өңдеуді қолдайды
MapReduce нақты уақыт режимінде жұмыс істейді
Spark тек SQL қолданады
Spark SQL қандай мақсатта қолданылады?
Құрылымдалған деректермен жұмыс істеу және SQL сұраныстарын орындау үшін
Тек машиналық оқыту үлгілерін құру үшін
Графтарды талдау үшін
Желі трафигін бақылау үшін
Деректерді визуалдау үшін
Spark SQL қандай негізгі компонентті пайдаланады сұраныстарды оңтайландыру үшін?
Catalyst Optimizer
Tensor Optimizer
SQL Engine
Spark Reducer
Data Combiner
Spark SQL қандай деректер көздерін қолдайды?
Hive, Parquet, JSON, RDBMS
Excel, Word, PDF
FTP, HTML, XML
Video, Audio, Image
Redis, Kafka, MQTT
Spark Streaming қандай мақсатта қолданылады?
Нақты уақыт режимінде деректер ағындарын өңдеу үшін
SQL сұраныстарын орындау үшін
Тек графтарды өңдеу үшін
Деректерді архивтеу үшін
Пайдаланушы интерфейсін жасау үшін
Spark Streaming деректерді қандай құрылым арқылы өңдейді?
D-Streams (Discretized Streams)
JSON Arrays
MapReduce Blocks
DataPipes
Binary Frames
Spark Streaming-тің басты ерекшелігі неде?
Деректерді микро-пакеттерге бөліп, нақты уақытқа жақын өңдеу
Барлық деректерді дискіде сақтау
Репликацияны өшіру
Тек пакеттік өңдеу
SQL сұраныстарын орындамау
MLlib кітапханасы не үшін қолданылады?
Масштабталатын машиналық оқыту алгоритмдерін орындау үшін
Деректерді сақтау үшін
Графтарды визуалдау үшін
SQL сұраныстарын орындау үшін
Деректерді шифрлау үшін
MLlib қандай алгоритм түрлерін қамтиды?
Регрессия, жіктеу, кластерлеу, өлшемділікті азайту
Тек SQL сұраныстары
Тек граф анализі
Визуализация және фильтрация
Репликация және кэштеу
GraphX қандай есептеулерге арналған?
Графтық-параллельді есептеулер мен байланыстарды талдау
SQL және JSON сұраныстар
Машиналық оқыту үлгілерін сақтау
Нейрондық желілерді үйрету
Мультимедиа файлдарын өңдеу
Apache Spark экожүйесінің басты артықшылығы неде?
Әртүрлі деректер түрлері мен өңдеу режимдерін бір платформада біріктіру
Тек пакеттiк өңдеудi қолдау
Тек SQL сұраныстарымен шектеу
Төмен масштабталу
Бір серверде ғана жұмыс істеу
Apache Kafka қандай мақсатта жасалған?
Нақты уақыт режимінде деректер ағындарын тасымалдау және жүйелер арасында хабар алмасуды қамтамасыз ету
Тек SQL сұраныстарын орындау үшін
Веб-қосымшалар жасау үшін
Деректерді визуалдау үшін
Бұлттық сақтау жүйесін құру үшін
Apache Kafka бастапқыда қай компанияда жасалды?
Microsoft
Amazon
Kafka архитектурасы қандай модельге негізделген?
Publish-Subscribe (жариялау-жазылу) моделі
Request-Response моделі
Client-Server моделі
Peer-to-Peer моделі
Master-Slave моделі
Kafka-ның басты артықшылығы неде?
Деректерді жоғалтпай реттелген түрде сақтау және жоғары өткізу қабілеті
Деректерді тек файл түрінде сақтау
Репликацияны өшіру
Тек оффлайн режимінде жұмыс істеу
Деректерді тек JSON форматында сақтау
Apache NiFi қандай мақсатта қолданылады?
Деректер ағындарын басқару, маршрутизация және түрлендіру үшін
SQL сұраныстарын орындау үшін
Тек хабар алмасуды ұйымдастыру үшін
Графикалық деректерді визуалдау үшін
Репликацияны басқару үшін
Apache NiFi жүйесіндегі негізгі элемент не болып табылады?
Процессор (Processor)
Коннектор
Брокер
Контроллер
Хранитель
ETL процесінің негізгі кезеңдері қандай?
Extract, Transform , Load
Extract, Load, Transfer
Evaluate, Transform, Learn
Encode, Test, Log
Execute, Track, Link
ELT процесі ETL-ден несімен ерекшеленеді?
Алдымен деректер қоймаға жүктеліп, кейін трансформация орындалады
Барлық өңдеу жергілікті серверде өтеді
Тек құрылымдалған деректермен жұмыс істейді
Мәліметтер алдымен түрлендіріліп, кейін жүктеледі
Репликацияны өшіреді
Apache Kafka қандай жағдайларда жиі қолданылады?
Мониторинг, ағымдық аналитика және микросервис интеграциясында
Веб-дизайн мен интерфейс жасауда
Графикалық есептеулерде
Мультимедиа файлдарын өңдеуде
Электрондық хат жіберуде
Apache NiFi мен Kafka-ны бірге қолдану не үшін тиімді?
Деректер интеграциясында сенімді және икемді шешімдер құру үшін
SQL сұраныстарын оңтайландыру үшін
Файлдық жүйелерді біріктіру үшін
Веб-қосымшаларды автоматтандыру үшін
Виртуалды машиналарды іске қосу үшін
Үлкен деректерді талдаудың негізгі мақсаты қандай?
Деректерді тек сақтау
Деректерді визуалдау
Деректерді жою
Деректерді көшіру
Болашақты болжауға және шешім қабылдауға көмектесетін заңдылықтарды анықтау
Spark MLlib дегеніміз не?
SQL сұраныстарын орындау құралы
Веб-қосымшалар платформасы
Графикалық интерфейс жүйесі
Файлдарды сақтау жүйесі
Spark-та масштабталатын машиналық оқыту алгоритмдеріне арналған кітапхана
Сипаттамалық аналитика қандай сұраққа жауап береді?
Неліктен болды?
Не болды?
Не болмады?
Не істеу керек?
Қалай болжауға болады?
Диагностикалық аналитиканың мақсаты қандай?
Болашақ оқиғаларды болжау
Автоматты шешім қабылдау
Деректерді сақтау
Графтарды талдау
Оқиғаның себебін анықтау және себеп-салдар байланысын табу
Болжамдық аналитика қандай әдіске негізделеді?
SQL сұраныстарына
Визуализацияға
Қолмен есептеуге
Репликацияға
Машиналық оқыту әдістеріне
Нұсқаулық аналитика (Prescriptive Analytics) не үшін қолданылады?
Өткен оқиғаларды жинақтау үшін
Тек деректерді сақтау үшін
Қателерді түзету үшін
Тек есеп беру үшін
Қандай әрекет жасау керектігін анықтау үшін
MLlib қандай негізгі концепцияны қолданады?
ML Pipelines
Neural Blocks
Data Bridges
JSON Tables
SQL Streams
Классификация (Classification) міндетінің мақсаты қандай?
Нысанды дискретті категориялардың біріне жатқызу
Үздіксіз мәнді болжау
Топтар құру
Өлшемділікті азайту
Деректерді сақтау
Регрессия (Regression) қандай мәнді болжауға бағытталған?
Үздіксіз сандық мәнді
Категориялық мәнді
Бинарлық нәтиже
Сапалық баға
Қарапайым индексі
Кластерлеу (Clustering) қандай типтегі оқытуға жатады?
Бақылаусыз оқыту (Unsupervised Learning)
Бақыланатын оқыту (Supervised Learning)
Күшейтілген оқыту (Reinforcement Learning)
Гибридті оқыту
Сызықтық оқыту
Деректерді визуализациялаудың негізгі мақсаты қандай?
Күрделі ақпаратты көрнекі түрде түсінікті етіп жеткізу
Деректерді сақтау
Деректерді шифрлау
Алгоритмдерді үйрету
Веб-сайт құрастыру
Визуализация принциптерінің бірі – Қарапайымдылық (Simplicity) нені білдіреді?
Артық элементтерді алып тастап, негізгі хабарламаға назар аудару
Барлық түстерді пайдалану
Мәліметтерді көбейту
Диаграммаларды қиындату
Графиктерге фон қосу
Деректер-Сия қатынасы (Data-Ink Ratio) принципінің мәні неде?
Көрсетілген элементтердің көбі деректерді көрсетуге арналуы тиіс
Барлық фон мен рамкаларды күшейту
Суретті көркем безендіру
Түстерді көбейту
Деректерді азайту
Tableau құралының басты артықшылығы неде?
Интуитивті интерфейс және тез дашбордтар жасау мүмкіндігі
Тек локалды қолдану
Тек мәтіндік деректермен жұмыс істеу
Күрделі код жазуды қажет ету
SQL сұраныстарын қолдамау
Power BI құралының ерекшелігі неде?
Microsoft экожүйесімен жақсы интеграцияланған және қолжетімді
Тек графикалық интерфейс жасау үшін
Ашық бастапқы кодты жүйе
Тек веб-қосымшалар үшін
SQL сұраныстарын орындамайды
Matplotlib кітапханасының негізгі рөлі қандай?
2D графиктер мен диаграммалар құруға арналған
Машиналық оқыту модельдерін үйрету
Деректерді сақтау
SQL базасын басқару
Веб-интерфейс жасау
Seaborn кітапханасы Matplotlib-тен несімен ерекшеленеді?
Күрделі статистикалық графиктерді аз кодпен құру мүмкіндігі
Тек кестелерді шығару үшін
SQL синтаксисін қолдануымен
Фондық суреттермен жұмыс істеу
Графиктерді тек 3D форматта салу
Plotly кітапханасының басты ерекшелігі неде?
Интерактивті және веб-негізделген визуализация жасау
Тек оффлайн есептер үшін
Деректерді тек CSV форматында сақтау
Динамикалық элементтерді қолданбау
SQL сұраныстарын орындау
Түс кодтауы (Color Coding) принципі не үшін қажет?
Түстерге ақпараттық мағына беру үшін
Визуалды безендіруді арттыру үшін
Эстетикалық әсер жасау үшін
Барлық элементтерді бір түспен бояу
Көрнекілікті азайту
Үлкен деректер визуализациясының басты нәтижесі қандай?
Аудиторияның деректер негізінде шешім қабылдауын жеңілдету
Тек есеп сақтау
Деректерді жою
Тек диаграмма құру
Алгоритмді баулату
Big Data үшін бұлттық платформаларды қолданудың басты артықшылығы неде?
Есептеу ресурстарын қажеттілікке қарай масштабтау және оңай басқару
Деректерді тек жергілікті серверлерде сақтау
Барлық жүйелерді қолмен конфигурациялау
Тек кіші көлемдегі деректермен жұмыс
Деректерді визуализациясыз өңдеу
Big Data саласындағы ең ірі үш бұлттық платформа қайсылар?
AWS, Azure, GCP
Oracle, IBM, SAP
Google Drive, Dropbox, OneDrive
Hadoop, Spark, Hive
Salesforce, Zoom, Slack
AWS платформасындағы Big Data қызметінің мысалы:
Amazon EMR
Azure HDInsight
BigQuery
Vertex AI
IBM Watson
Azure HDInsight қандай технологияларға негізделген?
Hadoop және Spark
SQL және MongoDB
TensorFlow және PyTorch
Kafka және NiFi
Docker және Kubernetes
GCP платформасындағы аналитикалық дерекқор қызметі:
BigQuery
S3
Redshift
HDInsight
Azure ML
Big Data қауіпсіздігін қамтамасыз етудегі негізгі принциптердің бірі:
Деректерді сақтау және тасымалдау кезінде шифрлау
Тек деректерді визуалдау
Деректерді қолмен көшіру
Деректерді ашық форматта сақтау
Деректерге еркін қолжетімділік
“Principle of Least Privilege” принципі нені білдіреді?
Әр пайдаланушыға тек қажетті ең аз рұқсат беру
Барлық пайдаланушыларға толық қолжетімділік беру
Деректерге тек әкімші ғана кіру
Деректерді тек шифрсыз сақтау
Кіру құпиясөзін өшіру
Анонимизацияның негізгі мақсаты:
Жеке тұлғаны сәйкестендіретін белгілерді жою
Деректерді көбейту
Деректерді визуалдау
Деректерді форматтау
Деректерді архивтеу
ML модельдеріндегі “Bias” ұғымы нені білдіреді?
Әлеуметтік немесе нәсілдік ауытқулардың шешімге әсер етуі
Модельдің жылдамдығының артуы
Мәліметтердің толық болмауы
Шешімдердің кездейсоқ болуы
Нәтижелердің қайталануы
Big Data саласындағы этикалық талаптардың бірі:
Модель шешімдерінің түсініктілігі мен транспаренттілігін қамтамасыз ету
Деректерді барынша құпия ұстау
Барлық деректерді автоматты түрде жою
Барлық алгоритмдерді ашық жариялау
Тек сандық деректермен жұмыс істеу
