Font size
Worksheets1.python sessia
Total questions: 301
Worksheet time: 3hrs 31mins
Какая библиотека в Python используется в первую очередь для работы с табличными данными (DataFrame)?
Pandas
NumPy
Matplotlib
Scikit-learn
Какую структуру данных в Pandas представляет столбец DataFrame?
Series
NumPy Array
Dictionary
List
Что означает аббревиатура NaN в контексте Pandas и числовых данных?
Not a Number
Not an Array
New and Notable
Numerical Axis Name
При создании DataFrame из словаря Python, что представляют собой ключи словаря?
Названия колонок
Метки индекса (строк)
Типы данных столбцов
Значения в первой строке
Какой атрибут используется для получения размера DataFrame в формате (количество_строк, количество_столбцов)?
df.shape
df.size
df.ndim
df.axes
Какая функция Python используется для получения количества строк в DataFrame?
len(df)
df.count()
df.rows()
df.shape[0]
Каким методом можно посмотреть типы данных всех столбцов DataFrame?
Какой синтаксис является некорректным для выбора столбца с именем 'math score' (содержащего пробел)?
df_exams.math score
df_exams['math score']
df_exams[['math score']]
Все варианты корректны.
Что возвращает операция df_exams['gender'] при выборе одного столбца?
Series
DataFrame
Python List
NumPy Array
Какой синтаксис необходимо использовать для выбора двух или более столбцов в DataFrame?
df[['col1', 'col2']]
df[['col1' 'col2']]
df('col1', 'col2')
df['col1', 'col2']
Какой метод используется для просмотра последних $N$ строк DataFrame, например, последних 10 строк?
Какой метод DataFrame используется для получения основных описательных статистик (count, mean, std, min, max, 25%, 50%, 75%) для числовых столбцов?
Что представляет собой значение 50% в выводе метода .describe()?
Медиана (Median)
Среднее арифметическое (Mean)
Стандартное отклонение (Standard Deviation)
Минимум (Min)
Какая операция используется для расчета среднего балла по трем столбцам (math score, reading score, writing score) для каждой строки?
(df['math score'] + df['reading score'] + df['writing score']) / 3
df[['math score', 'reading score', 'writing score']].mean(axis=1)
df.sum(axis=1) / 3
df.mean(columns=['math score', 'reading score', 'writing score'])
Если применить .sum() к столбцу df_exams['math score'], что будет результатом?
Общая сумма всех значений в столбце
Количество непустых значений
Среднее значение
Максимальное значение
Какой метод используется для сортировки строк DataFrame по значениям одного или нескольких столбцов?
df.sort_values()
df.order_by()
df.sort_index()
df.arrange()
Как отсортировать DataFrame по столбцу 'math score' по убыванию?
df.sort_values('math score', ascending=False)
df.sort_values('math score', order='desc')
df.sort('math score', direction='down')
df.sort_values(by='math score', descending=True)
Какой параметр в методе df.sort_values() позволяет применить временную функцию преобразования к столбцу только для целей сравнения (например, для регистронезависимой сортировки)?
key
func
transform
mapper
Какой метод используется для установки одного из столбцов DataFrame в качестве нового индекса?
df.set_index()
df.reset_index()
df.index_by()
df.change_index()
В контексте Pandas, что является специальным значением для пропущенных/неизвестных дат (Date/Time)?
NaT
NaD
None
Null
Какой метод используется для подсчета количества вхождений каждого уникального значения в столбце?
df.value_counts()
df.unique_counts()
df.freq()
df.count_values()
Какой параметр метода value_counts() необходимо установить в False, чтобы включить подсчет пропущенных значений (NaN) в результат?
dropna=False
include_nan
skip_nulls
include_missing
Какой параметр метода value_counts() используется для получения относительных частот (долей или процентов) вместо абсолютных количеств?
normalize=True
proportions=True
as_percentage=True
relative=True
Какова основная цель предобработки текста на начальном этапе информационного поиска?
Очистка, унификация структуры и подготовка данных перед векторизацией
Увеличение размера датасета
Построение графика распределения классов
Оценка качества работы модели
Какой из перечисленных методов является стандартной техникой векторизации текстов в задачах классификации?
TF-IDF
Principal Component Analysis (PCA)
One-Hot Encoding
K-Means Clustering
Какая из метрик не используется для оценки качества классификации текстов, согласно представленным материалам?\
F1
Accuracy
Precision
Entropy
Какой инструмент, согласно материалам, удобно использовать для определения наиболее часто встречающихся слов?
Counter
NumPy array
Pandas Series
Matplotlib
Что означает, что значение Cosine Similarity (косинусного сходства) между двумя векторами близко к 1?
Тексты сильно похожи
Тексты сильно различаются
Тексты имеют одинаковую длину
Векторы ортогональны
Какая классическая ML-модель упоминается в качестве примера, которую можно использовать для классификации текстов?
Logistic Regression
K-Nearest Neighbors (KNN)
Decision Tree
Random Forest
Что является ключевым этапом построения поисковой системы на основе TF-IDF после векторизации корпуса?
Сравнение векторов пользовательского запроса с векторами документов
Разделение данных на обучающую и тестовую выборки
Построение облака слов
Обучение модели нейронной сети
Что фиксирует метод TF-IDF?
Частоту значимых слов
Длину текста
Расстояние между словами
Средний балл по документу
С помощью какого инструмента можно получить метрики качества классификации, такие как precision, recall и F1?
classification_report
pd.DataFrame.describe()
np.array.sum()
df.value_counts()
В каком пространстве сравниваются пользовательский запрос и документы в поисковых системах?
Векторное пространство
Временное пространство
Двумерное пространство
Категориальное пространство
Какой из шагов является частью предобработки текста?
Нормализация
Векторизация
Обучение модели
Оценка качества
Что представляет собой одна из задач Задания 1 в предобработке текстов?
Статистический анализ длины текстов
Построение поисковой системы
Обучение модели Naive Bayes
Расчет Cosine Similarity
Что такое Веб-скрапинг?
Процесс автоматического сбора данных с веб-страниц
Ручной ввод данных с веб-страниц
Сохранение веб-страниц в формате PDF
Анализ данных на локальном компьютере
Какая процедура, согласно материалам, является базовой очисткой данных и используется для улучшения понимания датасета?
Переименование колонок
Замена пропущенных значений (NaN)
Удаление строк
Нормализация числовых столбцов
Какой метод используется для объединения списка DataFrame, собранных в цикле?
pd.concat(frames)
df.merge()
df.join()
pd.combine(frames)
Какое важное правило упоминается, которое следует соблюдать перед выполнением веб-скрапинга?
Убедиться, что сайт разрешает скрапинг, и избегать частых запросов
Использовать только Python 3
Всегда использовать try-except
Сначала сохранять данные в формат JSON
Какая конструкция кода используется для обработки ошибок при попытке загрузить CSV-файл с URL?
try/except
if/else
for loop
while loop
С какой целью используется метод df.insert() при сборе данных за несколько сезонов?
Для вставки новой колонки (например, 'season') в определенную позицию
Для удаления лишнего столбца
Для переименования столбца
Для объединения двух столбцов
Для чего в процессе скрапинга данных о футболе создается словарь dict_historical_data?
Для хранения объединённого DataFrame за все сезоны, где ключ — название лиги
Для хранения имен файлов CSV
Для хранения списка URL-адресов
Для хранения названий команд
Если URL для данных о футболе имеет структуру root + season + '/' + league + '.csv', что соответствует переменной season для сезона 2015/2016?
'1516'
'2015/2016'
'15'
'2015'
Какое из следующих названий столбцов, скорее всего, будет переименовано для ясности при анализе футбольных данных?
'FTHG'
'date'
'home_team'
'Div'
Какой метод помогает анализировать тренды со временем при сборе данных за несколько сезонов?
Вставка новой колонки 'season'
Использование try-except
Использование df.read_csv()
Использование цикла for league in leagues
Что представляет собой структура данных DataFrame в библиотеке Pandas?
Двумерная структура данных (таблица)
Одномерный массив (Series)
Коллекция словарей Python
Хранилище числовых массивов NumPy
Для какого типа доступа к данным используется метод .loc[]?
Доступ по меткам (именам строк/столбцов)
Доступ по позиции (целым числам)
Доступ по срезу (диапазону)
Доступ по булевым условиям
Для какого типа доступа к данным используется метод .iloc[]?
Доступ по позиции (целым числам)
Доступ по меткам (именам строк/столбцов)
Доступ по булевым условиям
Доступ с помощью SQL-подобных выражений
С какой целью используется параметр inplace=True при установке индекса с помощью df.set_index()?
Для изменения DataFrame на месте, без создания копии
Для создания копии DataFrame
Для переименования столбца
Для игнорирования пропущенных значений (NaN)
Какова основная причина, по которой рекомендуется использовать метод .copy() при манипуляциях с подмножеством DataFrame?
Чтобы избежать нежелательных изменений в оригинале (SettingWithCopyWarning)
Для ускорения обработки данных
Для автоматического переименования столбцов
Для преобразования типов данных
Какой оператор используется для логического И при комбинировании нескольких булевых условий фильтрации в Pandas?
&
|
!
~
Какой оператор используется для логического ИЛИ при комбинировании нескольких булевых условий фильтрации в Pandas?
|
&
!
~
В синтаксисе среза .loc[start:stop], какой из элементов диапазона включается в результат?
Оба, start и stop
Только start
Ни start, ни stop
Только stop
Каким будет синтаксис для получения роста игрока с меткой индекса 'L. Messi' с использованием .loc[]?
df.loc['L. Messi', 'height_cm']
df.iloc['L. Messi', 'height_cm']
df.loc['L. Messi', 3]
df.iloc[0, 'height_cm']
Какой синтаксис используется для получения всех строк и только столбца 'height_cm' с помощью .loc[]?
df.loc[:, 'height_cm']
df.loc['height_cm']
df.iloc[:, 'height_cm']
df.loc[all, 'height_cm']
Как получить данные о двух игроках ('L. Messi' и 'Cristiano Ronaldo') и только их рост и вес с использованием .loc[]?
df.loc[['L. Messi', 'Cristiano Ronaldo'], ['height_cm', 'weight_kg']]
df.loc[['L. Messi', 'Cristiano Ronaldo'], 'height_cm':'weight_kg']
df.iloc[[0, 1], [3, 4]]
df.loc['L. Messi':'Cristiano Ronaldo', ['height_cm', 'weight_kg']]
Каким будет синтаксис для получения роста игрока 'L. Messi' (первая строка, столбец 'height_cm' — позиция 3) с использованием .iloc[]?
df.iloc[0, 3]
df.iloc['L. Messi', 3]
df.loc[0, 3]
df.iloc[0, 'height_cm']
В синтаксисе среза .iloc[start:stop], какой из элементов диапазона не включается в результат?
stop
start
Ни один из них
Оба, start и stop
Как получить данные о первых десяти игроках (строки с позиции 0 до 9) и только столбцы с позиции 1 по 4, используя .iloc[]?
df.iloc[0:10, 1:5]
df.iloc[0:10, 1:4]
df.loc[0:10, 1:4]
df.iloc[1:11, 1:5]
В каком виде нужно передать булеву серию (результат условия) в .iloc[] для фильтрации?
Как список булевых значений с помощью list()
Как строковое выражение
Как NumPy array
.iloc[] не поддерживает фильтрацию по условиям
Какой метод более удобен для доступа к данным, когда вам нужен позиционный доступ, как в списках Python?
.iloc[]
.loc[]
.query()
.apply()
Какой синтаксис используется для изменения значения в одной ячейке, например, установить рост 'L. Messi' на 175, используя .loc[]?
df.loc['L. Messi', 'height_cm'] = 175
df.iloc['L. Messi', 'height_cm'] = 175
df['L. Messi']['height_cm'] = 175
df.set_value('L. Messi', 'height_cm', 175)
Как установить одно и то же значение (например, 190) для всех ячеек в столбце 'height_cm'?
df.loc[:, 'height_cm'] = 190
df['height_cm'].loc[:] = 190
df.iloc[:]['height_cm'] = 190
df['height_cm'].apply(lambda x: 190)
Как установить значения np.nan для всей строки, соответствующей последнему игроку, используя .iloc[]?
df.iloc[-1, :] = np.nan
df.loc[-1, :] = np.nan
df.iloc[len(df)-1, :] = np.nan
df.iloc[last, :] = np.nan
Как установить значение 0 для столбцов ['age', 'dob', 'height_cm', 'weight_kg'] только для тех строк, где height_cm больше 180?
df.loc[df['height_cm']>180, ['age', 'dob', 'height_cm', 'weight_kg']] = 0
df.iloc[df['height_cm']>180, [1, 2, 3, 4]] = 0
df['height_cm'].query('height_cm>180') = 0
df.apply(lambda row: 0 if row['height_cm']>180 else row)
Какой метод используется для удаления строк или столбцов из DataFrame?
df.drop()
df.delete()
df.remove()
df.clear()
Чтобы удалить столбец 'long_name', какой параметр axis необходимо использовать в методе df.drop()?
axis=1
axis=0
axis='rows'
axis='index'
Какая функция позволяет фильтровать данные с помощью SQL-подобных выражений в виде строки?
Как с помощью df.query() выбрать игроков старше 34 И из страны 'Italy'?
df.query("age>34 and nationality=='Italy'")
df.query("age>34 | nationality=='Italy'")
df.query("age, nationality > 34, 'Italy'")
df.query("age==34 & nationality=='Italy'")
Как выбрать случайную 20% выборку строк из DataFrame с помощью метода .sample()?
df.sample(frac=0.2)
df.sample(n=0.2)
df.sample(perc=0.2)
df.sample(ratio=0.2)
Какой параметр метода .sample() обеспечивает воспроизводимость (получение одного и того же набора случайных строк при каждом запуске)?
random_state
seed
replace=True
n
Каким будет синтаксис для увеличения выборки в два раза (frac=2) с помощью .sample()?
df.sample(frac=2, replace=True)
df.sample(frac=2, replace=False)
df.sample(frac=2)
df.sample(n=36556)
Какой метод используется для применения произвольной функции (например, пользовательской или NumPy-функции) к Series или DataFrame?
Что представляют собой Lambda-функции?
Анонимные (безымянные) функции для простых операций
Функции, определенные внутри класса
Функции, определенные для работы только с NumPy
Функции, возвращающие только булевы значения
При использовании .apply() с пользовательской функцией calculate_bmi(row), какой параметр axis нужно установить, чтобы функция работала построчно (имела доступ к 'weight_kg' и 'height_cm')?
axis=1
axis=0
axis='columns'
axis=None
Как с помощью apply() и Lambda-функции преобразовать значения столбца height_cm в метры?
df['height_cm'].apply(lambda x: x / 100)
df['height_cm'].apply(lambda x: x * 100)
df.apply(lambda row: row['height_cm']/100)
df['height_cm'].str.replace('cm', 'm')
Какой метод позволяет фильтровать строки, где значения столбца находятся в указанном списке значений (например, Apple или HP)?
df.isin()
df.query()
df.where()
df.contains()
Если вы хотите найти ноутбуки, произведенные только Apple И стоящие дороже 2000 евро, какой оператор необходимо использовать между двумя условиями?
&
|
OR
NOT
Если вы хотите найти ноутбуки, произведенные либо Apple, либо Dell, какой оператор необходимо использовать между двумя условиями?
|
&
NOT
AND
Какой метод используется для создания условного столбца с двумя возможными значениями ('Expensive' или 'Inexpensive') на основе одного условия?
Какой метод используется для поиска дублирующихся строк в DataFrame?
df.duplicated()
df.unique()
df.drop()
df.has_duplicates()
Что делает параметр keep='first' в методе df.duplicated()?
Помечает все дубликаты как True, кроме первого вхождения
Помечает первое вхождение дубликата как True.
Помечает все дубликаты как True, включая первое и последнее вхождение.
Помечает все дубликаты как True, кроме последнего вхождения.
Что делает параметр keep='last' в методе df.duplicated()?
Помечает все дубликаты как True, кроме последнего вхождения
Помечает все дубликаты как True, включая первое и последнее вхождение.
Помечает только последнее вхождение как True.
Удаляет дубликаты.
Что делает параметр keep=False в методе df.duplicated()?
Помечает все дубликаты как True, включая первое и последнее вхождение
Удаляет все дубликаты.
Помечает все дубликаты как False.
Сохраняет только первое вхождение.
Какой метод используется для удаления дублирующихся строк?
df.drop_duplicates()
df.drop()
df.duplicated()
df.remove_duplicates()
При использовании df.drop_duplicates(['Company'], keep='first'), какие строки будут сохранены?
Строки, соответствующие самым дешёвым ноутбукам (если данные отсортированы по цене по возрастанию)
Все строки, кроме первого вхождения каждой компании.
Только строки, где компания не повторяется.
Строки, соответствующие самым дорогим ноутбукам.
Какой метод возвращает список уникальных значений в столбце?
df.unique()
df.nunique()
df.count()
df.value_counts()
Какой метод возвращает количество уникальных значений в столбце (и обычно работает быстрее, чем len(unique()))?
df.nunique()
df.unique_count()
df.count_unique()
df.distinct()
Какой параметр drop_duplicates() используется для перенумерования индекса после удаления дубликатов?
ignore_index=True
reset_index=True
reindex=True
replicate=False
Если вы хотите найти ноутбуки с самым маленьким экраном для каждой компании, как нужно отсортировать данные перед использованием drop_duplicates(keep='first')?
Сортировка по ['Company', 'Inches'] (по возрастанию)
Сортировка по ['Company', 'Price_euros']
Сортировка по ['Inches', 'Company']
Сортировка по ['Company', 'Inches'] (по убыванию)
При поиске самого дорогого ноутбука для каждой компании, какой параметр keep следует использовать в drop_duplicates(), если DataFrame отсортирован по цене по возрастанию?
keep='last'
keep='first'
keep=False
keep=True
Какова основная цель метода df.pivot() в Pandas?
Перестроение DataFrame, преобразовывая строки в столбцы без агрегации
Применение агрегатных функций (sum, mean) к данным.
Фильтрация данных по нескольким условиям.
Создание случайной выборки данных.
Какое ограничение имеет метод df.pivot(), которое отсутствует у df.pivot_table()?
Он требует, чтобы комбинации индекса и столбцов были уникальными
Он не может работать с числовыми данными.
Он не может работать с индексами.
Он не может перестраивать DataFrame.
Какой метод Pandas является аналогом сводной таблицы в Excel, позволяющим применять агрегирующие функции (например, mean или sum) и обрабатывать дубликаты?
df.pivot_table()
df.pivot()
df.groupby()
df.aggregate()
Какая агрегирующая функция применяется по умолчанию методом df.pivot_table() к значениям, если в данных присутствуют дубликаты?
mean()
sum()
count()
max()
Какую функцию необходимо указать в параметре aggfunc при создании сводной таблицы, чтобы посчитать общее количество проданных товаров?
'sum'
'mean'
'count'
'max'
В чем ключевое отличие df.pivot_table() от df.pivot()?
pivot_table() агрегирует данные, что делает его полезным для суммирования или усреднения
pivot() более мощный и быстрый.
pivot_table() не требует указания индекса.
pivot() может работать с нечистыми данными.
Какая из перечисленных функций является агрегатной функцией?
sum()
print()
apply()
lambda
Какая фундаментальная стратегия лежит в основе метода df.groupby()?
Split-Apply-Combine (Разделить-Применить-Объединить)
Filter-Select-Visualize
Sort-Filter-Sum
Load-Clean-Analyze
Какой объект создается методом df.groupby() перед применением агрегации?
GroupBy object
DataFrame
Series
Dictionary
Что произойдет, если сразу после df.groupby() не применить агрегатную функцию (например, mean() или sum())?
Будет возвращен промежуточный объект GroupBy, который ничего не вычисляет
Будет возвращена ошибка.
Будет возвращен отсортированный DataFrame.
Будет возвращена медиана для каждой группы.
Какой метод позволяет применять несколько агрегатных функций (например, min, max) к группам одновременно?
df.agg()
df.pivot_table()
df.mean()
df.sum()
При использовании df.agg(), какой тип данных позволяет применять разные функции к разным столбцам?
Словарь (Dictionary)
Список строк (List)
Кортеж (Tuple)
Строка (String)
Какое ключевое слово используется в df.groupby().agg() для переименования столбца с результатом агрегации (например, sum_sales для суммы продаж)?
Использование кортежей ('sum_sales', 'sum')
Нельзя переименовывать столбцы в agg().
Параметр rename=...
С помощью lambda функции.
Какой метод позволяет применять пользовательские операции к каждой группе, используя анонимную функцию?
df.groupby().apply(lambda x: ...)
df.groupby().map()
df.groupby().filter()
df.groupby().transform()
Какой параметр df.groupby() по умолчанию контролирует обработку пропущенных значений (NaN)?
NaN игнорируются по умолчанию
fillna=0
dropna=False
include_nan=True
Каким образом можно получить данные конкретной группы (например, 'Ford') из объекта GroupBy?
groupby_obj.get_group('Ford')
groupby_obj['Ford']
groupby_obj.groups.get('Ford')
groupby_obj.filter('Ford')
Для чего используется метод df.groupby().filter()?
Для фильтрации целых групп на основе условия, примененного к группе целиком
Для фильтрации отдельных строк в группах.
Для удаления дубликатов.
Для выбора подмножества столбцов.
Что должна возвращать функция, переданная в метод df.groupby().filter()?
Булево значение для каждой группы
Числовое значение
Строка
Новый DataFrame
Какой тип графика наиболее полезен для отображения тенденций во времени (временных рядов)?
Линейный график (Lineplot)
Круговая диаграмма (Piechart)
Столбчатый график (Barplot)
Диаграмма размаха (Boxplot)
Какой тип графика подходит для отображения долей от целого и рекомендуется для небольшого количества категорий?
Круговая диаграмма (Piechart)
Линейный график
Диаграмма размаха
Гистограмма
Какой тип графика полезен для выявления аномалий (выбросов) и сравнения распределений данных?
Диаграмма размаха (Boxplot)
Диаграмма рассеивания (ScatterPlot)
Гистограмма
Группированный столбчатый график
Какой тип графика используется для отображения корреляции между двумя переменными (поиска зависимостей)?
Диаграмма рассеивания (ScatterPlot)
Гистограмма
Круговая диаграмма
Столбчатый график
Какую библиотеку необходимо использовать в дополнение к Pandas для создания интерактивных графиков, которые позволяют зумить и наводить мышь для просмотра деталей?
Plotly
Matplotlib
Seaborn
NumPy
Какой логический оператор в Pandas используется для реализации условия "И" при фильтрации по нескольким столбцам?
&
AND
|
!
Какое требование должно быть соблюдено при использовании нескольких условий (& или |) в фильтрации DataFrame?
Каждое условие должно быть заключено в скобки
Должны использоваться только строковые столбцы.
Должны использоваться только числовые столбцы.
Должен быть применен метод .query().
Какая функция из библиотеки NumPy используется для создания нового столбца с двумя возможными значениями на основе одного условия (аналог функции IF в Excel)?
Какой метод более мощный и подходит для создания условного столбца с более чем двумя категориями, позволяя задавать условия в порядке приоритета?
Какой метод позволяет фильтровать строки DataFrame, где значения столбца находятся в указанном списке значений (например, 'Apple' или 'HP')?
df.isin()
df.query('Company in ["Apple", "HP"]')
df.loc[]
df.contains()
Какое выражение используется для выбора строк, где компания не равна 'HP'?
df_laptops[df_laptops['Company'] != 'HP']
df_laptops['Company'] ! 'HP'
df_laptops['Company'] <> 'HP'
df_laptops[df_laptops['Company'].not_equal('HP')]
Что делает параметр keep=False в методе df.duplicated()?
Помечает все дубликаты как True, включая первое и последнее вхождение
Помечает только последнее вхождение как True.
Удаляет все дубликаты.
Помечает все дубликаты как False.
Если DataFrame отсортирован по цене по возрастанию, какой метод позволяет оставить только строки, соответствующие самым дешёвым ноутбукам для каждой компании?
df.drop_duplicates(['Company'], keep='first')
df.drop_duplicates(['Company'], keep='last')
df.duplicated(['Company'], keep='first')
df.drop_duplicates(keep=False)
Какой метод используется для получения списка всех уникальных значений в столбце?
df.unique()
df.nunique()
df.value_counts()
len(df)
Какой метод возвращает количество уникальных значений в столбце и является более быстрым, чем использование len(df.unique())?
df.nunique()
df.distinct()
df.value_counts()
df.agg('count')
Какой метод доступа к данным в Pandas используется для выбора строк и столбцов по именам (меткам)?
Какой метод доступа к данным в Pandas используется для выбора строк и столбцов по позиции (целым числам)?
df.iloc[]
df.loc[]
df.query()
df.iat[]
Каким будет синтаксис для получения значения высоты (столбец с позицией 3) для второго игрока (строка с позицией 1) с использованием позиционного доступа?
df.iloc[1, 3]
df.loc[1, 3]
df.loc[2, 4]
df.iloc[2, 4]
Как получить все столбцы для строки с меткой индекса 'L. Messi' с использованием доступа по меткам?
df.loc['L. Messi', :]
df.loc['L. Messi']
df.iloc[0, : ]
df.loc[:, 'L. Messi']
Какая функция Pandas используется для простого «склеивания» двух или более DataFrame вертикально (добавление строк)?
pd.concat(..., axis=0)
pd.merge()
df1.join(df2)
pd.concat(..., axis=1)
Какой параметр необходимо использовать в pd.concat(), чтобы горизонтально (добавление столбцов) объединить два DataFrame с одинаковым количеством строк?
axis=1
how='outer'
ignore_index=True
on='key'
Какая функция Pandas используется для настоящего соединения (JOIN) двух DataFrame по общему столбцу-ключу?
pd.merge()
pd.concat()
pd.join()
pd.aggregate()
Какой тип соединения (how) в pd.merge() используется для возврата только совпадающих строк из обеих таблиц?
'inner'
'outer'
'left'
'right'
Как найти строки, которые присутствуют в левой таблице (df1), но отсутствуют в правой таблице (df2)?
df1.merge(df2, how='outer', indicator=True).query("_merge == 'left_only'")
df1.merge(df2, how='left')
df1.merge(df2, how='inner')
df1.merge(df2, how='right', indicator=True).query("_merge == 'right_only'")
Какова основная разница между df.pivot() и df.pivot_table()?
pivot_table() может обрабатывать дубликаты, применяя агрегирующую функцию
pivot() выполняет агрегацию, а pivot_table() — нет.
pivot() может работать только со строками, а pivot_table() — со столбцами.
pivot_table() всегда возвращает сумму значений.
Какая стратегия лежит в основе метода df.groupby()?
Split-Apply-Combine
Sort-Filter-Combine
Load-Clean-Analyze
Pivot-Merge-Aggregate
Какой метод позволяет применять несколько агрегатных функций (например, min и max) к различным столбцам с помощью словаря?
Для чего используется метод df.groupby().filter()?
Для фильтрации групп, где агрегированный результат (например, сумма) превышает порог
Для удаления строк с NaN в группах.
Для выбора столбцов после группировки.
Для переименования столбцов результата.
Что является первым и ключевым шагом при очистке данных, который позволяет понять, с какими столбцами есть проблемы?
Выявление пропущенных данных (df.isnull().sum()) (правильный ответ).
Удаление всех строк с NaN.
Приведение текста к нижнему регистру.
Построение гистограммы.
Какая из стратегий является наиболее подходящей для заполнения пропущенных значений (NaN) в категориальном столбце?
Заполнение модой (самым частым значением)
Заполнение средним значением.
Заполнение медианой.
Удаление всего столбца.
Какой тип графика, согласно материалам, является лучшим способом для визуального выявления выбросов (Outliers) в числовых данных?
Диаграмма размаха (Boxplot)
Линейный график
Столбчатый график
Диаграмма рассеивания (ScatterPlot)
Что является одной из основных причин для приведения текстовых данных (названий, имён, адресов) к единому регистру?
Предотвращение потери данных при объединении таблиц (merge) из-за различий в регистре.
Уменьшение размера файла.
Ускорение вычислений.
Улучшение работы алгоритмов машинного обучения.
Какой метод используется для удаления лишних пробелов (ведущих и конечных) из строковых значений в столбце?
df['col'].str.strip()
df['col'].str.replace(' ', '')
df['col'].str.lower()
df['col'].str.upper()
Что позволяет лямбда-функция при использовании с методом .apply() в контексте трансформации данных?
Выполнять простые анонимные (безымянные) операции в одной строке кода.
Выполнять только агрегацию.
Определять сложные функции с несколькими строками кода.
Автоматически удалять NaN.
Какой метод позволяет фильтровать данные с помощью строкового выражения, похожего на SQL (например, "age>34 and nationality=='Italy'"), без сложной булевой индексации?
df.query()
df.loc[]
df.filter()
df.where()
С помощью чего делается объединение датафреймов?
concat, merge
union, combine
together, plus
join, combine
Что такое pd.concat()?
конкатенация
умножения DataFrame друг на друга.
вычитания одного DataFrame из другого
Функция для случайного перемешивания строк в DataFrame
Как выполнить вертикальную конкатенацию?
pd.concat([df1, df2], axis=0)
pd.merge(df1, df2, on="id", how="inner").
pd.concat_vertical(df1, df2)
pd.concat([df1, df2], axis=1)
Как выполнить горизонтальную конкатенацию?
pd.concat([df1, df2], axis=1)
pd.concat([df1, df2], axis=0)
pd.merge(df1, df2, on="id", how="inner").
pd.concat_vertical(df1, df2)
Какое требование к вертикальной конкатенации?
Одинаковые столбцы (одинаковая структура DataFrame).
Длина строк в двух DataFrame должна совпадать.
DataFrame должны быть отсортированы по возрастанию.
В обоих DataFrame не должно быть пропусков.
Что такое pd.merge()?
соединение по ключу как в SQL.
простое соединение.
соединение только слева.
поиск пресечения
Какие есть типы join?
inner, outer. left, right.
left, right
up, down.
outer, inner, up, down
За что отвечает аргумент how в функции pd.merge()?
Определяет тип объединения (inner, left, right, outer).
Указывает порядок сортировки строк после объединения.
Определяет направление конкатенации — вертикально или горизонтально
Объединяет DataFrame по индексам, игнорируя ключевые столбцы
Что делает how=”inner”в pd.merge()?
Оставляет только строки, у которых есть совпадения в обеих таблицах..
Объединяет таблицы без учета ключей.
Оставляет только строки из левой таблицы.
Удаляет дубликаты после объединения.
Что делает how="left" в pd.merge()?
Берёт все строки из левой таблицы и добавляет совпадающие из правой.
Берёт только строки, которые есть в обеих таблицах.
Возвращает только строки, отсутствующие в правой таблице.
Перемешивает строки случайным образом.
Что делает how="right" в pd.merge()?
Берёт все строки из правой таблицы и добавляет совпадающие из левой.
Берёт только строки, уникальные в левой таблице..
Делает конкатенацию по строкам.
Сортирует таблицы по убыванию.
Что делает how="outer" в pd.merge()?
Объединяет все строки из обеих таблиц, заполняя пропуски, если соответствия нет.
Удаляет все строки, которые имеют совпадения.
Оставляет только строки из правой таблицы.
Выполняет математическую сумму двух DataFrame.
Как найти строки, которых нет в другой таблице?
df1.merge(df2, on=’id’, how=’outer’,indicator=True).query(“_merge != ‘both’”)
df1 + df2
df1.merge(df2, on='id', how='inner')
df1.merge(df2, on='id', how='left').dropna()
Как получить только те строки, которых нет в правой?
df1.merge(df2, how=’left’,indicator=True).query(“merge = ‘left_only’”)
df1.merge(df2, how='inner')
df1.drop(df2)
df1.merge(df2, how='right', indicator=True).query("_merge == 'right_only'")
Что делает параметр indicator=True в функции pd.merge()?
Добавляет столбец merge, показывающий, из какой таблицы пришла каждая строка (leftonly, right_only, both).
Выполняет объединение только по индексам.
Создаёт индексы заново после объединения.
Перемешивает строки двух таблиц для ускорения слияния.
Когда лучше испольовать pd.merge()?
когда есть общий столбец-ключ
Когда нужно просто добавить строки друг под другом
Когда нужно умножить два DataFrame друг на друга.
Когда нужно только сортировать строки по столбцу.
Что такое агрегатные функции?
Функции, которые объединяют множество значений в одно (например, сумма, среднее, минимум, максимум).
Функции, которые перемешивают строки DataFrame.
Функции, которые сортируют столбцы по алфавиту.
Функции, которые создают новые столбцы на основе условия.
Что такое группировка?
Объединение строк DataFrame по значениям одного или нескольких столбцов для последующего вычисления агрегатных функций
Процесс сортировки строк по алфавиту.
Удаление дубликатов в столбцах.
Создание новых строк на основе случайного выбора.
В чем отличие nunique и unique?
unique() возвращает массив всех уникальных значений столбца, а nunique() — их количество.
unique() считает все строки, а nunique() сортирует их.
unique() удаляет пропуски, а nunique() оставляет только нули.
unique() дублирует значения, а nunique() перемешивает их.
Что делает метод agg?
Позволяет применять одну или несколько агрегатных функций к одному или нескольким столбцам DataFrame.
Перемешивает строки DataFrame случайным образом.
Объединяет два DataFrame по ключевому столбцу.
Сортирует строки по алфавиту или по числовому значению.
К каким столбцам применяется agg() по умолчанию ?
К числовым столбцам DataFrame.
К строковым столбцам DataFrame.
К столбцам с уникальными значениями (nunique).
Только к столбцам с пропущенными значениями.
Вычислите среднее и количество значений
df.agg([‘mean’, ‘count’])
df.agg(‘mean’, ‘count’)
df.apply(['mean', 'sum'])
df.agg(['median', 'mode'])
Как применить разные агрегатные функции к разным столбцам DataFrame?
df.agg({'столбец1': 'sum', 'столбец2': 'mean'})
df.aggregate('concat')
df.agg('столбец1': 'sum', 'столбец2': 'mean')
df.agg('max', 'min')
Как переименовать индекс результата?
df.agg(x=(‘a’,’sum’),y=(‘b’,’sum’))
df.rename(index={'sum':'Сумма'})
df.agg({'a':'sum', 'b':'sum'})
df.agg('sum').rename_axis('Новый индекс')
Что делает split?
делит данные на группы по ключу
Сортирует строки по алфавиту.
Удаляет пропущенные значения из DataFrame
Вычисляет агрегатные функции для каждого столбца
Что делает apply?
применяет функцию к каждой группе
Делит данные на группы по ключу.
Объединяет группы обратно в один DataFrame
Сортирует строки по алфавиту.
Что делает combine?
объединяет результаты в новый датафрейм
Делит данные на группы по ключу
Объединяет группы обратно в один DataFrame
Сортирует строки по алфавиту
Для чего используется стратегия Split-Apply-Combine?
позволяет вручную реализовать группировку
Сортирует DataFrame по алфавиту
Вычисляет только сумму всех значений без группировки
Объединяет два DataFrame без ключа
Что делает метод groupby()?
создает объект GroupBy для дальнейшей группировки и агрегации данных
Сразу вычисляет агрегатные функции по столбцy
Объединяет два DataFrame по ключевому столбцу
Перемешивает строки DataFrame случайным образом
Что возвращает атрибут groups?
Словарь, где ключи — уникальные значения групп, а значения — индексы строк, относящихся к каждой группе
Список всех уникальных значений столбца без индексов.
DataFrame с уже агрегированными значениями.
Количество строк в каждой группе в виде числа, а не словаря.
Что вернет g.groups.keys()?
Список всех уникальных значений, по которым были созданы группы
Все строки DataFrame, объединённые в один список
Индексы всех строк DataFrame
Количество строк в каждой группе
Что дает комбинация groupby() agg()?
позволяет применить несколько функций к группам
Перемешивает строки внутри каждой группы
Делит DataFrame на группы без возможности агрегировать
Удаляет все пропущенные значения из групп
Что такое Lambda()?
это анонимная функция, которая может применятся в apply() для кастомных операций
Функция, которая автоматически группирует данные.
Метод для объединения двух DataFrame.
Функция, которая сортирует строки DataFrame по алфавиту.
Что делает filter()?
позволяет фильтровать группы на основе условия,примененного к группе целиком
Фильтрует отдельные строки без учёта групп.
Делит DataFrame на группы по ключу
Сортирует строки в каждой группе по алфавиту
Чем filter() отличается от обычного фильтра?
тем что фильтрует целые группы, а не строки
Фильтрует только строки с пропущенными значениями.
Делит DataFrame на группы без фильтрации
Сортирует строки по алфавиту или числовым значениям.
Что такое метод pivot()?
это метод пандас, который позволяет перестраивать датафрейм преобразовывая строки в столбцы(и наоборот) без агрегации данных
Метод, который автоматически агрегирует данные при преобразовании.
Функция для фильтрации строк по условию
Функция для сортировки строк и столбцов по алфавиту
Что такое метод pivot_table()?
это более мощный метод, который позволяет не только перестраивать таблицу, но и применять агрегирующие функции
Метод, который только сортирует строки и столбцы по алфавиту
Функция для фильтрации строк без изменения структуры таблицы.
Метод, который создаёт случайные значения в DataFrame для тестирования.
Что делает index в pivot_table()?
Задаёт столбцы, значения которых будут использованы в качестве индекса (строк) новой таблицы.
Определяет, какие столбцы объединять с другими DataFrame.
Применяет агрегатные функции к данным.
Создаёт новый DataFrame с пропущенными значениями.
Что делает columns в pivot_table()?
Задаёт столбцы, значения которых будут преобразованы в новые столбцы в сводной таблице.
Определяет, какие строки объединять с другими DataFrame.
Применяет агрегатные функции к данным.
Создаёт новый DataFrame с пропущенными значениями.
Что делает values в pivot_table()?
Указывает, какие данные будут агрегироваться и отображаться в ячейках сводной таблицы.
Определяет, какие строки объединять с другими DataFrame.
Определяет строки, которые станут индексом.
Создаёт новый DataFrame с пропущенными значениями.
Что aggfunc values в pivot_table()?
Определяет агрегатную функцию для значений в ячейках сводной таблицы.
Определяет, какие столбцы будут использоваться для индексации строк сводной таблицы.
Указывает, какие столбцы будут преобразованы в новые столбцы сводной таблицы.
Задаёт, какие данные будут отображаться и агрегироваться в ячейках сводной таблицы.
В чем разница pivot_table() и pivot()?
pivot_table() позволяет не только перестраивать таблицу, но и применять агрегатные функции, тогда как pivot() просто преобразует строки в столбцы без агрегации.
pivot() может применять агрегатные функции, а pivot_table() только перестраивает таблицу без агрегации.
pivot_table() всегда возвращает DataFrame с уникальными индексами, а pivot() создаёт объект GroupBy.
pivot_table() используется для объединения двух DataFrame, а pivot() для фильтрации строк по ключу.
Для чего полезен линейный график?
для отображений тенденций во времени
Для сравнения пропорций категорий в виде частей целого
Для отображения взаимосвязей между двумя числовыми переменными в виде точек.
Для объединения нескольких графиков в один без отображения тенденци
Что сравнивает столбчатый график?
Сравнивает значения между различными категориями или группами данных.
Отображает изменения данных во времени или последовательности.
Показывает распределение значений и частоты появления элементов.
Визуализирует взаимосвязь между двумя числовыми переменными в виде точек.
С помощью какого метода создается график?
С помощью метода plot()
С помощью метода merge()
С помощью метода groupby()
С помощью метода pivot().
Что показывает круговая диаграмма?
показывает доли от целого
Отображает изменения данных во времени или последовательности.
Сравнивает значения между различными категориями или группами данных.
Показывает распределение значений и частоты появления элементов.
Что показывает диаграмма размаха?
Показывает распределение данных, медиану, квартали и выбросы в наборе данных.
Сравнивает значения между различными категориями или группами данных.
Отображает доли категорий от общего целого в виде сегментов круга.
Показывает взаимосвязь между двумя числовыми переменными в виде точек.
Что показывает гистограмма?
Показывает распределение непрерывных данных
Сравнивает значения между различными категориями или группами данных.
Отображает доли категорий от общего целого в виде сегментов круга.
Показывает взаимосвязь между двумя числовыми переменными в виде точек.
Для чего нужно указывать bins в гистограмме?
Определяет количество интервалов (корзин), на которые распределяются значения данных для построения гистограммы.
Задает цвет столбцов гистограммы.
Определяет толщину линий графика.
Объединяет несколько гистограмм в одну без изменения данных.
Как отобразить значения на круговой диаграмме?
С помощью параметра autopct
С помощью параметра legend, который только отображает подписи категорий.
С помощью метода xlabel(), который задаёт подпись оси X.
С помощью метода groupby()
Что показывает диаграмма рассеивания?
показывает корреляцию между двумя переменными
Отображает распределение одной переменной по интервалам
Сравнивает значения между категориями
Показывает доли категорий от целого
Что такое библиотека Pandas?
Библиотека для работы с таблицами
Библиотека для создания машинного обучения
Библиотека для визуализации графиков
Библиотека для работы с массивами и числовыми данными
Что такое библиотека Numpy?
Библиотека для работы с массивами и числовыми данными
Библиотека для создания машинного обучения
Библиотека для визуализации графиков
Библиотека для работы с таблицами
Для чего нужен атрибут index в DataFrame?
Для хранения меток строк и обращения к ним
Для автоматической сортировки таблицы по алфавиту
Для хранения типов данных в каждом столбце
Для удаления дубликатов в датафрейме
Что выведет команда df.shape?
Размер таблицы
Типы данных столбцов
Имена столбцов
Первые строки таблицы
Как получить список названий всех столбцов DataFrame?
df.columns
df.shape
df.names
df.index
Какой метод покажет основные статистики числовых столбцов?
Как выбрать один столбец с именем ‘age’?
df.age
df(age)
df[age]
df(‘age’)
Как выбрать несколько столбцов ‘age’ и ‘name’?
df[[‘age’, ‘name’]]
df[‘age’, ‘name’]
df(‘age’, ‘name’)
df(age, name)
Что делает метод df.head(10)?
Показывает первые 10 строк
Показывает последние 10 строк
Показывает 10 строк с пропусками
Показывает случайные 10 строк
Как посчитать сумму значений в столбце?
df[‘column_name’].sum()
df[‘column_name’].count()
df[‘column_name’].average()
df[‘column_name’].mean()
Как найти среднее значение в столбце?
df[‘column’].mean()
df[‘column’].sum()
df[‘column’].count()
df[‘column’].average()
Как отсортировать данные в столбце по возрастанию?
df.sort_values(‘column’)
df.sort_values[‘column’]
df.sorted(‘column’)
df.sorted_values[‘column’]
Как отсортировать данные в столбце по убыванию?
df.sort_values(‘column’, ascending=True)
df.sort_values[‘column’, descending=False]
df.sorted(‘column’, ascending=False)
df.sorted_values[‘column’, descending=True]
Что такое NaN в Pandas?
Отсутствующее значение
Пустая строка
Число 0
Ошибка
Как посчитать количество непропрущенных значений в столбце?
df[‘column’].count()
df[‘column’].sum()
df[‘column’].average()
df[‘column’].mean()
Как узнать частоту каждого значения в столбце?
df[‘column’].value_counts()
df[‘column’].count_values()
df[‘column’].unique()
df[‘column’].nunique()
Как получить относительные частоты в value_counts?
df[‘column’].value_counts(normalize=True)
df['column'].value_counts(percent=True)
df['column'].value_counts(ascending=True)
df['column'].value_counts(descending=True)
Какой метод добавляет столбец в определенную позицию?
df.insert()
df.add()
df.assign()
df.append()
Чем метод assign() отличается от прямого присваивания?
assign() возвращает новый DataFrame
assign() изменяет исходный DataFrame
assign() возвращает старый DataFrame
assign() изменяет новый DataFrame
Как установить столбец 'id' в качестве индекса?
df.set_index('id')
df.index('id')
df.index['id']
df.set_index['id']
Как отсортировать DataFrame по индексу?
df.sort_index()
df.sort_by_index()
df.sorted_index()
df.sort_values_index()
Как переименовать индекс 0 в 'first'?
df.rename(index={0: 'first'})
df.rename[index({0: 'first'}]
df.rename({0: 'first'})
df.rename_index(0='first')
Как переименовать столбец 'old' в 'new'?
df.rename(columns={'old': 'new'})
df.rename[columns('old', 'new')]
df.rename(columns{'old': 'new'})
df.columns['old'] = ['new']
Что делает параметр key в sort_values?
Задает функцию для преобразования данных перед сортировкой
Выбирает столбцы для сортировки
Определяет направление сортировки
Выбирает метод сортировки
Для чего используется параметр inplace=True?
Для изменения исходного DataFrame
Для создания копии DataFrame
Для ускорения операции
Для обработки пропущенных значений
Какой тип данных у df['column'], когда выбираем один столбец?
Series
DataFrame
List
Array
Как выбрать строки с math_score > 90?
df[df['math_score'] > 90]
df.(df['math_score'] > 90)
(df['math_score'] > 90)
df.filter(df['math_score'] > 90)
Как сбросить индекс и сделать его обычным столбцом?
df.reset_index()
df.remove_index()
df.drop_index()
df.delete_index()
Что выведет len(df)?
Количество строк
Количество столбцов
Количество ячеек
Размер файла
Как объединить два DataFrame по вертикали?
pd.concat([df1, df2])
pd.merge([df1, df2])
pd.join([df1, df2])
pd.combine([df1, df2])
Как загрузить данные CSV прямо из интернета?
Какой метод показывает информацию о типах данных в столбцах?
Как добавить столбец с номером сезона при загрузке данных?
df.insert(1, 'season', 2022)
df.column(1)['season'] = 2022
df.add_column(1, 'season', 2022)
df.column(1, 'season', 2022)
Зачем нужно переименовывать столбцы после загрузки?
Чтобы сделать названия более понятными
Чтобы уменьшить размер данных
Чтобы ускорить работу с данными
Чтобы исправить ошибки в данных
Какой символ используется для комментариев в коде Python?
#
//
*
--
Что делает метод df.tail(3)?
Показывает последние 3 строки
Показывает первые 3 строки
Показывает случайные 3 строки
Показывает 3 строки с пропусками
Как найти максимальное значение в столбце?
df['column'].max()
df['column'].maximum()
df['column'].top()
df['column'].highest()
Как найти минимальное значение в столбце?
df['column'].min()
df['column'].minimum()
df['column'].bottom()
df['column'].lowest()
Как посчитать стандартное отклонение?
df['column'].std()
df['column'].deviation()
df['column'].stdev()
df['column'].sigma()
Что выведет df['column'].nunique()?
Количество уникальных значений
Количество всех значений
Количество пропущенных значений
Количество нулевых значений
Как выбрать строки по условию в нескольких столбцах?
df[(df['a'] > 10) & (df['b'] < 5)]
df[df['a'] > 10 and df['b'] < 5]
df[df['a'] > 10, df['b'] < 5]
df.(df['a'] > 10 and df['b'] < 5)
Как создать DataFrame из списка списков?
pd.DataFrame([[1,2], [3,4]])
pd.list([[1,2], [3,4]])
pd.create([[1,2], [3,4]])
pd.array([[1,2], [3,4]])
Как создать DataFrame из словаря?
pd.DataFrame({'col1': [1,2], 'col2': [3,4]})
pd.from_dict({'col1': [1,2], 'col2': [3,4]})
pd.create_dict({'col1': [1,2], 'col2': [3,4]})
pd.dict_to_df({'col1': [1,2], 'col2': [3,4]})
Что такое веб-скрапинг?
Автоматический сбор данных с веб-страниц
Создание веб-сайтов
Парсинг веб-сайтов
Оптимизация данных с веб-страниц
Как обработать ошибку при загрузке данных из URL?
Использовать try-except блок
Использовать if-else проверку
Использовать цикл while
Использовать функцию error_handler()
Для чего нужен параметр dropna в value_counts()?
Для включения/исключения NaN в подсчет
Для удаления столбца
Для удаления дубликатов
Для сортировки результатов
Как округлить числа в DataFrame до 2 знаков?
df.round(2)
df.ceil(2)
df.floor(2)
df.format(2)
Как создать новый столбец как сумму трех других столбцов?
df['total'] = df['a'] + df['b'] + df['c']
df['total'] = sum(df['a'], df['b'], df['c'])
df['total'] = df.sum(['a', 'b', 'c'])
df['total'] = add(df['a'], df['b'], df['c'])
Зачем выбирают только нужные столбцы в DataFrame?
Чтобы уменьшить память и ускорить работу
Чтобы увеличить размер таблицы
Чтобы сломать код
Чтобы случайно удалить данные
Как выбирают столбцы из DataFrame?
Что делает loc[]?
Доступ по меткам
Доступ по номерам
Удаляет строки
Делает сортировку
Как получить данные строки по имени индекса?
df.loc[row_name]
df.get(row)
df.iloc[row_name]
df[row_name, :]
Команда df.loc['L. Messi', 'height_cm'] вернёт:
Его рост
Возраст
Имя игрока
Его клуб
Как получить несколько строк через loc?
df.loc[[row1, row2]]
df.loc(row1,row2)
df.getRows(row1,row2)
df.loc[row1;row2]
Что делает df.loc[:, 'height_cm']?
Возвращает высоту всех игроков
Выбирает только строчки
Удаляет столбец height_cm
Делает сортировку
Как выбрать несколько столбцов через loc?
df.loc[row, [col1, col2]]
df.loc[row, col1+col2]
df.loc[row, col1,col2]
df.loc[[col1,col2]]
В loc диапазон start:stop:
оба включены
start не включён
stop не включён
оба исключены
Как выбрать игроков ростом > 195?
df.loc[df['height_cm'] > 195]
df.loc[df['height_cm'] < 195]
df.loc[df.height = 195]
df.loc[df > 195]
Как применить два условия одновременно?
&
*
+
==
Что делает iloc[]?
Доступ по позициям (номерам)
Доступ по названиям
Удаление столбцов
Изменение индекса
Как получить первую строку через iloc?
df.iloc[0]
df.loc[0]
df.first()
df.get(0)
Что выберет df.iloc[0, 3]?
значение в 0-й строке и 3-м столбце
0 строку
3 строку
ничего
Как выбрать несколько столбцов через iloc?
df.iloc[row, [3,4]]
df.iloc[row, 3+4]
df.iloc[row, 3-4]
df.iloc[[3;4]]
В iloc срез 1:5 означает:
1 включён, 5 НЕ включён
1 и 5 включены
оба исключены
только 5 включён
Почему iloc не принимает логическое условие напрямую?
Потому что iloc принимает только списки позиций
Потому что это баг
Потому что работает только с числами
Потому что Pandas запрещает фильтрацию
Как применять условие в iloc?
list(df['col'] > value)
Никак
df.condition()
df.iloc.condition
Что делает df.loc['L. Messi', 'height_cm'] = 175?
Меняет рост Месси
Создаёт новый DataFrame
Удаляет строку
Добавляет новый столбец
Как удалить столбец?
df.drop(columns=['col'])
df.remove()
df.delete(col)
df.cut(col)
Что означает axis=1?
Работать по столбцам
Работать по строкам
Вывести таблицу
Сортировать
Для чего используют sample()?
Чтобы вернуть случайные строки
Чтобы удалить строки
Чтобы изменить индекс
Чтобы построить график
Что делает query()?
Фильтрация через строку
SQL-запросы
Сохранение файла
Сортировка
Что делает df.query("height_cm > 195")?
Выбирает игроков выше 195
Выбирает игроков ниже 195
Выбирает всех
Удаляет столбец height_cm
loc можно использовать для:
Выбора и изменения данных
Только сортировки
Только удаления
Изменения типа данных
Что такое pandas?
Библиотека для работы с таблицами
Библиотека для работы с массивами и числовыми данными
Функция для создания условных столбцов
Инструмент для чтения JSON-файлов
Что такое numpy?
Библиотека для работы с массивами и числовыми данными
Библиотека для работы с таблицами
Метод для удаления дубликатов
Инструмент для визуализации данных
Фильтрация-это?
Это один из ключевых навыков работы с данными в pandas, который позволяет выделить нужные данные
Преобразование данных из одного типа в другой
Изменение порядка строк в таблице
Операция по удалению пропущенных значений
Как вывести первые 5 строк?
Какой код проверяет, какие строки в столбце ‘Company ’ не содержат значение ‘HP’?
df_laptops[‘Company’] != ‘HP’
df_laptops['Company'] == 'HP'
df_laptops['Company'].isin('HP')
df_laptops.filter(company='HP')
Какой код фильтрует ноутбуки с ценой больше 2000 евро?
df_laptops[df_laptops[‘Price_euros’] > 2000]
df_laptops['Price_euros'] == 2000
df_laptops[df_laptops['Price_euros'] >= 2000]
df_laptops.query('Price_euros = 2000')
Какая функция из библиотеки NumPy, позволяет создавать новые данные на основе условия?
По какому принципу работает функция np.where()?
Если условие истинно, то одно значение, иначе-другое
Выполняет операцию, если цена больше или равна 2000
Позволяет задать несколько условий с приоритетами
Возвращает список уникальных значений
Какой правильный синтаксис np.where()?
np.where(условие, значение_если_истина, значение_если_ложь)
np.where(значение_если_истина, условие, значение_если_ложь)
np.where(условие, [значения])
np.where(значение_если_ложь, условие)
Логическое ИЛИ-это?
Когда достаточно выполнения хотя бы одного условия
Условия должны выполняться одновременно
Условие не должно выполняться
Используется только для числовых условий
Логическое И-это?
Когда условия должны выполняться одновременно
Достаточно выполнения хотя бы одного условия
Используется для удаления дубликатов
Применяется для сравнения уникальных значений
Какая функция позволяет задавать несколько условий и соответствующих им значений?
Какая разница между функцией np.select() и np.where?
Что делает метод isin()?
Позволяет фильтровать строки, где значения столбца находятся в указанном списке
Удаляет строки, которых нет в списке
Возвращает количество уникальных значений
Преобразует строковые значения в числовые
Что делает метод dublicated()?
Помогает найти строки которые дублируется в DataFrame или в определенных столбцах
Удаляет все повторяющиеся строки
Сортирует DataFrame по указанному столбцу
Находит строки с пропущенными значениями
Какой код проверяет, какие компании есть в столбце Company?
df_laptops.value_counts(‘Company’)
df_laptops['Company'].unique()
df_laptops.sort_values('Company')
df_laptops['Company'].nunique()
Какой метод удаляет строки, которые дублируются из DataFrame?
drop_dublicates()
df.drop_rows()
df.filter_unique()
df.remove_dubs()
Что делает метод unique()?
Возвращает список уникальных значений в столбце
Возвращает количество уникальных значений
Помечает дубликаты как True
Удаляет все дубликаты
Как мы получим уникальные значения в столбце ‘Company’?
df_laptops[‘Company’].unique()
df_laptops.nunique('Company')
df_laptops.value_counts('Company')
df_laptops.get_unique('Company')
Какой метод возвращает количество уникальных значений в столбце?
nunique()
unique()
count()
value_counts()
Метод использования nunique() быстрее чем...?
len(unique())
value_counts()
duplicated()
head()
Какой код правильно показывает получение количества уникальных значений в столбце ‘Company’?
df_laptops[‘Company’].nunique()
df_laptops['Company'].unique()
df_laptops['Company'].count()
df_laptops.value_counts('Company')
Какой код фильтрует DataFrame: ноутбуки от Apple ИЛИ DeLL?
df_laptops[(df_laptops[‘Company’] == ‘Apple’) | (df_laptops[‘Company’] == ‘Dell’)]
df_laptops[(df_laptops['Company'] == 'Apple') & (df_laptops['Company'] == 'Dell')]
df_laptops[df_laptops['Company'].isin('Apple', 'Dell')]
df_laptops['Company'].isin(['Apple', 'Dell'])
