1. Онлайн-ритейлер применяет методы интеллектуального анализа данных (Data Mining) для прогнозирования спроса на товары. В качестве одного из инструментов используется модель временных рядов ARIMA. Прогнозирование проводится по данным за последние два года. Какие действия необходимо выполнить для корректной подготовки данных? (Укажите 3 варианта ответа).
2. Финансовая компания внедряет интеллектуальную систему для автоматического выявления мошеннических транзакций. Используется метод классификации с обучением, и данные обрабатываются в режиме реального времени. Данные включают числовые и категориальные признаки, такие как сумма, страна, тип транзакции. Какие шаги следует выполнить для обеспечения эффективности модели? (Укажите 3 варианта ответа).
3. Аналитик работает над проектом по предсказанию цен на недвижимость. Была выбрана задача прогнозирования с использованием методов регрессии. В качестве признаков используются площадь, число комнат, район и тип жилья. Рассматриваются разные модели: линейная регрессия, случайный лес и градиентный бустинг. Какие шаги необходимо выполнить для повышения качества модели прогнозирования? (Укажите 3 варианта ответа).
4. Компания анализирует эффективность моделей классификации, применяемых к задачам фильтрации спама. Используются наивный байесовский классификатор, логистическая регрессия и случайный лес. Результаты оценивались по метрикам: точность (precision), полнота (recall), F1-мера и ROC-AUC. Охарактеризуйте данные метрики и рекомендации по их применению. (Укажите 3 варианта ответа).
5. Финансовая организация использует стандарт CRISP-DM как основу для построения модели предсказания дефолта по кредитам. На этапе подготовки данных проводятся очистка, кодирование категориальных признаков и нормализация числовых переменных. Охарактеризуйте выполняемые действия в соответствии со стандартом CRISP-DM. (Укажите 3 варианта ответа).
6. Компания готовит данные для построения модели предсказания продаж. В исходной таблице содержатся пропущенные значения, дубликаты, различные форматы дат и нестандартные номера телефонов. Какие действия необходимо предпринять для корректной очистки данных? (Укажите 4 варианта ответа).
7. В маркетинговом агентстве используется среда RapidMiner для сегментации клиентов по поведенческим признакам. Применяется алгоритм K-means. После выполнения анализа необходимо интерпретировать сегменты и определить ключевые характеристики каждой группы. Что следует учесть при работе с результатами кластеризации? (Укажите 3 варианта ответа).
8. Компания разрабатывает систему автоматического подбора моделей машинного обучения для бизнес-приложений. В рамках проекта используется такая AutoML-платформа, как Google AutoML Цель — упростить построение моделей и минимизировать участие специалиста в подборе параметров. Какие преимущества и ограничения следует учитывать при использовании автоматизированного машинного обучения AutoML? (Укажите 4 варианта ответа).
9. Компания использует технологии OLAP и Data Mining для анализа продаж и выявления скрытых закономерностей. OLAP-кубы применяются для многомерного анализа, а интеллектуальный анализ данных (Data Mining) – для построения прогностических моделей. Охарактеризуйте использование данных технологий. (Укажите 3 варианта ответа).
10. Ритейлер внедряет BI- и KM-системы для улучшения бизнес-аналитики и управления знаниями. BI-система используется для визуализации данных и отчетности, а KM-система – для хранения инструкций и аналитических материалов. Охарактеризуйте использование данных систем. (Укажите 3 варианта ответа).
11. Установите соответствие между типами наборов данных и их примерами:
12. Упорядочьте данные по убыванию объема (от наиболее к наименее объемным):
13. Наиболее важными аспектами в предобработке данных являются такие, как … (укажите 2 варианта ответа)
14. Пример технических метаданных: …
15. Один из популярных форматов хранения структурированных данных, представляющий собой текстовый файл с разделителями, является… (обозначается английской аббревиатурой)
16. Установите соответствие между компонентами рынка интеллектуальных технологий и их функциями:
17. Одним из вызовов интеллектуального анализа данных (Data Mining) является …
18. Установите соответствие между видами данных и их описаниями:
19. Расположите в правильной последовательности этапы работы с данными:
20. Установите соответствие между задачами анализа данных и примерами их реализации:
21. Установите правильную последовательность применения метрик в оценке модели классификации:
22. Показателем качества кластеризации, учитывающим расстояние до центра своего и ближайшего чужого кластера, является индекс …
23. Не требует указания числа кластеров до начала кластеризации алгоритмов
24. Установите соответствие между методами анализа данными и их характеристиками:
25. Примером задач, относящихся к прогнозированию, является …
26. В числе методов, применяемых в анализе временных рядов, – … (укажите 2 варианта ответа)
27. ROC-кривая отражает зависимость между чувствительностью и … срабатываниями
28. Основное требование к качественной визуализации данных –…
29. Установите соответствие между этапами построения модели и необходимыми для этого действиями:
31. Для визуального построения ETL-процессов используются такие инструменты, как … (укажите 2 варианта ответа)
32. CRISP-DM относится к категории стандартов … анализа данных
33. … – это метод оценки модели, основанный на разделении данных на обучающие и тестовые выборки
34. Установите соответствие между инструментами и их применением:
35. Примером задач, в которых применяются стандарты интеллектуального анализа данных (Data Mining), является …
36. Метрики для оценки регрессионной модели используются такие метрики, как … (укажите 2 варианта ответа)
37. Особенностью этапа оценки модели в CRISP-DM является проверка … модели и ее соответствия бизнес-целям
38. Требованием к итоговой модели перед внедрением является …
39. Установите соответствие между задачами и примерами инструментов, предназначенных для их выполнения:
40. Установите правильную последовательность внедрения инструмента Data Mining в бизнес-процесс:
41. В числе инструментов с открытым исходным кодом (open-source) с интерфейсом drag-and-drop – … (укажите 2 варианта ответа)
42. … – это программная платформа для анализа данных и машинного обучения; эта среда позволяет применять алгоритмы FP-Growth и Apriori
43. Сервис, поддерживающий генерацию пайплайнов с помощью генетических алгоритмов, – …
44. Установите соответствие между библиотеками и их основными возможностями:
45. … – это инструмент, ориентированный на анализ временных рядов и интеграцию с Jupyter Notebook …
46. В ряду примеров облачных решений для автоматизации анализа данных – … (укажите 3 варианта ответа)
47. … — это утилита, реализующая подход «визуальное программирование» и поддерживающая построение процессов …
48. … – это платформа, позволяющей строить аналитические пайплайны без программирования:
49. Установите соответствие между направлениями и примерами применения интеллектуальных технологий в этих направлениях:
50. Расположите архитектуры OLAP-систем в порядке возрастания степени гибкости:
51. – это облачное хранилище данных (укажите 2 варианта ответа)
52. Главная цель аналитической обработки данных в бизнесе – это извлечение … и оптимизация процессов
53. OLAP-куб позволяет …
54. Установите соответствие между задачами и технологиями, которые используются для их выполнения:
55. Одним из признаков хорошо организованного хранилища данных является поддержка … данных, то есть данных, относящихся к прошлым и, возможно, к будущим периодам времени
56. Технология, применяемая для семантического анализа текста …
57. Основным преимуществом BI-системы для компании является …
58. Хранилище Data Warehouse (DWH), в отличие от OLTP-систем, ориентировано на … и отчетность
59. «Проклятие » — это проблема разрастания количества данных, связанная с высокоразмерными данными и ростом числа признаков
60. Существуют такие методы визуализации многомерных данных, как … (укажите 2 варианта ответа)
61. … – это система, обеспечивающая анализ данных и построение отчетов для принятия бизнес-решений
62. … – это созданная компанией Atlassian платформа, ориентированная на управление корпоративными знаниями и совместную работу
63. Установите соответствие между системами и их функциями:
64. Расположите в правильной последовательности этапы применения интеллектуального анализа данных (Data Mining) в бизнес-задаче:
65. Интеллектуальный анализ данных (Data Mining) активно используется в сфере … (укажите 2 варианта ответа)
66. Пример применения интеллектуального анализа данных (Data Mining) в банковской сфере – …
67. Применение алгоритма K-Means чаще всего связано с задачей … клиентов
68. Консалтинговая компания, предоставляющая решение задач интеллектуального анализа данных (Data Mining) на базе байесовской классификации, – …
69. Основное преимущество обращения к консалтингу в сфере интеллектуального анализа данных (Data Mining), – это …
70. Сервис, известный публикациями по методологиям интеллектуального анализа данных (Data Mining), – …
71. Банк внедряет систему интеллектуального анализа данных для прогнозирования оттока клиентов. В процессе используются алгоритмы машинного обучения, такие как случайный лес и XGBoost. Оценка моделей производится по метрикам ROC-AUC и F1-score. Охарактеризуйте построение модели прогнозирования оттока клиентов. (Укажите 3 варианта ответа).
72. … – это программный инструмент, предлагающий алгоритмы машинного обучения и визуальный интерфейс для работы с данными
73. Scikit-learn – это … машинного обучения на языке программирования Python
74. Установите соответствие между платформами и их характеристиками:
75. Установите правильный порядок этапов работы в Weka:
76. К AutoML-системам относятся такие инструменты, как … (укажите 2 варианта)
77. Решение … ориентировано на обработку данных с GPU и использование по работе с большими данными (Big Data)
78. Инструмент, предоставляющий модули для поиска ассоциативных правил и визуализации результатов, – …
80. В числе критериев выбора инструментов Data Mining – … (укажите 3 варианта ответа)
81. Примером программного средства, ориентированного на разработчиков с использованием Python, является … – фреймворк машинного обучения с открытым исходным кодом, разработанный компанией Facebook
82. Аналитик в образовательной организации использует инструмент KNIME для классификации данных об успеваемости студентов. В наборе содержатся числовые и категориальные признаки, включая оценки, посещаемость и форму обучения. Перед обучением модели применяются преобразование категориальных признаков и нормализация числовых данных. Охарактеризуйте подготовку данных и их классификацию. (Укажите 3 варианта ответа).
83. … – это извлечение данных с веб-страниц с помощью кода и парсинга HTML
84. Название метода оптическое распознавание символов, т.е. извлечения текста из изображений и сканов, обозначается английской аббревиатурой …
85. Установите соответствие между источниками данных и методами извлечения данных:
86. Установите правильный порядок подготовки к извлечению данных:
87. Существуют такие методы работы с неструктурированными текстами, как … (укажите 2 варианта ответа)
88. Преобразование категориальных переменных в числовой формат выполняется с помощью …
89. Один из признаков дубликатов данных – …
90. Английское название метода для нормализации числовых признаков перед обучением модели – …
91. При очистке данных используются такие инструменты библиотеки Pandas, как … (укажите 3 варианта ответа)
92. Условием, при котором выброс в данных может быть оставлен без удаления, является то, что этот выброс …
93. Компания анализирует отзывы пользователей на своем сайте с целью определить тональность комментариев и выявить ключевые проблемы. Для этого используются методы обработки естественного языка (NLP) и библиотека TextBlob. Охарактеризуйте анализ тональности текста и использование методов NLP и библиотеки TextBlob. (Укажите 3 варианта ответа).
94. Отнесение объекта к категории «спам» или к категории «не спам» относится к задаче …
95. Метод k-ближайших соседей определяет … объекта на основе наиболее распространенных среди его k ближайших соседей
96. Установите соответствие между методами и их описаниями:
97. Расположите в правильной последовательности этапы классификации данных:
98. Ансамблевые подходы включают такие методы, как … (укажите 2 варианта ответа)
99. Наивный байесовский классификатор характеризует такой признак, как …
100. Метод, наиболее чувствительный к шуму в выборке, – …
101. Применение гиперплоскостей для разделения классов характерно для метода опорных … (SVM)
102. Градиентный бустинг часто применяется при … (укажите 2 варианта ответа)
103. Признаком переобучения дерева решений является …
104. Онлайн-магазин собирает данные о покупательской активности пользователей для анализа. Аналитик использует метод k-ближайших соседей (k-NN) для классификации новых пользователей как активных или неактивных. Перед запуском классификации проводится предварительная обработка данных, включая нормализацию признаков и удаление пропусков. Охарактеризуйте метод k-NN. (Укажите 2 варианта ответа).
105. Data Mining – это …
106. Один из ключевых этапов процесса извлечения знаний из баз данных (KDD), в рамках которого применяются алгоритмы для поиска закономерностей, – это … данных
107. Установите соответствие между методами анализа данных и их описанием:
108. Расположите в правильной последовательности этапы процесса извлечения знаний из баз данных (KDD):
109. … – это инструмент, предназначенный для визуального анализа данных без необходимости программирования
110. В числе задач интеллектуального анализа данных (Data Mining) при анализе временных рядов – … (укажите 2 варианта ответа)
111. «… размерности» – это проблема разрастания количества данных, связанная с высокоразмерными данными и ростом числа признаков
112. Интеллектуальный анализ данных (Data Mining) активно применяется в … (укажите 3 варианта ответа)
113. Характеристика интеллектуального анализа данных (Data Mining), которая позволяет использовать его для предсказания будущих событий, – …
114. Компания использует данные о покупательском поведении для анализа и разработки персонализированных рекомендаций товаров. В ходе анализа были выявлены следующие категории клиентов: «часто покупающие», «покупатели по акциям», «редкие покупатели». Для анализа был применен алгоритм кластеризации K-Means. Перед кластеризацией данные были нормализованы. Как можно охарактеризовать процессы кластеризации и подготовки данных? (Укажите 2 варианта ответа).
115. В основе интеллектуального анализа данных (Data Mining) лежат такие ключевые технологии, как … (укажите 2 варианта ответа)