INTR: Основы Hadoop: Вебинар

Курс "Основы Hadoop" представляет сокращенную версию курса "Администрирование кластера Hadoop" и проводится параллельно с данным курсом в 3 дня, согласно утвержденной программе, на платформе Cloudera, HortonWorks или ArenaData Hadoop по выбору.
IT: Информационные системы: ERP, CRM
Коммерсант логоКоммерсант
18 июля 2022
24 часа
Москва
Коммерсант
от 60 000 ₽

Анонс программы

Курс "Основы Hadoop" представляет сокращенную версию курса "Администрирование кластера Hadoop" и проводится параллельно с данным курсом в 3 дня, согласно утвержденной программе, на платформе Cloudera, HortonWorks или ArenaData Hadoop по выбору.

Целевая аудитория

Системные администраторы, системные архитекторы, разработчики Hadoop, желающие получить теоретические знания и практические навыки по установке, настройке и использованию кластера Hadoop с использованием дистрибутивов Cloudera и HortonWorks.

Преподаватель

Николай Комиссаренко

Описание Программы

  1. Основы Hadoop и Big Data

    • Что такое Big Data. Понимание проблемы Big Data. Эволюция систем распределенных вычислений Hadoop. Концепция Data Lake.
  2. Архитектура Apache Hadoop

    • Hadoop сервисы и основные компоненты: Name node, Data Node, YARN, HDFS.
    • Отказоустойчивость и высокая доступность.
    • Batch процессинг.
    • Потоковая обработка
  3. Распределенная файловая система HDFS

    • Основы HDFS: Блоки HDFS. Основные команды работы с HDFS. Операции чтения и записи, назначения HDFS. Дисковые квоты.
    • Архитектура HDFS. Управление репликацией. Политики гибридного хранения данных HDFS.
    • Основные форматы хранения данных TXT, AVRO, ORC, Parquet, Sequence файлы.
    • Влияние компрессии на производительность. Кодеки компрессии.
    • Импорт(загрузка) данных на HDFS
  4. MapReduce

    • Ведение в MapReduce. Компоненты MapReduce. Работа программ MapReduce. YARN MapReduce v2. Ограничения и параметры MapReduce и YARN. Управление запуском пользовательских задач (jobs) под MapReduce.
  5. Установка кластера Hadoop

    • Установка Hadoop кластера.
    • Выбор начальной конфигурации.
    • Оптимизация уровня ядра для узлов.
    • Оптимизация Java, JVM, Heap size, Garbage Collection
    • Начальная конфигурация HDFS и MapReduce.
    • Файлы логов и конфигураций.
    • Настройка подключений Hadoop клиентов.
    • Установка кластера Hadoop в облаке.
    • Особенности настройки кластера Hadoop на физическом сервере (on-premises)
    • Топология кластера Hadoop
    • Tiering — многоуровневое хранение данных (Cold, Warm,Hot, RAM disk). Storage policy — полтиики хранения. Метки конфигураций узлов. RACK awareness.
  6. Архитектура YARN — планировщик и менеджер ресурсов

    • Поиск узких мест. Производительность. Файловая система. Data Node. Сетевая производительность.
    • FIFO scheduler
    • Capacity scheduler (Планировщик по мощности)
    • Fair scheduler (Гранулярное управление ресурсами)
    • Защита очередей и доминантное управление ресурсами DRF
  7. Инструментарий Hadoop экосистемы

    • Графический интерфейс сервиса HUE/Zeppelin
    • Базовые операции в Apache Pig
    • Использование Apache Hive для доступа к данным на HDFS по SQL интерфейсу, понятие Hive таблицы, HiveQL — базовый синтаксис.
    • Импорт и экспорт SQL таблиц с применением Apache sqoop
    • Настройка агентов для управления потоковыми операциями с Apache Flume
    • Базовые операции в Apache Spark

Примерный список практических занятий для курса "Основы Hadoop":

  • Установка 3х-узлового кластера в облаке Amazon Web Services с использованием Cloudera Manager/Apache Ambari
  • Базовые операции обслуживания кластера Hadoop и файловые операции HDFS
  • Управление ресурсами и запуском задач с использованием YARN и MapReduce
  • ETL операции преобразования с использованием Apache Pig
  • Знакомство с SQL интерфейсом доступа Apache Hive
  • Выполнение базовых операций импорта/экспорта с применением Apache sqoop
  • Настройка агента потоковой обработки Apache Flume(опционально)
  • Применение веб-интерфейса HUE/Zeppelin (опционально)

Соотношение теории к практике 50/50

Записаться на курс
INTR: Основы Hadoop: Вебинар
60 000
Заполните контактные данные
Оставьте заявку, чтобы забронировать себе место.
Наш менеджер свяжется с вами и ответит на любые ваши вопросы.
18 июля 2022
24 часа
Москва
Коммерсант
от 60 000 ₽
Как добраться?
Москва, Коммерсант