Анализ больших данных: что это, суть и цели — методы и технологии сбора и анализа big data, инструменты обработки данных

Анализ больших данных: зачем он нужен и кто им занимается Сегодня тысячи компаний собирают и хранят большие данные о поведении своих клиентов, ассортименте, состоянии […]

Анализ больших данных: зачем он нужен и кто им занимается

Сегодня тысячи компаний собирают и хранят большие данные о поведении своих клиентов, ассортименте, состоянии производства и других вещах, важных для бизнеса. Но чтобы принимать взвешенные решения на основе данных, просто собирать их недостаточно — нужен еще грамотный анализ. Рассмотрим, что же включает в себя анализ больших данных и какие инструменты для этого можно использовать.

  • Что такое анализ больших данных
  • Сбор и хранение больших данных
  • Технологии анализа и использования больших данных
  • Инструменты для анализа больших данных
  • Профессии в сфере анализа данных

Что такое анализ больших данных

Чёткого определения того, какие данные считать большими, не существует. Нет какого-то предела объёма, после которого обычные данные превращаются в большие. Но обычно речь идёт как минимум о сотнях гигабайт и сотнях тысяч строк в базах данных. Ещё большие данные, как правило, регулярно пополняются, обновляются и изменяются, то есть их не только хранят, но и активно собирают.

Итак, мы собрали большие данные и сохранили их. Но в таком виде это просто набор информации, который не способен принести никакой пользы. Чтобы польза была, необходим анализ больших данных — их структурирование и обработка по специальным алгоритмам с целью сделать определённые выводы.

Например, у нас есть гипермаркет, в котором люди покупают определённые продукты. Большие данные — это сама информация о покупках: какие именно товары берут люди, как часто, в каких количествах. Анализ больших данных — это изучение этой информации, чтобы понять, каких товаров стоит закупать больше, а какие лучше вообще вывести из ассортимента. То есть в данной ситуации анализ больших данных подразумевает изучение информации о товарах с целью получения результатов, которые могут помочь компании в развитии.

Материал по теме:
Что такое Big Data и как они устроены

Сбор и хранение больших данных

Существует множество источников больших данных для дальнейшей работ. Например:

Статистика поведения пользователей на сайте и в приложении. Какие страницы они посещают, как долго выбирают товар, какие разделы изучают внимательнее всего.

Данные о продажах с касс и из CRM. Что именно и на какую сумму люди покупают.

Информация с датчиков на оборудовании. Как работают станки в цеху, какая температура поддерживается в помещении, какие каналы человек включает на умном телевизоре.

Социальные опросы. Данные о семейном положении, возрасте, предпочтениях в еде и т. п.

Данные из медицинских карт. Информация о состоянии здоровья пациентов.

Записи с камер видеонаблюдения. Возраст и пол людей, их примерный поток в разное время дня, маршруты по торговому залу.

Сборная информация из разных баз данных. Мы берём несколько баз с «маленькими» данными и собираем всё в одном месте, превращая данные в большие.

После сбора данные необходимо где-то хранить для последующего анализа. Есть три группы мест для хранения.

Базы данных (БД). Их используют для хранения как малых, так и больших данных. В базах хранятся чётко структурированные данные, разложенные по полочкам. Данные из баз проще анализировать, но для хранения их нужно предварительно очищать и структурировать. Это отнимает время и может привести к потере данных, которые пока кажутся бессмысленными, но могут стать полезными в будущем.

Для хранения big data обычно используют:

● Классические реляционные БД: MySQL, PostgreSQL, Oracle. Они надёжные, но плохо масштабируются, поэтому не подходят для огромных массивов данных, которые часто обновляются.

● Нереляционные БД: MongoDB, Redis. Такие БД менее надёжные, но гораздо более гибкие.

Хранилище данных. Это сложная система хранения из нескольких баз данных и инструментов для их обработки и структурирования. Часто она также включает в себя сервисы для проведения анализа данных и их визуализации для пользователей.

Для построения хранилищ данных часто используют Greenplum, ClickHouse.

Озеро данных. Это большое хранилище, в котором лежит много «сырой», неструктурированной информации. Туда можно загружать любые данные, чтобы потом их извлекать, анализировать и использовать в бизнесе. Анализировать их потом сложнее, зато при загрузке никакой анализ и структурирование не нужны.

Для построения озёр данных обычно используют Hadoop.

Часто озёра используют вместе с хранилищами или базами данных. Сначала все данные сгружают в озеро, а потом извлекают из него по определённым критериям, структурируют и кладут уже в хранилище или базу.

Средний рейтинг
0 из 5 звезд. 0 голосов.

Редакционный дайджест

Один полезный разбор каждую неделю

Новые инструкции, сравнения и разборы появляются в тематических рубриках журнала.

Выбрать тему