Анализ больших данных: зачем он нужен и кто им занимается
Сегодня тысячи компаний собирают и хранят большие данные о поведении своих клиентов, ассортименте, состоянии производства и других вещах, важных для бизнеса. Но чтобы принимать взвешенные решения на основе данных, просто собирать их недостаточно — нужен еще грамотный анализ. Рассмотрим, что же включает в себя анализ больших данных и какие инструменты для этого можно использовать.
- Что такое анализ больших данных
- Сбор и хранение больших данных
- Технологии анализа и использования больших данных
- Инструменты для анализа больших данных
- Профессии в сфере анализа данных
Что такое анализ больших данных
Чёткого определения того, какие данные считать большими, не существует. Нет какого-то предела объёма, после которого обычные данные превращаются в большие. Но обычно речь идёт как минимум о сотнях гигабайт и сотнях тысяч строк в базах данных. Ещё большие данные, как правило, регулярно пополняются, обновляются и изменяются, то есть их не только хранят, но и активно собирают.
Итак, мы собрали большие данные и сохранили их. Но в таком виде это просто набор информации, который не способен принести никакой пользы. Чтобы польза была, необходим анализ больших данных — их структурирование и обработка по специальным алгоритмам с целью сделать определённые выводы.
Например, у нас есть гипермаркет, в котором люди покупают определённые продукты. Большие данные — это сама информация о покупках: какие именно товары берут люди, как часто, в каких количествах. Анализ больших данных — это изучение этой информации, чтобы понять, каких товаров стоит закупать больше, а какие лучше вообще вывести из ассортимента. То есть в данной ситуации анализ больших данных подразумевает изучение информации о товарах с целью получения результатов, которые могут помочь компании в развитии.
Материал по теме:
Что такое Big Data и как они устроены
Сбор и хранение больших данных
Существует множество источников больших данных для дальнейшей работ. Например:
● Статистика поведения пользователей на сайте и в приложении. Какие страницы они посещают, как долго выбирают товар, какие разделы изучают внимательнее всего.
● Данные о продажах с касс и из CRM. Что именно и на какую сумму люди покупают.
● Информация с датчиков на оборудовании. Как работают станки в цеху, какая температура поддерживается в помещении, какие каналы человек включает на умном телевизоре.
● Социальные опросы. Данные о семейном положении, возрасте, предпочтениях в еде и т. п.
● Данные из медицинских карт. Информация о состоянии здоровья пациентов.
● Записи с камер видеонаблюдения. Возраст и пол людей, их примерный поток в разное время дня, маршруты по торговому залу.
● Сборная информация из разных баз данных. Мы берём несколько баз с «маленькими» данными и собираем всё в одном месте, превращая данные в большие.
После сбора данные необходимо где-то хранить для последующего анализа. Есть три группы мест для хранения.
Базы данных (БД). Их используют для хранения как малых, так и больших данных. В базах хранятся чётко структурированные данные, разложенные по полочкам. Данные из баз проще анализировать, но для хранения их нужно предварительно очищать и структурировать. Это отнимает время и может привести к потере данных, которые пока кажутся бессмысленными, но могут стать полезными в будущем.
Для хранения big data обычно используют:
● Классические реляционные БД: MySQL, PostgreSQL, Oracle. Они надёжные, но плохо масштабируются, поэтому не подходят для огромных массивов данных, которые часто обновляются.
● Нереляционные БД: MongoDB, Redis. Такие БД менее надёжные, но гораздо более гибкие.
Хранилище данных. Это сложная система хранения из нескольких баз данных и инструментов для их обработки и структурирования. Часто она также включает в себя сервисы для проведения анализа данных и их визуализации для пользователей.
Для построения хранилищ данных часто используют Greenplum, ClickHouse.
Озеро данных. Это большое хранилище, в котором лежит много «сырой», неструктурированной информации. Туда можно загружать любые данные, чтобы потом их извлекать, анализировать и использовать в бизнесе. Анализировать их потом сложнее, зато при загрузке никакой анализ и структурирование не нужны.
Для построения озёр данных обычно используют Hadoop.
Часто озёра используют вместе с хранилищами или базами данных. Сначала все данные сгружают в озеро, а потом извлекают из него по определённым критериям, структурируют и кладут уже в хранилище или базу.