Раскопки сокрытых данных

Опубликовано: 3 февраля 2005 г., четверг
Если вы видели ролики из рекламной кампании IBM под лозунгом "Решение для небольшой планеты", то не могли не обратить внимания на одетые с иголочки манекены, рассуждающие о прелестях добычи данных (data mining). В их устах добыча данных оказывается так же проста, как работа с электронными таблицами. Шумихи вокруг добычи данных ничуть не меньше, чем в свое время вокруг искусственного интеллекта и систем автоматизированного проектирования. Разница только в том, что первые два направления развивались преимущественно небольшими поставщиками, а в рассматриваемом нами случае бразды правления держат такие гиганты, как IBM и AT&T. Однако, несмотря на участие последних, добыча данных - это всего только формирующийся сектор рынка. Он настолько незрел, что поставщики и эксперты не выработали даже определения добычи данных. Наибольшим успехом добыча данных пользуется у реселлеров, использующих ее для выявления ранее необнаруженных образцов в заказах своих клиентов. Например, работающие с кредитными карточками компании, определив клиентов, купивших купальный костюм и записавшихся на уроки подводного плавания, посылают им затем купоны для получения скидки при путешествии на Карибы. Сеть универсальных магазинов, проанализировав покупательские корзины, приходит к выводу, что покупающие косметику покупают вместе с ней и поздравительные открытки. В результате им удается увеличить продажу и косметики, и открыток за счет того, что оба вида товаров теперь продаются в одном отделе. Каждый из этих информационных "самородков" помогает "добытчикам" увеличить прибыль, повысить уровень обслуживания клиентов и, следовательно, добиться преимущества в конкурентной борьбе. Проект для добычи Мощные системы добычи данных не терпят ошибок в проекте. Даже небольшая избыточность и неэффективность ведет к образованию заторов при опросе многогигабайтных или терабайтных хранилищ данных сложными многомерными запросами. Параллельная обработка - это краеугольный камень для создания успешной системы добычи данных. Так как каждый запрос запрашивает данные из различных хранилищ, обрабатывает их с использованием устройств ввода/вывода, а также выполняет итеративную сортировку и объединение, то последовательные процессоры возвращают ответ на запрос только через несколько дней или недель, если вообще это делают. Параллельные процессоры же разделяют запросы на крохотные куски и затем распределяют их между несколькими ЦПУ, извлекающими информацию параллельно. Появление сравнительно недорогих систем параллельной обработки дало возможность поставщикам повысить сложность программного обеспечения добычи данных. Благодаря параллельной обработке многие приложения для добычи данных стали ставить многомерные запросы, например: продажа сезонных товаров в северовосточном регионе в ноябре месяце [деятельность, товар, география, период времени]. Здравомыслящие проектировщики сетей структурируют обычно сети для добычи данных одним из двух способов: либо они используют большой центральный сервер для хранения данных и обращаются к нужным секторам данных только для обработки, либо они извлекают компоненты из складов данных и передают нужные части в меньшие вместилища данных. Типичная конфигурация дает возможность пользователям генерировать запросы с рабочей станции, затем запросы посылаются по локальной сети (обычно в виде того или иного запроса на SQL) суперсерверу, осуществляющему анализ и возвращающему ответ. Большинство проектировщиков сетей делят данные. Некоторые используют специализированные небольшие склады данных, называемые ярмарками данных, или даже меньшие копи данных. Эти хранилища подразделяют данные в зависимости от назначения (например, инвентарные данные) или по имени заказчика (например, по заказчикам, фамилии которых начинаются с буквы "А"). Это позволяет осуществлять добычу данных в меньших объемах данных, экономя время и затраты на обработку. Кое-где ярмарки данных, первоначально оптимизированные для добычи, затем подразделяются в соответствии с назначением. Каждая группа в корпорации использует отдельное хранилище данных, предоставляемое центральным хранилищам данных или даже более крупным ярмаркам данных. Подразделение по добыче данных в IBM рекомендует классическую трехзвенную логическую архитектуру для поддержки приложения по добыче данных. При этой схеме клиент запускает приложения и графически представляет результаты добычи данных. Сервер приложений, сердце приложения по добыче данных, хранит относящуюся к бизнесу и приложениям информацию и обрабатывает данные при помощи специально спроектированных инструментов. Сервер данных хранит оперативные и суммарные данные. "Большинство пользователей обращаются к 20% информации из базы данных в 80% случаев, - говорит Донна Рубен, менеджер по технологиям складирования данных в Sun. - Зная это, администраторы сетей могут выбрать инструмент с быстрым доступом к часто требуемым данным". Гигабайт за гигабайтом Если вы уж взялись за добычу данных, то, предупреждает Рубин, обратного пути нет. "Это как наркотик - с каждым разом хочется все больше", - говорит она. Учитывая вероятность "склонности к употреблению" сетевых пользователей, администратору локальной сети необходимо аккуратно спланировать наращивание приложений для добычи данных, но как это сделать? При первом знакомстве со средствами добычи данных большинство администраторов локальных сетей интересуются организацией оперативного доступа к накопленным рабочим данным. Некоторые администраторы обнаруживают, что данные содержат больше ошибок или повторений, чем ожидалось, быстро осознают, что они недооценили общий объем данных для оперативного доступа. Сейлор из MicroStrategy рассказал одну печальную историю о клиенте, который решил, что массив данных в 20 Гбайт вполне удовлетворит потребности его узла в добыче данных. Однако после начала добычи, массив данных удваивался каждые шесть недель и вскоре достиг 500 Гбайт. Если хорошо продумать первоначальный план, то с таким ростом справиться довольно легко. Сейлор советует администраторам локальных сетей не помещать 500 Гбайт данных на склад и надеяться добыть их оттуда, а нанять опытного консультанта, способного помочь в создании пилотного проекта размером в одну десятую - одну двенадцатую от ожидаемого объема операций по добыче данных.
Источник: olap.ru
Копировать, распространять, публиковать информацию портала News.lt без письменного согласия редакции запрещено.

Комментарии Facebook

Новый комментарий


Captcha

статьи по схожей тематике

Adata выпустила USB-накопители в новогоднем дизайне

Компания Adata Technology представила флеш-накопитель UV100F, предназначенный для новогоднего сезона. дальше »

HUAWEI представил первый смартфон с двумя двойными камерами и безрамочным дисплеем

HUAWEI Consumer Business Group представил многофункциональный и производительный смартфон HUAWEI nova 2i – новейшее пополнение известной серии nova. дальше »

Datalogic представила новое Android-устройство Joya Touch для здравоохранения

Компания Datalogic, которая специализируется на автоматическом сборе данных и промышленной автоматизации, объявила о выпуске нового устройства для здравоохранения Joya Touch A6 Healthcare. дальше »

Моноблок Acer Aspire U5-620 для комфортной работы и отдыха

Acer Aspire U5-620 - моноблочный компьютер универсального назначения для широкого круга пользователей. дальше »

Новейший Moto Mod превратит смартфон Moto Z в камеру Polaroid (1)

ДДля смартфонов Moto Z уже выпущено множество модульных устройств, таких как зарядное устройство, акустическая система, проектор и камера. дальше »

Разработчик Pokemon Go готовит игру по вселенной Гарри Поттера

Студия Niantic Labs, разработавшая популярное мобильное приложение Pokemon Go влетом прошлого года, заявила о планах выпуска аналогичной игры по вселенной «Гарри Поттера». дальше »

Представлены новые селфи-телефоны Xiaomi Redmi Y1 и Y1 Lite

Китайская компания Xiaomi представила в Нью-Дели новую серию смартфонов в бюджетной линейке Redmi для любителей селфи. дальше »

Amazon на вершине славы

По данным опроса, проведенного The Verge в партнерстве с консалтинговой фирмой Reticle Research, Amazon признан самым надежным и популярным технологическим брендом, а не его конкуренты Apple и Google по выпуску умных домашних устройств. дальше »

ECS выпустила самый миниатюрный неттоп в мире

Компания Elitegroup Computer System (ECS) анонсировала новый настольный компьютер LIVA Q с функцией воспроизведения видео разрешения 4K. дальше »

Intel и AMD выпустят совместный процессор

Слухи о том, что компания Intel планирует лицензировать графическое ядро AMD для использования его в своих процессорах, ходили уже давно, и вот наконец-то они нашли своё подтверждение. дальше »