Раскопки сокрытых данных

Опубликовано: 3 февраля 2005 г., четверг
Если вы видели ролики из рекламной кампании IBM под лозунгом "Решение для небольшой планеты", то не могли не обратить внимания на одетые с иголочки манекены, рассуждающие о прелестях добычи данных (data mining). В их устах добыча данных оказывается так же проста, как работа с электронными таблицами. Шумихи вокруг добычи данных ничуть не меньше, чем в свое время вокруг искусственного интеллекта и систем автоматизированного проектирования. Разница только в том, что первые два направления развивались преимущественно небольшими поставщиками, а в рассматриваемом нами случае бразды правления держат такие гиганты, как IBM и AT&T. Однако, несмотря на участие последних, добыча данных - это всего только формирующийся сектор рынка. Он настолько незрел, что поставщики и эксперты не выработали даже определения добычи данных. Наибольшим успехом добыча данных пользуется у реселлеров, использующих ее для выявления ранее необнаруженных образцов в заказах своих клиентов. Например, работающие с кредитными карточками компании, определив клиентов, купивших купальный костюм и записавшихся на уроки подводного плавания, посылают им затем купоны для получения скидки при путешествии на Карибы. Сеть универсальных магазинов, проанализировав покупательские корзины, приходит к выводу, что покупающие косметику покупают вместе с ней и поздравительные открытки. В результате им удается увеличить продажу и косметики, и открыток за счет того, что оба вида товаров теперь продаются в одном отделе. Каждый из этих информационных "самородков" помогает "добытчикам" увеличить прибыль, повысить уровень обслуживания клиентов и, следовательно, добиться преимущества в конкурентной борьбе. Проект для добычи Мощные системы добычи данных не терпят ошибок в проекте. Даже небольшая избыточность и неэффективность ведет к образованию заторов при опросе многогигабайтных или терабайтных хранилищ данных сложными многомерными запросами. Параллельная обработка - это краеугольный камень для создания успешной системы добычи данных. Так как каждый запрос запрашивает данные из различных хранилищ, обрабатывает их с использованием устройств ввода/вывода, а также выполняет итеративную сортировку и объединение, то последовательные процессоры возвращают ответ на запрос только через несколько дней или недель, если вообще это делают. Параллельные процессоры же разделяют запросы на крохотные куски и затем распределяют их между несколькими ЦПУ, извлекающими информацию параллельно. Появление сравнительно недорогих систем параллельной обработки дало возможность поставщикам повысить сложность программного обеспечения добычи данных. Благодаря параллельной обработке многие приложения для добычи данных стали ставить многомерные запросы, например: продажа сезонных товаров в северовосточном регионе в ноябре месяце [деятельность, товар, география, период времени]. Здравомыслящие проектировщики сетей структурируют обычно сети для добычи данных одним из двух способов: либо они используют большой центральный сервер для хранения данных и обращаются к нужным секторам данных только для обработки, либо они извлекают компоненты из складов данных и передают нужные части в меньшие вместилища данных. Типичная конфигурация дает возможность пользователям генерировать запросы с рабочей станции, затем запросы посылаются по локальной сети (обычно в виде того или иного запроса на SQL) суперсерверу, осуществляющему анализ и возвращающему ответ. Большинство проектировщиков сетей делят данные. Некоторые используют специализированные небольшие склады данных, называемые ярмарками данных, или даже меньшие копи данных. Эти хранилища подразделяют данные в зависимости от назначения (например, инвентарные данные) или по имени заказчика (например, по заказчикам, фамилии которых начинаются с буквы "А"). Это позволяет осуществлять добычу данных в меньших объемах данных, экономя время и затраты на обработку. Кое-где ярмарки данных, первоначально оптимизированные для добычи, затем подразделяются в соответствии с назначением. Каждая группа в корпорации использует отдельное хранилище данных, предоставляемое центральным хранилищам данных или даже более крупным ярмаркам данных. Подразделение по добыче данных в IBM рекомендует классическую трехзвенную логическую архитектуру для поддержки приложения по добыче данных. При этой схеме клиент запускает приложения и графически представляет результаты добычи данных. Сервер приложений, сердце приложения по добыче данных, хранит относящуюся к бизнесу и приложениям информацию и обрабатывает данные при помощи специально спроектированных инструментов. Сервер данных хранит оперативные и суммарные данные. "Большинство пользователей обращаются к 20% информации из базы данных в 80% случаев, - говорит Донна Рубен, менеджер по технологиям складирования данных в Sun. - Зная это, администраторы сетей могут выбрать инструмент с быстрым доступом к часто требуемым данным". Гигабайт за гигабайтом Если вы уж взялись за добычу данных, то, предупреждает Рубин, обратного пути нет. "Это как наркотик - с каждым разом хочется все больше", - говорит она. Учитывая вероятность "склонности к употреблению" сетевых пользователей, администратору локальной сети необходимо аккуратно спланировать наращивание приложений для добычи данных, но как это сделать? При первом знакомстве со средствами добычи данных большинство администраторов локальных сетей интересуются организацией оперативного доступа к накопленным рабочим данным. Некоторые администраторы обнаруживают, что данные содержат больше ошибок или повторений, чем ожидалось, быстро осознают, что они недооценили общий объем данных для оперативного доступа. Сейлор из MicroStrategy рассказал одну печальную историю о клиенте, который решил, что массив данных в 20 Гбайт вполне удовлетворит потребности его узла в добыче данных. Однако после начала добычи, массив данных удваивался каждые шесть недель и вскоре достиг 500 Гбайт. Если хорошо продумать первоначальный план, то с таким ростом справиться довольно легко. Сейлор советует администраторам локальных сетей не помещать 500 Гбайт данных на склад и надеяться добыть их оттуда, а нанять опытного консультанта, способного помочь в создании пилотного проекта размером в одну десятую - одну двенадцатую от ожидаемого объема операций по добыче данных.
Источник: olap.ru
Копировать, распространять, публиковать информацию портала News.lt без письменного согласия редакции запрещено.

Комментарии Facebook

Новый комментарий


Captcha

статьи по схожей тематике

Google Pixel внезапно отключается при 30% заряда

Владельцы Nexus 6P жалуются на похожую проблему после установки Android 7.0 Nougat. дальше »

Apple раздает бесплатно головоломку Warp Shift

Компания Apple анонсировала в рамках акции «Приложение недели» раздачу Warp Shift — уникальной головоломки, действие которой разворачивается в таинственном мире. дальше »

Samsung представила колонку в стиле ретро

Пришла очередь Samsung, которая после приобретения Harman не может стоять в стороне от рынка колонок и наушников. Компания представила беспроводную колонку H7 Wireless Speaker. дальше »

Трамп лично попросил Тима Кука перенести производство Apple из Китая в США

Избранный президент США Дональд Трамп рассказал о звонке главы Apple Тима Кука, который поздравил его c победой на выборах. дальше »

Вышел новый смартфон HTC Bolt

Хотя очередной прилив активности покупателей на HTC прямо связан с выпуском линейки смартфонов Pixel, компания HTC недавно анонсировала выпуск нового смартфона Bolt с улучшенными характеристиками и стильным дизайном дальше »

Xiaomi обновит некоторые смартфоны до Android 7.0 Nougat

После выпуска компанией Google очередного обновления, провайдеры сотовых сетей и производители гаджетов готовят свои собственные корректировки, которые очень часто могут задержать выход на несколько месяцев. дальше »

Apple заменит iPhone 7 Plus на новые из-за проблем с камерой

Все владельцы iPhone 7 Plus, столкнувшиеся со аналогичными сбоями в работе камеры, незамедлительно получат бесплатную замену. дальше »

Apple может выпустить смартфон в сотрудничестве с Ferrari

По слухам, компания Apple собирается в будущем году выпустить особую версию iPhone, созданную в сотрудничестве со знаменитым автопроизводителем Ferrari. дальше »

Смартфон Elephone S7 Limited Edition выпущен в ограниченном количестве

Китайская компания Elephone официально выпустил ограниченную версию Elephone S7 Special Edition c 10-тиядерным процессором MTK Helio X25. дальше »

Apple ведет переговоры о производстве продукции в Индии

Wall Street Journal: компания Apple ведет переговоры с индийским правительством о возможном производстве продукции в этой стране. дальше »