Раскопки сокрытых данных

Опубликовано: 3 февраля 2005 г., четверг
Если вы видели ролики из рекламной кампании IBM под лозунгом "Решение для небольшой планеты", то не могли не обратить внимания на одетые с иголочки манекены, рассуждающие о прелестях добычи данных (data mining). В их устах добыча данных оказывается так же проста, как работа с электронными таблицами. Шумихи вокруг добычи данных ничуть не меньше, чем в свое время вокруг искусственного интеллекта и систем автоматизированного проектирования. Разница только в том, что первые два направления развивались преимущественно небольшими поставщиками, а в рассматриваемом нами случае бразды правления держат такие гиганты, как IBM и AT&T. Однако, несмотря на участие последних, добыча данных - это всего только формирующийся сектор рынка. Он настолько незрел, что поставщики и эксперты не выработали даже определения добычи данных. Наибольшим успехом добыча данных пользуется у реселлеров, использующих ее для выявления ранее необнаруженных образцов в заказах своих клиентов. Например, работающие с кредитными карточками компании, определив клиентов, купивших купальный костюм и записавшихся на уроки подводного плавания, посылают им затем купоны для получения скидки при путешествии на Карибы. Сеть универсальных магазинов, проанализировав покупательские корзины, приходит к выводу, что покупающие косметику покупают вместе с ней и поздравительные открытки. В результате им удается увеличить продажу и косметики, и открыток за счет того, что оба вида товаров теперь продаются в одном отделе. Каждый из этих информационных "самородков" помогает "добытчикам" увеличить прибыль, повысить уровень обслуживания клиентов и, следовательно, добиться преимущества в конкурентной борьбе. Проект для добычи Мощные системы добычи данных не терпят ошибок в проекте. Даже небольшая избыточность и неэффективность ведет к образованию заторов при опросе многогигабайтных или терабайтных хранилищ данных сложными многомерными запросами. Параллельная обработка - это краеугольный камень для создания успешной системы добычи данных. Так как каждый запрос запрашивает данные из различных хранилищ, обрабатывает их с использованием устройств ввода/вывода, а также выполняет итеративную сортировку и объединение, то последовательные процессоры возвращают ответ на запрос только через несколько дней или недель, если вообще это делают. Параллельные процессоры же разделяют запросы на крохотные куски и затем распределяют их между несколькими ЦПУ, извлекающими информацию параллельно. Появление сравнительно недорогих систем параллельной обработки дало возможность поставщикам повысить сложность программного обеспечения добычи данных. Благодаря параллельной обработке многие приложения для добычи данных стали ставить многомерные запросы, например: продажа сезонных товаров в северовосточном регионе в ноябре месяце [деятельность, товар, география, период времени]. Здравомыслящие проектировщики сетей структурируют обычно сети для добычи данных одним из двух способов: либо они используют большой центральный сервер для хранения данных и обращаются к нужным секторам данных только для обработки, либо они извлекают компоненты из складов данных и передают нужные части в меньшие вместилища данных. Типичная конфигурация дает возможность пользователям генерировать запросы с рабочей станции, затем запросы посылаются по локальной сети (обычно в виде того или иного запроса на SQL) суперсерверу, осуществляющему анализ и возвращающему ответ. Большинство проектировщиков сетей делят данные. Некоторые используют специализированные небольшие склады данных, называемые ярмарками данных, или даже меньшие копи данных. Эти хранилища подразделяют данные в зависимости от назначения (например, инвентарные данные) или по имени заказчика (например, по заказчикам, фамилии которых начинаются с буквы "А"). Это позволяет осуществлять добычу данных в меньших объемах данных, экономя время и затраты на обработку. Кое-где ярмарки данных, первоначально оптимизированные для добычи, затем подразделяются в соответствии с назначением. Каждая группа в корпорации использует отдельное хранилище данных, предоставляемое центральным хранилищам данных или даже более крупным ярмаркам данных. Подразделение по добыче данных в IBM рекомендует классическую трехзвенную логическую архитектуру для поддержки приложения по добыче данных. При этой схеме клиент запускает приложения и графически представляет результаты добычи данных. Сервер приложений, сердце приложения по добыче данных, хранит относящуюся к бизнесу и приложениям информацию и обрабатывает данные при помощи специально спроектированных инструментов. Сервер данных хранит оперативные и суммарные данные. "Большинство пользователей обращаются к 20% информации из базы данных в 80% случаев, - говорит Донна Рубен, менеджер по технологиям складирования данных в Sun. - Зная это, администраторы сетей могут выбрать инструмент с быстрым доступом к часто требуемым данным". Гигабайт за гигабайтом Если вы уж взялись за добычу данных, то, предупреждает Рубин, обратного пути нет. "Это как наркотик - с каждым разом хочется все больше", - говорит она. Учитывая вероятность "склонности к употреблению" сетевых пользователей, администратору локальной сети необходимо аккуратно спланировать наращивание приложений для добычи данных, но как это сделать? При первом знакомстве со средствами добычи данных большинство администраторов локальных сетей интересуются организацией оперативного доступа к накопленным рабочим данным. Некоторые администраторы обнаруживают, что данные содержат больше ошибок или повторений, чем ожидалось, быстро осознают, что они недооценили общий объем данных для оперативного доступа. Сейлор из MicroStrategy рассказал одну печальную историю о клиенте, который решил, что массив данных в 20 Гбайт вполне удовлетворит потребности его узла в добыче данных. Однако после начала добычи, массив данных удваивался каждые шесть недель и вскоре достиг 500 Гбайт. Если хорошо продумать первоначальный план, то с таким ростом справиться довольно легко. Сейлор советует администраторам локальных сетей не помещать 500 Гбайт данных на склад и надеяться добыть их оттуда, а нанять опытного консультанта, способного помочь в создании пилотного проекта размером в одну десятую - одну двенадцатую от ожидаемого объема операций по добыче данных.
Источник: olap.ru
Копировать, распространять, публиковать информацию портала News.lt без письменного согласия редакции запрещено.

Комментарии Facebook

Новый комментарий


Captcha

статьи по схожей тематике

Sharp Aquos R: новый флагманский смартфон с «умным» голосовым помощником

Компания Sharp провела презентацию нового флагманского смартфона Aquos R с изящным дизайном, высокими техническими характеристиками и интеллектуальным голосовым помощником. дальше »

Все модели iPhone 2017 года получат 3 Гб оперативной памяти

Все три модели iPhone 2017 года будут оснащены 3 Гб оперативной памяти, утверждает известный аналитик Тимоти Аркури из компании Cowen and Company. дальше »

Новая линейка игровых ноутбуков Inspiron от Dell

В компании Dell, пересмотрев свой подход к созданию мультимедийных моделей, выпустили несколько версий 15,6-дюймового ноутбука линейки Inspiron. дальше »

Huawei Watch первого поколения получат Android Wear 2.0 и поддержку NFC

Компания Huawei сообщила, что ее “умные” часы первого поколения будут обновлены до Android Wear 2.0. Вместе с прошивкой, пользователи получат доступ к NFC–модулю новинки. дальше »

Apple и Samsung подписали двухлетнее соглашение на поставку OLED-дисплеев для iPhone

Общая стоимость контракта - 9 миллиардов долларов: в 2017 году Apple ожидает от Samsung по условиям нового контракта от 70 до 92 миллионов экранов. дальше »

Обновленная Tamagotchi напомнит о вашей юности

Японская компания Bandai Namco, которая перевыпустила электронную игрушку Тамагочи в честь 20-летия с момента ее появления на рынке. дальше »

Состоялся анонс нового ноутбука Chuwi LapBook 12.3 на Windows 10

Китайский производитель Chuwi представил очередной свой продукт на операционной системе Windows 10. дальше »

NEC совершенствует решения Digital Signage, выпуская новые дисплеи серии P и V

Широкоформатные дисплеи для современной цифровой рекламы представляют простой доступ к встроенным интеллектуальным функциям IoT. дальше »

Qualcomm выступила с ответным иском против Apple

Qualcomm считает, что Apple намеренно не использовала некоторый функционал модемов компании, установленных в смартфонах iPhone 7, чтобы они не могли превзойти модемы компании Intel, которыми оснащалась другие смартфоны Apple. дальше »

Nokia 9 будет чуть дешевле Galaxy S8

Инсайдерская информация о характеристиках предстоящей модели Nokia 9 появилась неделю назад. Теперь тот же источник сообщил, что в США новинка будет стоить $700, тогда, как Европе ценник может доходить до 750 евро. дальше »