Джон Келлехер - Наука о данных. Базовый курс

Тут можно читать онлайн Джон Келлехер - Наука о данных. Базовый курс - бесплатно ознакомительный отрывок. Жанр: comp-db, издательство Альпина Паблишер, год 2020. Здесь Вы можете читать ознакомительный отрывок из книги онлайн без регистрации и SMS на сайте лучшей интернет библиотеки ЛибКинг или прочесть краткое содержание (суть), предисловие и аннотацию. Так же сможете купить и скачать торрент в электронном формате fb2, найти и слушать аудиокнигу на русском языке или узнать сколько частей в серии и всего страниц в публикации. Читателям доступно смотреть обложку, картинки, описание и отзывы (комментарии) о произведении.
  • Название:
    Наука о данных. Базовый курс
  • Автор:
  • Жанр:
  • Издательство:
    Альпина Паблишер
  • Год:
    2020
  • Город:
    Москва
  • ISBN:
    978-5-9614-3378-4
  • Рейтинг:
    3/5. Голосов: 11
  • Избранное:
    Добавить в избранное
  • Отзывы:
  • Ваша оценка:
    • 60
    • 1
    • 2
    • 3
    • 4
    • 5

Джон Келлехер - Наука о данных. Базовый курс краткое содержание

Наука о данных. Базовый курс - описание и краткое содержание, автор Джон Келлехер, читайте бесплатно онлайн на сайте электронной библиотеки LibKing.Ru
Сегодня наука о данных используется практически во всех сферах: вы видите подобранные специально для вас рекламные объявления, рекомендованные на основе ваших предпочтений фильмы и книги, ссылки на предполагаемых друзей в соцсетях, отфильтрованные письма в папке со спамом.
Книга знакомит с основами науки о данных. В ней охватываются все ключевые аспекты, начиная с истории развития сбора и анализа данных и заканчивая этическими проблемами, связанными с конфиденциальностью информации. Авторы объясняют, как работают нейронные сети и машинное обучение, приводят примеры анализа бизнес-проблем и того, как их можно решить, рассказывают о сферах, на которые наука о данных окажет наибольшее влияние в будущем.
«Наука о данных» уже переведена на японский, корейский и китайский языки.

Наука о данных. Базовый курс - читать онлайн бесплатно ознакомительный отрывок

Наука о данных. Базовый курс - читать книгу онлайн бесплатно (ознакомительный отрывок), автор Джон Келлехер
Тёмная тема
Сбросить

Интервал:

Закладка:

Сделать

Фокусировка.Каждый успешный проект науки о данных начинается с четкого определения проблемы, которую он должен помочь решить. Этот шаг подсказывает обычный здравый смысл — проекту сложно достичь успеха, если у него нет четкой цели. Наличие четкой цели определяет решения относительно того, какие данные и алгоритмы машинного обучения использовать, как оценивать результаты, как будут применяться анализ и развертываться модели и когда может потребоваться повторный процесс для обновления моделей.

Данные.Точно сформулированная задача позволяет определить, какие данные необходимы для проекта. Ясность в этом вопросе помогает направить проект туда, где эти данные находятся. Если какие-то данные в настоящее время недоступны, следует запустить вспомогательные проекты, которые изучат возможность сбора и доступность этих данных. При этом крайне важно обеспечить их высокое качество. Потеря качества данных может произойти в силу плохо спроектированных приложений или плохих моделей, имеющихся у организации, персонала, не обученного правильно вводить данные, или по иным причинам. На самом деле существует масса факторов, которые снижают качество данных в системах, а потребность в данных хорошего качества настолько важна, что некоторые организации нанимают специалистов, которые постоянно проверяют данные, оценивая их качество и внося предложения о его улучшении. Без качественных данных добиться успеха трудно.

Прежде чем привлекать сторонние источники данных стоит проверить какие данные - фото 38

Прежде чем привлекать сторонние источники данных, стоит проверить, какие данные уже собраны и используются в организации. К сожалению, подход некоторых наукоемких проектов заключается в том, чтобы сразу взять доступные данные из транзакционных баз или других источников, очистить и интегрировать их, а затем приступить к исследованию и анализу. Такой подход полностью игнорирует группу бизнес-аналитики и возможное наличие хранилища данных. Во многих организациях бизнес-аналитики и специалисты по организации хранилища данных уже собирают, очищают, трансформируют и интегрируют данные организации в один центральный репозиторий. Если хранилище уже существует, то, вероятно, оно содержит все или бо́льшую часть данных, необходимых для проекта, что может сэкономить значительное время на их интеграцию и очистку. Кроме того, в хранилище будет гораздо больше данных, чем в текущих транзакционных базах. Используя хранилище данных, можно вернуться на несколько лет назад и построить прогнозные модели, а затем прокрутить их на разных временных периодах и измерить уровень точности прогнозов для каждой из моделей. Это позволяет отслеживать изменения в данных и их влияние на модели. Кроме того, можно отслеживать, как эти изменения происходят и развиваются с течением времени. Использование такого подхода облегчает демонстрацию поведения моделей в долгосрочном периоде, что помогает укрепить доверие клиентов. Например, в одном проекте на основе пятилетних исторических данных из хранилища было продемонстрировано, как именно компания могла сэкономить более $40 млн за этот период.

Люди.В успешных проектах науки о данных часто принимают участие люди, обладающие сочетанием разных компетенций и навыков. В большинстве организаций такие люди уже есть, они играют различные роли, но могут и должны внести свой вклад в проекты науки о данных. К ним относятся специалисты по базам данных, по процессу ETL, по интеграции данных, менеджеры проектов, бизнес-аналитики, отраслевые эксперты и т. д. Иногда организациям необходимо нанимать специалистов, обладающих навыками работы с большими данными, применения машинного обучения и точной постановки задач. Успешные специалисты по данным должны быть готовы и способны сотрудничать и общаться с командой менеджеров, конечными пользователями и всеми заинтересованными сторонами, чтобы показать и объяснить, как именно наука о данных может помочь в их работе. Трудно найти людей, которые обладают одновременно необходимыми техническими навыками и способностью общаться и работать с людьми на разных уровнях организации. Тем не менее эта комбинация компетенций имеет решающее значение для успеха проектов науки о данных.

Модели.Экспериментируйте с различными алгоритмами машинного обучения, чтобы выяснить, какой из них лучше работает с набором данных. В литературе часто встречаются примеры использования одного-единственного алгоритма. Возможно, авторы заранее выяснили, какой алгоритм предпочтительнее в их случае, или же просто применили особо любимый алгоритм. Наибольший интерес вызывают нейронные сети и глубокое обучение, однако, как правило, существуют и другие алгоритмы, которые следует рассмотреть и протестировать. Кроме того, на выбор алгоритмов и моделей в проектах науки о данных, ведущихся на территории ЕС, может повлиять Общий регламент по защите данных (GDPR), который вступил в силу с апреля 2018 г. Статьи, затрагивающие «право человека на объяснение» автоматизированных процессов принятия решений, могут ограничить использование в ряде областей сложных моделей, трудно поддающихся интерпретации и объяснению.

Интеграция с бизнесомПри определении цели проекта науки о данных важно - фото 39

Интеграция с бизнесом.При определении цели проекта науки о данных важно определить, каким образом выходные данные и результаты проекта будут развернуты в ИТ-архитектуре и бизнес-процессах организации. Для этого нужно определить, где и как модель должна быть интегрирована в существующие приложения и как полученные результаты будут использоваться его конечными пользователями или передаваться в другой процесс. Чем более автоматизирован процесс, тем быстрее организация сможет реагировать на изменения профилей своих клиентов, снижая затраты и увеличивая потенциальную прибыль. К примеру, модель определения уровня риска клиента для выдачи банковских кредитов должна быть встроена во внешнее приложение, которое обрабатывает кредитные заявки от клиентов. Таким образом, когда сотрудник банка вводит заявку на кредит, он сразу получает обратную связь от модели. В дальнейшем эта обратная связь может использоваться в реальном времени для решения любых возникших вопросов с клиентом. Другой пример — обнаружение мошенничества. Может потребоваться от четырех до шести недель, чтобы выявить случай потенциального мошенничества, требующий расследования. Используя науку о данных и встраивая ее в системы мониторинга транзакций, компании могут выявлять потенциальные случаи мошенничества в реальном времени. Благодаря автоматизации и интегрированию моделей на основе данных уменьшается время отклика, и действия могут быть предприняты своевременно. Если выходные данные и модели, созданные проектом, не интегрированы в бизнес-процессы, то они просто не будут использоваться, и в итоге проект потерпит неудачу.

Читать дальше
Тёмная тема
Сбросить

Интервал:

Закладка:

Сделать


Джон Келлехер читать все книги автора по порядку

Джон Келлехер - все книги автора в одном месте читать по порядку полные версии на сайте онлайн библиотеки LibKing.




Наука о данных. Базовый курс отзывы


Отзывы читателей о книге Наука о данных. Базовый курс, автор: Джон Келлехер. Читайте комментарии и мнения людей о произведении.


Понравилась книга? Поделитесь впечатлениями - оставьте Ваш отзыв или расскажите друзьям

Напишите свой комментарий
x