GoSlideGoSlide

Презентация на тему «Большие данные»

Пример презентации по теме — 24 слайдов с готовой структурой и оформлением. Возьмите за основу, отредактируйте под свои требования и скачайте бесплатно.

Слайды презентации

Слайд 1 из 24

Доклад к слайду 1

Тема моей работы — большие данные. Сегодня это одно из ключевых понятий информационных технологий: за ним стоят и техника хранения информации, и методы её анализа, и целый пласт вопросов о приватности. Я расскажу, как появилось это направление, на чём оно держится технически и где применяется на практике.

Выберите оформление

Одна и та же презентация в нескольких шаблонах — выберите подходящий под свой вуз, слайды выше обновятся, и скачайте бесплатно. Все шаблоны вузов.

Содержание презентации по слайдам

Слайд 1. Большие данные

  • Технологии сбора, хранения и анализа сверхбольших массивов информации и их применение

Доклад: Тема моей работы — большие данные. Сегодня это одно из ключевых понятий информационных технологий: за ним стоят и техника хранения информации, и методы её анализа, и целый пласт вопросов о приватности. Я расскажу, как появилось это направление, на чём оно держится технически и где применяется на практике.

Слайд 2. Содержание

  • Введение
  • Что такое большие данные
  • Признаки больших данных
  • Хронология становления
  • Кто стоял у истоков
  • Откуда берутся большие данные
  • Какие данные преобладают
  • Рост объёма данных в мире
  • Технологический стек
  • Центры обработки данных
  • Как работает распределённая обработка
  • Реляционные базы и системы больших данных
  • Методы анализа
  • Большие данные в бизнесе
  • Медицина и здравоохранение
  • Умный город и транспорт
  • Большие данные в науке
  • Риски и скрытые угрозы
  • Защита данных и регулирование
  • Выводы
  • Список литературы

Доклад: Работа построена так: сначала мы разберёмся с определением и признаками больших данных, затем посмотрим на историю становления направления и его технологическую основу. Вторая половина посвящена практическим применениям — в бизнесе, медицине, городском хозяйстве и науке, — а завершим разговором о рисках и правовом регулировании.

Слайд 3. Введение

  • Ежедневно человечество создаёт около 400 миллионов терабайт новой информации: сообщения, платежи, показания датчиков, записи камер и медицинские снимки.
  • Привычные реляционные базы данных не справляются с такими объёмами — обработка одного запроса на единственном сервере растягивается на часы и сутки.
  • Работа с большими массивами стала отдельной отраслью: мировой рынок соответствующих технологий и услуг превышает 300 миллиардов долларов.
  • Умение извлекать смысл из данных превратилось в базовую компетенцию экономиста, инженера, врача и управленца.

Доклад: Чтобы почувствовать масштаб: человечество ежедневно создаёт порядка четырёхсот миллионов терабайт новой информации. Обычные базы данных на таких объёмах просто перестают работать — запрос, который раньше выполнялся за секунду, растягивается на сутки. Именно из этой практической проблемы выросла целая отрасль стоимостью более трёхсот миллиардов долларов.

Слайд 4. Что такое большие данные

  • Большие данные — это массивы информации такого объёма, скорости поступления и разнообразия, что традиционные средства хранения и обработки становятся непригодными, и требуются распределённые технологии, работающие на множестве серверов одновременно.
  • 1997 — первая постановка задачи — Исследователи выделили «проблему больших данных» при визуализации расчётов
  • 1998 — появление термина — Джон Мэши употребил выражение в докладе о росте нагрузки на хранилища
  • 2001 — модель признаков — Объём, скорость и разнообразие описаны как три оси проблемы

Доклад: Строгого порога, за которым данные становятся «большими», не существует, и это принципиально. Определение опирается не на число терабайт, а на непригодность привычных инструментов: если одна машина уже не справляется и нужен кластер, мы имеем дело с большими данными. Сам термин закрепился в конце девяностых годов, а через несколько лет была описана и модель его основных признаков.

Слайд 5. Признаки больших данных

  • Объём — счёт идёт на терабайты и петабайты
  • Скорость — данные поступают непрерывным потоком
  • Разнообразие — текст, видео, показания датчиков
  • Достоверность — часть записей неполна и противоречива
  • Ценность — польза появляется только после анализа

Доклад: Классически выделяют пять признаков, каждый из которых создаёт свою трудность. Объём требует распределённого хранения, скорость — обработки на лету, разнообразие — умения работать с текстом и видео наравне с таблицами. Достоверность напоминает, что часть записей всегда неполна, а ценность — что сами по себе данные бесполезны, пока их не проанализировали.

Слайд 6. Хронология становления

  • Понятие сложилось за два десятилетия: от узкой задачи визуализации расчётов до самостоятельной отрасли.
  • Ключевую роль сыграли интернет-компании, которым первыми пришлось обрабатывать миллиарды запросов в сутки.
  • 1997 — заявлена «проблема больших данных»
  • 1998 — введён сам термин
  • 2004 — описана модель распределённых вычислений
  • 2006 — свободная платформа Apache Hadoop
  • 2012 — государственные программы по данным
  • 2020 — данные как основа обучения нейросетей

Доклад: История направления укладывается примерно в четверть века. Всё началось с частной задачи визуализации расчётов, затем интернет-компании столкнулись с миллиардами запросов и создали технологии распределённой обработки. К началу двадцатых годов данные стали ещё и топливом для нейросетей, что придало отрасли новый импульс.

Слайд 7. Кто стоял у истоков

  • Джон Мэши, род. 1946, Ввёл в оборот выражение «большие данные», описывая растущую нагрузку на хранилища
  • Дуглас Каттинг, род. 1963, Создатель свободной платформы распределённой обработки Apache Hadoop
  • Джеффри Дин, род. 1968, Соавтор модели распределённых вычислений и хранилищ, на которых выросла вся отрасль

Доклад: У истоков направления стоят конкретные люди. Джон Мэши ввёл сам термин, описывая, как растёт нагрузка на хранилища. Дуглас Каттинг создал свободную платформу, благодаря которой распределённая обработка стала доступна не только гигантам, но и обычным компаниям. Джеффри Дин — соавтор моделей вычислений и хранилищ, на которых выросла вся современная инфраструктура.

Слайд 8. Откуда берутся большие данные

  • Источники больших данных удобно разделить по тому, кто именно их порождает. Такое деление подсказывает и способ обработки: люди дают тексты, машины — числовые потоки, организации — учётные записи.
  • Сообщения
  • Фотографии
  • Отзывы
  • Поисковые запросы
  • Датчики
  • Камеры
  • Спутники
  • Журналы серверов
  • Платежи
  • Заказы
  • Медицинские карты
  • Отчётность

Доклад: Источники данных удобно разделить на три группы. Люди порождают тексты, фотографии и поисковые запросы; машины — непрерывные потоки показаний датчиков и записи камер; организации — платежи, заказы и учётные документы. Деление не формальное: от природы источника напрямую зависит, какие методы обработки придётся применять.

Слайд 9. Какие данные преобладают

  • Около четырёх пятых всей накопленной информации не имеет строгой структуры: это тексты, изображения, видео и звук.
  • Именно неструктурированные данные дают основной прирост объёма и требуют самых сложных методов анализа.

Доклад: Важно понимать структуру этого массива. Около четырёх пятых всей информации не укладывается в таблицы — это письма, фотографии, видеозаписи и звук. Именно неструктурированная часть растёт быстрее всего и требует самых сложных методов, тогда как привычные структурированные таблицы занимают лишь узкую долю.

Слайд 10. Рост объёма данных в мире

  • Годовой объём созданной информации удваивается примерно каждые два года.
  • К 2030 году он, по прогнозам, превысит 600 зеттабайт — это в триста раз больше, чем было в 2010 году.

Доклад: График показывает динамику мирового объёма данных. За пятнадцать лет он вырос с двух зеттабайт до почти двухсот, а к тридцатому году прогнозируется превышение шестисот. Такой рост означает, что задача хранения и анализа не решается один раз навсегда: инфраструктуру приходится наращивать постоянно.

Слайд 11. Технологический стек

  • Каждый слой решает свою задачу и опирается на нижележащий.
  • Данные движутся снизу вверх: от сырых записей к готовому решению.
  • Замена одного слоя не требует переделки всей системы.
  • Слабое звено внизу обесценивает работу верхних уровней.
  • Представление — панели показателей и отчёты для принятия решений
  • Анализ — статистические модели и машинное обучение
  • Обработка — распределённые вычисления на кластере серверов
  • Хранение — распределённая файловая система и нереляционные базы
  • Сбор — очереди сообщений и загрузка из внешних источников

Доклад: Любая система работы с данными строится слоями. Внизу — сбор из источников, над ним распределённое хранение, затем обработка на кластере, анализ и, наконец, представление результата человеку. Такая архитектура удобна тем, что слои можно менять по отдельности, но она же требовательна к качеству нижних уровней: ошибка при сборе обесценит все верхние.

Слайд 12. Центры обработки данных

  • Физически большие данные живут в центрах обработки данных — залах с тысячами серверов, системами охлаждения и резервным питанием.
  • Крупный центр потребляет до 100 мегаватт — как небольшой город, причём до 40 процентов этой мощности уходит на охлаждение.
  • Каждая запись хранится в трёх копиях на разных узлах, поэтому поломка отдельного диска не приводит к потере информации.

Доклад: Физически данные хранятся в центрах обработки данных — залах с тысячами серверов. Масштаб впечатляет: крупный центр потребляет до ста мегаватт, почти как небольшой город, и значительная часть этой энергии уходит на охлаждение. Надёжность обеспечивается избыточностью: каждая запись хранится в нескольких копиях на разных узлах.

Слайд 13. Как работает распределённая обработка

  • Главный принцип: вычисление приходит к данным, а не данные к вычислению.
  • Отказ одного узла не останавливает расчёт — его задача переназначается соседнему.
  • Разбиение — массив делится на блоки и раскладывается по узлам кластера
  • Отображение — каждый узел параллельно считает свою часть данных
  • Перегруппировка — промежуточные результаты собираются по общим ключам
  • Свёртка — частичные итоги сводятся в конечный ответ

Доклад: Ключевая идея распределённой обработки формулируется одной фразой: вычисление приходит к данным, а не наоборот. Массив делится на блоки, каждый узел параллельно считает свою часть, промежуточные результаты группируются по общим ключам и сводятся в итог. Такая схема линейно масштабируется и переживает отказ отдельных машин.

Слайд 14. Реляционные базы и системы больших данных

  • Выбор технологии определяется задачей: строгая отчётность требует надёжной реляционной базы, анализ потоков — распределённой системы.
  • На практике их сочетают: оперативный учёт ведут в базе, а накопленный архив анализируют на кластере.

Доклад: Сравнение с реляционными базами показывает, что речь идёт о разных инструментах, а не о замене одного другим. Базы дают строгость, точность операций и подходят для отчётности; системы больших данных берут объёмом и дешёвым масштабированием на обычном оборудовании. На практике в компании обычно работают обе технологии одновременно.

Слайд 15. Методы анализа

  • Описательный анализ отвечает на вопрос «что произошло»: сводные показатели, срезы и отчёты за период.
  • Интеллектуальный анализ ищет скрытые закономерности — устойчивые сочетания товаров, группы схожих клиентов.
  • Машинное обучение строит модели, предсказывающие отток клиентов, поломку станка или спрос на товар.
  • Обработка естественного языка извлекает смысл из отзывов, обращений и документов.
  • Потоковая обработка анализирует события в момент их поступления, за доли секунды, ещё до записи в хранилище.

Доклад: Методы анализа выстраиваются по нарастанию сложности. Описательный отвечает на вопрос, что произошло; интеллектуальный анализ ищет неочевидные закономерности; машинное обучение переходит к прогнозу. Отдельно стоят обработка естественного языка, работающая с текстами обращений и отзывов, и потоковая обработка, реагирующая на события за доли секунды.

Слайд 16. Большие данные в бизнесе

  • Торговые сети прогнозируют спрос по каждому товару в каждом магазине и сокращают потери от просроченной продукции на 20–30 процентов.
  • Рекомендательные системы подбирают товары и фильмы по поведению схожих пользователей: до трети продаж крупных площадок приходится на такие подсказки.
  • Банки оценивают кредитный риск по сотням признаков и выявляют мошеннические операции за доли секунды после списания.

Доклад: Бизнес был первым, кто извлёк из больших данных прямую выгоду. Торговые сети точнее прогнозируют спрос и заметно сокращают списание просроченного товара, рекомендательные системы приносят крупным площадкам до трети продаж, а банки успевают распознать мошенническую операцию быстрее, чем клиент заметит списание.

Слайд 17. Медицина и здравоохранение

  • 200 ГБ — геном человека — Полная расшифровка наследственной информации одного пациента даёт такой объём исходных данных
  • 30% — снимков — Системы анализа изображений берут на себя первичный просмотр рентгеновских и томографических исследований
  • 24/7 — мониторинг — Носимые датчики непрерывно передают пульс и давление, позволяя заметить ухудшение заранее
  • 2020 — эпидемиология — Модели на данных о перемещениях помогали прогнозировать распространение инфекции по регионам

Доклад: В медицине большие данные работают сразу на нескольких уровнях. Расшифровка генома одного человека даёт около двухсот гигабайт исходных данных, системы анализа изображений берут на себя первичный просмотр снимков, а носимые датчики позволяют следить за состоянием пациента непрерывно. Опыт две тысячи двадцатого года показал ценность таких моделей и в эпидемиологии.

Слайд 18. Умный город и транспорт

  • Данные с датчиков на перекрёстках и из навигаторов позволяют управлять светофорами в реальном времени и сокращать время в пробках на 10–25 процентов.
  • Перевозчики анализируют треки автомобилей и подбирают маршруты, экономя топливо и рабочие часы водителей.
  • Записи о поездках по транспортным картам показывают реальные пассажиропотоки и помогают перекраивать маршрутную сеть города.

Доклад: Городское хозяйство — ещё одна наглядная область. Данные с перекрёстков и из навигаторов позволяют управлять светофорами в реальном времени и заметно сокращать время в пробках. Записи о поездках по транспортным картам показывают, куда люди ездят на самом деле, и на этом основании перестраивают маршрутную сеть.

Слайд 19. Большие данные в науке

  • Детекторы Большого адронного коллайдера порождают около петабайта данных в секунду; система отбора оставляет для анализа лишь доли процента событий.
  • Обзоры звёздного неба и климатические модели хранят в архивах десятки петабайт наблюдений, доступных исследователям всего мира.
  • Работа с такими массивами породила понятие «четвёртой парадигмы науки» — открытий, сделанных не в опыте, а при анализе накопленных данных.

Доклад: Наука породила одни из самых крупных потоков данных в мире. Детекторы Большого адронного коллайдера выдают около петабайта в секунду, и лишь ничтожная доля событий отбирается для дальнейшего анализа. Работа с такими массивами изменила саму методологию исследований: сегодня говорят о четвёртой парадигме науки, где открытие рождается при анализе накопленных данных.

Слайд 20. Риски и скрытые угрозы

  • На поверхности — очевидная польза для пользователя.
  • Под водой — цена, которую платят человек и общество.
  • Оценивать технологию корректно только по обеим частям сразу.
  • Многие риски проявляются не сразу, а спустя годы накопления данных.
  • Удобные сервисы — точный поиск, персональные предложения, мгновенные подсказки
  • Тотальный сбор персональных данных — фиксируется каждое действие, а согласие даётся формально
  • Предвзятость моделей — алгоритм наследует перекосы обучающей выборки и повторяет их в решениях
  • Ложные корреляции — на огромных массивах случайные совпадения выглядят закономерностями
  • Уязвимость хранилищ — утечка одной базы затрагивает сразу миллионы людей

Доклад: У этой технологии есть и обратная сторона. На поверхности пользователь видит удобные сервисы, но под водой скрыты тотальный сбор персональных данных, предвзятость моделей, унаследованная от обучающей выборки, и ложные корреляции, которые на огромных массивах выглядят убедительно. Отдельный риск — уязвимость самих хранилищ: одна утечка задевает миллионы людей.

Слайд 21. Защита данных и регулирование

  • Персональные данные — любые сведения, относящиеся к определённому человеку; их обработка требует согласия.
  • Обезличивание — удаление признаков, по которым запись можно связать с конкретным лицом.
  • Закон № 152-ФЗ — российская правовая основа обработки и защиты персональных данных.
  • Общий регламент по защите данных — европейские правила 2018 года со штрафами до 4 процентов годового оборота.
  • Локализация — требование хранить данные российских граждан на серверах внутри страны.

Доклад: Поэтому обработка данных регулируется законом. В России базовым документом остаётся Федеральный закон номер сто пятьдесят два о персональных данных, в Европе — Общий регламент по защите данных с очень чувствительными штрафами. Ключевые практические инструменты — согласие субъекта, обезличивание записей и требование хранить данные граждан внутри страны.

Слайд 22. Выводы

  • Большие данные — не просто объём, а новый способ получать знание из потока информации.
  • Технологическая основа отрасли — распределённое хранение и параллельные вычисления на рядовых серверах.
  • Ценность создаёт не хранилище, а верно поставленный вопрос и корректно построенная модель.
  • Обратная сторона возможностей — приватность, предвзятость алгоритмов и цена ошибки.
  • Базовые навыки работы с данными сегодня нужны специалисту любой сферы.

Доклад: Подведу итог. Большие данные — это прежде всего новый способ получать знание, а не просто много файлов на дисках. Их основа — распределённое хранение и параллельные вычисления, но реальную ценность создаёт правильно поставленный вопрос. При этом технология требует ответственности: приватность и качество моделей сегодня так же важны, как и производительность.

Слайд 23. Список литературы

  • Майер-Шёнбергер В., Кукьер К. Большие данные. Революция, которая изменит то, как мы живём, работаем и мыслим. — М.: Манн, Иванов и Фербер, 2014. — 240 с.
  • Марц Н., Уоррен Дж. Большие данные: принципы и практика построения масштабируемых систем обработки данных в реальном времени. — М.: Вильямс, 2016. — 368 с.
  • Силен Д., Мейсман А., Али М. Основы науки о данных и аналитики больших данных. — СПб.: Питер, 2017. — 336 с.
  • Уайт Т. Hadoop. Подробное руководство. — СПб.: Питер, 2013. — 672 с.
  • Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных» (с изменениями и дополнениями).
  • Черняк Л. Большие данные — новая теория и практика // Открытые системы. СУБД. — 2011. — № 10. — С. 18–25.

Доклад: При подготовке работы я опирался на переводные монографии по большим данным, отечественные обзорные публикации и действующее законодательство о персональных данных. Список составлен по алфавиту и оформлен по требованиям государственного стандарта.

Слайд 24. Спасибо за внимание!

Доклад: Благодарю за внимание. Готов ответить на вопросы по технической стороне работы с большими данными и по правовым ограничениям их обработки.

Частые вопросы

Эту презентацию правда можно скачать бесплатно?

Да. Готовый образец из каталога открывается в онлайн-редакторе и скачивается в формате .PPTX для PowerPoint бесплатно, без регистрации.

Можно ли изменить текст и оформление под свою работу?

Да. Нажмите «Открыть в редакторе», замените текст на свой, при желании выберите оформление под свой вуз — и скачайте итоговый файл.

В каком формате скачивается презентация?

.PPTX — стандартный формат Microsoft PowerPoint. Файл открывается в PowerPoint, LibreOffice Impress и Google Презентациях.

Подходит ли презентация для вуза?

Да. Структура соответствует требованиям учебных работ: титульный лист, содержание, введение, основная часть, выводы и список литературы по ГОСТ.

А если нужной темы нет в каталоге?

Нейросеть соберёт презентацию по любой вашей теме за пару минут — с таким же оформлением, докладом и списком литературы. Стоимость — 259 ₽ за скачивание.

Создайте презентацию по своей теме

Введите тему — нейросеть составит план и соберёт готовую презентацию с оформлением, докладом и списком литературы.

Похожие презентации