Слайд 1. Искусственный интеллект: как он работает
- Устройство, обучение и границы возможностей современных интеллектуальных систем
Доклад: Тема нашей работы — искусственный интеллект и принципы его работы. Мы разберём не отдельные продукты, а внутреннее устройство обучаемых систем: из чего они состоят и почему вообще способны выдавать осмысленный результат. Такой взгляд позволяет трезво оценивать и возможности технологии, и её пределы.
Слайд 2. Содержание
- Введение
- Ключевые понятия
- Уровни технологии
- Вехи развития
- Учёные, заложившие основы
- Искусственный нейрон
- Формула искусственного нейрона
- Путь сигнала по сети
- Виды машинного обучения
- Как модель учится
- Слагаемые обученной модели
- Масштабы обучения
- Вычислительная основа
- Рост размера языковых моделей
- Архитектуры глубокого обучения
- Трансформер и механизм внимания
- Цикл порождения текста
- Прикладные области
- Ограничения и риски
- Выводы
- Список литературы
Доклад: Работа построена от общих понятий к деталям. Сначала мы определим термины и покажем, как связаны искусственный интеллект, машинное обучение и нейронные сети, затем разберём устройство нейрона и процесс обучения, а в конце рассмотрим прикладные области и ограничения.
Слайд 3. Введение
- Технологии искусственного интеллекта вышли за пределы исследовательских лабораторий: их применяют в медицине, транспорте, промышленности и образовании.
- Понимание внутреннего устройства обучаемых систем становится частью профессиональной грамотности специалиста любой отрасли.
- Массовое распространение генеративных моделей обострило вопросы достоверности данных, авторского права и ответственности за принятые решения.
- Цель работы — разобрать, из каких элементов состоит система искусственного интеллекта и по каким принципам она обучается.
Доклад: Актуальность темы определяется масштабом её проникновения: обучаемые системы работают в медицине, транспорте, промышленности и образовании. Для специалиста понимание их устройства становится такой же базовой грамотностью, как умение работать с таблицами. Цель работы — показать внутреннюю логику этих систем без упрощений и без мистики.
Слайд 4. Ключевые понятия
- Искусственный интеллект — свойство технических систем решать задачи, которые традиционно требуют человеческого мышления.
- Машинное обучение — раздел, в котором правила не задаются программистом, а извлекаются алгоритмом из данных.
- Нейронная сеть — вычислительная модель из простых связанных элементов, поведение которых задаётся числовыми весами.
- Глубокое обучение — настройка сетей с большим числом слоёв, выявляющих признаки возрастающей сложности.
- Обучающая выборка — набор примеров, на котором модель подбирает значения своих параметров.
Доклад: Начнём с терминологии, поскольку в обиходе понятия часто смешивают. Искусственный интеллект — самое широкое понятие, машинное обучение — способ получения правил из данных, а нейронная сеть — конкретная вычислительная модель. Обучающая выборка при этом играет роль учебника, по которому система настраивает свои параметры.
Слайд 5. Уровни технологии
- Понятия «искусственный интеллект», «машинное обучение» и «нейронные сети» в обиходе смешивают.
- На деле они вложены друг в друга и образуют слои единой технологии.
- Каждый верхний слой опирается на возможности нижележащего.
- Внизу — универсальные алгоритмы, наверху — готовые продукты для пользователя.
- Прикладные сервисы — переводчики, помощники, системы рекомендаций
- Генеративные модели — порождают текст, изображение и звук
- Глубокое обучение — многослойные нейронные сети
- Машинное обучение — статистические алгоритмы, обучаемые на данных
Доклад: Наглядно связь этих понятий выглядит как слоёный пирог. В основании лежат статистические алгоритмы машинного обучения, над ними — глубокие нейронные сети, ещё выше — генеративные модели, а на поверхности находятся привычные пользователю сервисы. Каждый верхний слой полностью опирается на возможности нижнего.
Слайд 6. Вехи развития
- Идея мыслящей машины старше самих вычислительных машин, но её практическое воплощение заняло семь десятилетий.
- Периоды подъёма чередовались с «зимами», когда финансирование направления резко сокращалось.
- Каждый новый скачок опирался на рост вычислительной мощности и объёма доступных данных.
- 1950 — Тьюринг предлагает проверку разумности машины
- 1956 — Дартмутский семинар вводит термин
- 1958 — Розенблатт строит перцептрон
- 1986 — метод обратного распространения ошибки
- 2012 — прорыв в распознавании изображений
- 2017 — появление архитектуры «трансформер»
Доклад: История направления показывает, что путь от идеи до практики занял около семидесяти лет. Отправной точкой считают работу Тьюринга 1950 года, а сам термин появился на Дартмутском семинаре в 1956 году. Периоды энтузиазма сменялись «зимами» искусственного интеллекта, и лишь рост вычислительной мощности сделал старые идеи работоспособными.
Слайд 7. Учёные, заложившие основы
- Алан Тьюринг, 1912–1954, Предложил математическую модель вычислений и критерий разумности машины.
- Джон Маккарти, 1927–2011, Ввёл сам термин «искусственный интеллект» и создал язык программирования Лисп.
- Джеффри Хинтон, род. 1947, Развил метод обратного распространения ошибки; лауреат Нобелевской премии по физике 2024 года.
- Ян Лекун, род. 1960, Автор свёрточных нейронных сетей — основы современного распознавания изображений.
Доклад: За ключевыми идеями стоят конкретные исследователи. Алан Тьюринг заложил математическую основу вычислений, Джон Маккарти дал направлению имя, Джеффри Хинтон довёл до практического применения метод обратного распространения ошибки, а Ян Лекун создал свёрточные сети. Работы Хинтона и Лекуна лежат в основе всего современного глубокого обучения.
Слайд 8. Искусственный нейрон
- Нейрон принимает несколько числовых сигналов, и каждому соответствует свой вес — мера важности связи.
- Взвешенная сумма входов складывается со смещением и передаётся в функцию активации.
- Функция активации вносит нелинейность: без неё сеть любой глубины сводилась бы к одной линейной формуле.
- Перцептрон Розенблатта (1958) стал первой реализацией такого элемента с обучаемыми весами.
Доклад: Базовый элемент любой сети — искусственный нейрон, и устроен он на удивление просто. Он складывает входные сигналы с учётом весов, добавляет смещение и пропускает результат через функцию активации. Именно нелинейность активации позволяет сети выражать сложные зависимости, а не оставаться линейной формулой.
Слайд 9. Формула искусственного нейрона
- y = f(w₁x₁ + w₂x₂ + … + wₙxₙ + b)
- x — входные сигналы от данных или от предыдущего слоя
- w — веса связей, именно они изменяются при обучении
- b — смещение, сдвигающее порог срабатывания нейрона
- f — функция активации, задающая нелинейный отклик
- y — выходной сигнал, передаваемый дальше по сети
Доклад: Запишем работу нейрона формулой. Выход равен функции активации от суммы произведений входов на веса плюс смещение. Ключевой момент: при обучении меняются именно веса и смещение — входы приходят извне, а вид функции активации задаётся заранее конструктором сети.
Слайд 10. Путь сигнала по сети
- Прямой проход по сети — это последовательность матричных умножений и нелинейных преобразований.
- Один и тот же механизм работает и при обучении модели, и при её практическом применении.
- Входной слой — исходные данные переводятся в числа
- Скрытые слои — выявляются признаки возрастающей сложности
- Выходной слой — формируется числовой ответ модели
- Интерпретация — число превращается в класс, текст или действие
Доклад: Теперь проследим путь сигнала целиком. Данные поступают на входной слой в числовом виде, затем проходят через скрытые слои, где выявляются признаки возрастающей сложности — от простых контуров до целых объектов. На выходном слое формируется число, которое мы уже интерпретируем как класс, текст или команду.
Слайд 11. Виды машинного обучения
- Способ обучения определяется тем, что известно о данных заранее. По этому основанию выделяют три больших семейства алгоритмов.
- Размеченные примеры
- Классификация
- Регрессия
- Диагностика по снимкам
- Неразмеченные данные
- Кластеризация
- Поиск аномалий
- Сегментация клиентов
- Награда и штраф
- Стратегия действий
- Игровые среды
- Управление роботом
Доклад: Способы обучения различаются по тому, что известно о данных заранее. При обучении с учителем есть готовые правильные ответы, при обучении без учителя система сама ищет структуру в данных, а при обучении с подкреплением она действует методом проб и получает награду или штраф. Выбор семейства алгоритмов определяется постановкой задачи.
Слайд 12. Как модель учится
- Обучение — это не «понимание», а численная оптимизация большого набора параметров.
- Цикл повторяется миллионы раз на разных порциях обучающей выборки.
- Скорость обучения задаёт величину шага изменения весов на каждой итерации.
- Обучение останавливают, когда ошибка на проверочной выборке перестаёт снижаться.
- Подготовка данных — очистка, разметка и разделение выборки
- Прямой проход — модель выдаёт предсказание при текущих весах
- Расчёт ошибки — функция потерь измеряет расхождение с верным ответом
- Обратное распространение — вычисляется вклад каждого веса в ошибку
- Обновление весов — градиентный спуск сдвигает параметры в сторону меньшей ошибки
Доклад: Сам процесс обучения — это повторяющийся цикл из пяти шагов. Модель делает предсказание, функция потерь измеряет ошибку, обратное распространение показывает вклад каждого веса в эту ошибку, после чего градиентный спуск сдвигает параметры в нужную сторону. Цикл повторяется миллионы раз, пока ошибка на проверочной выборке не перестанет уменьшаться.
Слайд 13. Слагаемые обученной модели
- Ни одно слагаемое не работает в одиночку: нехватка любого из трёх делает обучение невозможным.
- Именно поэтому крупные модели создают целые лаборатории, а не отдельные исследователи.
- Данные — размеченные примеры, тексты и изображения
- Алгоритм — архитектура сети и функция потерь
- Вычисления — специализированные процессоры и время обучения
- Обученная модель — набор настроенных весов
Доклад: Обученная модель — это результат сложения трёх обязательных слагаемых: данных, алгоритма и вычислительных ресурсов. Нехватка любого из них делает обучение невозможным: без данных нечему учиться, без подходящей архитектуры зависимость не выразить, а без вычислений процесс растянется на годы.
Слайд 14. Масштабы обучения
- Порядок величин, с которыми работают крупные языковые модели, объясняет их высокую стоимость.
- 175 млрд — параметров в языковой модели поколения 2020 года
- 570 ГБ — объём очищенного текста в обучающей выборке
- 10 тыс. — вычислительных ускорителей в обучающем кластере
- 3–6 мес. — длительность одного цикла обучения
Доклад: Порядок величин здесь заслуживает отдельного внимания. Языковая модель поколения 2020 года содержала около ста семидесяти пяти миллиардов параметров и обучалась на выборке в сотни гигабайт очищенного текста. Обучение занимало месяцы на кластере из тысяч ускорителей — отсюда и стоимость таких проектов.
Слайд 15. Вычислительная основа
- Обучение сети сводится к умножению больших матриц, поэтому нужны процессоры с тысячами параллельных ядер.
- Графические ускорители подошли для этой задачи: они изначально создавались для параллельных расчётов.
- Тензорные процессоры проектируют специально под операции нейронных сетей — они быстрее и экономичнее по энергии.
- Доступность и стоимость вычислений сегодня остаются главным ограничением при разработке крупных моделей.
Доклад: Технической основой этих расчётов служат специализированные процессоры. Обучение сети сводится к перемножению огромных матриц, а такие операции хорошо распараллеливаются. Сначала для этого приспособили графические ускорители, а затем появились тензорные процессоры, спроектированные прямо под операции нейронных сетей.
Слайд 16. Рост размера языковых моделей
- Число обучаемых параметров росло на порядок каждые полтора-два года.
- Дальнейший рост упирается в стоимость вычислений и запас качественных текстов.
Доклад: Динамика роста моделей наглядна: за пять лет число параметров выросло примерно в тысячи раз. Однако кривая не может расти бесконечно — упор идёт в стоимость вычислений и в исчерпание качественных текстовых данных. Поэтому исследования смещаются в сторону эффективности, а не только размера.
Слайд 17. Архитектуры глубокого обучения
- Архитектура — это способ соединения слоёв, подобранный под структуру данных.
- Универсальной архитектуры не существует: выбор диктуется задачей.
Доклад: Архитектур глубокого обучения существует несколько, и каждая подобрана под свою структуру данных. Свёрточные сети приспособлены к изображениям, рекуррентные — к последовательностям, трансформеры универсальны и особенно сильны в работе с текстом. Универсального решения нет: выбор всегда диктуется задачей.
Слайд 18. Трансформер и механизм внимания
- Текст разбивается на токены — короткие фрагменты слов, и каждый превращается в числовой вектор.
- Механизм внимания оценивает, насколько каждый фрагмент важен для понимания всех остальных.
- Позиционное кодирование добавляет сведения о порядке слов, которых сами векторы не хранят.
- Многоголовое внимание разбирает связи одновременно по нескольким смысловым срезам.
- Все фрагменты обрабатываются параллельно — отсюда выигрыш в скорости перед рекуррентными сетями.
Доклад: Отдельно остановимся на трансформере — именно он обеспечил прорыв последних лет. Текст разбивается на фрагменты, механизм внимания вычисляет, насколько каждый фрагмент важен для остальных, а позиционное кодирование сохраняет порядок слов. Главное преимущество — параллельная обработка всей последовательности сразу.
Слайд 19. Цикл порождения текста
- Языковая модель не «знает» ответ целиком — она достраивает текст по одному фрагменту.
- Каждый следующий фрагмент выбирается по вероятностям, рассчитанным для всего словаря.
- Параметр «температура» регулирует степень случайности этого выбора.
- Уже написанная часть ответа снова подаётся на вход — так цикл замыкается.
- Приём запроса
- Оценка контекста
- Выбор фрагмента
- Дописывание ответа
- Повтор шага
Доклад: Порождение текста устроено циклически. Модель принимает запрос, оценивает контекст и выбирает очередной фрагмент по рассчитанным вероятностям, после чего дописывает его к ответу и снова подаёт всё на вход. Именно поэтому модель не «знает» ответ заранее — она строит его пошагово.
Слайд 20. Прикладные области
- Транспорт: беспилотный автомобиль объединяет распознавание образов, прогноз траекторий и планирование маршрута.
- Медицина: анализ снимков помогает выявлять патологии на ранних стадиях с чувствительностью, сопоставимой с врачебной.
- Промышленность: предиктивное обслуживание предсказывает отказ оборудования по показаниям датчиков.
- Образование и наука: модели ускоряют поиск литературы, обработку данных и подготовку учебных материалов.
Доклад: Прикладные области охватывают практически все отрасли. В транспорте беспилотный автомобиль совмещает распознавание образов, прогноз траекторий и планирование маршрута, в медицине системы анализа снимков помогают выявлять патологии на ранней стадии, в промышленности — предсказывать отказ оборудования по данным датчиков.
Слайд 21. Ограничения и риски
- На поверхности заметны лишь отдельные неточности в ответах.
- Их причины лежат глубже — в данных, архитектуре и самом способе обучения.
- Поэтому проверка результата человеком остаётся обязательной.
- Критически важные решения нельзя передавать модели без контроля специалиста.
- Правдоподобные ошибки — модель уверенно выдаёт вымышленные факты
- Качество данных — искажения обучающей выборки переносятся в ответы
- Непрозрачность — связь между весами и итоговым выводом не поддаётся простому объяснению
- Отсутствие модели мира — система оперирует статистикой, а не причинами явлений
- Правовая неопределённость — ответственность за ошибку системы не закреплена законодательно
Доклад: Ограничения систем вытекают из самого принципа их работы. На поверхности мы видим правдоподобные, но вымышленные факты в ответах, а под водой скрыты подлинные причины: качество обучающих данных, непрозрачность решений и отсутствие у модели представления о причинно-следственных связях. Отсюда обязательное правило — проверка результата человеком.
Слайд 22. Выводы
- Искусственный интеллект — не одна технология, а слоистая система: от статистических алгоритмов до готовых сервисов.
- В основе современных систем лежит искусственный нейрон — взвешенная сумма входов с нелинейным откликом.
- Обучение сводится к численной оптимизации: сеть многократно сравнивает свой ответ с эталоном и корректирует веса.
- Прорыв последних лет обеспечили три условия сразу: большие данные, архитектура «трансформер» и дешёвые параллельные вычисления.
- Ограничения систем вытекают из самого принципа их работы, поэтому проверка результата человеком остаётся необходимой.
Доклад: Подведём итоги. Искусственный интеллект — это слоистая система технологий, в основе которой лежит предельно простой элемент, а сила достигается их количеством и объёмом обучающих данных. Понимание этого механизма позволяет применять технологию осознанно: доверять ей рутинные расчёты и обязательно контролировать ответственные решения.
Слайд 23. Список литературы
- Гудфеллоу, Я. Глубокое обучение / Я. Гудфеллоу, И. Бенджио, А. Курвилль. — Москва : ДМК Пресс, 2018. — 652 с.
- Николенко, С. И. Глубокое обучение / С. И. Николенко, А. А. Кадурин, Е. О. Архангельская. — Санкт-Петербург : Питер, 2018. — 480 с.
- Рассел, С. Искусственный интеллект: современный подход / С. Рассел, П. Норвиг. — Москва : Вильямс, 2016. — 1408 с.
- Флах, П. Машинное обучение. Наука и искусство построения алгоритмов, которые извлекают знания из данных / П. Флах. — Москва : ДМК Пресс, 2015. — 400 с.
- Хайкин, С. Нейронные сети: полный курс / С. Хайкин. — Москва : Вильямс, 2006. — 1104 с.
- Ясницкий, Л. Н. Введение в искусственный интеллект : учебное пособие / Л. Н. Ясницкий. — Москва : Академия, 2010. — 176 с.
Доклад: В списке литературы приведены источники, на которые опирается работа: классические учебники по нейронным сетям и машинному обучению, а также отечественные пособия по введению в искусственный интеллект. Описания даны по действующему стандарту библиографического описания.
Слайд 24. Спасибо за внимание!
Доклад: Благодарю за внимание. Готов ответить на вопросы по устройству нейронных сетей, процессу их обучения и по границам применимости современных интеллектуальных систем.