Слайд 1. Отклонения в статистике
- Показатели вариации: размах, среднее линейное и стандартное отклонение, коэффициент вариации, правило трёх сигм и поиск выбросов
Доклад: Тема нашей презентации — отклонения в статистике. Речь пойдёт о том, как измеряют разброс данных: от простейшего размаха до стандартного отклонения, коэффициента вариации и правил поиска нетипичных значений. Это базовый инструментарий, без которого не обходится ни одно эмпирическое исследование.
Слайд 2. Содержание
- Введение
- Почему одной средней недостаточно
- Отклонение от средней и его главное свойство
- Показатели вариации: абсолютные и относительные
- Размах вариации
- Среднее линейное отклонение
- Порядок расчёта стандартного отклонения
- Дисперсия и стандартное отклонение
- Генеральная и выборочная оценка: n или n − 1
- Числовой пример: расчёт по восьми значениям
- Коэффициент вариации
- Однородность совокупности
- Правило трёх сигм
- Выбросы: как их обнаруживают
- Сравнение показателей вариации
- Где применяются показатели отклонения
- Типичные ошибки при расчёте
- Учёные, создавшие аппарат вариации
- Выводы
- Список литературы
Доклад: Разговор построим последовательно. Сначала выясним, почему одной средней недостаточно, затем разберём каждый показатель вариации по отдельности, посчитаем сквозной числовой пример, а в конце перейдём к правилу трёх сигм и к обнаружению выбросов.
Слайд 3. Введение
- Средняя величина показывает, вокруг чего группируются данные, но ничего не говорит о том, насколько сильно они разбросаны.
- Две совокупности с одинаковой средней могут быть устроены совершенно по-разному — различает их только вариация.
- Отклонение — это разность между отдельным значением признака и средней; из отклонений построены все меры разброса.
- Оценка разброса нужна в контроле качества, финансах, психодиагностике, метрологии и любой обработке результатов измерений.
Доклад: Начнём с главного: средняя величина сообщает, вокруг какого значения группируются данные, но совершенно не описывает, насколько плотно они к нему прижаты. Отклонение — это разность между отдельным значением признака и средней, и именно из отклонений строятся все меры разброса. Без них невозможно оценить надёжность самой средней.
Слайд 4. Почему одной средней недостаточно
- Две учебные группы по четыре студента получили одинаковый средний балл 50, но устойчивость результата у них совершенно разная. Сравним, что сообщает средняя и что добавляет разброс.
- Средний балл — 50
- Размах — всего 2 балла
- Стандартное отклонение σ ≈ 0,7 балла
- Результаты ровные, средняя описывает группу точно
- Средний балл — тот же 50
- Размах — 60 баллов
- Стандартное отклонение σ ≈ 22,4 балла
- Ни один студент не набрал балл, близкий к средней
Доклад: Вот наглядное подтверждение. Две группы по четыре студента получили один и тот же средний балл — пятьдесят. Но в первой группе результаты укладываются в два балла, а во второй разлетаются на шестьдесят. Стандартное отклонение отличается более чем в тридцать раз, и во второй группе средняя не описывает реально ни одного студента.
Слайд 5. Отклонение от средней и его главное свойство
- Σ(x − x̄) = 0
- x — отдельное значение признака в совокупности
- x̄ — средняя арифметическая по всем наблюдениям
- x − x̄ — отклонение отдельного значения от средней
- Следствие — сумма отклонений всегда равна нулю, поэтому усреднять их напрямую бессмысленно: берут модули или квадраты
Доклад: Отклонение записывается предельно просто — значение минус средняя. Но у него есть свойство, которое сразу закрывает наивный путь: сумма всех отклонений от средней арифметической тождественно равна нулю, плюсы гасят минусы. Поэтому усреднять сами отклонения бессмысленно, и статистика идёт двумя обходными путями — берёт модули либо квадраты.
Слайд 6. Показатели вариации: абсолютные и относительные
- Все меры разброса делятся на две группы. Абсолютные выражены в единицах самого признака, относительные — в процентах и позволяют сравнивать признаки, измеренные в разных единицах.
- Размах вариации
- Среднее линейное отклонение
- Дисперсия
- Стандартное отклонение
- Коэффициент осцилляции
- Относительное линейное отклонение
- Коэффициент вариации
Доклад: Все показатели вариации принято делить на две группы. Абсолютные — размах, среднее линейное отклонение, дисперсия и стандартное отклонение — выражены в единицах самого признака. Относительные — коэффициент осцилляции, относительное линейное отклонение и коэффициент вариации — выражены в процентах и потому годятся для сравнения разнородных признаков.
Слайд 7. Размах вариации
- R = Xmax − Xmin
- Xmax — наибольшее значение признака в совокупности
- Xmin — наименьшее значение признака
- R — размах вариации, выражен в единицах признака
- Ограничение — опирается только на два крайних значения и потому крайне чувствителен к выбросам
Доклад: Самый простой показатель — размах вариации, разность между наибольшим и наименьшим значением. Он мгновенно считается и понятен без пояснений. Но у него серьёзный недостаток: размах опирается ровно на два крайних наблюдения и потому полностью подчинён выбросам — одно ошибочное значение искажает его целиком.
Слайд 8. Среднее линейное отклонение
- d = Σ|x − x̄| / n
- |x − x̄| — модуль отклонения: знак отбрасывается, остаётся величина
- n — число наблюдений в совокупности
- d — среднее линейное отклонение в единицах признака
- Особенность — учитывает все значения, но модуль неудобен в алгебраических преобразованиях, поэтому чаще берут квадраты
Доклад: Среднее линейное отклонение уже учитывает все наблюдения: мы берём модуль каждого отклонения и усредняем. Показатель нагляден и выражен в единицах признака. Его слабое место чисто математическое — модуль плохо поддаётся алгебраическим преобразованиям, поэтому в теоретической статистике предпочитают квадраты.
Слайд 9. Порядок расчёта стандартного отклонения
- Расчёт всегда идёт по одной схеме: от средней к отклонениям, затем к квадратам и корню.
- Пропуск любого шага меняет результат, поэтому промежуточные суммы стоит выписывать отдельно.
- Тот же порядок заложен в функциях СТАНДОТКЛОН.В и СТАНДОТКЛОН.Г электронных таблиц.
- Ошибка на четвёртом шаге — самая частая: делитель зависит от того, выборка перед нами или вся совокупность.
- Средняя — найти среднюю арифметическую x̄ по всем значениям
- Отклонения — вычесть среднюю из каждого значения выборки
- Квадраты — возвести каждое отклонение в квадрат и сложить
- Дисперсия — разделить сумму квадратов на n или на n − 1
- Корень — извлечь квадратный корень из полученной дисперсии
Доклад: Порядок расчёта стандартного отклонения всегда один и тот же — пять шагов: средняя, отклонения, квадраты и их сумма, деление и корень. Промежуточные суммы стоит выписывать отдельно, иначе легко потерять слагаемое. Самый ответственный шаг — четвёртый: именно там решается, делим мы на количество наблюдений или на количество наблюдений минус единица.
Слайд 10. Дисперсия и стандартное отклонение
- σ² = Σ(x − x̄)² / n, σ = √σ²
- σ² — дисперсия, средний квадрат отклонения от средней
- σ — стандартное (среднеквадратическое) отклонение, корень из дисперсии
- Единицы — дисперсия измеряется в квадрате единиц признака, стандартное отклонение — в самих единицах
- Смысл σ — типичная величина, на которую отдельное значение отступает от средней
Доклад: Дисперсия — это средний квадрат отклонения от средней. Возведение в квадрат убирает знаки и одновременно усиливает крупные отклонения. Но у дисперсии неудобные единицы: если признак измерен в баллах, дисперсия будет в баллах в квадрате. Поэтому из неё извлекают корень и получают стандартное отклонение — типичную величину отступа значения от средней в тех же единицах, что и сам признак.
Слайд 11. Генеральная и выборочная оценка: n или n − 1
- Формулы различаются только знаменателем, но путать их нельзя: при делении на n выборочная оценка систематически занижает разброс генеральной совокупности.
- σ² = Σ(x − x̄)² / n
- Применяют, когда обследованы все единицы совокупности
- Даёт точное значение параметра, а не его оценку
- Обозначения — σ² для дисперсии и σ для отклонения
- s² = Σ(x − x̄)² / (n − 1)
- Применяют, когда изучена лишь часть совокупности
- n − 1 — число степеней свободы, это поправка Бесселя
- Даёт несмещённую оценку генеральной дисперсии
Доклад: А теперь ключевое различие, в котором чаще всего ошибаются. Если обследована вся совокупность целиком, сумму квадратов делят на количество наблюдений. Если перед нами выборка, делят на количество наблюдений минус единица — это поправка Бесселя, а знаменатель называют числом степеней свободы. Без этой поправки выборочная оценка систематически занижает истинный разброс.
Слайд 12. Числовой пример: расчёт по восьми значениям
- Выборка из восьми результатов теста, баллы: 2, 4, 4, 4, 5, 5, 7, 9.
- Сумма значений 40, средняя x̄ = 40 / 8 = 5; сумма модулей отклонений равна 12, сумма квадратов отклонений равна 32.
- При делении на n вышло бы σ² = 4 и σ = 2, но перед нами выборка, поэтому берём n − 1 = 7.
Доклад: Посчитаем всё на одном примере: восемь результатов теста — два, четыре, четыре, четыре, пять, пять, семь и девять. Их сумма равна сорока, значит средняя равна пяти. Сумма модулей отклонений равна двенадцати, сумма квадратов отклонений — тридцати двум. Отсюда размах семь, среднее линейное отклонение полтора, а поскольку у нас выборка, дисперсия равна тридцати двум седьмым, то есть примерно четыре целых пятьдесят семь сотых, и стандартное отклонение — примерно две целых четырнадцать сотых балла.
Слайд 13. Коэффициент вариации
- V = (σ / x̄) × 100 %
- σ — стандартное отклонение; для выборки в формулу подставляют s
- x̄ — средняя арифметическая, она должна быть положительной
- V — коэффициент вариации в процентах, величина безразмерная
- Расчёт по примеру — V = (2,14 / 5) × 100 % = 42,8 %
Доклад: Коэффициент вариации — это стандартное отклонение, выраженное в процентах от средней. Он безразмерен, а потому позволяет сравнивать разброс роста и веса, баллов и рублей. В нашем примере он равен двум целым четырнадцати сотым, делённым на пять, то есть сорока двум и восьми десятым процента.
Слайд 14. Однородность совокупности
- Коэффициент вариации переводит разброс в проценты и позволяет сравнивать признаки в разных единицах — рост и вес, баллы и рубли.
- В отечественной статистике порогом однородности принято считать 33 %: выше него средняя перестаёт быть надёжной характеристикой.
- Наш пример дал 42,8 % — совокупность неоднородная, и средний балл 5 описывает группу плохо.
- 42,8 % — Неоднородная
- Слабая — до 10 %
- Умеренная — 10–25 %
- Сильная — 25–33 %
- Неоднородная — свыше 33 %
Доклад: По величине коэффициента вариации судят об однородности совокупности. Ориентировочная шкала такова: до десяти процентов вариация слабая, от десяти до двадцати пяти — умеренная, дальше сильная, а порогом однородности в отечественной статистике считают тридцать три процента. Наши сорок два и восемь десятых процента этот порог превышают: совокупность неоднородна, и средний балл описывает группу плохо.
Слайд 15. Правило трёх сигм
- Для нормального распределения доля наблюдений в симметричном интервале вокруг средней известна точно.
- За пределы ±3σ выходит менее 0,3 % значений, поэтому такое отклонение считают практически невозможным по случайным причинам.
- Если форма распределения неизвестна, работает более слабое неравенство Чебышёва: в пределах ±3σ лежит не менее 88,9 % данных при любом распределении.
Доклад: Для нормального распределения доли наблюдений в интервалах вокруг средней известны точно: в пределах одной сигмы лежит около шестидесяти восьми процентов данных, двух сигм — около девяноста пяти, трёх сигм — почти сто, а точнее девяносто девять и семь десятых процента. Отсюда и правило трёх сигм: выход за эти границы случайным быть практически не может. Если же форма распределения неизвестна, выручает неравенство Чебышёва — оно гарантирует не менее восьмидесяти восьми и девяти десятых процента данных в пределах трёх сигм при любом распределении.
Слайд 16. Выбросы: как их обнаруживают
- Выброс — наблюдение, резко отличающееся от остальных: оно смещает среднюю и заметно раздувает стандартное отклонение.
- Правило Тьюки: нормой считают значения между Q1 − 1,5 · (Q3 − Q1) и Q3 + 1,5 · (Q3 − Q1), где Q1 и Q3 — первый и третий квартили.
- Пример: при Q1 = 15 и Q3 = 22 межквартильный размах равен 7, границы — 4,5 и 32,5; значение 60 в них не попадает и признаётся выбросом.
- Правило стандартизованных отклонений: подозрительны значения, у которых |z| > 3, где z = (x − x̄) / σ.
- Выброс не удаляют автоматически: сначала выясняют, ошибка это измерения или реальное редкое явление.
Доклад: Выброс — это наблюдение, резко выпадающее из общего ряда; оно тянет за собой среднюю и сильно раздувает стандартное отклонение. Классический критерий предложил Джон Тьюки: нормой считают значения между первым квартилем минус полтора межквартильных размаха и третьим квартилем плюс полтора. Второй критерий — стандартизованное отклонение больше трёх по модулю. Но обнаружить выброс не значит его выбросить: сначала выясняют, ошибка это измерения или редкое, но настоящее явление.
Слайд 17. Сравнение показателей вариации
- Показатели вариации не заменяют, а дополняют друг друга: у каждого своя область применения.
- Сравнивать разброс признаков, измеренных в разных единицах, можно только относительным показателем.
Доклад: Сведём показатели в таблицу. Размах фиксирует разрыв между крайними значениями, среднее линейное отклонение и стандартное отклонение измеряют типичное отступление от средней в единицах признака, дисперсия остаётся промежуточной величиной в квадрате единиц, а коэффициент вариации переводит разброс в проценты. Показатели не заменяют друг друга, а работают в связке.
Слайд 18. Где применяются показатели отклонения
- Контроль качества: допуск на деталь задают в долях стандартного отклонения, а контрольные карты Шухарта строят по границам ±3σ.
- Финансы: стандартное отклонение доходности — общепринятая мера риска вложения.
- Психодиагностика: тестовые нормы задают в стандартных единицах — например, шкала умственного развития со средней 100 и отклонением 15.
- Метрология и медицина: разброс повторных измерений показывает точность прибора, а ширина нормы задаётся в сигмах от среднего значения.
Доклад: Практическое применение этих показателей очень широко. В контроле качества допуск на деталь задают в долях стандартного отклонения, а контрольные карты Шухарта строят по границам плюс-минус три сигмы. В финансах стандартное отклонение доходности — общепринятая мера риска. В психодиагностике тестовые нормы задают в стандартных единицах: у шкалы умственного развития средняя равна ста, а отклонение — пятнадцати.
Слайд 19. Типичные ошибки при расчёте
- Делить сумму квадратов на n, работая с выборкой, — оценка разброса выходит систематически заниженной.
- Сравнивать разброс двух признаков в разных единицах по стандартному отклонению вместо коэффициента вариации.
- Принимать дисперсию за итоговый показатель: она выражена в квадрате единиц и напрямую не интерпретируется.
- Применять правило трёх сигм к распределению, которое явно не является нормальным.
- Удалять выбросы, не разобравшись, ошибка это измерения или реальное значение признака.
Доклад: Перечислю ошибки, которые встречаются чаще всего. Деление на количество наблюдений при работе с выборкой занижает разброс. Сравнение признаков в разных единицах по стандартному отклонению вместо коэффициента вариации даёт бессмысленный вывод. Дисперсию нельзя подавать как итоговый показатель. Правило трёх сигм неприменимо к явно ненормальным распределениям. И, наконец, выбросы нельзя удалять не разобравшись.
Слайд 20. Учёные, создавшие аппарат вариации
- Пафнутий Львович Чебышёв, 1821–1894, Доказал неравенство, ограничивающее долю значений за пределами k стандартных отклонений при любом распределении
- Карл Пирсон, 1857–1936, Ввёл в 1893 году сам термин «стандартное отклонение» и его общепринятое обозначение
- Рональд Фишер, 1890–1962, Ввёл в 1918 году термин «дисперсия» и разработал дисперсионный анализ
- Джон Тьюки, 1915–2000, Предложил диаграмму «ящик с усами» и правило полутора межквартильных размахов для поиска выбросов
Доклад: Аппарат вариации создавался почти столетие. Пафнутий Львович Чебышёв доказал неравенство, которое работает при любом распределении. Карл Пирсон в тысяча восемьсот девяносто третьем году ввёл сам термин «стандартное отклонение». Рональд Фишер в тысяча девятьсот восемнадцатом году ввёл понятие дисперсии и построил дисперсионный анализ. Джон Тьюки предложил диаграмму «ящик с усами» и правило полутора межквартильных размахов.
Слайд 21. Выводы
- Средняя без показателя вариации неполна: разброс данных нужно измерять всегда, иначе выводы о совокупности не обоснованы.
- Основные абсолютные меры — размах, среднее линейное отклонение, дисперсия и стандартное отклонение; последнее удобнее всех, так как выражено в единицах признака.
- Выборочные формулы делят сумму квадратов на n − 1: поправка Бесселя устраняет систематическое занижение разброса.
- Коэффициент вариации переводит разброс в проценты и позволяет сравнивать любые признаки; порогом однородности принято считать 33 %.
- Правило трёх сигм и правило полутора межквартильных размахов дают простые рабочие критерии для поиска нетипичных значений.
Доклад: Подведём итоги. Средняя без показателя вариации неполна. Основные абсолютные меры — размах, среднее линейное отклонение, дисперсия и стандартное отклонение, причём последнее удобнее всех, потому что выражено в единицах признака. Для выборки сумму квадратов делят на количество наблюдений минус единица. Коэффициент вариации переводит разброс в проценты, а правило трёх сигм и правило полутора межквартильных размахов дают рабочие критерии поиска нетипичных значений.
Слайд 22. Список литературы
- Гмурман, В. Е. Теория вероятностей и математическая статистика : учебное пособие / В. Е. Гмурман. — Москва : Юрайт, 2016. — 479 с.
- Годин, А. М. Статистика : учебник / А. М. Годин. — Москва : Дашков и К°, 2016. — 412 с.
- Елисеева, И. И. Общая теория статистики : учебник / И. И. Елисеева, М. М. Юзбашев. — Москва : Финансы и статистика, 2004. — 656 с.
- Кремер, Н. Ш. Теория вероятностей и математическая статистика : учебник / Н. Ш. Кремер. — Москва : Юнити-Дана, 2010. — 551 с.
- Наследов, А. Д. Математические методы психологического исследования : анализ и интерпретация данных / А. Д. Наследов. — Санкт-Петербург : Речь, 2004. — 392 с.
Доклад: И последнее замечание к списку литературы. Приведённые учебники — Гмурмана, Година, Елисеевой, Кремера и Наследова — покрывают тему с разных сторон: от классической теории вероятностей до прикладной обработки данных в психологическом исследовании. По ним можно закрепить и формулы, и практику расчётов.
Слайд 23. Спасибо за внимание!
Доклад: Благодарю за внимание. Готов ответить на вопросы по формулам, по различию выборочной и генеральной оценки и по обработке выбросов.