Меры положения
Меры положения выборки
Меры положения — это статистические показатели, которые показывают центральное или типичное значение выборки, а также делят данные на части, чтобы понять распределение.
1. Среднее выборочное (Mean)
Определение: среднее арифметическое всех наблюдений.
Формула:
- \(x_i\) — значения выборки
- \(n\) — количество наблюдений
Применение:
Показывает «среднее» значение данных. Используется, когда данные не имеют сильных выбросов.
Пример:
Выборка: \([2, 4, 6]\)
2. Мода (Mode)
Определение: значение, которое встречается чаще всего.
Формула: нет стандартной формулы, определяется по частоте встречаемости.
Применение:
Показывает самое распространённое значение. Полезно для категориальных данных или для понимания «типичного» значения в выборке.
Пример:
Выборка: \([2, 2, 3, 4, 4, 4, 5]\)
Мода: \(4\)
3. Медиана (Median)
Определение: срединное значение упорядоченной выборки.
Формула:
- Если \(n\) нечётное: медиана — центральное значение
- Если \(n\) чётное: медиана — среднее двух средних значений
Применение:
Хорошо отражает «типичное» значение, когда есть выбросы или данные неравномерно распределены.
Пример:
Выборка: \([1, 2, 3, 10, 20]\)
Медиана = \(3\) (третье значение в упорядоченном ряду)
4. Квантили (Quantiles)
Определение: значения, которые делят упорядоченную выборку на равные части.
Основные квантили:
- \(Q_1\) — первый квартиль (25% значений меньше)
- \(Q_2\) — второй квартиль (медиана, 50% значений меньше)
- \(Q_3\) — третий квартиль (75% значений меньше)
Формула:
\(Q_k = x_{(k(n+1)/4)}\) — значение, соответствующее позиции в упорядоченной выборке
- При необходимости берём интерполяцию, если позиция дробная.
Применение:
Показывают распределение данных, помогают оценивать разброс и границы данных. Полезны для ящика с усами (boxplot).
Пример:
Выборка: \([1, 2, 3, 4, 5, 6, 7, 8]\)
- \(Q_1 = 2.5\) (между 2 и 3)
- \(Q_2 = 4.5\) (между 4 и 5)
- \(Q_3 = 6.5\) (между 6 и 7)
5. Перцентили (Percentiles)
Определение: значения, которые делят данные на 100 равных частей.
- \(P_k\) — значение, ниже которого находится \(k\%\) данных.
Формула: аналогично квантили, но с делением на 100 вместо 4.
Применение:
Позволяет оценивать распределение конкретного значения относительно всей выборки. Используется, например, для школьных тестов, где говорят «ты в 90-м перцентиле».
6. Минимум и максимум
- Минимум: наименьшее значение в выборке
- Максимум: наибольшее значение в выборке
Применение:
Показывают диапазон данных. Используются для выявления выбросов.
Пример:
Выборка: \([3, 5, 2, 8, 6]\)
Минимум = \(2\), Максимум = \(8\)
7. Размах (Range)
Определение: разница между максимальным и минимальным значением
Применение:
Оценка общей разбросанности данных. Легко вычислять, но чувствителен к выбросам.
Пример:
Выборка: \([3, 5, 2, 8, 6]\)
Размах \(R = 8 - 2 = 6\)
Итоговая таблица мер положения
| Мера | Формула/определение | Для чего применяется | Пример |
|---|---|---|---|
| Среднее | \(\bar{x} = \frac{1}{n}\sum x_i\) | Среднее значение, когда нет выбросов | 4 |
| Мода | чаще всего встречающееся значение | Типичное значение, категориальные данные | 4 |
| Медиана | среднее значение в упорядоченном ряду | Типичное значение при выбросах | 3 |
| Квартиль | \(Q_1, Q_2, Q_3\) | Делят выборку на части, визуализация | \(Q_1=2.5\) |
| Перцентиль | \(P_k\) | Распределение конкретного значения | 90-й перцентиль |
| Минимум | \(x_{\min}\) | Нижняя граница | 2 |
| Максимум | \(x_{\max}\) | Верхняя граница | 8 |
| Размах | \(R = x_{\max} - x_{\min}\) | Общий разброс | 6 |