Меры положения
Меры положения — это статистические показатели, которые показывают центральное или типичное значение выборки, а также делят данные на части, чтобы понять распределение.
1. Среднее выборочное (Mean)
Определение: среднее арифметическое всех наблюдений.
Формула:
- $x_i$ — значения выборки
- $n$ — количество наблюдений
Применение:
Показывает «среднее» значение данных. Используется, когда данные не имеют сильных выбросов.
Пример:
Выборка: $[2, 4, 6]$
2. Мода (Mode)
Определение: значение, которое встречается чаще всего.
Формула: нет стандартной формулы, определяется по частоте встречаемости.
Применение:
Показывает самое распространённое значение. Полезно для категориальных данных или для понимания «типичного» значения в выборке.
Пример:
Выборка: $[2, 2, 3, 4, 4, 4, 5]$
Мода: $4$
3. Медиана (Median)
Определение: срединное значение упорядоченной выборки.
Формула:
- Если $n$ нечётное: медиана — центральное значение
- Если $n$ чётное: медиана — среднее двух средних значений
Применение:
Хорошо отражает «типичное» значение, когда есть выбросы или данные неравномерно распределены.
Пример:
Выборка: $[1, 2, 3, 10, 20]$
Медиана = $3$ (третье значение в упорядоченном ряду)
4. Квантили (Quantiles)
Определение: значения, которые делят упорядоченную выборку на равные части.
Основные квантили:
- $Q_1$ — первый квартиль (25% значений меньше)
- $Q_2$ — второй квартиль (медиана, 50% значений меньше)
- $Q_3$ — третий квартиль (75% значений меньше)
Формула:
$Q_k = x_{(k(n+1)/4)}$ — значение, соответствующее позиции в упорядоченной выборке
- При необходимости берём интерполяцию, если позиция дробная.
Применение:
Показывают распределение данных, помогают оценивать разброс и границы данных. Полезны для ящика с усами (boxplot).
Пример:
Выборка: $[1, 2, 3, 4, 5, 6, 7, 8]$
- $Q_1 = 2.5$ (между 2 и 3)
- $Q_2 = 4.5$ (между 4 и 5)
- $Q_3 = 6.5$ (между 6 и 7)
5. Перцентили (Percentiles)
Определение: значения, которые делят данные на 100 равных частей.
- $P_k$ — значение, ниже которого находится $k\%$ данных.
Формула: аналогично квантили, но с делением на 100 вместо 4.
Применение:
Позволяет оценивать распределение конкретного значения относительно всей выборки. Используется, например, для школьных тестов, где говорят «ты в 90-м перцентиле».
6. Минимум и максимум
- Минимум: наименьшее значение в выборке
- Максимум: наибольшее значение в выборке
Применение:
Показывают диапазон данных. Используются для выявления выбросов.
Пример:
Выборка: $[3, 5, 2, 8, 6]$
Минимум = $2$, Максимум = $8$
7. Размах (Range)
Определение: разница между максимальным и минимальным значением
Применение:
Оценка общей разбросанности данных. Легко вычислять, но чувствителен к выбросам.
Пример:
Выборка: $[3, 5, 2, 8, 6]$
Размах $R = 8 - 2 = 6$
Итоговая таблица мер положения
| Мера | Формула/определение | Для чего применяется | Пример |
|---|---|---|---|
| Среднее | $\bar{x} = \frac{1}{n}\sum x_i$ | Среднее значение, когда нет выбросов | 4 |
| Мода | чаще всего встречающееся значение | Типичное значение, категориальные данные | 4 |
| Медиана | среднее значение в упорядоченном ряду | Типичное значение при выбросах | 3 |
| Квартиль | $Q_1, Q_2, Q_3$ | Делят выборку на части, визуализация | $Q_1=2.5$ |
| Перцентиль | $P_k$ | Распределение конкретного значения | 90-й перцентиль |
| Минимум | $x_{\min}$ | Нижняя граница | 2 |
| Максимум | $x_{\max}$ | Верхняя граница | 8 |
| Размах | $R = x_{\max} - x_{\min}$ | Общий разброс | 6 |