Меры положения

Меры положения — это статистические показатели, которые показывают центральное или типичное значение выборки, а также делят данные на части, чтобы понять распределение.

1. Среднее выборочное (Mean)

Определение: среднее арифметическое всех наблюдений.

Формула:

\[ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i \]
  • $x_i$ — значения выборки
  • $n$ — количество наблюдений

Применение:
Показывает «среднее» значение данных. Используется, когда данные не имеют сильных выбросов.

Пример:

Выборка: $[2, 4, 6]$

\[ \bar{x} = \frac{2 + 4 + 6}{3} = 4 \]

2. Мода (Mode)

Определение: значение, которое встречается чаще всего.

Формула: нет стандартной формулы, определяется по частоте встречаемости.

Применение:
Показывает самое распространённое значение. Полезно для категориальных данных или для понимания «типичного» значения в выборке.

Пример:

Выборка: $[2, 2, 3, 4, 4, 4, 5]$
Мода: $4$

3. Медиана (Median)

Определение: срединное значение упорядоченной выборки.

Формула:

  • Если $n$ нечётное: медиана — центральное значение
  • Если $n$ чётное: медиана — среднее двух средних значений

Применение:
Хорошо отражает «типичное» значение, когда есть выбросы или данные неравномерно распределены.

Пример:

Выборка: $[1, 2, 3, 10, 20]$

Медиана = $3$ (третье значение в упорядоченном ряду)

4. Квантили (Quantiles)

Определение: значения, которые делят упорядоченную выборку на равные части.

Основные квантили:

  • $Q_1$ — первый квартиль (25% значений меньше)
  • $Q_2$ — второй квартиль (медиана, 50% значений меньше)
  • $Q_3$ — третий квартиль (75% значений меньше)

Формула:

$Q_k = x_{(k(n+1)/4)}$ — значение, соответствующее позиции в упорядоченной выборке

  • При необходимости берём интерполяцию, если позиция дробная.

Применение:
Показывают распределение данных, помогают оценивать разброс и границы данных. Полезны для ящика с усами (boxplot).

Пример:

Выборка: $[1, 2, 3, 4, 5, 6, 7, 8]$

  • $Q_1 = 2.5$ (между 2 и 3)
  • $Q_2 = 4.5$ (между 4 и 5)
  • $Q_3 = 6.5$ (между 6 и 7)

5. Перцентили (Percentiles)

Определение: значения, которые делят данные на 100 равных частей.

  • $P_k$ — значение, ниже которого находится $k\%$ данных.

Формула: аналогично квантили, но с делением на 100 вместо 4.

Применение:
Позволяет оценивать распределение конкретного значения относительно всей выборки. Используется, например, для школьных тестов, где говорят «ты в 90-м перцентиле».

6. Минимум и максимум

  • Минимум: наименьшее значение в выборке
  • Максимум: наибольшее значение в выборке

Применение:
Показывают диапазон данных. Используются для выявления выбросов.

Пример:
Выборка: $[3, 5, 2, 8, 6]$
Минимум = $2$, Максимум = $8$

7. Размах (Range)

Определение: разница между максимальным и минимальным значением

\[ R = x_{\max} - x_{\min} \]

Применение:
Оценка общей разбросанности данных. Легко вычислять, но чувствителен к выбросам.

Пример:
Выборка: $[3, 5, 2, 8, 6]$
Размах $R = 8 - 2 = 6$

Итоговая таблица мер положения

Мера Формула/определение Для чего применяется Пример
Среднее $\bar{x} = \frac{1}{n}\sum x_i$ Среднее значение, когда нет выбросов 4
Мода чаще всего встречающееся значение Типичное значение, категориальные данные 4
Медиана среднее значение в упорядоченном ряду Типичное значение при выбросах 3
Квартиль $Q_1, Q_2, Q_3$ Делят выборку на части, визуализация $Q_1=2.5$
Перцентиль $P_k$ Распределение конкретного значения 90-й перцентиль
Минимум $x_{\min}$ Нижняя граница 2
Максимум $x_{\max}$ Верхняя граница 8
Размах $R = x_{\max} - x_{\min}$ Общий разброс 6