Меры положения

Меры положения выборки

Меры положения — это статистические показатели, которые показывают центральное или типичное значение выборки, а также делят данные на части, чтобы понять распределение.

1. Среднее выборочное (Mean)

Определение: среднее арифметическое всех наблюдений.

Формула:

\[ \bar{x} = \frac{1}{n} \sum_{i=1}^{n} x_i \]
  • \(x_i\) — значения выборки
  • \(n\) — количество наблюдений

Применение:
Показывает «среднее» значение данных. Используется, когда данные не имеют сильных выбросов.

Пример:

Выборка: \([2, 4, 6]\)

\[ \bar{x} = \frac{2 + 4 + 6}{3} = 4 \]

2. Мода (Mode)

Определение: значение, которое встречается чаще всего.

Формула: нет стандартной формулы, определяется по частоте встречаемости.

Применение:
Показывает самое распространённое значение. Полезно для категориальных данных или для понимания «типичного» значения в выборке.

Пример:

Выборка: \([2, 2, 3, 4, 4, 4, 5]\)
Мода: \(4\)

3. Медиана (Median)

Определение: срединное значение упорядоченной выборки.

Формула:

  • Если \(n\) нечётное: медиана — центральное значение
  • Если \(n\) чётное: медиана — среднее двух средних значений

Применение:
Хорошо отражает «типичное» значение, когда есть выбросы или данные неравномерно распределены.

Пример:

Выборка: \([1, 2, 3, 10, 20]\)

Медиана = \(3\) (третье значение в упорядоченном ряду)

4. Квантили (Quantiles)

Определение: значения, которые делят упорядоченную выборку на равные части.

Основные квантили:

  • \(Q_1\) — первый квартиль (25% значений меньше)
  • \(Q_2\) — второй квартиль (медиана, 50% значений меньше)
  • \(Q_3\) — третий квартиль (75% значений меньше)

Формула:

\(Q_k = x_{(k(n+1)/4)}\) — значение, соответствующее позиции в упорядоченной выборке

  • При необходимости берём интерполяцию, если позиция дробная.

Применение:
Показывают распределение данных, помогают оценивать разброс и границы данных. Полезны для ящика с усами (boxplot).

Пример:

Выборка: \([1, 2, 3, 4, 5, 6, 7, 8]\)

  • \(Q_1 = 2.5\) (между 2 и 3)
  • \(Q_2 = 4.5\) (между 4 и 5)
  • \(Q_3 = 6.5\) (между 6 и 7)

5. Перцентили (Percentiles)

Определение: значения, которые делят данные на 100 равных частей.

  • \(P_k\) — значение, ниже которого находится \(k\%\) данных.

Формула: аналогично квантили, но с делением на 100 вместо 4.

Применение:
Позволяет оценивать распределение конкретного значения относительно всей выборки. Используется, например, для школьных тестов, где говорят «ты в 90-м перцентиле».

6. Минимум и максимум

  • Минимум: наименьшее значение в выборке
  • Максимум: наибольшее значение в выборке

Применение:
Показывают диапазон данных. Используются для выявления выбросов.

Пример:
Выборка: \([3, 5, 2, 8, 6]\)
Минимум = \(2\), Максимум = \(8\)

7. Размах (Range)

Определение: разница между максимальным и минимальным значением

\[ R = x_{\max} - x_{\min} \]

Применение:
Оценка общей разбросанности данных. Легко вычислять, но чувствителен к выбросам.

Пример:
Выборка: \([3, 5, 2, 8, 6]\)
Размах \(R = 8 - 2 = 6\)

Итоговая таблица мер положения

Мера Формула/определение Для чего применяется Пример
Среднее \(\bar{x} = \frac{1}{n}\sum x_i\) Среднее значение, когда нет выбросов 4
Мода чаще всего встречающееся значение Типичное значение, категориальные данные 4
Медиана среднее значение в упорядоченном ряду Типичное значение при выбросах 3
Квартиль \(Q_1, Q_2, Q_3\) Делят выборку на части, визуализация \(Q_1=2.5\)
Перцентиль \(P_k\) Распределение конкретного значения 90-й перцентиль
Минимум \(x_{\min}\) Нижняя граница 2
Максимум \(x_{\max}\) Верхняя граница 8
Размах \(R = x_{\max} - x_{\min}\) Общий разброс 6