Математическая статистика: выборка, среднее, дисперсия
Генеральная совокупность и выборка, выборочное среднее и дисперсия, несмещённые оценки, доверительный интервал, проверка гипотез и критерий Стьюдента.
Теория вероятностей идёт от модели к данным, статистика — наоборот: по конечной выборке восстанавливает характеристики всей совокупности. Именно она нужна, когда в курсовой обрабатывают результаты измерений или опроса.
| Понятие | Генеральная совокупность | Выборка |
|---|---|---|
| Что это | Все объекты изучаемого множества | Часть, отобранная для наблюдения |
| Среднее | μ — параметр, неизвестен | x̄ — статистика, вычисляется |
| Дисперсия | σ² | s² |
| Объём | N, часто бесконечен | n |
Основные оценки
Выборочное среднее: x̄ = (1/n)·Σ xᵢ Выборочная дисперсия (несмещённая): s² = (1/(n−1))·Σ (xᵢ − x̄)² Стандартное отклонение: s = √s² Стандартная ошибка среднего: SE = s / √n
Свойства хорошей оценки
- Несмещённость: математическое ожидание оценки равно истинному параметру.
- Состоятельность: при росте n оценка сходится к параметру.
- Эффективность: среди несмещённых имеет наименьшую дисперсию.
Доверительный интервал для среднего
При известной σ (или большом n): x̄ ± z_(α/2) · σ/√n При неизвестной σ (обычный случай): x̄ ± t_(α/2, n−1) · s/√n Критические значения для доверительной вероятности 95 %: z = 1,96 t при n = 10 (df = 9): 2,262 t при n = 20 (df = 19): 2,093 t при n = 30 (df = 29): 2,045
Пример: n = 16, x̄ = 24,5, s = 3,2, доверительная вероятность 95 % df = 15, t = 2,131 Δ = 2,131 · 3,2/√16 = 2,131 · 0,8 = 1,70 Интервал: 24,5 ± 1,70 → (22,8; 26,2)
Читается так: при многократном повторении эксперимента 95 % построенных таким способом интервалов накроют истинное среднее. Утверждение относится к процедуре, а не к конкретному интервалу — на защите это любят уточнять.
Проверка гипотез
- Формулируют нулевую гипотезу H₀ (различий нет) и альтернативную H₁.
- Выбирают уровень значимости α, обычно 0,05.
- Вычисляют наблюдаемое значение критерия по выборке.
- Находят критическое значение по таблице для α и числа степеней свободы.
- Сравнивают: |t_набл| > t_крит — H₀ отвергается, различие значимо.
Критерий Стьюдента для двух независимых выборок: t = (x̄₁ − x̄₂) / √( s₁²/n₁ + s₂²/n₂ ) Для сравнения среднего с заданным значением μ₀: t = (x̄ − μ₀) / (s/√n), df = n − 1
| Ошибка | Что произошло | Вероятность |
|---|---|---|
| Первого рода | Отвергли верную H₀ — увидели различие, которого нет | α |
| Второго рода | Приняли ложную H₀ — не заметили реальное различие | β |
| Мощность критерия | Вероятность обнаружить реальное различие | 1 − β |
Другие частые критерии
- Хи-квадрат Пирсона — согласие эмпирического распределения с теоретическим и независимость признаков в таблице сопряжённости.
- Критерий Фишера — сравнение дисперсий, а также значимость регрессионной модели в целом.
- Критерий Колмогорова-Смирнова — проверка нормальности распределения.
- Непараметрические критерии Манна-Уитни и Уилкоксона — когда нормальность не подтверждается или данные порядковые.
Обработка в практической части
import numpy as np
from scipy import stats
data = np.array([24.1, 23.8, 25.2, 24.9, 23.5, 26.0, 24.4, 25.1])
mean = data.mean()
sd = data.std(ddof=1) # ddof=1 — несмещённая оценка
se = sd / np.sqrt(len(data))
# доверительный интервал 95 %
low, high = stats.t.interval(0.95, len(data)-1, loc=mean, scale=se)
print(f'x̄ = {mean:.2f}, s = {sd:.2f}, ДИ 95 %: ({low:.2f}; {high:.2f})')
# проверка гипотезы: среднее равно 24,0?
t_stat, p_value = stats.ttest_1samp(data, 24.0)
print(f't = {t_stat:.3f}, p = {p_value:.4f}')
print('различие значимо' if p_value < 0.05 else 'различие не значимо')
Параметр ddof=1 в numpy отвечает ровно за ту самую поправку Бесселя. По умолчанию ddof=0, и дисперсия выйдет заниженной — распространённая ошибка в расчётной части, которую легко не заметить.
Частые вопросы
Что означает p-значение 0,03?
Если различия на самом деле нет, вероятность получить такое или более сильное расхождение по случайности составляет 3 %. Это меньше принятого порога 0,05, поэтому нулевую гипотезу отвергают.
Какого объёма выборки достаточно?
Зависит от разброса и величины эффекта, который хотите обнаружить. Для учебной работы обычно требуют не менее 30 наблюдений — при таком n распределение среднего близко к нормальному.
Можно ли применять критерий Стьюдента к ненормальным данным?
При больших выборках он устойчив к отклонениям от нормальности. При малых лучше взять непараметрический аналог — критерий Манна-Уитни.