Математическая статистика: выборка, среднее, дисперсия

Генеральная совокупность и выборка, выборочное среднее и дисперсия, несмещённые оценки, доверительный интервал, проверка гипотез и критерий Стьюдента.

Теория вероятностей идёт от модели к данным, статистика — наоборот: по конечной выборке восстанавливает характеристики всей совокупности. Именно она нужна, когда в курсовой обрабатывают результаты измерений или опроса.

ПонятиеГенеральная совокупностьВыборка
Что этоВсе объекты изучаемого множестваЧасть, отобранная для наблюдения
Среднееμ — параметр, неизвестенx̄ — статистика, вычисляется
Дисперсияσ²
ОбъёмN, часто бесконеченn

Основные оценки

Выборочное среднее:
  x̄ = (1/n)·Σ xᵢ

Выборочная дисперсия (несмещённая):
  s² = (1/(n−1))·Σ (xᵢ − x̄)²

Стандартное отклонение:
  s = √s²

Стандартная ошибка среднего:
  SE = s / √n
Деление на n−1, а не на n — не опечатка. Отклонения считаются от выборочного среднего, которое само подстроено под данные, поэтому разброс систематически занижается. Поправка Бесселя это компенсирует. При n > 100 разница мала, при n = 5 — принципиальна.

Свойства хорошей оценки

Доверительный интервал для среднего

При известной σ (или большом n):
  x̄ ± z_(α/2) · σ/√n

При неизвестной σ (обычный случай):
  x̄ ± t_(α/2, n−1) · s/√n

Критические значения для доверительной вероятности 95 %:
  z = 1,96
  t при n = 10 (df = 9): 2,262
  t при n = 20 (df = 19): 2,093
  t при n = 30 (df = 29): 2,045
Пример: n = 16, x̄ = 24,5, s = 3,2, доверительная вероятность 95 %

  df = 15,  t = 2,131
  Δ = 2,131 · 3,2/√16 = 2,131 · 0,8 = 1,70

  Интервал: 24,5 ± 1,70  →  (22,8; 26,2)

Читается так: при многократном повторении эксперимента 95 % построенных таким способом интервалов накроют истинное среднее. Утверждение относится к процедуре, а не к конкретному интервалу — на защите это любят уточнять.

Проверка гипотез

  1. Формулируют нулевую гипотезу H₀ (различий нет) и альтернативную H₁.
  2. Выбирают уровень значимости α, обычно 0,05.
  3. Вычисляют наблюдаемое значение критерия по выборке.
  4. Находят критическое значение по таблице для α и числа степеней свободы.
  5. Сравнивают: |t_набл| > t_крит — H₀ отвергается, различие значимо.
Критерий Стьюдента для двух независимых выборок:

  t = (x̄₁ − x̄₂) / √( s₁²/n₁ + s₂²/n₂ )

Для сравнения среднего с заданным значением μ₀:

  t = (x̄ − μ₀) / (s/√n),   df = n − 1
ОшибкаЧто произошлоВероятность
Первого родаОтвергли верную H₀ — увидели различие, которого нетα
Второго родаПриняли ложную H₀ — не заметили реальное различиеβ
Мощность критерияВероятность обнаружить реальное различие1 − β
Уменьшая α, вы снижаете риск ложной находки, но повышаете риск пропустить настоящий эффект. Единственный способ снизить обе ошибки одновременно — увеличить объём выборки.

Другие частые критерии

Обработка в практической части

import numpy as np
from scipy import stats

data = np.array([24.1, 23.8, 25.2, 24.9, 23.5, 26.0, 24.4, 25.1])

mean = data.mean()
sd   = data.std(ddof=1)          # ddof=1 — несмещённая оценка
se   = sd / np.sqrt(len(data))

# доверительный интервал 95 %
low, high = stats.t.interval(0.95, len(data)-1, loc=mean, scale=se)
print(f'x̄ = {mean:.2f}, s = {sd:.2f}, ДИ 95 %: ({low:.2f}; {high:.2f})')

# проверка гипотезы: среднее равно 24,0?
t_stat, p_value = stats.ttest_1samp(data, 24.0)
print(f't = {t_stat:.3f}, p = {p_value:.4f}')
print('различие значимо' if p_value < 0.05 else 'различие не значимо')

Параметр ddof=1 в numpy отвечает ровно за ту самую поправку Бесселя. По умолчанию ddof=0, и дисперсия выйдет заниженной — распространённая ошибка в расчётной части, которую легко не заметить.

Частые вопросы

Что означает p-значение 0,03?

Если различия на самом деле нет, вероятность получить такое или более сильное расхождение по случайности составляет 3 %. Это меньше принятого порога 0,05, поэтому нулевую гипотезу отвергают.

Какого объёма выборки достаточно?

Зависит от разброса и величины эффекта, который хотите обнаружить. Для учебной работы обычно требуют не менее 30 наблюдений — при таком n распределение среднего близко к нормальному.

Можно ли применять критерий Стьюдента к ненормальным данным?

При больших выборках он устойчив к отклонениям от нормальности. При малых лучше взять непараметрический аналог — критерий Манна-Уитни.

Читайте также

Сделаем работу по этой теме

Опишите задачу — ответим в течение 15 минут в личных сообщениях ВКонтакте, назовём срок и цену. Предоплаты за оценку нет.

  • Оценка заявки бесплатно
  • Правки по замечаниям преподавателя
  • Работы по всем техническим и IT-дисциплинам

Нажимая кнопку, вы соглашаетесь на обработку указанных данных для ответа на заявку.