Распределение ХИ-квадрат. Распределения математической статистики в EXCEL
Рассмотрим Распределение ХИ-квадрат. С помощью функции MS EXCEL ХИ2.РАСП() построим графики функции распределения и плотности вероятности, поясним применение этого распределения для целей математической статистики.
Распределение ХИ-квадрат ( Х 2 , ХИ2, англ. Chi — squared distribution ) применяется в различных методах математической статистики:
- при построении доверительных интервалов для дисперсии ;
- при проверке гипотез о дисперсии нормального распределения ;
- при проверке гипотез с помощью критерия согласия Пирсона (согласуются ли эмпирические данные с нашим предположением о теоретической функции распределения или нет, англ. Goodness-of-fit)
- при проверке гипотез с помощью критерия независимости хи-квадрат (используется для определения связи между двумя категориальными переменными, англ. Chi-square test of association).
Определение : Если x 1 , x 2 , …, x n независимые случайные величины, распределенные по стандартному нормальному закону N(0;1), то распределение случайной величины Y=x 1 2 + x 2 2 +…+ x n 2 имеет распределение Х 2 с n степенями свободы.
Распределение Х 2 зависит от одного параметра, который называется степенью свободы ( df , degrees of freedom ). Например, при построении доверительных интервалов для оценки дисперсии число степеней свободы равно df=n-1, где n – размер выборки .
Плотность распределения Х 2 выражается формулой: 
СОВЕТ : Подробнее о Функции распределения и Плотности вероятности см. статью Функция распределения и плотность вероятности в MS EXCEL .
Графики функций
Распределение Х 2 имеет несимметричную форму, среднее значение равно n, дисперсия равна 2n.
В файле примера на листе График приведены графики плотности распределения вероятности и интегральной функции распределения .

Примечание : Для построения функции распределения и плотности вероятности можно использовать диаграмму типа График или Точечная (со сглаженными линиями и без точек). Подробнее о построении диаграмм читайте статью Основные типы диаграмм .
Полезное свойство ХИ2-распределения
Пусть x 1 , x 2 , …, x n независимые случайные величины, распределенные по нормальному закону с одинаковыми параметрами μ и σ, а X cр является арифметическим средним этих величин x. Тогда случайная величина y равная

Имеет Х 2 -распределение с n-1 степенью свободы. Используя определение дисперсии выборки вышеуказанное выражение можно переписать следующим образом:

Следовательно, выборочное распределение статистики y, при выборке из нормального распределения , имеет Х 2 -распределение с n-1 степенью свободы.
Это свойство нам потребуется при построении доверительного интервала при оценке дисперсии распределения . Т.к. дисперсия может быть только положительным числом, а Х 2 -распределение используется для его оценки, то y д.б. >0, как и указано в определении.
ХИ2-распределение в MS EXCEL
В MS EXCEL, начиная с версии 2010, для Х 2 -распределения имеется специальная функция ХИ2.РАСП() , английское название – CHISQ.DIST(), которая позволяет вычислить плотность вероятности (см. формулу выше) и интегральную функцию распределения (вероятность, что случайная величина Х, имеющая ХИ2 — распределение , примет значение меньше или равное х, P
Функция ХИ2.РАСП.ПХ() возвращает функцию распределения , точнее — правостороннюю вероятность, т.е. P
ХИ2.РАСП() является единственной функцией, которая возвращает плотность вероятности ХИ2-распределения (третий аргумент должен быть равным ЛОЖЬ). Остальные функции возвращают интегральную функцию распределения , т.е. вероятность того, что случайная величина примет значение из указанного диапазона: P Найдем вероятность, что случайная величина Х примет значение меньше или равное заданного x : P = 1-ХИ2.РАСП(x; n; ИСТИНА) =ХИ2.РАСП.ПХ(x; n)=ХИ2РАСП(x; n) Обратная функция используется для вычисления альфа — квантилей , т.е. для вычисления значений x при заданной вероятности альфа , причем х должен удовлетворять выражению P Функция ХИ2.ОБР.ПХ() используется для вычисления верхнего квантиля , т.е. если в качестве аргумента функции указан уровень значимости, например 0,05, то функция вернет такое значение случайной величины х, для которого P Вышеуказанные функции можно взаимозаменять, т.к. следующие формулы возвращают один и тот же результат: =ХИ.ОБР(альфа;n) =ХИ2.ОБР.ПХ(1-альфа;n) =ХИ2ОБР(1- альфа;n) Некоторые примеры расчетов приведены в файле примера на листе Функции . В MS EXCEL имеется еще одна функция, использующая для расчетов ХИ2-распределение – это ХИ2.ТЕСТ() . Ее более ранняя версия — ХИ2ТЕСТ() . Подробнее об использовании этой функции см. статью про критерий независимости хи-квадрат . Ниже приведено соответствие русских и английских названий функций: ХИ2.РАСП.ПХ() — англ. название CHISQ.DIST.RT, т.е. CHI-SQuared DISTribution Right Tail, the right-tailed Chi-square(d) distribution ХИ2.ОБР() — англ. название CHISQ.INV, т.е. CHI-SQuared distribution INVerse ХИ2.ПХ.ОБР() — англ. название CHISQ.INV.RT, т.е. CHI-SQuared distribution INVerse Right Tail ХИ2РАСП() — англ. название CHIDIST, функция эквивалентна CHISQ.DIST.RT ХИ2ОБР() — англ. название CHIINV, т.е. CHI-SQuared distribution INVerse Т.к. обычно ХИ2-распределение используется для целей математической статистики (вычисление доверительных интервалов, проверки гипотез и др.), и практически никогда для построения моделей реальных величин, то для этого распределения обсуждение оценки параметров распределения здесь не производится. При числе степеней свободы n>30 распределение Х 2 хорошо аппроксимируется нормальным распределением со средним значением μ=n и дисперсией σ =2*n (см. файл примера лист Приближение ). Сравниваем χ 2 и χ 2 крит, если χ 2 < χ 2 крит, то гипотезу H0 о совпадении фактического распределения с теоретическим принимаем. Практически mi должны быть больше или равны 5, если в некотором интервале это условие нарушается, то интервал объединяется с соседним. ПРИМЕР 1. В результате 300 бросков кости (кубика с 6 гранями) были получены следующие результаты (табл.1): Проверить гипотезу о том, что кость «правильная». Решение. Если кость «правильная», то все значения в таблице должны встречаться более–менее одинаково. Такую картину имеет равномерный закон распределения, при котором каждый из шести возможных исходов (кол-во выпавших очков) равновероятен, т.е. Pi=1/6 для всех i=1,2…6. Таким образом, задача гипотезы о «правильности» кости сводиться к проверке гипотезы H0 о том, что выборка приведенная в табл. 1 является равномерно распределенной. Альтернативной является гипотеза H1 – данная выборка не является равномерно распределенной. Все расчеты сведем в табл. 2. Получено значение χ 2 =11.320. В нашем случае r = 6-1= 5 и при α=0.05, находим χ 2 крит = 11.07. Поэтому гипотеза H0 о равномерном распределении отвергается, и принимается альтернативная гипотеза H1 . Приходим к выводу, что кость «неправильная». ПРИМЕР 2 Проверить гипотезу о том, что распределение, представленное в таблице 3. является частным случаем нормального распределения (уровень значимости α=0,05). (См. материалы лабораторной работы №3, табл.3.1.) Решение. Построим полигон распределения (рис. 4.1 б, кривая синего цвета). Кривая имеет колокообразную форму и симметрична, поэтому можно сделать предположение, что генеральная совокупность распределена по нормальному закону. Выдвигаем гипотезу Но: данное распределение нормально. Альтернативная гипотеза – Н1: распределение не является нормальным. Воспользуемся результатами, полученными в лаб.раб. 3. Будем считать, что диапазон ячеек C67:N81 уже заполнен, т.е. уже вычислено среднее значение равное 4.77 и стандартное отклонение s равное 3.03. · интервале ячеек D70:E78 записаны значения левой и правой границ интервала; · в интервале ячеек F70:F78 – середины интервалов; · в интервале ячеек G70:G78 — наблюдаемые значения частоты mi . Как уже упоминалось ранее (лаб.раб 2), случайная величина называется распределенной по нормальному (Гауссовскому) закону, если она имеет следующую плотность распределения Величина m и σ – параметр распределения. Известно, что математического ожидание такой случайной величины равно m, дисперсия — σ 2 (стандартное отклонение σ). Это существенно используется при проверке гипотезы. Сначала определяем значение m. Поскольку оно имеет смысл математического ожидания, то в качестве m возьмем xср =4.77. Именно это значение будем использовать для построения теоретического распределения. Далее определяем параметр σ , в качестве этого значения возьмем 3.04 — это и есть оценка значения σ. Это значение будем использовать для построения теоретического распределения. Наша следующая подзадача — вычислить pi — теоретические значения вероятности того, что случайная величина, имеющая нормальное распределение с параметрами a =4,77 и σ =3,04 попадает в i-ый интервал. Для этого воспользуемся соотношениями: где F(x) – функция распределения. В MS Excel для нормального закона распределения с параметрами a и σ значение F(x) можно вычислить, воспользовавшись встроенной функцией НОРМРАСП: F(x) =НОРМРАСП(x; a; σ; ИСТИНА). В ячейки N70:N78 заносим значения F(bi) ; В ячейки M70:M78 заносим значения F(ai) ; В интервале O70:O78 получаем теоретические значения вероятности, вычисленные по формуле (4.7) (F(bi)- F(ai)). В интервал P70:P78 заносим теоретические значения частот, вычисленные по формуле . Для визуального сравнения наблюдаемых mi и теоретических частот построим соответствующие графики – полигоны частот, по оси ординат отложим середины интервалов (красная кривая для теоретических частот) (рис.4.1 б). Анализируя эти графики, заметим, что распределения по тенденциям схожи: симметричность относительно оси проходящей через максимум и плавное убывание по мере удаления от максимума. Заметим, что в некоторых интервалах значения теоретических частот получились меньше 5, объединим эти интервалы. Таких интервалов у нас 6:1,2,3,7,8 и 9. Объединим интервалы с 1 по 3 включительно, соответствующие значения наблюдаемых и теоретических частот просто суммируются, заполнив ячейки Q72 и R72. Объединим интервалы с 7 по 9 включительно, соответствующие значения наблюдаемых и теоретических частот просто суммируются, заполнив ячейки Q76 и R76. Ячейки Q73:R75 заполняются очевидным образом. После этого объединения число интервалов у нас сократилось до 5, т.е. теперь k=5. Теперь мы готовы вычислить χ 2 по формуле (4.1). Для этого в ячейку S72 заносим формулу =(Q72-R72)^2/R72, в остальные ячейки диапазона S72:S76 формула заносится копированием. Сумму значений ячеек S72:S76 помещаем в ячейку S79 – это искомое значение χ 2. = 3,04. Определим число степеней свободы r по формуле (4.2). Поскольку k=5 , c=2, то r = 2. Для α = 0,05 и r = 2 найдем χ 2 крит, используя встроенную функцию EXCEL =ХИ2ОБР(0.05;2). χ 2 крит = 5.99 Поскольку χ 2 < χ 2 крит, то гипотезу H0 о соответствии случайной величины x нормальному закону распределения принимаем (Согласно выборочным экспериментальным данным нет оснований отвергнуть гипотезу Но). Критерий Фишера F — критерий Фишера используют для сравнения дисперсий двух вариационных рядов. Выдвигается гипотеза H0 , что дисперсии выборок равны, альтернативная гипотеза H1 — они не равны. Вычисляется по формуле: где — большая дисперсия, — меньшая дисперсия. По трем величинам — уровень значимости , число степеней свободы числителя и число степеней свободы знаменателя — определяем по таблицам или используя встроенные функции Excel. Число степеней свободы числителя определяется по формуле: где n1— число вариант для большей дисперсии. Число степеней свободы знаменателя определяется по формуле: где n2 — число вариант для меньшей дисперсии. Если (вычисленное значение критерия не больше критического), то принимается гипотеза H0 (дисперсии равны), в противоположном случае ( ) принимается гипотеза H1 (дисперсии различны). ПРИМЕР 3 При проведении тестирования двух одинаковых приборов были проведены измерения эталона. При этом первым прибором были проведены n1 =11 измерений, а вторым n2=9. Результаты были записаны в виде отклонений от величины эталона. Требуется выяснить: одинаковой ли точностью обладают приборы? Решение: При измерении величины отклонений для первого прибора (n1 =11) результаты внесены в столбец В, а для второго прибора (n2=9) результаты внесены в столбец С. (рис. 4.2) Подсчет средних показал, что они одинаковы и равны нулю. Следовательно, у приборов отсутствует систематическая ошибка. Проверка точности приборов сводится к проверке совпадения дисперсий. Если дисперсии статистически равны, то приборы обладают одинаковой точностью. Выдвигается гипотеза H0 , что дисперсии выборок равны, альтернативная гипотеза H1 — они не равны. В результате расчета были получены соответственно следующие величины дисперсий — =7.35 и =2.188. Значение критерия =7.35 /2.188 составило 3.36. По уровню значимости α=0.05 ; числу степеней свободы числителя r1=11-1=10 и числу степеней свободы знаменателя r2=9-1=8 находим Fкрит =3,347. Fкрит найдено используявстроенную функцию FРАСПОБР() . Поскольку то гипотеза H0 отклоняется, а принимается альтернативная гипотеза H1 (дисперсии различны). Следовательно, приборы имеют различную точность. Cредство анализа надстройки «Пакет анализа» MS Excel «Двухвыборочный F-тест для дисперсии». Это средство анализа служит проверки гипотезы о равенстве дисперсий двух выборок. Для проверки необходимо заполнить диалоговое окно, приведенное на рис. 4.4, назначение всех полей очевидно. Результат работы представлен на следующем рисунке. Сравните полученные результаты, с результатами, полученными вручную. До конца XIX века нормальное распределение считалась всеобщим законом вариации данных. Однако К. Пирсон заметил, что эмпирические частоты могут сильно отличаться от нормального распределения. Встал вопрос, как это доказать. Требовалось не только графическое сопоставление, которое имеет субъективный характер, но и строгое количественное обоснование. Так был изобретен критерий χ 2 (хи квадрат), который проверяет значимость расхождения эмпирических (наблюдаемых) и теоретических (ожидаемых) частот. Это произошло в далеком 1900 году, однако критерий и сегодня на ходу. Более того, его приспособили для решения широкого круга задач. Прежде всего, это анализ категориальных данных, т.е. таких, которые выражаются не количеством, а принадлежностью к какой-то категории. Например, класс автомобиля, пол участника эксперимента, вид растения и т.д. К таким данным нельзя применять математические операции вроде сложения и умножения, для них можно только подсчитать частоты. Наблюдаемые частоты обозначим О (Observed), ожидаемые – E (Expected). В качестве примера возьмем результат 60-кратного бросания игральной кости. Если она симметрична и однородна, вероятность выпадения любой стороны равна 1/6 и, следовательно, ожидаемое количество выпадения каждой из сторон равна 10 (1/6∙60). Наблюдаемые и ожидаемые частоты запишем в таблицу и нарисуем гистограмму. Нулевая гипотеза заключается в том, что частоты согласованы, то есть фактические данные не противоречат ожидаемым. Альтернативная гипотеза – отклонения в частотах выходят за рамки случайных колебаний, расхождения статистически значимы. Чтобы сделать строгий вывод, нам потребуется. Начнем с расстояния между частотами. Если взять просто разницу О — E, то такая мера будет зависеть от масштаба данных (частот). Например, 20 — 5 =15 и 1020 – 1005 = 15. В обоих случаях разница составляет 15. Но в первом случае ожидаемые частоты в 3 раза меньше наблюдаемых, а во втором случае – лишь на 1,5%. Нужна относительная мера, не зависящая от масштаба. Обратим внимание на следующие факты. В общем случае количество категорий, по которым измеряются частоты, может быть гораздо больше, поэтому вероятность того, что отдельно взятое наблюдение попадет в ту или иную категорию, довольно мала. Раз так, то, распределение такой случайной величины будет подчинятся закону редких событий, известному под названием закон Пуассона. В законе Пуассона, как известно, значение математического ожидания и дисперсии совпадают (параметр λ). Значит, ожидаемая частота для некоторой категории номинальной переменной Ei будет являться одновременное и ее дисперсией. Далее, закон Пуассона при большом количестве наблюдений стремится к нормальному. Соединяя эти два факта, получаем, что, если гипотеза о согласии наблюдаемых и ожидаемых частот верна, то, при большом количестве наблюдений, выражение Важно помнить, что нормальность будет проявляться только при достаточно больших частотах. В статистике принято считать, что общее количество наблюдений (сумма частот) должна быть не менее 50 и ожидаемая частота в каждой группе должна быть не менее 5. Только в этом случае величина, показанная выше, имеет стандартное нормальное распределение. Предположим, что это условие выполнено. У стандартного нормального распределения почти все значение находятся в пределах ±3 (правило трех сигм). Таким образом, мы получили относительную разность в частотах для одной группы. Нам нужна обобщающая мера. Просто сложить все отклонения нельзя – получим 0 (догадайтесь почему). Пирсон предложил сложить квадраты этих отклонений. Это и есть статистика для критерия Хи-квадрат Пирсона. Если частоты действительно соответствуют ожидаемым, то значение статистики Хи-квадрат будет относительно не большим (отклонения находятся близко к нулю). Большое значение статистики свидетельствует в пользу существенных различий между частотами. «Большой» статистика Хи-квадрат становится тогда, когда появление наблюдаемого или еще большего значения становится маловероятным. И чтобы рассчитать такую вероятность, необходимо знать распределение статистики Хи-квадрат при многократном повторении эксперимента, когда гипотеза о согласии частот верна. Как нетрудно заметить, величина хи-квадрат также зависит от количества слагаемых. Чем больше слагаемых, тем больше ожидается значение статистики, ведь каждое слагаемое вносит свой вклад в общую сумму. Следовательно, для каждого количества независимых слагаемых, будет собственное распределение. Получается, что χ 2 – это целое семейство распределений. И здесь мы подошли к одному щекотливому моменту. Что такое число независимых слагаемых? Вроде как любое слагаемое (т.е. отклонение) независимо. К. Пирсон тоже так думал, но оказался неправ. На самом деле число независимых слагаемых будет на один меньше, чем количество групп номинальной переменной n. Почему? Потому что, если мы имеем выборку, по которой уже посчитана сумма частот, то одну из частот всегда можно определить, как разность общего количества и суммой всех остальных. Отсюда и вариация будет несколько меньше. Данный факт Рональд Фишер заметил лет через 20 после разработки Пирсоном своего критерия. Даже таблицы пришлось переделывать. По этому поводу Фишер ввел в статистику новое понятие – степень свободы (degrees of freedom), которое и представляет собой количество независимых слагаемых в сумме. Понятие степеней свободы имеет математическое объяснение и проявляется только в распределениях, связанных с нормальным (Стьюдента, Фишера-Снедекора и сам Хи-квадрат). Чтобы лучше уловить смысл степеней свободы, обратимся к физическому аналогу. Представим точку, свободно движущуюся в пространстве. Она имеет 3 степени свободы, т.к. может перемещаться в любом направлении трехмерного пространства. Если точка движется по какой-либо поверхности, то у нее уже две степени свободы (вперед-назад, вправо-влево), хотя и продолжает находиться в трехмерном пространстве. Точка, перемещающаяся по пружине, снова находится в трехмерном пространстве, но имеет лишь одну степень свободы, т.к. может двигаться либо вперед, либо назад. Как видно, пространство, где находится объект, не всегда соответствует реальной свободе перемещения. Примерно также распределение статистики может зависеть от меньшего количества элементов, чем нужно слагаемых для его расчета. В общем случае количество степеней свободы меньше наблюдений на число имеющихся зависимостей. Таким образом, распределение хи квадрат (χ 2 ) – это семейство распределений, каждое из которых зависит от параметра степеней свободы. Формальное определение следующее. Распределение χ 2 (хи-квадрат) с k степенями свободы — это распределение суммы квадратов k независимых стандартных нормальных случайных величин. Далее можно было бы перейти к самой формуле, по которой вычисляется функция распределения хи-квадрат, но, к счастью, все давно подсчитано за нас. Чтобы получить интересующую вероятность, можно воспользоваться либо соответствующей статистической таблицей, либо готовой функцией в Excel. Интересно посмотреть, как меняется форма распределения хи-квадрат в зависимости от количества степеней свободы. С увеличением степеней свободы распределение хи-квадрат стремится к нормальному. Это объясняется действием центральной предельной теоремы, согласно которой сумма большого количества независимых случайных величин имеет нормальное распределение. Про квадраты там ничего не сказано )). Вот мы и подошли к проверке гипотез по методу хи-квадрат. В целом техника остается прежней. Выдвигается нулевая гипотеза о том, что наблюдаемые частоты соответствуют ожидаемым (т.е. между ними нет разницы, т.к. они взяты из той же генеральной совокупности). Если этот так, то разброс будет относительно небольшим, в пределах случайных колебаний. Меру разброса определяют по статистике Хи-квадрат. Далее либо полученную статистику сравнивают с критическим значением (для соответствующего уровня значимости и степеней свободы), либо, что более правильно, рассчитывают наблюдаемый p-value, т.е. вероятность получить такое или еще больше значение статистики при справедливости нулевой гипотезы. Т.к. нас интересует согласие частот, то отклонение гипотезы произойдет, когда статистика окажется больше критического уровня. Т.е. критерий является односторонним. Однако иногда (иногда) требуется проверить левостороннюю гипотезу. Например, когда эмпирические данные уж оооочень сильно похожи на теоретические. Тогда критерий может попасть в маловероятную область, но уже слева. Дело в том, что в естественных условиях, маловероятно получить частоты, практически совпадающие с теоретическими. Всегда есть некоторая случайность, которая дает погрешность. А вот если такой погрешности нет, то, возможно, данные были сфальсифицированы. Но все же обычно проверяют правостороннюю гипотезу. Вернемся к задаче с игральной костью. Рассчитаем по имеющимся данным значение статистики критерия хи-квадрат. Теперь найдем критическое значение при 5-ти степенях свободы (k) и уровне значимости 0,05 (α) по таблице критических значений распределения хи квадрат. То есть квантиль 0,05 хи квадрат распределения (правый хвост) с 5-ю степенями свободы χ 2 0,05; 5 = 11,1. Сравним фактическое и табличное значение. 3,4 (χ 2 ) < 11,1 (χ 2 0,05; 5). Расчетный значение оказалось меньшим, значит гипотеза о равенстве (согласии) частот не отклоняется. На рисунке ситуация выглядит вот так. Если бы расчетное значение попало в критическую область, то нулевая гипотеза была бы отклонена. Более правильным будет рассчитать еще и p-value. Для этого нужно в таблице найти ближайшее значение для заданного количества степеней свободы и посмотреть соответствующий ему уровень значимости. Но это прошлый век. Воспользуемся ЭВМ, в частности MS Excel. В эксель есть несколько функций, связанных с хи-квадрат. Ниже их краткое описание. ХИ2.ОБР – критическое значение Хи-квадрат при заданной вероятности слева (как в статистических таблицах) ХИ2.ОБР.ПХ – критическое значение при заданной вероятности справа. Функция по сути дублирует предыдущую. Но здесь можно сразу указывать уровень α, а не вычитать его из 1. Это более удобно, т.к. в большинстве случаев нужен именно правый хвост распределения. ХИ2.РАСП – p-value слева (можно рассчитать плотность). ХИ2.РАСП.ПХ – p-value справа. ХИ2.ТЕСТ – по двум диапазонам частот сразу проводит тест хи-квадрат. Количество степеней свободы берется на одну меньше, чем количество частот в столбце (так и должно быть), возвращая значение p-value. Давайте пока рассчитаем для нашего эксперимента критическое (табличное) значение для 5-ти степеней свободы и альфа 0,05. Формула Excel будет выглядеть так: Результат будет одинаковым – 11,0705. Именно это значение мы видим в таблице (округленное до 1 знака после запятой). Рассчитаем, наконец, p-value для 5-ти степеней свободы критерия χ 2 = 3,4. Нужна вероятность справа, поэтому берем функцию с добавкой ПХ (правый хвост) Значит, при 5-ти степенях свободы вероятность получить значение критерия χ 2 = 3,4 и больше равна почти 64%. Естественно, гипотеза не отклоняется (p-value больше 5%), частоты очень хорошо согласуются. А теперь проверим гипотезу о согласии частот с помощью теста хи квадрат и функции Excel ХИ2.ТЕСТ. Никаких таблиц, никаких громоздких расчетов. Указав в качестве аргументов функции столбцы с наблюдаемыми и ожидаемыми частотами, сразу получаем p-value. Красота. Представим теперь, что вы играете в кости с подозрительным типом. Распределение очков от 1 до 5 остается прежним, но он выкидывает 26 шестерок (количество всех бросков становится 78). p-value в этом случае оказывается 0,003, что гораздо меньше чем, 0,05. Есть серьезные основания сомневаться в правильности игральной кости. Вот, как выглядит эта вероятность на диаграмме распределения хи-квадрат. Статистика критерия хи-квадрат здесь получается 17,8, что, естественно, больше табличного (11,1). Надеюсь, мне удалось объяснить, что такое критерий согласия χ 2 (хи-квадрат) Пирсона и как с его помощью проверяются статистические гипотезы. Напоследок еще раз о важном условии! Критерий хи-квадрат исправно работает только в случае, когда количество всех частот превышает 50, а минимальное ожидаемое значение для каждой группы не меньше 5. Если в какой-либо категории ожидаемая частота менее 5, но при этом сумма всех частот превышает 50, то такую категорию объединяют с ближайшей, чтобы их общая частота превысила 5. Если это сделать невозможно, или сумма частот меньше 50, то следует использовать более точные методы проверки гипотез. О них поговорим в другой раз. Ниже находится видео ролик о том, как в Excel проверить гипотезу с помощью критерия хи-квадрат.Примеры
Обратная функция ХИ2-распределения
Функции MS EXCEL, использующие ХИ2-распределение
Оценка параметров распределения
Приближение ХИ2-распределения нормальным распределением

ХИ2ОБР (вероятность; число степеней свободы)
Кол-во очков
Кол-во повторений
Xi
mi
Pi
N*Pi
(mi-N*Pi)^2 /N*Pi
0,1667
2,88
0,1667
2,88
0,1667
0,00
0,1667
0,08
0,1667
0,98
0,1667
4,50
N=
11,32
Xi-квадрат
Интервал
[-4;-2]
[-2;0]
[0;2]
[2;4]
[4;6]
[6;8]
[8;10]
[10;12]
[12;14]
Частота mi
Рис. 4.4Критерий согласия Пирсона χ2 (Хи-квадрат)

![]()
![]()
Проверка гипотезы по критерию Хи квадрат Пирсона

![]()





