Перейти к содержанию

Нормальное распределение

Материал из Мегавики — свободной энциклопедии
Нормальное распределение
Плотность нормального распределения
Зеленая линия соответствует стандартному нормальному распределениюПлотность вероятности
Функция распределения нормального распределения
Цвета на этом графике соответствуют графику наверхуФункция распределения
Обозначение N(μ,σ2)
Параметры μ — коэффициент сдвига (вещественный)
σ > 0 — коэффициент масштаба (вещественный, строго положительный)
Носитель x(;+)
Плотность вероятности 1σ2πexp((xμ)22σ2)
Функция распределения 12[1+erf(xμ2σ2)]
Математическое ожидание μ
Медиана μ
Мода μ
Дисперсия σ2
Коэффициент асимметрии 0
Коэффициент эксцесса 0
Дифференциальная энтропия ln(σ2πe)
Производящая функция моментов MX(t)=exp(μt+σ2t22)
Характеристическая функция ϕX(t)=exp(μitσ2t22)

Норма́льное распределе́ние[1][2], также называемое распределением Гаусса или Гаусса — Лапласа[3], или колоколообразная кривая — непрерывное распределение вероятностей с пиком в центре и симметричными боковыми сторонами, которое в одномерном случае задаётся функцией плотности вероятности, совпадающей с функцией Гаусса:

f(x)=1σ2πe12(xμσ)2,
где параметр μ — математическое ожидание (среднее значение), медиана и мода распределения, а параметр σ — среднеквадратическое отклонение, σ2 — дисперсия распределения.

Таким образом, одномерное нормальное распределение является двухпараметрическим семейством распределений, которое принадлежит экспоненциальному классу распределений[4]. Многомерный случай описан в статье «Многомерное нормальное распределение».

Стандартным нормальным распределением называется нормальное распределение с математическим ожиданием μ=0 и стандартным отклонением σ=1.

Общие сведения[править]

Если величина является суммой многих случайных слабо взаимозависимых величин, каждая из которых вносит малый вклад относительно общей суммы, то центрированное и нормированное распределение такой величины при достаточно большом числе слагаемых стремится к нормальному распределению.

Это следует из центральной предельной теоремы теории вероятностей. В окружающем нас мире часто встречаются величины, значение которых определяется совокупностью многих независимых факторов. Этот факт, а также то, что распределение считалось типичным, обычным, привели к тому, что в конце XIX века стал использоваться термин «нормальное распределение». Нормальное распределение играет заметную роль во многих областях науки, например в математической статистике и статистической физике.

Случайная величина, имеющая нормальное распределение, называется нормальной, или гауссовской, случайной величиной.

Определения[править]

Стандартное нормальное распределение[править]

Наиболее простой случай нормального распределения — стандартное нормальное распределение — частный случай, когда μ=0 и σ=1. Его плотность вероятности равна:

φ(x)=12πe12x2.

Множитель 12π в выражении обеспечивает условие нормировки интеграла +φ(x)dx=1[5]. Поскольку множитель 12 в экспоненте обеспечивает дисперсию равную единице, то и стандартное отклонение равно 1. Функция симметрична в точке x=0, её значение в ней максимально и равно 12π. Точки перегиба функции: x=+1 и x=1.

Гаусс называл стандартным нормальным распределение с σ2=1/2, то есть:

φ(x)=ex2π.

Нормальное распределение с параметрами μ, σ[править]

Каждое нормальное распределение — это вариант стандартного нормального распределения, область значений которого растягивается множителем σ (стандартное отклонение) и переносится на μ (математическое ожидание):

f(xμ,σ2)=1σφ(xμσ).

μ,σ являются параметрами нормального распределения. Плотность вероятности должна нормироваться 1σ, так что интеграл равен 1.

Если Z — стандартная нормальная случайная величина, то величина X=σZ+μ будет иметь нормальное распределение с математическим ожиданием μ и стандартным отклонением σ. Наоборот, если X — нормальная величина с параметрами μ и σ2, то Z=Xμσ будет иметь стандартное нормальное распределение.

Если в экспоненте плотности вероятности раскрыть скобки и учитывать, что 1=lne, то:

f(x)=1σ2πe12(xμσ)2=e12(2lnσ+ln2π+(xμσ)2)=e12(x2σ22μxσ2+2lnσ+ln2π+μ2σ2).

Таким образом, плотность вероятности каждого нормального распределения представляет собой экспоненту квадратичной функции:

f(x)=eax2+bx+c,
где a=12σ2, b=μσ2, c=(lnσ+12ln2π+12μ2σ2).

Отсюда можно выразить среднее значение как μ=b2a, а дисперсию как σ2=12a. Для стандартного нормального распределения a=1/2, b=0 и c=12ln2π.

Обозначение[править]

Плотность вероятности стандартного нормального распределения (с нулевым средним и единичной дисперсией) часто обозначается греческой буквой ϕ (фи)[6]. Также достаточно часто используется альтернативная формы греческой буквы фи φ.

Нормальное распределение часто обозначается N(μ,σ2), или 𝒩(μ,σ2)[7]. Если случайная величина X распределена по нормальному закону со средним μ и вариацией σ2, то пишут:

X𝒩(μ,σ2).

Функция распределения[править]

Функция распределения стандартного нормального распределения обычно обозначается заглавной греческой буквой Φ (фи) и представляет собой интеграл:

Φ(x)=12πxet2/2dt.

С ней связана функция ошибок (интеграл вероятности) erf(x), дающий вероятность того, что нормальная случайная величина со средним 0 и вариацией 1/2 попадёт в отрезок [x,x]:

erf(x)=2π0xet2dt.

Эти интегралы не выражаются в элементарных функциях и называются специальными функциями. Многие их численные приближения известны. См. ниже.

Функции связаны, в частности, соотношением:

Φ(x)=12[1+erf(x2)].

Нормальное распределение с плотностью f, средним μ и отклонением σ имеет следующую функцию распределения:

F(x)=Φ(xμσ)=12[1+erf(xμσ2)].

Можно использовать функцию Q(x)=1Φ(x) — она даст вероятность того, что значение стандартной нормальной случайной величины X превысит x:

P(X>x).

График стандартной нормальной функции распределения Φ имеет 2-кратную вращательную симметрию относительно точки (0;1/2), то есть Φ(x)=1Φ(x). Её неопределенный интеграл равен:

Φ(x)dx=xΦ(x)+φ(x)+C.

Функция распределения стандартной нормальной случайной величины может быть разложена с помощью метода интегрирования по частям в ряд:

Φ(x)=12+12πex2/2[x+x33+x535++x2n+1(2n+1)!!+],

где знак !! означает двойной факториал.

Асимптотическое разложение функции распределения для больших x может быть также произведено интегрированием по частям.

Стандартное отклонение[править]

Встречается также вариант написания: Интервальная оценка.

Правило 68-95-99,7.
Для нормального распределения количество значений, отличающихся от среднего на число, меньшее чем одно стандартное отклонение, составляют 68,27 % выборок. В то же время количество значений, отличающиеся от среднего на два стандартных отклонения, составляют 95,45 %, а на три стандартных отклонения — 99,73 %.

Около 68 % значений из нормального распределения находятся на расстоянии не более одного стандартного отклонения σ от среднего; около 95 % значений лежат расстоянии не более двух стандартных отклонений; и 99,7 % не более трёх. Этот факт является частным случаем правила 3 сигм для нормальной выборки.

Более точно, вероятность получить нормальное число в интервале между μnσ и μ+nσ равна:

F(μ+nσ)F(μnσ)=
Φ(n)Φ(n)=erf(n2).

С точностью до 12 значащих цифр значения для n=1,2,,6 приведены в таблице[8]:

n p=F(μ+nσ)F(μnσ) 1p 11p OEIS
1 0,682689492137 0,317310507863
3,15148718753
A178647
2 0,954499736104 0,045500263896
21,9778945080
A110894
3 0,997300203937 0,002699796063
370,398347345
A270712
4 0,999936657516 0,000063342484
15787.1927673
5 0,999999426697 0,000000573303
1744277,89362
6 0,999999998027 0,000000001973
506797345,897

Свойства[править]

Моменты[править]

Моментами и абсолютными моментами случайной величины X называются математические ожидания случайных величин Xp и |X|p, соответственно. Если математическое ожидание случайной величины μ=0, то эти параметры называются центральными моментами. В большинстве случаев представляют интерес моменты для целых p.

Если X имеет нормальное распределение, то для неё существуют (конечные) моменты при всех p с действительной частью больше −1. Для неотрицательных целых p центральные моменты таковы:

𝔼[Xp]={0p=2n+1,σp(p1)!!p=2n.

Здесь n — натуральное число, а запись (p1)!! означает двойной факториал числа p1, то есть (поскольку p1 в данном случае нечётно) произведение всех нечётных чисел от 1 до p1.

Центральные абсолютные моменты для неотрицательных целых p таковы:

𝔼[|X|p]=σp(p1)!!{2πp=2n+1,1p=2n.}=σp2p2Γ(p+12)π.

Последняя формула справедлива также для произвольных p>1.

Преобразование Фурье и характеристическая функция[править]

Преобразование Фурье нормальной плотности вероятности f с математическим ожиданием μ стандартным отклонением σ равно[9]:

f^(t)=f(x)eitxdx=eiμte12(σt)2,
где i есть мнимая единица.

Если математическое ожидание μ=0, то первый множитель равен 1, и преобразование Фурье, с точностью до константы есть нормальная плотность вероятности на частотных интервалах, с математическим ожиданием равным 0 и стандартным отклонением 1/σ. В частности, стандартное нормальное распределение φ есть собственная функция от преобразования Фурье.

В теории вероятности, преобразование Фурье плотности распределения действительной случайной величины X близко связано с характеристической функцией φX(t) этой величины, которая определена как математическое ожидание от eitX и является функцией вещественной переменной t (частотный параметр преобразования Фурье). Определение может быть распространено и на комплексную переменную t[10]. Соотношение записывается так:

φX(t)=f^(t).

Бесконечная делимость[править]

Нормальное распределение является бесконечно делимым.

Если случайные величины X1 и X2 независимы и имеют нормальное распределение с математическими ожиданиями μ1 и μ2 и дисперсиями σ12 и σ22 соответственно, то X1+X2 также имеет нормальное распределение с математическим ожиданием μ1+μ2 и дисперсией σ12+σ22.

Отсюда вытекает, что нормальная случайная величина представима как сумма произвольного числа независимых нормальных случайных величин.

Максимальная энтропия[править]

Нормальное распределение имеет максимальную дифференциальную энтропию среди всех непрерывных распределений, дисперсия которых не превышает заданную величину[11][12].

Правило трёх сигм для гауссовской случайной величины[править]

График плотности вероятности нормального распределения и процент попадания случайной величины на отрезки, равные среднеквадратическому отклонению.

Правило трёх сигм (3σ) — практически все значения нормально распределённой случайной величины лежат в интервале:

(μ3σ;μ+3σ),
где μ=𝔼ξ — математическое ожидание и параметр нормальной случайной величины.

Более точно — приблизительно с вероятностью 0,9973 значение нормально распределённой случайной величины лежит в указанном интервале.

Моделирование нормальных псевдослучайных величин[править]

При компьютерном моделировании, особенно при применении метода Монте-Карло, желательно использовать величины, распределенные по нормальному закону. Многие алгоритмы дают стандартные нормальные величины, так как нормальную величину XN(μ,σ2) можно получить как:

X=μ+σZ,
где Z — стандартная нормальная величина.

Алгоритмы также используют различные преобразования равномерных величин. Простейшие приближённые методы моделирования основываются на центральной предельной теореме. Если сложить достаточно большое количество независимых одинаково распределённых величин с конечной дисперсией, то сумма будет иметь распределение, близкое к нормальному. Например, если сложить 100 независимых стандартно равномерно распределённых случайных величин, то распределение суммы будет приближённо нормальным.

Для программного генерирования нормально распределённых псевдослучайных величин предпочтительнее использовать преобразование Бокса — Мюллера. Оно позволяет генерировать одну нормально распределённую величину на базе одной равномерно распределённой.

Также существует алгоритм Зиккурат, который работает даже быстрее преобразования Бокса — Мюллера. Тем не менее, сложнее в реализации, но его применение оправдано в случаях, когда требуется генерирование очень большого числа неравномерно распределённых случайных чисел.

Нормальное распределение в природе и приложениях[править]

Нормальное распределение часто встречается в природе. Например, следующие случайные величины хорошо моделируются нормальным распределением:

  • отклонение при стрельбе;
  • погрешности измерений (однако погрешности некоторых измерительных приборов имеют иное распределение);
  • некоторые характеристики живых организмов в популяции.

Такое широкое распространение этого распределения связано с тем, что оно является бесконечно делимым непрерывным распределением с конечной дисперсией. Поэтому к нему в пределе приближаются некоторые другие, например биномиальное и пуассоновское. Этим распределением моделируются многие недетерминированные физические процессы[13].

Многомерное нормальное распределение используется при исследовании многомерных случайных величин (случайных векторов). Одним из многочисленных примеров таких приложений является исследование параметров личности человека в психологии и психиатрии.

Связь с другими распределениями[править]

  • Нормальное распределение является распределением Пирсона типа XI[14].
  • Отношение пары независимых стандартных нормально распределенных случайных величин имеет распределение Коши[15]. То есть, если случайная величина X представляет собой отношение X=Y/Z (где Y и Z — независимые стандартные нормальные случайные величины), то она будет обладать распределением Коши.
  • Если z1,,zk — совместно независимые стандартные нормальные случайные величины, то есть ziN(0,1), то случайная величина x=z12++zk2 имеет распределение хи-квадрат с k степенями свободы.
  • Если случайная величина X подчинена логнормальному распределению, то её натуральный логарифм имеет нормальное распределение. То есть, если XLogN(μ,σ2), то Y=ln(X)N(μ,σ2). И наоборот, если YN(μ,σ2), то X=exp(Y)LogN(μ,σ2).
  • Если X1,X2,...,Xn независимые нормально распределенные случайные величины с математическими ожиданиями μ и дисперсиями σ2, то их выборочное среднее независимо от выборочного стандартного отклонения[16], а отношение следующих двух величин будет иметь t-распределение с n1степенями свободы:
t=XμS/n=1n(X1++Xn)μ1n(n1)[(X1X)2++(XnX)2]tn1.
  • Если X1,X2,...,Xn, Y1,Y2,...,Yn независимые стандартные нормальные случайные величины, то отношение нормированных сумм квадратов будет иметь распределение Фишера с (n, m) степенями свободы[17]:
F=(X12+X22++Xn2)/n(Y12+Y22++Ym2)/mFn,m.
  • Отношение квадратов двух стандартных нормальных случайных величин имеет распределение Фишера со степенями свободы (1,1).

История[править]

Впервые нормальное распределение как предел биномиального распределения при p=12 появилось в 1738 году во втором издании работы Муавра «Доктрина случайностей»[англ.][18]. Это было первое доказательство частного случая центральной предельной теоремы. В 1809 году Гаусс в сочинении «Теория движения небесных тел» ввёл это распределение как возникающее в результате многократных измерений движения небесных тел. Однако Гаусс вывел формулу для действительных случайных величин из принципа достижения максимума совместной плотности всех измерений в точке с координатами, равными среднему всех измерений. Этот принцип впоследствии подвергался критике. В 1812 году Лаплас в теореме Муавра — Лапласа обобщил результат Муавра для произвольного биномиального распределения, то есть для сумм одинаково распределённых независимых бинарных величин[3].

См. также[править]

Примечания[править]

  1. Вентцель Е. С. Теория вероятностей. — 10-е изд., стереотипное.. — М.: Academia, 2005. — 576 с. — ISBN 5-7695-2311-5.
  2. Ширяев А. Н. Вероятность. — М.: Наука, 1980.
  3. 3,0 3,1 Математический энциклопедический словарь. — М.: Советская энциклопедия, 1988. — С. 139—140.
  4. Wasserman L. All of Statistics. — New York, NY: Springer, 2004. — С. 142. — 433 с. — ISBN 978-1-4419-2322-6.
  5. Доказательство см. Гауссов интеграл
  6. Halperin, Hartley & Hoel, 1965, item 7.
  7. McPherson (1990)
  8. Wolfram|Alpha: Computational Knowledge Engine. Wolframalpha.com. Дата обращения: 3 марта 2017.
  9. Bryc (1995, p. 23)
  10. Bryc (1995, p. 24)
  11. Cover, Thomas M.; Thomas, Joy A. Elements of Information Theory. — John Wiley and Sons, 2006. — С. 254.
  12. Park, Sung Y.; Bera, Anil K. Maximum Entropy Autoregressive Conditional Heteroskedasticity Model (англ.) // Journal of Econometrics[англ.] : journal. — Elsevier, 2009. — P. 219—230. Архивировано 7 марта 2016 года.
  13. Талеб Н. Н. Чёрный лебедь. Под знаком непредсказуемости = The Black Swan: The Impact of the Highly Improbable. — КоЛибри, 2012. — 525 с. — ISBN 978-5-389-00573-0.
  14. Королюк, 1985, с. 135.
  15. Галкин В. М., Ерофеева Л. Н., Лещева С. В. Оценки параметра распределения Коши // Труды Нижегородского государственного технического университета им. Р. Е. Алексеева. — 2014. — № 2(104). — С. 314—319. — УДК 513.015.2(G).
  16. Lukacs, Eugene. A Characterization of the Normal Distribution (англ.) // The Annals of Mathematical Statistics[англ.] : journal. — 1942. — Vol. 13, no. 1. — P. 91—3. — ISSN 0003-4851. — doi:10.1214/aoms/1177731647. — JSTOR 2236166.
  17. Lehmann, E. L.[англ.]. Testing Statistical Hypotheses. — 2nd. — Springer[англ.], 1997. — С. 199. — ISBN 978-0-387-94919-2.
  18. The doctrine of chances; or, a method of calculating the probability of events in play, L., 1718, 1738, 1756; L., 1967 (репродуцир. изд.); Miscellanea analytica de scriebus et quadraturis, L., 1730.

Литература[править]

Ссылки[править]