Files
knowledge-base/AI/mechine learning/probability and statistics.md
2026-08-25 22:28:36 +08:00

840 lines
27 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# probability and statistics
> 来源:原 mongodb 集合 `t_blog` · 整理日期:2026-08-25
> 分类 ID:`2022102117130200000000000002` · 排序:11 · 文章数:6
## 目录
1. [1. 随机事件](#1-随机事件)
2. [3. 随机变量的重要数字特征](#3-随机变量的重要数字特征)
3. [2. 随机变量以及其分布率](#2-随机变量以及其分布率)
4. [4. 参数估计](#4-参数估计)
5. [5. 置信区间](#5-置信区间)
6. [10. 线性回归分析和方差分析](#10-线性回归分析和方差分析)
---
## 1. 1. 随机事件
<sub>bid: `2022102117130400000000000005`</sub>
## Proba
[视频课程](https://www.bilibili.com/video/BV1D741147G5?p=9&spm_id_from=pageDriver)
### 1.2 随机试验
### 1.3 样本空间
### 1.4 随机事件
### 1.5 事件关系和运算
### 1.6 频率和概率
### 1.7 古典概型
### 1.8 超几何概型
### 1.9 几何概型
---
## 1.10 条件概率
随机事件对应的sample space 为 S
随机事件A 对应的样本空间是 C<sub>A</sub>
随机事件B 对应的样本空间是 C<sub>B</sub>
那么在已知随机事件A 已经发生的情况下,随机事件B的发生概率,记为 P(B|A)
> $$
P(B|A) = \frac{P(AB)}{P(A)}
$$
※注意、P(AB)与P(B|A)的意思是不同的,P(AB)是在样本空间S的下A和B同时发生的概率,P(B|A)是在已知A已经发生情况下的,B发生的概率,此时样本空间已经从S缩减至A。
### 条件概率 性质
P(A) > 0 时,
(1) $P(B|A) \geq{0}$
(2) $P(S|A) = 1, P(\phi|A) = 0 $
(3) $P(B \cup C | A) = P(B|A) + P(C|A) - P(BC|A) $
(4) $P(B - C | A) = P(B|A) - P(BC|A) $
(5) $P(\overline{B} | A) = 1 - P(B|A) $
---
## 1.11 乘法公式
$$
P(B|A) = \frac{P(AB)}{P(A)}
$$
由条件概率公式可知
$$
P(AB) = P(A)P(B|A)
$$
$$
P(ABC) = P(A)P(B|A)P(C|AB)
$$
乘法公式 多个事件的积事件,前一个事件发生对后一个事件有影响的情况下
将文字描述转化为 符号
---
## 1.12 全概率公式 与 贝叶斯公式
对于事件A,很复杂,无法单独求出概率,但是已知两两互不相容的事件B<sub>1</sub>,B<sub>2</sub>,B<sub>3</sub>,
$S = B_1 + B_2 + B_3 $
对于任意事件A,$ A\subset{S} $:
$$
由 P(A) = P(A)P(S) 即,P(A) = P(A)(P(B_1) + P(B_2) + P(B_3) )
$$
$$
P(A) = P(A)P(B_1) + P(A)P(B_2) + P(A)P(B_3)
$$
$$
P(A) = P(B_1)P(A|B_1) + P(B_2)P(A|B_2) + P(B_3)P(A|B_3)
$$
> 划分 ,对于事件B1 到 Bn,两两互不相容,且合集为 S,则称 B1到Bn是样本空间的一个划分,则对于每次的随机试验,事件B1到Bn有且只有一个发生。
样本空间的划分通常是不唯一的。
### 全概率公式
$$
P(A) = P(B_1)P(A|B_1) + P(B_2)P(A|B_2) + ... + P(B_n)P(A|B_n)
$$
$$
即,P(A) = \sum_{i=1}^{n} P(B_i)P(A|B_i)
$$
### 贝叶斯公式
已知A已经发生,求B<sub>i</sub>发生的概率
$$
即,P(B_i) = P(B_i|A) = \frac{P(AB_i)}{P(A)} = \frac{P(B_i)P(A|B_i)}{\sum_{i=1}^{n} P(B_i)P(A|B_i)}
$$
可以看出,贝叶斯 是由结果推出原因的公式
### 先验概率与后验概率
单纯的概率$P(B_i)$我们叫做**先验概率**,指的是在没有别的前提信息情况下的概率值,这个值一般需要借助我们的经验估计得到。
而条件概率$P(B_i|A)$,我们把他叫做是**后验概率**,他代表了在获得了信息 之后出现的概率,可以说后验概率是先验概率在获取了新信息之后的一种修正。
---
## 1.12 独立性
设 事件A 和事件B ,若满足 P(AB) = P(A)P(B)
我们则称这两个事件A和B是相互独立的。
互不相容 和 独立性是 不能同时存在的
两个事件独立则有$ P(AB) = P(A)P(B) > 0 $
两个事件互不相容则有$ P(AB) = P(A)P(B) = \phi $
不可能事件 和 任一事件 相互独立
必然事件 和 任意事件 也 相互独立
---
## 2. 3. 随机变量的重要数字特征
<sub>bid: `2022102117153700000000000007`</sub>
## 1.1 样本均值
>设 $X_1,X_2,\cdots,X_n$ 为总体 $X$ 的样本,样本容量为 $n$,则样本均值为
$$
\bar{X}=\frac{1}{n}\sum_{i=1}^{n}X_i
$$
用样本均值来估计总体的期望$\mu$,$\bar{X}$是围绕$\mu$左右波动的,即多次采样计算出来的统计量 $\bar{X}$ 有的落在 $\mu$ 左边,有的落在 $\mu$ 右边,
由于 $\bar{X}$ 落在 $\mu$ 左右两侧的情况是均匀的,即 $E(\bar{X})=\mu$,所以 $\bar{X}$ 就是 $\mu$ 的无偏估计。
样本均值能够保持比较好的无偏性是因为它的计算过程本质还是一个线性过程,这个就是无偏。
## 1.2 加权平均
## 1.3 数学期望
>离散型随机变量X的分布率
$$
P\{X=x_k\}=p_k, \quad k=1,2,3...
$$
级数
$$
\sum_{k=1}^{\infty}x_kp_k
$$
绝对收敛,则称级数为随机变量X的数学期望,记为$E(X)$,即
$$
E(x) = \sum_{k=1}^{\infty}x_kp_k
$$
注意* 数学期望可能不存在。
**计算** 核心是确定分布率,数学期望,反映了随机变量X的取值的平均水平
>连续性随机变量X的分布率
概率密度函数$f(x)$
若积分
$$
\int_{-\infty}^{+\infty} x \cdot p(x)dx
$$
绝对收敛,则称积分值$\int_{-\infty}^{+\infty} x \cdot p(x)dx$为随机变量X的数学期望,记为$E(X)$
即
$$
E(x)=\int_{-\infty}^{+\infty} x \cdot p(x)dx
$$
注意绝对收敛,是取|x|
> 数学期望的性质
(1) 设C为常数,则$E(C)=C$
(2) 设$X,Y$是相互独立的随机变量,则$E(XY)=E(X) \cdot E(Y)$
## 1.4 总体方差(variance)
>设$X$是随机变量,$E\{[X-E(X)]^2 \}$存在,则称$E\{[X-E(X)]^2 \}$为随机变量X的方差,记为$D(X)$或$Var(X)$即
$$
D(X)=Var(X)=E\{[X-E(X)]^2 \}
$$
引入
$$
\sigma(X)=\sqrt{D(X)}
$$
为均方差,或者标准差。
注意:
$D(X)$表示随机变量的取值和他的数学期望的偏离程度。
$D(X)$较小,则随机变量X大多分布在数学期望附近。
$D(X)$较大,则随机变量X取值分散。
$D(X)$刻画了随机变量X的分散程度的量度。
> 离散型随机变量的方差
$$
E\{[X-E(X)]^2 \}=D(X)=Var(X)=\sigma^{2}=\sum_{k=1}^{\infty}[x_k -\mu]^{2} \cdot P_k
$$
> 连续型随机变量的方差
$$
E\{[X-E(X)]^2 \}=D(X)=Var(X)=\sigma^{2}=\int_{-\infty}^{+\infty} [x -\mu]^{2} \cdot f(x)dx
$$
> 性质
由
$$
E\{[x-E(X)]^2 \} = \int_{-\infty}^{+\infty}[x-E(X)]^2 \cdot f(x)dx
$$
$$
= \int_{-\infty}^{+\infty}x^2 \cdot f(x)dx -2xE(x)\int_{-\infty}^{+\infty}f(x)dx + E^{2}(X)\int_{-\infty}^{+\infty}f(x)dx
$$
$$
=E(x^2)-2E^{2}(x) + E^{2}(x) = E(x^2)-E^{2}(x)
$$
$$
\sigma^{2}=E(x^2)-\mu^{2}
$$
## 1.5 样本方差
> 样本方差和总体方差是不一样的,样本方差如下:
$$
S^{2}=\frac{1}{n-1} \sum_{i=1}^{n}(X_i - \bar{X})^{2}
$$
下面我们从推导一下,样本方差为什么是$\frac{1}{n-1}$
由方差的基本定义可知道,(样本值 - 均值) 的 平方后的 均值可知,暂时认为
$$
S^2 = \frac{1}{n}\sum_{k=1}^{n}[X_i - \bar{X}]^2
$$
那么该方差的数学期望为
$$
E(S^2) = E[\frac{1}{n}\sum_{k=1}^{n}[X_i - \bar{X}]^2]
$$
$$
E(S^2) = E[\frac{1}{n}\sum_{k=1}^{n}[(X_i - \mu) - (\bar{X} - \mu)]^2 ]
$$
$$
E(S^2) = E [\frac{1}{n}\sum_{k=1}^{n}[(X_i - \mu)^2 - (X_i - \mu)(\bar{X} - \mu) + (\bar{X} - \mu)^2] ]
$$
$$
E(S^2) = E [\frac{1}{n}\sum_{k=1}^{n}(X_i - \mu)^2 - \frac{2}{n}\sum_{k=1}^{n}(X_i - \mu)(\bar{X} - \mu) + \frac{1}{n}\sum_{k=1}^{n}(\bar{X} - \mu)^2 ]
$$
$$
E(S^2) = E [\frac{1}{n}\sum_{k=1}^{n}(X_i - \mu)^2 - \frac{2}{n}(\bar{X} - \mu)\sum_{k=1}^{n}(X_i - \mu) + \frac{1}{n}\sum_{k=1}^{n}(\bar{X} - \mu)^2 ]
$$
$$
E(S^2) = E [\frac{1}{n}\sum_{k=1}^{n}(X_i - \mu)^2 - \frac{2}{n}(\bar{X} - \mu)n(\bar{X} - \mu) + \frac{1}{n}(\bar{X} - \mu)^2 ]
$$
$$
E(S^2) = E [\frac{1}{n}\sum_{k=1}^{n}(X_i - \mu)^2 - \frac{1}{n}(\bar{X} - \mu)^2 ]
$$
$$
E(S^2) = E [\frac{1}{n}(\sum_{k=1}^{n}(X_i - \mu)^2 - (\bar{X} - \mu)^2) ]
$$
$$
E(S^2) = E [\frac{1}{n}\sum_{k=1}^{n}((X_i - \mu)^2 - (\bar{X} - \mu)^2) ]
$$
$$
E(S^2) = E [\frac{1}{n}\sum_{k=1}^{n}(X_i - \mu)^2] - \frac{1}{n}E[(\bar{X} - \mu)^2 ]
$$
$$
E(S^2) = \sigma^2 - \frac{1}{n}E[(\bar{X}^{2} -2\bar{X}\mu + \mu^2) ]
$$
$$
E(S^2) = \sigma^2 - \frac{1}{n}(E(\bar{X}^{2}) -2\mu E(\bar{X}) + E(\mu^2))
$$
$$
E(S^2) = \sigma^2 - \frac{1}{n}(E(\bar{X}^{2}) - E(\mu^2))
$$
$$
E(S^2) = \sigma^2 - \frac{1}{n}\sigma^2 = \frac{n-1}{n}\sigma^2 \neq \sigma^2
$$
我们看出,$E(S^2)$和总体方差是不相等的,即是有偏向的,为了修正这个问题,
我们需要重新估计得到
$$
S^2 = \frac{1}{n-1}\sum_{k=1}^{n}[X_i - \bar{X}]^2
$$
## 1.6 均方误差(mean-square error, MSE)
均方误差是 反映估计量与被估计量之间差异程度的一种度量。
>一般地,在样本量一定时,评价一个点估计的好坏标准使用的指标 是点估计与参数真值 的距离的函数,最常用的函数是距离的平方.
由于估计量 具有随机性,可以对该函数求期望,这就是下式给出的均方误差:
$$
E(X_i) = \frac{1}{n} \sum_{i=1}^{n} (f(x_i) -y_i)^2
$$其中 $f(x_i)$ 为预测值,$y_i$为真值。
## 1.6 相关系数
## 1.7 矩阵
## 7.2 矩
**矩**
1. $k$阶矩($k$阶原点矩)
设$X$是随机变量,若
$$
E(X^k), \quad k=1,2,3...
$$
存在,称它为$X$的$k$阶**原点矩**,简称$k$阶矩。
注意:k=1,是1阶矩,$E(X)$,1阶矩是数学期望
k=2,是2阶矩,$E(x^2)$的数学期望。
$$
E(X^k)=\int_{-\infty}^{+\infty}x^{k}f(x)dx, \quad k=1,2,3...
$$
2. $k$阶中心矩
设$X$是随机变量,若
$$
E\{[X-E(X)]^k\}, \quad k=2,3...
$$
存在,称它为$X$的$k$阶**中心矩**。
注意:k=2的时候,2阶中心距就是方差。
$$
E\{[X-E(X)]^k\}=\int_{-\infty}^{+\infty}[X-E(X)]^kf(x)dx, \quad k=2,3...
$$
3. $k+l$阶混合矩
设$(X+Y)$是随机变量,若
$$
E(X^{k}Y^{l}), \quad k,l=2,3...
$$
存在,称它为$X,Y$的$k+l$阶**混合矩**。
注意:k=l=1的时候,E(XY)的数学期望。
4. $k+l$阶混合中心矩
设$(X+Y)$是随机变量,若
$$
E([X-E(X)]^{k}[Y-E(Y)]^{l}), \quad k,l=1,2,3...
$$
存在,称它为$X,Y$的$k+l$阶**混合中心矩**。
注意:当$k=l=1$的时候,$k+l=2$,即2阶混合中心距,协方差$Cov(X,Y)$是$X$和$Y$的2阶混合中心距。
**协方差矩阵**
对n维随机变量使用协方差矩阵研究。
1. 2维随机变量的协方差矩阵
设2维随机变量(X,Y)有四个2阶中心距,分别为
$c_{11}=E\{[X-E(X)]^{2}\}$
$c_{12}=E\{[X-E(X)][Y-E(Y)]\}$
$c_{21}=E\{[Y-E(Y)][X-E(X)]\}$
$c_{22}=E\{[Y-E(Y)]^{2}\}$
将他们排成矩阵的形式
$$
\begin{pmatrix}
c_{11} & c_{12} \\
c_{21} & c_{22} \\
\end{pmatrix} \tag{1}
$$
这个矩阵就成为随机变量(X,Y)的协方差矩阵。是一个对称矩阵
2. n维随机变量$(X_1,X2,...X_n)$的协方差矩阵
$c_{ij}=E[X_i-E[X_i]]E[X_j-E(X_j)]$的协方差都存在。
则称矩阵
$$
\begin{pmatrix}
c_{11} & c_{12} & ... & c_{1n}\\
c_{21} & c_{22} & ... & c_{2n}\\
\vdots & \vdots & \ & \vdots\\
c_{n1} & c_{n2} & ... & c_{nn}\\
\end{pmatrix} \tag{1}
$$
称为n维随机变量$(X_1,X2,...X_n)$的协方差矩阵
在数理统计中,往往并不知道n维随机变量的概率分布,或者太复杂,以至于无法处理,因此在实际应用中协方差矩阵就很重要了。
---
## 3. 2. 随机变量以及其分布率
<sub>bid: `2022102117154100000000000006`</sub>
## 第二部分 随机变量
---
用随机变量 来表示 随机事件 是 probability 中最要用的应用。
随机变量定义:
设随机实验的样本空间
$ S = \{e \},$ $X = X(e) $是定义在样本空间S上的单值函数,称$ X = X(e)$为随机变量。
约定,用 X,Y,Z, W 来表示随机变量,用小写的x,y,z,w 实数
X是指随机事件的描述。
离散型数学变量,我们用分布律来描述。
分布律:
设 离散型随机变量X的所有可能取值为$ x_k(k=1,2,3...) $
事件{$X=x_k$}的概率P{$X=x_k$} = $p_k$,为离散型随机变量的分布率。
## 随机变量的分布函数
---
适合离散型和非离散型的各种应用
**定义**
设$X$是一个随机变量,$x$是任意实数,函数$f(x)=P{X≦x}, -\infty≦x≦+\infty$
称为X的分布函数
定义域: $-\infty<sub>≦</sub>x≦+\infty$
值域 :$0≦F(x)≦1$
性质:
1,单调不减
2,有界性
3,右连续的
离散型的概率分布都是左闭右开的。
## 离散型随机变量的分布率
---
### 2.1 0-1分布
### 2.2 二项分布
特性:重复,独立
以X表示在n重伯努利实验中事件A发生的次数$P(A) = p, 0< p < 1$
定义:若X 的分布律为
$ P\{X=k\} = C_n^kP^k(1-P)^{n-k}$
则称随机变量X服从参数为n,P的二项分布,记为$ X ~ b(n,P)$
n发生次数,P为每次发生的规律。
### 2.3 泊松分布
大量次数,每次发生的概率很小的情况下,可以用泊松分布计算,
此时λ = np
$$
P\{X=k\} =\frac{λ^k-e^{-λ}}{k!}
$$
### 2.4 几何分布
重复独立的随机试验中,试验次数事先无法确定,每一次成功的概率为p,将实验进行至成功为止,以X表示实验进行的次数,则X的分布律为
$$
P\{X=k\} = (1-p)^{k-1}p
$$
像这样的随机分布为几何分布
### 2.5 超几何分布
从大N件产品中(包含M件次品)取出n件产品,以X表示取到的次品数,则X的分布律为
$$
P\{X=k\} = \frac{C_M^k C_{N-M}^{n-k}}{C_N^n}
$$
则称随机变量X服从参数为(N,M,n)的超几何分布。
## 连续性随机变量以及其概率密度
---
> 连续性随机变量 定义
若对于随机变量$X$的分布函数$F(X)$,存在非负可积函数$f(x)$,使对于任意实数$x$有
$$
F(x)=\int_{-\infty}^{x}f(x)dx
$$
则称$X$为连续性随机变量,$f(x)$为$X$概率密度函数,简称概率密度。
### 2.6 均匀分布(uniform distribution)
> 定义
若随机变量的X的概率密度为
$$
f(x)= \begin{cases}
\frac{1}{b-a}x, \quad a<x<b \\
0 \quad, \text{others}\\
\end{cases} \tag{1}
$$
则称$X$在区间$[a,b]$上服从均匀分布,记为$X \sim U(a,b)$,其概率分布函数为
$$
F(x)=\begin{cases}
0, x <a \\
\frac{x-a}{b-a}, \quad a \leq x<b \\
1 \quad, x \leq b\\
\end{cases} \tag{2}
$$
### 2.7 正态分布(normal distribution)
> 定义
若随机变量的X的概率密度为
$$
f(x)=\frac{1}{\sqrt{2 \pi} \sigma} \cdot e^{- \frac{(x-\mu)^2}{2 \sigma^2}}
$$
其中$\mu, \sigma$为常数,且 $\sigma > 0$,则称$X$服从参数$\mu, \sigma$的正态分布,记为 $X \sim N(\mu,\sigma)$,其分布函数为
$$
F(x)=\int_{-\infty}^{x} \frac{1}{\sqrt{2 \pi} \sigma} \cdot e^{- \frac{(x-\mu)^2}{2 \sigma^2}} dx
$$
> 已知概率积分(Gaussian integral)或者 高斯积分
$$
\int_{-\infty}^{+\infty} e^{-x^2}dx = \sqrt{\pi}
$$
则有
$$
F(x)=\int_{-\infty}^{x} \frac{1}{\sqrt{2 \pi} \sigma} \cdot e^{- \frac{(x-\mu)^2}{2 \sigma^2}} dx
$$
设
$$
t = \frac{(x-\mu)}{\sqrt{2}\sigma} => dx = \sqrt{2}\sigma dt
$$
则
$$
F(x)=\int_{-\infty}^{x} \frac{1}{\sqrt{2 \pi} \sigma} \cdot e^{-t^2} \cdot \sqrt{2}\sigma dt
$$
$$
F(x)=\frac{1}{\sqrt{\pi}}\int_{-\infty}^{x} e^{-t^2} dt = 1
$$
### 概率密度函数的图形
- 对称性
$f(x)$关于$x=\mu$对称
$P\{ \mu-h<X <\mu \} = P\{ \mu<X <\mu + h\}$
- 最大值
当$x=\mu$时,$f(x)$取最大值。
$$
f_{max}(x)=\frac{1}{\sqrt{2\pi}\sigma}
$$
- 凹凸性
由高等数学可知,凹凸性是二阶导数等于0时存在凹凸拐点。
$$
f^{''}(x)=\frac{(x-\mu)^2-\sigma^2}{\sqrt{2 \pi} \sigma^5} \cdot e^{- \frac{(x-\mu)^2}{2 \sigma^2}} = 0
$$
可知
$$
(x-\mu)^2-\sigma^2 = 0
$$
在$x=\mu \underline{+} \sigma$ 处是 概率密度函数的凹凸拐点,其中$\mu$为数学期望,$\sigma$为总体样本的标准差。
- 渐进性
$$
\lim_{x \to \infty} \frac{1}{\sqrt{2 \pi} \sigma} \cdot e^{- \frac{(x-\mu)^2}{2 \sigma^2}} = 0
$$
- $\mu,\sigma$变化时
$\mu$决定了概率密度曲线的未知
$\sigma$决定了最大值,标准差越小,在$\mu$一定的情况下,说明X在$\mu$附近的概率越大。
### 标准正态分布函数
$X \sim N(0,1)$时的正态分布就是标准正态分布。
### 正态分布的概率计算
$X \sim N(\mu,\sigma)$
由
$$
t= \frac{x-\mu}{\sigma}
$$
来代替$x$可知
$$
F(t)=\int_{-\infty}^{t} \frac{1}{\sqrt{2\pi}}e^{-t^2} dt = 1
$$
可知$t= \frac{x-\mu}{\sigma}$服从$N(0,1)$的正态分布。
### 2.8 指数分布(Exponential distribution)
> 定义
若随机变量的X的概率密度为
$$
f(x)= \begin{cases}
\frac{1}{\theta}e^{x/\theta}, \quad x>0 \\
0 \quad, \text{others}\\
\end{cases} \tag{3}
$$
其中$\theta >0 $为常数,记为$X \sim exp(\theta)$则称$X$服从参数为$\theta$的指数分布。
其概率分布为
$$
F(x)=\begin{cases}
1 - e^{x/\theta}, \quad x>0 \\
0 \quad, \text{others}\\
\end{cases} \tag{4}
$$
### 2.9 边缘分布
### 2.10 条件分布
## 二维随机变量
---
### 3.1 随机变量的相互独立性
已知
$X,Y$的联合分布函数$F(x,y)$,边缘分布函数$F_X(x),F_Y(y)$
$F(X,Y)=P\{X\leq x,Y \leq y \} =P\{ X \leq x \} \cdot P\{ Y \leq y \}$
$= F_X(x) \cdot F_Y(y)$
---
## 4. 4. 参数估计
<sub>bid: `2022102117160500000000000008`</sub>
## 第七章 参数估计
---
- 在进入数理统计学习之前,我们明确以下概念问题,有助于我们学习这些知识到底来干什么。
- probability and statistics are two faces of a coin。
- from 【All of Statistics】 book
>The basic problem that we study in probability is:
Given a data generating process, what are the properities of the outcomes?
>The basic problem of statistical inference is the inverse of probability:
Given the outcomes, what can we say about the process that generated the data?
- 概率论,给出概率分布,算出概率,即知总体,估算样本
- 数理统计,给出样本数据,推算出概率分布(参数),即知道样本估算总体。
about statistics, we will learn estimation。
点估计,区间估计,最大似然估计(maximum likelihood estimation)
## 7.1 点估计
点估计问题
> 设总体$X$的分布函数(概率密度,分布率)的形式已知,但他的一个或者多个参数未知,借助于总体$X$的一个样本来估计总体未知参数的值的问题,称为参数的点估计问题
点估计问题的提法
已知:总体$X$的分布函数的$F(x;\theta)$的形式
未知:$\theta$待估参数,此处的$\theta$可以理解为向量,$\theta=(\theta_1,\theta_2,\theta_3)$
利用:$X_1,X_2,...,X_n$是$X$的一个样本,$x_1,x_2,...,x_n$是样本值
点估计问题:
构造一个适当的统计量$\hat{\theta}(X_1,X_2,...,X_n)$
用它的观察值$\hat{\theta}(x_1,x_2,...,x_n)$
作为位置$\theta$的近似值。
### 7.1.1 矩估计
### 知识点
总体$X$
- X的k阶原点矩 $E(X^k) \quad k=1,2,3..,n$
总体1阶矩,$E(X)$
总体2阶矩,$E(X^{2})$
样本$X_1,X_2,..,X_n$
- 样本的k阶原点矩 $A_{k}=\frac{1}{n} \sum_{i=1}^{n}X_{i}^{k} \quad k=1,2,3..,n$
样本1阶矩,$\bar{X}$
样本2阶矩,$A_{2}=\frac{1}{n} \sum_{i=1}^{n}X_{i}^{2} $
### 理论基础
样本的k阶矩是依概率而收敛于总体的k阶矩的。
当样本足够大的时候,即n取无穷的时候$A_k$就近似于$E(X^{k})$
### 矩估计的求解步骤
设总体X的分布中有m个未知参数$\theta_{1},\theta_{2},\theta_{3},...,\theta_{m}$
1. 求总体的各阶矩
2. 令样本的各阶矩等于总体的各阶矩,得到m个参数的方程,然后求解方程式
### 7.1.2 最大似然估计法
最大似然估计(maximum likelihood estimation, MLE)一种重要而普遍的求估计量的方法。
一,离散型
>设总体X为离散型,分布率已知,但是分布中有m个位置参数$\theta_{1},\theta_{2},...,\theta_{m}$,$X_{1},X_{2},...,X_{n}$是总体X的一个样本,$x_{1},x_{2},...,x_{n}$是对应的样本值。
已知$X_{1},X_{2},...,X_{n}$取到观察值$x_{1},x_{2},...,x_{n}$的概率,
即事件$P\{ X_{1}=x_{1},X_{2}=x_{2},...,X_{n}=x_{n} \}$发生的概率为
$$
L(x_1,x_2,...,x_n;\theta_{1},\theta_{2},...,\theta_{m})=\prod_{i=1}^{n}P\{ X=x_1 \} \quad (7.3)
$$
这一概率随$\theta_{1},\theta_{2},...,\theta_{m}$的取值而变化,他是m个未知参数$\theta_{1},\theta_{2},...,\theta_{m}$的函数,称为样本的似然函数,需要注意的是$x_{1},x_{2},...,x_{n}$是已知的样本值。
最大似然估计的思想是:
已经取到样本值$x_{1},x_{2},...,x_{n}$,这就说明,这一样本值发生的概率$L(x_1,x_2,...,x_n;\theta_{1},\theta_{2},...,\theta_{m})$比较大。
因此,可以固定样本观察值$x_{1},x_{2},...,x_{n}$,挑选使似然函数$L(x_1,x_2,...,x_n;\theta_{1},\theta_{2},...,\theta_{m})$达到最大值的
$$
\hat{\theta}_{i}(x_1,x_2,...,x_n) \quad i=1,2,...,m
$$
用这种思想求出的参数值
二,连续型
>设总体X为连续型,$X_{1},X_{2},...,X_{n}$是总体X的一个样本,$x_{1},x_{2},...,x_{n}$是对应的样本值,则$X_{1},X_{2},...,X_{n}$的联合概率密度$(X_{1},X_{2},...,X_{n})$的$f(x_{1},x_{2},...,x_{n})=f_{X_1}(x_1) \cdot f_{X_2}(x_2) \cdots f_{X_n}(x_n)$
$$
L(x_1,x_2,...,x_n;\theta_{1},\theta_{2},...,\theta_{m})=\prod_{i=1}^{n}f(x_i;\theta_{1},\theta_{2},...,\theta_{m}) \quad (7.4)
$$
随机点$X_{1},X_{2},...,X_{n}$落在点$(x_{1},x_{2},...,x_{n})$的邻域(边长分别为$dx_1,dx_2,...,dx_n, $的n维立方体)内近似概率为
$$
\prod_{i=1}^{n}f(x_i;\theta_{1},\theta_{2},...,\theta_{m})dx_i \quad (7.5)
$$
$$
\prod_{i=1}^{n}f(x_i;\theta_{1},\theta_{2},...,\theta_{m}) \cdot \prod_{i=1}^{n}dx_i \quad (7.6)
$$
这一概率随$\theta_{1},\theta_{2},...,\theta_{m}$的取值而变化,最大似然估计的思想是取$\theta_{1},\theta_{2},...,\theta_{m}$的估计值,使上述概率取得最大值,注意
$$
\prod_{i=1}^{n}dx_i \quad (7.7)
$$
不随$\theta_{1},\theta_{2},...,\theta_{m}$的改变而改变,故而只需考虑函数
$$
\prod_{i=1}^{n}f(x_i;\theta_{1},\theta_{2},...,\theta_{m})
$$
的最大值即可,我们称n维随机变量的联合概率密度函数(7.4)为样本的似然函数。
解题步骤
(1)写出 似然函数
(2)对似然函数左右两边取对数,由乘积变成对数和。
(3)对各个参数求偏导数,形成方程组。
(4)求解方程组,求出参数。
## 7.2 估计量评价标准
通过点估计,矩估计和最大似然估计求出的估计量是各不相同的,如何评价估计量的好坏就是估计量的评价标准。
- 无偏性
> 定义
设总体 $\xi$ 的概率分布函数为 $F(x; \theta)$,其中 $x$ 为变元,$ \theta∈ \Theta$为未知参数,$\Theta$称为参数空间。
$(\xi_1,\xi_2, \cdots ,\xi_{n})$为取自总体$\xi$的随机样本,若$(\xi_1,\xi_2, \cdots ,\xi_{n})$是参数$\theta$的一个估计量,且对一切 $ \theta∈ \Theta$,关系式 $E_{\theta}=E[(\xi_1,\xi_2, \cdots ,\xi_{n})]$,其中$E_{\theta}=E[(\xi_1,\xi_2, \cdots ,\xi_{n})]$表示数学期望,则称$(\xi_1,\xi_2, \cdots ,\xi_{n})$为参数$\theta$的无偏估计,具有无偏性。
- 有效性
- 相合性
-
---
## 5. 5. 置信区间
<sub>bid: `2022102117166600000000000009`</sub>
## 5.1 置信区间
---
> 定义 设总体$X$的分布函数$F(x;\theta)$,含有一个位置参数$\theta, \theta \in \Theta, \Theta$是 $\theta$的可能的取值范围。
对于给定值 $ 0<\alpha < 1$,来自X的一个样本$(X_1,X_2,\cdots, X_n)$确定的两个统计量,$\theta=\theta(X_1,X_2,\cdots, X_n)$和$\bar{\theta}=\theta(X_1,X_2,\cdots, X_n) \quad (\theta < \bar{\theta})$
对于任意的$\theta \in \Theta$满足,
$$
P\{\underline{\theta}(X_1,X_2,\cdots, X_n) < \theta < \bar{\theta}(X_1,X_2,\cdots, X_n) \} \ge
$$
则称随机区间$(\underline{\theta}, \bar{\theta})$是 置信水平为 $1- \alpha$ 的置信区间。
$\underline{\theta}$为置信下限,$\bar{\theta}$为置信上限,$1- \alpha$为置信水平。
## 5.1 置信区间
---
## 6. 10. 线性回归分析和方差分析
<sub>bid: `2022102509540400000000000001`</sub>
## 10.1 线性回归分析
---
线性回归分析中,通常要求$x$为普通变量,是可控制的变量,Y是随机变量,是可以观察但不可控制的变量。如$x$是施肥量,Y是产量。
### 10.1.1 线性回归模型
> &emsp;&emsp;设$x$是普通变量,Y是随机变量,且
$$
Y = \alpha + \beta x + \varepsilon, \quad \varepsilon \sim N(0,\sigma^2)
\tag{10.1.1}
$$
其中,$\alpha,\beta,\sigma^2$是不依赖于 $x$ 的未知参数,称此模型为一元线性回归模型。
&emsp;&emsp;易见,此时
$$
Y \sim N(\alpha + \beta x,\sigma^2)
\tag{10.1.2}
$$
称 $Y$ 的数学期望
$$
\tilde{Y} = E(Y) = \alpha + \beta x
\tag{10.1.3}
$$
为 $Y$ 关于 $x$ 的线性回归函数,$\alpha,\beta$ 为回归系数,$x$ 为回归变量。
&emsp;&emsp;取得样本观测值 $(x_1,y_1),(x_2,y_2),\cdots,(x_n,y_n)$,若能得到$\alpha,\beta$的点估计$\hat{\alpha},\hat{\beta}$,称
$$
\tilde{Y} = \hat{\alpha} + \hat{\beta} x
\tag{10.1.4}
$$
为线性回归方程。
### 10.1.2 α,β 和 σ<sup>2</sup>的极大似然估计及性质
&emsp;&emsp;取的样本观测值$(x_1,y_1),(x_2,y_2),\cdots,(x_n,y_n)$ 后,由(10.1.2),得到似然函数
$$
L(\alpha,\beta,\sigma^2)= \prod_{i=1}^{n} f(x_i;\alpha,\beta,\sigma^2)
$$
$$
= \prod_{i=1}^{n} \frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(y_i - (\alpha + \beta x_i))^2}{2\sigma^2}}
$$
$$
= \frac{1}{(\sqrt{2\pi}\sigma)^n}e^{\sum_{i=1}^{n}-\frac{(y_i - (\alpha + \beta x_i))^2}{2\sigma^2}}
$$
$$
= (2\pi)^{-\frac{n}{2}}(\sigma)^{-\frac{n}{2}} e^{-\frac{1}{2\sigma^2} \sum_{i=1}^{n}[ y_i - (\alpha + \beta x_i)]^2}
$$
从而有
$$
\ln{L(\alpha,\beta,\sigma^2)}= -\frac{n}{2}\ln(2\pi) -\frac{n}{2}\ln \sigma^2 - \frac{1}{2\sigma^2} \sum_{i=1}^{n}[ y_i - (\alpha + \beta x_i)]^2
$$
故而取对数方程组,对个参数取偏导
$$
\begin{cases}
\frac{\large{\partial{(\ln (\alpha,\beta,\sigma^2))}}}{\large{\partial{\alpha}}} = \frac{\large{1}}{\large{\sigma^2}}\sum_{i=1}^{n}( y_i - (\alpha + \beta x_i)) = 0\\
\frac{\large{\partial{(\ln (\alpha,\beta,\sigma^2))}}}{\large{\partial{\beta}}} = \frac{\large{1}}{\large{\sigma^2}}\sum_{i=1}^{n}x_i( y_i - (\alpha + \beta x_i)) = 0\\
\frac{\large{\partial{(\ln (\alpha,\beta,\sigma^2))}}}{\large{\partial{\sigma^2}}} = - \frac{\large{n}}{\large{2\sigma^2}} + \frac{\large{1}}{\large{2\sigma^4}} \sum_{i=1}^{n}[ y_i - (\alpha + \beta x_i)]^2 = 0
\end{cases}
$$
整理为关于 $\alpha,\beta,\sigma^2$ 的方程组。
$$
\begin{cases}
n\alpha +\beta\sum_{i=1}^{n}x_i=\sum_{i=1}^{n}y_i\\
\alpha\sum_{i=1}^{n}x_i + \beta\sum_{i=1}^{n}x_i^2 = \sum_{i=1}^{n}x_i y_i\\
\sigma^2=\frac{1}{n}\sum_{i=1}^{n}[y_i - (\alpha + \beta x_i)]^2
\end{cases}
$$
解得$\alpha,\beta,\sigma^2$的最大似然估计值为
$$
\begin{cases}
\hat{\alpha} = \bar{y} - \hat{\beta}\bar{x}\\
\hat{\beta} = \frac{s_xy}{s_xx}\\
\hat{\sigma}^2= \frac{1}{n}\sum_{i=1}^{n}[y_i - (\hat{\alpha} + \hat{\beta} x_i)]^2
\end{cases}
\tag{10.1.5}
$$
其中
$$
s_{xy}=\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})=\sum_{i=1}^{n}x_iy_i -n\bar{x}\bar{y}
\tag{10.1.6}
$$
$$
s_{xx}=\sum_{i=1}^{n}(x_i-\bar{x})^2=\sum_{i=1}^{n}x_i^2 -n\bar{x}^2
\tag{10.1.7}
$$
(10.1.5),(10.1.6),(10.1.7)中,观测值 $y_i$ 改为 $Y_i$ 则得到相应的最大似然估计量
$$
\begin{cases}
\hat{\alpha} = \bar{Y} - \hat{\beta}\bar{x}\\
\hat{\beta} = \frac{s_xY}{s_xx}\\
\hat{\sigma}^2= \frac{1}{n}\sum_{i=1}^{n}[Y_i - (\hat{\alpha} + \hat{\beta} x_i)]^2
\end{cases}
\tag{10.1.5}
$$
&emsp;&emsp; 注意,$\alpha$ 和 $\beta$ 的最大似然估计值是似然函数中e的指数部分
$$
Q(\alpha,\beta)= \sum_{i=1}^{b}[y_i - (\hat{\alpha} + \hat{\beta} x_i)]^2
$$
达到最小的估计,所以 $\alpha$ 和 $\beta$ 的最大似然估计 $\hat{\alpha}$ 和 $\hat{\beta}$ 又叫做最小二乘估计。
&emsp;&emsp;事实上,$Q(\hat{\alpha},\hat{\beta})$ 是数据$(x_i,y_i)$对估计$\hat{y}=\hat{\alpha}+\hat{\beta}x_i$ 的变差平方和。最小二乘估计使数据点到回归线的垂直距离平方和达到最小,而且回归线是通过点 $(\bar{x},\bar{y})$.
## 10.2 单因素试验的方差分析
---
### 10.2.1单因素实验的方差分析模型
> 若实验中,只让一个因素A变化,而让其他因素保持不变,这样的试验称为单因素试验。
---