概率统计

作者

周忠国 河海大学

  • 针对选择题类型, 不讲复杂的计算, 节约复习时间.

  • 主要是基本概念与基本方法.

  • 用例子说明概念与方法.

  • 标题里红色两位数(如18,19)表示2018,2019年的考试真题涉及本小节内容.

  • 理解: 掌握知识点的含义

  • 记忆: 用自己熟悉的方法记住

  • 使用: 掌握例子的解题步骤

  • 效率: 针对选择题思路要灵活

拿起纸笔, 想一想, 算一算, 才能真正理解, 掌握.

1 随机事件与概率

1.1 随机事件

  • 随机试验\(E\)的每个可能结果称为一个基本事件, 试验\(E\)的所有可能结果的集合称为\(E\)的样本空间, 记作\(\Omega.\)

  • 基本事件通常用\(A,B,C\)表示.

  • 随机事件的关系与运算

    1. 包含与相等: \(A\subset B.\)
    2. 和事件: 至少一个发生. 记作\(A\cup B\)\(A+B.\)
    3. 积事件: 同时发生. 记作\(A\cap B\)\(AB.\)
    4. 差事件: \(A\)发生\(B\)不发生. 记作\(A-B.\)
    5. 互不相容(互斥)事件: 不能同时发生. 即\(A\cap B=\emptyset.\)
    6. 对立事件: \(A\),\(B\)中有且只有一个发生. 即\(A\cup B=\Omega\)\(AB=\emptyset.\)\(A\),\(B\)为对立事件. \(A\)的对立事件记作\(\overline A.\)
  • 随机事件的运算满足:

    1. 分配律: \(A(B\cup C)=(AB)\cup (AC)\);
    2. 分配律: \(A\cup (BC)=(A\cup B)(A\cup C)\);
    3. \(\overline{ A\cup B}=\overline A \,\overline B;\)
    4. \(\overline{ AB}=\overline A \cup\,\overline B.\)
  • 例: 有\(A,B,C\)三个事件, 下列选项中与事件\(A\)互斥的是: \[\begin{aligned} & A.\ \overline{ B\cup C} &\qquad\qquad\qquad & B. & \ \ \overline{ A\cup B\cup C} \\ & C.\ \overline{A}B+AC &\ & D. & \ \ A(B+C)\\ \end{aligned}\]

  • 提示: \(D\)\(A\)互斥等价于\(A\cap D=\emptyset.\) 用运算律逐一验证.

  • 考试策略: 互斥的是\(\overline{A}\), 要出现, 排除选项\(A,D\). 和\(B,C\)无关, 排除选项\(A\).

  • 关键是熟悉互斥的等价说法与记号.

  • 概率的性质与公式

    1. \(P(A\cup B)=P(A)+P(B)-P(AB).\)
    2. \(P(A)+P(\overline{A})=1.\)
    3. \(P(AB)+P({A}\overline{B})=P(A).\)
  • 例: 若\(P({A})=0.8, P({A}\overline{B})=0.2,\)\(P(\overline{A}\cup \overline{B})\)等于: \[\begin{aligned} & A.\ 0.4 &\qquad\qquad\qquad & B. & \ \ 0.6 \\ & C.\ 0 &\ & D. & \ \ 0.3\\ \end{aligned}\]

  • \[\begin{align} 提示:\ &用公式计算.\\ &P(AB)=P(A)-P({A}\overline{B})=0.6,\\ &P(\overline{A}\cup \overline{B})=P(\overline{A B})=1-P({A B})=0.4\end{align}\]

  • 关键: 熟悉运算公式.

  • 组合数\(C_N^m:\)\(N\)个球中取\(m\)个, 不同取法的总数.

  • 一般不需要组合数的计算公式\(C_N^m=\frac{N!}{m!(N-m)!}.\)

  • 加法原理: 取法分成不相交的几类, 总数就是各类加起来.

  • 乘法原理: 完成一类要分几步, 这一类的个数就是把每一步的取法乘起来.

  • 例: 袋中有5个球, 其中3个是白球, 2个是红球, 一次随机地取出3个球, 其中恰有2个是白球的概率是: \[\begin{aligned} A.\ \left[\frac{3}{5}\right]^2\frac{2}{5} \qquad B.\ C_5^3\left[\frac{3}{5}\right]^2\frac{1}{5} \qquad C.\ \left[\frac{3}{5}\right]^2 \qquad D. \frac{C_3^2C_2^1}{C_5^3} \end{aligned}\]

  • 提示: 取出3个球的总数为\(C_5^3\), 恰有2个白球的总数为\(C_3^2C_2^1\)(乘法原理, 分两步).

  • 关键: 分类与分步清晰, 应用加法, 乘法原理. 每个球都认为是不一样的, 可以分辨的.

  • \(A,B\)为两个事件, \(P(A)>0\), 则称\[P(B|A)=\frac{P(AB)}{P(A)}\]为事件\(A\)发生的条件下, 事件\(B\)发生的条件概率.

  • 乘法公式: \(P(A)>0\)时, \(P(AB)=P(A)P(B|A)=P(B)P(A|B).\)

  • 全概率公式: 如果\(A_1, A_2, A_3\)是互斥事件, 且\(A_1\cup A_2\cup A_3=\Omega, P(A_i)>0.\) 则对任一事件\(B\)\[P(B)=P(B|A_1)P(A_1)+P(B|A_2)P(A_2)+P(B|A_3)P(A_3).\]

  • 若事件\(A, B\)满足 \(P(AB)=P(A)P(B),\) 则称\(A, B\)相互独立.

  • \(A, B\)相互独立的意思是说两个是否发生, 互不影响. 即\(P(B|A)=P(B).\)

  • \(A, B\)相互独立, 则\(\overline{A}, \overline{B}\)也相互独立.

  • 注意区分互斥事件, 对立(互补)事件, 独立事件.

    1. 互不相容(互斥)事件: 不能同时发生. 即\(AB=\emptyset.\)
    2. 对立事件: \(A\),\(B\)中有且只有一个发生. 即\(A\cup B=\Omega\)\(AB=\emptyset.\), \(B=\overline A.\)
    3. 相互独立事件: \(P(AB)=P(A)P(B).\)

1.2 历年真题

  • 求互补的概率: 不能译出的概率也独立.

  • \[P(\overline{A} \overline{B}\overline{C} )=P(\overline{A})P() \overline{B})P(\overline{C} )=\frac{4}{5}\frac{3}{4}\frac{2}{3}=\frac{2}{5}.\]

  • 古典概率

  • 条件概率

  • 画图

  • 或运算

  • 注意独立与互斥不同

  • 条件概率的计算

  • 直接计算

  • 公式

  • 计算

\(A,B\)是两个随机事件, \(P({A})=0.3, P({B})=0.8,\) 则当\(P({A}\cup {B})\)为最小值时, \(P(AB)=\) \[\begin{aligned} & A.\ 0.1 &\qquad\qquad\qquad & B. & \ \ 0.2 \\ & C.\ 0.3 &\ & D. & \ \ 0.4\\ \end{aligned}\]

  • \(P({A}\cup {B})\)最小值, 则\(P(AB)\)最大, 即有包含关系, 选C.

  • 对称性, A对则B也对, 排除

  • D超过1了

  • 公式或画图

  • 不相容的定义

2 随机变量

  • 随机变量\(X\), 事件\(X=0, X\leq 2.\)

  • 分布函数\[F(x)=P\{X\leq x\}, x\in (-\infty, +\infty).\]

  • 分布函数的性质.

    1. \(\displaystyle\lim_{x \rightarrow +\infty}F(x)=1, \lim_{x \rightarrow -\infty}F(x)=0.\)
    2. \(F(x)\)单调递增.
    3. \(F(x)\)右连续, 即\(\displaystyle\lim_{x \rightarrow a^+}F(x)=F(a).\)
    4. \(P\{a<X\leq b\}=F(b)-F(a).\)
  • 离散型随机变量的取值为有限多个.

  • 离散型随机变量的分布律为\[P\{X=x_k\}=P_k, k=1,2,\cdots, n.\]

  • 表格表示

  • \(X\) \(1\) \(3\) \(0\)
    \(P_k\) \(0.5\) \(0.2\) \(0.3\)
  • 分布律的性质

    1. 非负性, \(P_k\geq 0\)
    2. 全概率的和为1, \(\displaystyle\sum_{k=1}^\infty P_k=1.\)
  • 存在非负函数\(f(x)\), 使对任意实数\(x\)\[F(x)=P\{X\leq x\}=\int_{-\infty}^x f(t)dt.\]

  • \(X\)称为连续型随机变量, \(f(x)\)为概率密度, 分布函数\(F(x)\)为连续函数.

  • 概率密度\(f(x)\)的性质

    1. \(\displaystyle\int_{-\infty}^{+\infty} f(x)dx=1.\)
    2. 在连续点\(F'(x)=f(x).\)
    3. \(\displaystyle P\{a<X\leq b\}=F(b)-F(a)=\int_{a}^{b} f(x)dx.\)
  • \(0\)-\(1\)分布
    1. 分布律: \(P\{X=k\}=p^kq^{1-k},\ 0<p<1, q=1-p, k=0,1.\)

    2. \(X\) \(0\) \(1\)
      \(P_k\) \(q\) \(p\)
  • 二项分布\(B(n,p)\)
    1. 分布律: \(P\{X=k\}=C_n^kp^kq^{n-k},\ 0<p<1, q=1-p, k=0, 1,\cdots, n.\)
    2. \(0\)-\(1\)分布就是\(B(1,p).\)
    3. \(n\)次独立重复试验中, 事件\(A\)发生的次数服从二项分布.
  • 泊松分布\(P(\lambda)\)分布
    1. 分布律: \(P\{X=k\}=\frac{e^{-\lambda}\lambda^k}{k!},\) 参数\(\lambda\)为正常数, \(k=0, 1,\cdots,.\)
  • 均匀分布\(U(a,b)\)分布
    1. 概率密度(参数\(\lambda\)为正常数) \[f(x)=\left\{\begin{align} \frac{1}{b-a}, &\quad a\leq x\leq b,\\ 0, & \quad 其他 \end{align}\right.\]
  • 指数分布\(E(\lambda)\)分布
    1. 概率密度(参数\(\lambda\)为正常数) \[f(x)=\left\{\begin{align} \lambda e^{-\lambda}, &\quad x\geq 0,\\ 0, & \quad x<0 \end{align}\right.\]
  • 正态分布\(N(\mu,\sigma^2)\)
    1. 概率密度(\(\mu\)为常数, \(\sigma\)为正常数) \[f(x)=\frac{1}{\sqrt{2\pi}\sigma}e^{-\frac{(x-\mu)^2}{2\sigma^2}}, \quad -\infty< x<+\infty.\]
    2. 标准正态分布\(N(0,1).\) 分布函数\[\Phi(x)=\frac{1}{\sqrt{2\pi}}\int_{-\infty}^x e^{-\frac{t^2}{2}}dt.\]
  • \(X\sim N(\mu,\sigma^2),\)
    1. \(\frac{x-\mu}{\sigma}\sim N(0,1).\)
    2. \(a\neq 0, aX+b \sim N(a\mu+b,a^2\sigma^2).\)
  • \(X\)\(Y\)的联合分布函数: \[F(x,y)=P\{X\leq x, Y\leq y\},\quad (-\infty<x,y<+\infty).\]

  • 联合分布函数的性质:

    1. \(F(x,y)\)分别对\(x, y\)是单调递增函数.
    2. \(F(x,y)\)分别对\(x, y\)是右连续的.
  • 边缘分布函数\[F_X(x)=\lim_{y\to +\infty}F(x,y)=F(x,+\infty),\\ F_Y(y)=\lim_{x\to +\infty}F(x,y)=F(+\infty,y).\]

  • 联合分布律\[P(X=x_i, Y=y_j)=p_{ij}.\]

  • 性质: \(p_{ij}\geq 0; \ \displaystyle \sum_{i=1}^\infty\sum_{j=1}^\infty p_{ij}=1.\)

  • 边缘分布律. 关于\(X\)的边缘分布律\[P(X=x_i)=\sum_{j=1}^\infty p_{ij}=p_i.\]关于\(Y\)的边缘分布律\[P(Y=y_j)=\sum_{i=1}^\infty p_{ij}=p_j.\]

  • \(X\)\(Y\)相互独立的充要条件是\(p_{ij}=p_ip_j.\)

设二维随机变量\((X,Y)\)的分布律为

\(Y\backslash X\) 1 2 3
1 \(\frac{1}{6}\) \(\frac{1}{9}\) \(\frac{1}{18}\)
2 \(\frac{1}{3}\) \(\beta\) \(\alpha\)

\(X\)\(Y\)相互独立, 则\(\alpha, \beta\) 的取值为:\[\begin{aligned} & A.\ \alpha=\frac{1}{6}, \beta=\frac{1}{6} &\qquad\qquad\qquad & B. & \ \ \alpha=0, \beta=\frac{1}{3}\\ & C.\ \alpha=\frac{2}{9}, \beta=\frac{1}{1} &\ & D. & \ \ \alpha=\frac{1}{9}, \beta=\frac{2}{9} \end{aligned}\]

  • 结论: 相互独立时, 分布律的任意两行(或两列)成比例.
  • 联合概率密度函数\(f(x,y)\)满足

    1. \[\int_{-\infty}^{+\infty}\int_{-\infty}^{+\infty}f(x,y)dxdy=1.\]
  • 边缘概率密度 \[f_X(x)=\int_{-\infty}^{+\infty}f(x,y)dy,\\ f_Y(y)=\int_{-\infty}^{+\infty}f(x,y)dx.\]

  • \(X\)\(Y\)相互独立的充要条件是\(f(x,y)=f_X(x)f_Y(y).\)

  • 数学期望(均值)\[离散型:\ E(X)=\sum_{k=1}^{\infty}x_kP_k,\\ \quad \ \ \ \ \ 连续型:\ E(X)=\int_{-\infty}^{+\infty}xf(x)dx.\]

  • 性质:

  1. \(E(c)=c, (c为常数);\)
  2. \(E(kX+b)=kE(X)+b, (k,b为常数);\)
  3. \(E(X+Y)=E(X)+E(Y);\)
  4. \(X,Y\) 相互独立, 则\(E(XY)=E(X)E(Y).\)
  • 方差\(D(X)=E[(X-E(X))^2]=E(X^2)-[E(X)]^2,\) 标准差或均方差\(\sqrt{D(X)}.\)

  • \[离散型:\ D(X)=\sum_{k=1}^\infty[(x_k-E(X))^2]p_k,\\ \quad\quad \ \ 连续型:\ D(X)=\int_{-\infty}^{+\infty}[(x-E(X))^2]f(x)dx.\]

  • 性质: 1. \(D(C)=0, (C为常数);\)

  1. \(D(kX+b)=k^2D(X), (k,b为常数);\)
  2. \(D(X+Y)=D(X)+D(Y).\)
  • 例: 已知\(E(X)=2, D(X)=1, Y=X^2,\)\(E(Y).\)

  • 分析: \(E(Y)=E(X^2)=D(X)+[E(X)]^2=1+2^2=5.\)

\(X\)服从的分布 \(E(X)\) \(D(X)\)
\(0\)-\(1\)分布 \(p\) \(p(1-p)\)
二次分布\(B(n,p)\) \(np\) \(np(1-p)\)
泊松分布 \(P(\lambda)\) \(\lambda\) \(\lambda\)
均匀分布\(U(a,b)\) \(\frac{a+b}{2}\) \(\frac{(a+b)^2}{12}\)
指数分布\(E(\lambda)\) \(\frac{1}{\lambda}\) \(\frac{1}{\lambda^2}\)
正态分布\(N(\mu, \sigma^2)\) \(\mu\) \(\sigma^2\)
  • 协方差\[Cov(X,Y)=E[(X-E(X))(X-E(X)]\\ =E(XY)-E(X)E(Y).\]

  • \(X,Y\) 相互独立, 则\(Cov(X,Y)=0.\)

  • \(D(X+Y)=D(X)+D(Y)-2Cov(X,Y).\)

  • 相关系数. 设\(D(X)>0,D(Y)>0,\) \[ \rho_{XY}=\frac{Cov(X,Y)}{\sqrt{D(X)D(Y)}}.\]

2.1 历年真题

  • 方法一: 计算
    1. \(P\displaystyle\{X\leq \frac{1}{2}\}=\int_0^\frac{1}{2} 2xdx=\frac{1}{4}.\)
    2. \(P\displaystyle\{Y=2\}=C_3^2\cdot(\frac{1}{4})^2\cdot\frac{3}{4}=\frac{9}{64}\)
  • 方法二: 猜测
    1. 3次观察, 分子是3的倍数;
    2. 2次成功, 分母是3次方, 分子不能是3次方.
  • 同方法一
  • 古典概率

  • 概率密度与概率

  • 非负, 排除A

  • 极限等于0和1, 排除C,D

  • 注意和密度函数的区别

  • 常见分布的数学期望

  • \(E(X)=\frac{a+b}{2}, E(Y)=\frac{1}{\lambda}\)

  • 常见分布的数学期望
  • 常见分布的数学期望

  • 公式
  • 同上
  • 统计量的分布

  • 互斥的定义 交集为空集

  • A,D选项不可能, C是或者.

  • 积分是1. 指数是负数

  • 用对称性, \(a,b\)异号

  • 期望的定义
  • 分布函数求导德密度函数. 密度函数乘\(x\)积分得期望

方法二

  • 积分区间排除D
  • 被积函数排除A, C

  • 分布律的性质: 两行成比例

  • 联合分布律加起来等于1.

  • 期望与方差的公式

  • 泊松分布的期望与方差

  • 期望与方差的公式

  • 均匀分布

  • 面积的倒数

  • 积分

  • 期望, 方差, 相关系数, 协方差的公式

  • 公式

  • 先列出\(X^2\)或直接算

  • 积分为1

  • 公式

  • 边缘密度即积分.

  • 或积分等于1

  • 或 系数和指数不能相等

3 统计

  • 研究对象的全体称为总体\(X\), 组成总体的单元称为个体\(X_i.\)

  • 从总体中随机抽取\(n\)个个体, 称为样本, 记为\(X_1,\cdots, X_n.\)

  • 样本相互独立, 和总体有相同的概率分布.

  • \(X_1,\cdots, X_n\)是样本, 不含未知参数的函数\(g(X_,\cdots, X_n)\)称为统计量.

  • 常用统计量:

    1. 样本均值\(\overline{X}=\frac{1}{n}\sum_{i=1}^n X_i.\)
    2. 样本方差\(S^2=\frac{1}{n-1}\sum_{i=1}^n (X_i-\overline{X})^2.\)
    3. 样本标准差\(S=\sqrt{\frac{1}{n-1}\sum_{i=1}^n (X_i-\overline{X})^2}.\)
  • 如果\(E(X)=\mu, D(X)=\sigma^2,\)\(E(\overline{X})=\mu, D(\overline{X})=\frac{1}{n}\sigma^2\)\(E(S^2)=\sigma^2.\)

  • 样本的\(k\)阶原点矩\[A_k=\frac{1}{n}\sum_{i=1}^nX_i^k, k=1,2,\cdots.\]

  • 样本的\(k\)阶中心矩\[B_k=\frac{1}{n}\sum_{i=1}^n(X_i-\overline{X})^k, k=1,2,\cdots.\]

  • 正态分布的矩估计量

3.1 统计中常用的分布

  • 用样本来估计总体的某些未知参数. 分为点估计和区间估计.

  • 点估计: 总体分布函数中含有未知参数\(\theta\), 构造一个统计量\(g(X_1, \cdots, X_n)\), 用统计量的值估计参数, 称为点估计.

  • \(\theta\)的估计量和估计值记为\(\hat\theta.\)

  • 矩估计法. 样本均值\(\overline{X}=\frac{1}{n}\sum_{i=1}^n X_i,\)和样本二阶中心矩\(S_n^2=\frac{1}{n}\sum_{i=1}^n (X_i-\overline{X})^2\) 分别作为总体参数\(E(X),D(X)\)的矩估计量.

  • 如果\(E(\hat\theta)=E(\theta)\), 则称为无偏估计.

  • \(\overline{X}=\frac{1}{n}\sum_{i=1}^n X_i\)\(E(X)\)的无偏估计量

  • \(S^2=\frac{1}{n-1}\sum_{i=1}^n (X_i-\overline{X})^2\)\(D(X)\)无偏估计量.

  • 样本二阶中心矩\[S_n^2=\frac{1}{n}\sum_{i=1}^n (X_i-\overline{X})^2\]\(D(X)\)有偏估计量. 也是最大似然估计.

  • 如果\(X\sim N(\mu_1,\sigma_1^2),Y\sim N(\mu_2,\sigma_2^2)\), 都服从\(N(\mu_1,1)\)分布, 且相互独立, 则\[X+Y\sim N(\mu_1+\mu,(\sigma_1\sigma_2)^2).\]

  • \(\chi^2\)分布[2011]

  • 如果\(X,Y\)都服从\(N(0,1)\)分布, 且相互独立, 则\[X^2\sim \chi^2(1),\quad X^2+Y^2\sim \chi^2(2).\]

  • 标准正态分布的平方和服从\(\chi^2\)分布.

  • \(t\)分布

  • 如果\(X\sim N(0,1), Y\sim \chi^2(n)\), 且相互独立, 则\[T=\frac{X}{\sqrt{\frac{Y}{n}}} \sim t(n).\]

  • 例如, 如果\(X,Y\)都服从\(N(0,1)\)分布, 且相互独立, 则\[\frac{X}{\sqrt{\frac{X^2+Y^2}{2}}} \sim t(2).\]

  • 标准正态分布与\(\chi^2\)分布平方根的商服从\(t\)分布.

  • \(F\)分布

  • 如果\(X\sim \chi^2(n), Y\sim \chi^2(m)\), 且相互独立, 则\(F=\frac{X/n}{Y/m} \sim F(n,m)\)分布.

  • 例如, 如果\(X,Y\)都服从\(N(0,1)\)分布, 且相互独立, 则\[\frac{X^2}{(X^2+Y^2)/2} \sim F(1,2).\]

  • \(\chi^2\)分布的商服从\(F\)分布.

  • 都是从相互独立的一组正态分布\(X_1, X_2, \cdots, X_n\)构造统计量.

  • 正态分布的线性组合服从正态分布.

  • 正态分布的平方和服从\(\chi^2\)分布.

  • 正态分布与平方和的平方根的商服从\(t\)-分布.

  • 正态分布平方和的商服从\(F\)分布.

  • 假设检验就是检验假设\(H_0\)成立不成立.

  • 默认假设\(H_0\)成立, 构造统计量.

  • \(H_0\)成立时, 统计量服从某些分布.

  • 根据结果, 选择接受\(H_0\)还是\(H_1.\)

  • \(X\sim N(\mu,\sigma^2),X_1,\cdots, X_n\) 来自\(X\),\(\overline X\)是样本均值, \(S^2\)是样本方差.

  • 被检参数 其他参数 \(H_0\) 统计量 分布
    \(\mu\) \(\sigma^2\)已知 \(\mu=\mu_0\) \(U=\sqrt{n}\,\frac{\overline X-\mu_0}{\sigma}\) \(N(0,1)\)
    \(\mu\) \(\sigma^2\)未知 \(\mu=\mu_0\) \(T=\sqrt{n}\,\frac{\overline X-\mu_0}{S}\) \(t(n-1)\)
    \(\sigma^2\) \(\mu\)已知 \(\sigma^2=\sigma^2_0\) \(\chi^2=\frac{\sum_{i=1}^n (X_i-\mu_0)^2}{\sigma^2_0}\) \(\chi^2(n)\)
    \(\sigma^2\) \(\mu\)未知 \(\sigma^2=\sigma^2_0\) \(\chi^2=\frac{(n-1)S^2}{\sigma^2_0}\) \(\chi^2(n-1)\)

3.2 历年真题

  • 选择项带根号, 用\(t\)-检验

  • 期望未知, 涉及\(n-1,n\).

  • 假设检验的统计量
  • 假设检验的统计量

  • 不相互独立, A,B,D都不成立.

  • 选C.

  • 正态分布的组合, 需要相互独立.

  • 已知期望,
  • 估计量的期望私钥对, 选D

  • 平方的商是\(F\)分布
  • 统计量的分布

  • 无偏估计
  • 无偏估计

  • 期望的运算

  • 平方和方差有关, 不是无偏

  • 均匀分布的期望\(\frac{1+\theta}{2}\)

  • 期望与方差的公式

  • 卡方分布