面试复习——概率论篇

gaomingyang
30
2025-07-04

省流版:保研面试/考研复试概率论与数理统计问题整理 - 知乎

省流版:计算机保研/考研面试题——数学篇_面试数理题 - CSDN博客

1 概率论

1.1 全概率公式和贝叶斯公式

  • 全概率公式

    • 由因推果。造成某种结果,有多种原因,求发生这种结果的概率是多少?

    • 假设造成结果A的原因有B_1,B_2,\cdots,B_n,则A发生的概率为每个原因发生的概率乘以在这种情况下A发生的条件概率的加和,即

      P\left( A \right) =\sum_{i=1}^n{P\left( B_i \right) P\left( A|B_i \right)}
  • 贝叶斯公式

    • 由果推因。已知某结果的发生概率,求造成该结果的第i个原因的概率是多少?

    • 假设结果A发生的概率为P(A),原因可能有B_1,B_2,\cdots,B_n,则A是由B_i造成的概率P(B_i|A)这样求

      先用条件概率公式计算,再用全概率公式替换分母

      P\left( B_i|A \right) =\frac{P\left( A|B_i \right) P\left( B_i \right)}{P\left( A \right)}=\frac{P\left( A|B_i \right) P\left( B_i \right)}{\sum_{j=1}^n{P\left( B_j \right) P\left( A|B_j \right)}}

1.2 大数定律

  • 大数定律:当重复试验的次数很大时,随机变量的均值依概率收敛于自己的期望,“偶然中包含着某种必然”。

  • 意义:大数定律将数理统计中的均值和概率论中的期望联系在了一起。

  • 三种表述

    • 切比雪夫大数定律:随机变量X_1,X_2,\cdots,X_n独立、期望EX_i和方差DX_i都存在、方差DX_i有一致上界(即每个方差都有上界且收敛速度接近),则样本均值收敛于自己的期望,即

      \frac{1}{n}\sum_{i=1}^n{X_i}\overset{P}{\rightarrow}\frac{1}{n}\sum_{i=1}^n{EX_i}
    • 伯努利大数定律:对于X\sim B\left( n,p \right),当n很大时,有\frac{X}{n}\overset{P}{\rightarrow}p。即大量独立重复实验后,随机事件发生的频率收敛于概率

    • 辛钦大数定律:随机变量X_1,X_2,\cdots,X_n独立同分布、期望EX=\mu存在,当n很大时,他们的算术平均值依概率收敛于期望,即

      \frac{1}{n}\sum_{i=1}^n{X_i}\overset{P}{\rightarrow}\mu

1.3 中心极限定理

  • 独立同分布中心极限定理:随机变量X_1,X_2,\cdots,X_n独立同分布,期望EX=\mu,方差DX=\sigma ^2>0,当n很大时,则均值\overline{X_n}近似服从正态分布N\left( \mu ,\frac{\sigma ^2}{n} \right),即

    \lim_{n\rightarrow \infty}P\left( \frac{\overline{X_n}-\mu}{\dfrac{\sigma}{\sqrt{n}}}<a \right) =\varPhi \left( a \right) =\int_{-\infty}^a{\frac{1}{\sqrt{2\pi}}e^{-\frac{t^2}{2}}dt}
  • 拉普拉斯/二项分布中心极限定理:是独立同分布中心极限定理的特殊情况,设随机变量\xi_n服从二项分布B(n,p)\xi_n可视为n个独立同分布的0-1分布随机变量的和,当n很大时,则均值\xi_n近似服从正态分布N(np,np(1-p)),即

    \lim_{n\rightarrow \infty}P\left( \frac{\xi _n-np}{\sqrt{np\left( 1-p \right)}}<a \right) =\varPhi \left( a \right)

    该定理表明:当试验次数n足够大时,二项分布近似于正态分布。

  • 应用:如某炮兵阵地对敌人的防御地段进行100次射击,每次射击中炮弹的命中数是一个随机变量,其期望为2,方差为1.69,求在100次射击中有180颗到220颗炮弹命中目标的概率。

1.4 变量与随机变量的区别

  • 变量:描述确定性现象,取值固定唯一。

  • 随机变量:描述随机现象,取值有多个,且每个取值都有一定的概率。

1.5 联合概率、边缘概率、条件概率

  • 联合概率:两个事件共同发生的概率,P(A,B)

  • 边缘概率:某个事件发生的概率,与其它事件无关,P(A)

  • 条件概率:在事件B已经发生的条件下,事件A发生的概率,P(A|B)

1.6 常见的概率分布

59d3ff7795c5a049a7873674b025b26.png

补充:

  • 0-1分布又叫伯努利分布、两点分布。

  • 泊松分布:

    • \lambda:单位时间/面积内随机事件的平均发生次数

    • 泊松分布和二项分布的关系:当二项分布的n很大而p很小时,泊松分布可作为二项分布的近似

    • 应用:描述单位时间内随机事件发生的次数,如:一天内电路受电磁波干扰的次数

  • 超几何分布(不放回抽样):N件产品中有M件不合格,从N件产品中随机抽n件检查,发现k件不合格品的概率

1.8 若干个高斯分布相加/相乘后得到的分布是什么

假设多个随机变量分别服从不同的高斯分布,如果这些随机变量彼此独立,那么这些随机变量的和也服从高斯分布,乘积为高斯分布乘以常数。

参考:概率论之——高斯分布的乘积_高斯分布相乘 - CSDN博客

1.9 期望和方差

  • 期望:随机变量的每个取值与其概率的乘积的累加和,它描述了随机变量的集中特性。

  • 方差:随机变量的每个取值减去期望的平方与其概率的乘积的累加和,它描述了随机变量的离散特性。

    • D(X)=E((X-E(X))^2)=E(X^2)-E^2(X)(平方的期望 - 期望的平方)

1.10 协方差和相关系数

  • 协方差:X,Y的协方差等于每个X减去其平均值乘上每个Y减去其平均值的乘积的和的平均。

    \begin{align*} \mathrm{cov}(X,Y) &= E\left[ \left( X - E(X) \right) \left( Y - E(Y) \right) \right] \\ &= E\left[ XY \right] - E\left[ X \right] E\left[ Y \right] \end{align*}
    • 意义:协方差表示的是两个变量总体误差的期望,当协方差为0时,两者不线性相关;协方差绝对值越大,两者对彼此的影响越大(>0就是正相关,<0就是负相关)

    • var(X+Y)=var(X)+var(Y)+2cov(X+Y)var指方差

  • 协方差矩阵:n维随机变量X=[X_1,X_2,\cdots,X_n]^T的协方差矩阵为(c_{ij}=cov(X_i,X_j)

    C=\left( c_{ij} \right) _{n\times n}=\left( \begin{matrix} c_{11}& c_{12}& \cdots& c_{1n}\\ c_{21}& c_{22}& \cdots& c_{2n}\\ \vdots& \vdots& \ddots& \vdots\\ c_{n1}& c_{n2}& \cdots& c_{nn}\\ \end{matrix} \right)
  • 相关系数:用X,Y的协方差除以X的标准差和Y的标准差

    \rho _{X,Y}=\frac{cov\left( X,Y \right)}{\sqrt{D\left( X \right)}\sqrt{D\left( Y \right)}}
    • 意义:标准化的协方差,消除了两个变量量纲的影响,取值范围为[0,1]。

1.11 独立与不相关的区别

  • 独立:P(A|B)=P(A)\Leftrightarrow P(AB)=P(A)P(B)

  • 不相关:cov(X,Y)=E[XY]-E[X]E[Y]

  • 独立一定不相关,而不相关不一定独立。不相关就是两者没有线性关系,但是不排除其它关系存在;独立就是互不相干没有关联

1.12 独立和互斥的关系

  • 独立:P(AB)=P(A)P(B)

  • 互斥:A\cap B=\phi

  • 如果P(A)\ne 0,P(B)\ne 0,则互斥不独立,独立不互斥。

1.13 古典概型和几何概型的区别

  • 古典概型——有限等可能(有限个可能事件,且每个事件都是等可能概率事件)

  • 几何概型——无限等可能

1.14 概率密度函数

  • 连续型随机变量的取值有无穷多个实数,无法用分布列表示,所以用概率密度函数来表示。

  • 概率密度函数不是概率,乘以区间长度微元后就表示概率的近似值。

  • 概率密度函数在一段区间上的积分就是随机变量X在这段区间上取值的概率。

1.15 极大似然估计

  • 一种参数估计的方法,它先确定模型,通过若干次实验,观察其结果,反推最有可能(最大概率)导致这样结果的参数值。

  • 似然方程的解只是一个估计值,只有在样本数趋于无限多的时候,它才会接近于真实值。

  • 步骤:

    • 1、写出似然函数

    • 2、对似然函数取对数,并整理

    • 3、求导数

    • 4、解似然方程

1.16 什么是假设和检验

  • 假设检验:在总体分布函数未知的情况下,先对总体参数提出一个假设值,然后利用样本信息来判断这一假设是否成立。

  • 基本思想:小概率事件在一次的实验中是不可能发生的。

  • 两个假设:原假设(要检验的假设)、备选假设(拒绝原假设时的假设),他们是互补的。

  • 两类错误

    • 第一类错误 (弃真错误):原假设H_0为真,但是检验出的拒绝原假设,其概率为\alpha

    • 第二类错误 (存伪错误):原假设H_0为假,但是检验出的接受原假设,其概率为\beta

    • 两类错误是相互矛盾的,不能同时降低两种错误,因此一般在限制\alpha的情况下,尽可能地降低\beta的值。

  • 基本步骤

    • 1、提出原假设和备选假设。

    • 2、选取检验统计量。

    • 3、给定显著性水平。

    • 4、计算检验统计量的具体值,做出判断。

1.17 机器学习为什么要使用概率?

  • 机器学习的是由数据驱动的方法,它的学习对象是数据,从数据出发提取数据特征抽象出数据模型又从数据中发现知识,最后回到数据的分析和预测中去。

  • 机器学习的算法设计通常依赖于对数据的概率假设。

  • 机器学习模型的训练和预测过程的评价指标——模型误差,其本身就是概率的形式。

1.18 不均匀硬币产生等概率

  • 已知一随机发生器,产生0的概率是p,产生1的概率是1-p,现在要你构造一个发生器,使得它构造0和1的概率均为\frac{1}{2}

    • 连续随机生成两次,可能的情况有

      • 00:pp

      • 01:p(1-p)

      • 10:(1-p)p

      • 11:(1-p)(1-p)

    • 所以2次1组,认为01表示0,10表示1,等概率,其他情况放弃。

  • 扩展到3,4,...,n同理,以3为例

    • 构造一个发生器,使得它构造1,2,3的概率均为\frac{1}{3}:认为001表示1,010表示2,100表示3,等概率,其他情况放弃。

1.19 伪随机数产生均匀分布

混合同余法,其中m是模长,a是乘数,c是增量,X_0是初始值。

X_n=\left( aX_{n-1}+b \right) \%m/m

1.20 由均匀分布产生高斯分布

Box-Muller算法,一共有两种形式,其中U_1,U_2是值域为(0,1]的均匀分布的随机数,Z_1,Z_2是高斯分布的随机数。

Z_0=R\cos \left( \varTheta \right) =\sqrt{-2\ln U_1}\cos \left( 2\pi U_2 \right)
Z_1=R\sin \left( \varTheta \right) =\sqrt{-2\ln U_1}\sin \left( 2\pi U_2 \right)

动物装饰