贝叶斯学派的思想是用数据来更新特定假设的概率,例如根据检测结果来更新一只电芯是否有缺陷的判断。
假设一只电芯刚通过缺陷检测设备,被判为阳性(疑似有缺陷)。我们最想知道的是:已知这个结果,它真的有缺陷的概率是多少?毕竟检测设备并非 100% 准确。贝叶斯公式让我们能算出这个概率:
$$P(\text{有缺陷}|阳性) = \dfrac{P(阳性|\text{有缺陷})P(\text{有缺陷})}{P(阳性)}$$这正是测量系统分析(MSA)里属性检测能力的核心问题。把一只良品误判为 NG,是误报;把一只真有缺陷的电芯漏判成 OK,是漏检,检测设备的好坏正由这两个错误率决定。式中“有缺陷”的先验概率 \( P(\text{有缺陷}) \),就是这批电芯真实的不良率;拖拽下方柱状图来调整它。
后验概率同时依赖检测的准确程度:一只良品被判为阴性的概率、一只缺陷电芯被判为阳性的概率,你都可以在下方设定。
最后还需要知道检测给出阳性的总概率,点击按钮生成样本来模拟检测过程。后验概率 \( P(\text{有缺陷}\mid\text{阳性}) \) 告诉你:在所有被判 NG 的电芯里,真正有缺陷的占多少,而这正是衡量一套属性检测系统是否可信的关键指标。
| 阴性 | 阳性 |
|---|---|
以上就是计算后验概率所需要的所有信息。下方的表格给出了利用贝叶斯公式算出的其他后验概率。
| 阴性 | 阳性 | |
|---|---|---|
| 良品 | ||
| 有缺陷 |
在统计学中, 似然函数 的定义是:
$$L(\theta | x) = P(x | \theta)$$似然函数的概念在频率学派和贝叶斯学派中都有重要的作用。
选择样本大小\(n\)然后生成样本。
拖动紫色滑块(改变\(\theta\)的值)并观察似然函数。
贝叶斯统计的核心思想是利用观察到的数据来更新先验信息。考虑一条产线,每只电芯合格的概率(良率)为\(p\)。下面的紫色滑块可以调整\(p\)的大小(假设在现实中我们并不知道\(p\))。
粉色的滑块可以调整\(p\)的先验分布。这里我们假定\(p\)的先验分布是Beta(\(\alpha,\beta\)),在图中粉色曲线代表了先验概率的密度分布函数。
当我们不断抽检电芯时,我们不断更新关于\(p\)的后验分布。这个后验分布就是我们对\(p\)的最好估计,同时这也是我们对下一只电芯抽检结果的先验信息。