工程师平台

概率分布与中心极限定理可视化

面积就是概率 —— 拖动区间看概率变化,再亲眼看双峰分布如何收敛成钟形

本站自研 · 秒开
PDF 与 CDF 联动
CLT 实时采样
数值已交叉验证
累积分布函数 CDF(从 0 升到 1)
P(-1 ≤ X ≤ 1)
0
曲线下面积
期望 E(X)
0
分布的中心位置
标准差 σ
0
σ = √Var(X)
密度曲线总面积
0
应恒等于 1
方差 Var(X)
0
类型
连续 · PDF
f(x) = (1/(σ√2π))·e^(−(x−μ)²/2σ²)
模式
分布选择
参数调节
0

均值,决定曲线中心位置

1

标准差,越小曲线越尖越高

概率区间(阴影部分)
-1
1

阴影面积就是这个区间的概率

💡 建议这样玩:
① 正态分布把 σ 调到 0.2 —— 密度峰值超过 1(密度≠概率)
② 区间设成 μ±1σ、±2σ、±3σ —— 读数应为 0.683 / 0.954 / 0.997
③ 二项分布 n 拖到 100 —— 条形逼近钟形(棣莫弗-拉普拉斯)
④ 切「中心极限」选双峰分布,n 从 1 拖到 30 —— 看它变成钟形
概率分布原理详解

概率密度函数与概率质量函数:面积才是概率

描述随机变量的分布要分两种情形。离散随机变量(如掷骰子点数、一批产品中的不良品数)用概率质量函数 PMF,P(X=k)直接就是取到该值的概率,所有值的概率相加等于 1。连续随机变量(如实测尺寸、寿命时间)用概率密度函数 PDF, 此时单点概率恒为零 —— 一根轴的直径恰好等于 10.000000… 毫米的概率是 0,有意义的只有落在某个区间内的概率, 它等于P(a≤X≤b) = ∫ₐᵇ f(x)dx,也就是曲线下的面积。这解释了为什么密度值可以大于 1:密度的单位是"每单位 x 的概率",只有积分之后才是概率。 页面上方的阴影区域面积就是当前区间的概率,拖动区间滑块可以实时看到它变化。

期望与方差:中心位置与离散程度

期望E(X) = ∫x·f(x)dx是分布的"重心",代表长期平均结果;方差Var(X) = E[(X−μ)²]衡量数据围绕期望的离散程度,其平方根即标准差 σ,与原始数据同单位因而更常用。 工程上这两个量对应着完全不同的质量含义:期望偏离目标值说明存在系统偏差(可通过调整机床、修正刀补消除), 而方差过大说明过程波动大(需要改善设备刚性、控制环境温度、稳定来料)。两者的改善手段截然不同, 因此把"偏心"和"波动大"区分开是质量分析的第一步。

正态分布与 3σ 原则

正态分布f(x) = (1/(σ√2π))·e^(−(x−μ)²/2σ²)完全由 μ 和 σ 两个参数决定:μ 平移曲线,σ 控制胖瘦。它有一组极其重要的数值:数据落在 μ±1σ 内的概率约 68.27%,μ±2σ 内约 95.45%,μ±3σ 内约 99.73%,即著名的 68-95-99.7 法则。 工程含义是:受控过程超出 ±3σ 的情形约每 370 次才出现一次,因此一旦观测到就有理由判定过程异常 —— 这正是统计过程控制 SPC 把控制限设在 ±3σ 的依据。要注意 3σ 描述的是过程自身的波动幅度, 与产品是否满足公差要求是两回事,二者的匹配程度才由过程能力指数 Cp、Cpk 来衡量。

中心极限定理:为什么正态分布无处不在

中心极限定理断言:若从任意一个具有有限方差的总体中抽取容量为 n 的样本,则样本均值的分布随 n 增大趋于正态分布N(μ, σ²/n),其标准差为σ/√n,与源分布的形状无关。这个"与形状无关"是它威力的来源:现实中的测量误差通常是许多独立小因素叠加的结果, 所以哪怕每个因素各自的分布千奇百怪,叠加后的总误差依然近似正态。本页 CLT 模式让你亲眼验证 —— 选一个明显双峰、完全不像钟形的源分布,把样本量拖到 10 以上,累积的样本均值直方图依然收敛到理论正态曲线上。 同时注意 σ/√n 中的√n:要把测量不确定度减半需要样本量增大到四倍,这条规律直接决定了抽样检验方案的成本。

工程应用

概率分布是质量工程与可靠性分析的语言。机械设计中的尺寸链统计法正是基于 CLT:各环公差独立随机时,封闭环公差按平方和求根而非直接相加,因此统计法算出的公差远宽于极值法, 能显著降低加工成本,该计算器同时给出 Cpk 过程能力评估。可靠性工程用指数分布描述恒定失效率阶段的寿命、 用对数正态和威布尔分布描述疲劳寿命。质量控制的 SPC 控制图、抽样检验方案(AQL)依赖二项与泊松分布。 此外测量不确定度评定、蒙特卡洛容差分析、分子速率的麦克斯韦分布、通信中的高斯白噪声建模,背后都是这一套理论。

🎓 学生自学
  • • 概率论与数理统计课程预习
  • • 理解「面积即概率」与密度的含义
  • • 亲眼验证中心极限定理
👨‍🏫 教师授课
  • • 现场演示 CLT 收敛过程
  • • PDF 与 CDF 双图对照讲解
  • • 对比离散 PMF 与连续 PDF
🔧 工程师参考
  • • 快速查正态分布区间概率
  • • 建立 3σ 与过程能力的直觉
  • • 公差统计分析请用尺寸链计算器
常见问题 FAQ

概率密度可以大于 1 吗?

可以,而且很常见。概率密度不是概率,它的单位是"每单位 x 的概率",只有对 x 积分之后得到的面积才是概率。比如均匀分布 U(0, 0.5) 的密度恒为 2,远大于 1,但它在区间上的总面积仍是 1。同理把正态分布的 σ 调到 0.2,峰值密度约为 2.0。真正必须满足的约束是两条:密度非负,且全域积分等于 1。工具里的「密度曲线总面积」读数就是在实时验证第二条。

为什么工程测量数据大多接近正态分布?

因为中心极限定理。一个实测尺寸的误差往往是许多独立小因素叠加的结果——机床振动、刀具磨损、材料不均、温度漂移、测量读数误差等等。CLT 说的是:不管这些单个因素各自服从什么分布,只要它们独立且数量足够多,它们的和(或均值)就趋近正态分布。你可以在 CLT 模式里选「双峰分布」这种完全不像钟形的源分布,把样本量 n 拖到 10 以上,会看到样本均值的直方图依然收敛成漂亮的钟形曲线。

3σ 到底意味着什么?

对正态分布,数据落在 μ±1σ 内的概率约 68.27%,μ±2σ 内约 95.45%,μ±3σ 内约 99.73%,这就是常说的 68-95-99.7 法则。工程上的含义是:若过程受控且服从正态分布,那么超出 ±3σ 的情况约每 370 次才出现 1 次,因此一旦观测到就有理由怀疑过程异常——这正是 SPC 控制图设 3σ 控制限的依据。注意 3σ 说的是过程波动本身,与产品公差是否合格是两件事,两者的关系由过程能力指数 Cp、Cpk 衡量。

离散分布和连续分布有什么本质区别?

离散随机变量只能取可数个值(如二项分布的成功次数、泊松分布的事件数),描述它的是概率质量函数 PMF,PMF 在每一点的值就是该点的真实概率,所有点的概率相加等于 1,图形上画成条形。连续随机变量可取区间内任意实数,描述它的是概率密度函数 PDF,单点概率恒为零,只有区间才有概率(等于曲线下面积)。把 PMF 和 PDF 混为一谈是常见的概念错误,本工具对离散分布明确标注 PMF 并用条形绘制。

样本量 n 要多大,中心极限定理才成立?

没有统一答案,取决于源分布的偏斜程度。源分布本身接近对称时,n = 5 就相当接近正态;像指数分布这种重度右偏的,通常需要 n ≥ 30 才收敛得比较好;极端偏斜或存在重尾时需要更大。经验法则 n ≥ 30 就是这么来的。你可以在工具里选指数分布,把 n 从 1 逐步拖到 30,观察直方图从明显右偏逐渐变成对称钟形——这个过程比任何文字说明都直观。注意 CLT 保证的是样本均值的分布趋于正态,不是原始数据变成正态。

这些分布的计算准确吗?

正态分布的累积概率使用 Abramowitz & Stegun 7.1.26 的 erf 有理近似,绝对误差小于 1.5×10⁻⁷;连续分布的区间概率用辛普森法数值积分(800 个子区间)。二项分布的组合数用对数累加而非阶乘直接计算,因此 n=100 也不会溢出(实测 PMF 全域求和为 1.0000000000、均值 50.000000);泊松分布同样用对数形式,λ=10 时求和为 1.0000000000。CLT 采样用逆变换法生成指数分布、Box-Muller 生成正态。所有计算都在你的浏览器本地完成。

📌 说明:本工具由工程师平台自主开发,在你的浏览器本地实时计算与绘制,不依赖任何第三方服务,不收集任何操作数据。 正态分布累积概率采用 Abramowitz & Stegun 7.1.26 的 erf 有理近似(绝对误差小于 1.5×10⁻⁷); 连续分布的区间概率用辛普森法数值积分(800 个子区间)。二项分布的组合数以对数累加实现、泊松分布以对数形式实现, 因此 n=100、λ=20 时均不会溢出 —— 实测二项 Binomial(100,0.5) 的 PMF 全域求和为 1.0000000000、均值 50.000000, 泊松 Poisson(10) 求和为 1.0000000000、均值 10.000000。中心极限定理的采样使用逆变换法生成指数分布、 Box-Muller 变换生成正态分布,随机源为浏览器内置 Math.random(),适用于教学演示而非密码学用途。 工具用于概念理解与快速估算,精确的统计推断请使用专业统计软件。

相关仿真与教学工具