年末备考季,总有学生抱着一沓概率论试卷来找我,问得最集中的就是第三章“多维随机向量”。倒也不意外,前两章再怎么绕,研究对象始终是一个随机变量;到了第三章,突然变成两个变量一起看,联合分布、边缘分布、条件分布、独立性判定全挤在几十页教材里,公式密度比前两章加起来都高。很多同学上课听的时候觉得“老师讲得好清楚”,合上书做题却连第一步该求密度函数还是分布函数都拿不准。
这篇文章不打算给你复述一遍教材,而是把第三章当成一门“通关游戏”来拆:哪些是必考点,哪些是送分题,哪些地方最容易挂,复习时按什么顺序推进最高效。如果你正在准备期末考,或者你刚开始学这门课,希望在一轮复习之前先搭好框架,可以直接照着下面的思路走。我会把联合分布、边缘分布、条件分布、独立性判定和随机变量函数的分布这几块全部过一遍,中间穿插实际算例和最容易踩的坑,保证你在考场上看到“二维连续型随机变量”这几个字,心里先有谱。
1. 先看全局:多维随机向量这门课的主线是什么
1.1 第三章到底比前两章难在哪
我见过不少学生的痛苦表情,一翻开第三章就开始头皮发麻。其实难的原因特别单纯:前两章你只需要同时处理一个随机变量,最多算一算期望、方差、分布函数;第三章把变量数量从“一个”变成“两个”,很多直觉就没法用了。
举个例子,一维时你看到概率密度函数,第一反应是曲线下的面积。二维时你看到的是一张曲面,概率变成了“曲面下面某块区域的体积”。不少同学在这里转不过弯,老想着用“面积”去套,一算就错。另一种常见误区是,把二维联合分布律和两个一维分布律混在一起,列表格时漏掉行或漏掉列,导致所有后续计算全崩。
从学习策略角度看,第三章其实是把一整条逻辑链铺开:先定义二维随机变量,再定义联合分布函数,然后分别引出联合分布律和联合密度函数;接着从联合分布里“抽离”出每个变量各自的分布,也就是边缘分布;再考虑“已知一个变量取值时,另一个变量的分布规律”,这就是条件分布;有了前几块,才能判断两个变量是否独立;最后,还要研究两个随机变量经过函数映射后,新变量的分布如何求。
这条链一旦串起来,你会发现整章其实就干四件事:求联合、求边缘、求条件、判定独立性。试卷上所有题都逃不出这个框架。
1.2 用一条逻辑链串起所有考点
我建议你在第一轮复习时,别按教材的目录顺序傻傻往后翻,而是把考点排成这样一条链:
联合分布函数 → 联合分布律 / 联合密度函数 → 边缘分布 → 条件分布 → 独立性判定 → 随机变量函数的分布
每个环节都是下一环节的“原料”。比如不知道边缘分布,你就没法求条件分布;不会判断独立性,你再遇到 Z = X + Y 这种函数分布时,就不知道该用卷积还是不能直接用卷积。
这条链的本质是:你从一个完整的信息源(联合分布)出发,逐步做“降维”或“过滤”处理。联合分布中包含所有变量的全部概率信息,边缘分布相当于把另一个变量“积掉”或“加总”掉,条件分布则是在固定另一个变量取值的前提下重新归一化。考试题无论是给分布律表格,还是给密度函数,最终都是让你在这条链上做前向或反向推导。
另一个容易忽视的地方是二维均匀分布和二维正态分布这两个特殊例子。二维均匀分布计算简单,但区域变化多端,特别喜欢考“落在某块区域上的概率”;二维正态分布则常用来考边缘分布仍然是正态、独立与相关系数为零的关系。这两类题目年年出现,复习时一定要单独整理。
2. 核心概念拆解:联合分布、边缘分布、条件分布一次讲透
2.1 联合分布函数:一切分布的“总源头”
先说定义。设 (X, Y) 是二维随机变量,对任意实数 x, y,二元函数
F(x, y) = P{X ≤ x, Y ≤ y}
就叫作 (X, Y) 的联合分布函数。它表示随机点落在以 (x, y) 为右上角的左下无穷矩形区域里的概率。
这个定义看起来简单,但它有三条性质你必须记牢。
第一,单调性。对任意 x₁ ≤ x₂,F(x₁, y) ≤ F(x₂, y);对任意 y₁ ≤ y₂,F(x, y₁) ≤ F(x, y₂)。这个性质在判断一个函数能不能当分布函数时特别管用。
第二,极限性质。F(∞, ∞) = 1,F(-∞, y) = 0,F(x, -∞) = 0,F(-∞, -∞) = 0。注意这里负无穷方向的极限都是0,正无穷方向两个变量都取无穷才是1。
第三,非负矩形概率。对任意 a<b,c<d,有
P{a < X ≤ b, c < Y ≤ d} = F(b, d) - F(a, d) - F(b, c) + F(a, c) ≥ 0
这公式是选择题和判断题最爱挖的坑。很多同学会把它记成 F(b, d) - F(a, c),少减了两个交叉项。它的几何意义其实很好理解:先把大矩形 [(-∞, b), (-∞, d)] 的概率取出来,剪掉左边和下面的长条,但左下角那块被剪了两次,所以要加回来。
实际计算中,二维离散型随机变量求联合分布函数,就是把所有满足 X≤x, Y≤y 的分布律概率加总。二维连续型求分布函数,则要算二重积分:
F(x, y) = ∫∫_{u≤x, v≤y} f(u, v) du dv
我在批作业时发现一个高频问题:题目给的是一个分段密度函数,积分区域分了好几块,学生只积了其中一块,导致 F(x, y) 的表达式不完整。这种情况我一般建议:先画图,把积分区域的分界线和你的积分上下限都标出来,再看密度函数作用的区域哪里和它相交,相交的部分才需要积分。
2.2 边缘分布:把二维世界“压”回一维
边缘分布的思想非常朴素:我们手里有二维的信息,但如果只关心 X 一个人,就得把 Y 的所有可能情况都“加总”或“积掉”。
离散型的情况特别直观。设联合分布律为 P{X=xᵢ, Y=yⱼ}=pᵢⱼ,那么
P{X=xᵢ} = pᵢ· = Σⱼ pᵢⱼ
P{Y=yⱼ} = p·ⱼ = Σᵢ pᵢⱼ
如果你手里是一张分布律表格,边缘分布就是把“第 i 行求和”得到 P{X=xᵢ},把“第 j 列求和”得到 P{Y=yⱼ}。这个过程简直不能再机械。但恰恰因为机械,很多同学掉以轻心,表格抄错数字、求和漏行、最后忘了归一化检查,这些低级错误几乎每次考试都有。
连续型的情况稍难一些。设联合密度函数为 f(x, y),则
f_X(x) = ∫_{-∞}^{∞} f(x, y) dy
f_Y(y) = ∫_{-∞}^{∞} f(x, y) dx
一个是“对 y 积分”,一个是“对 x 积分”,千万不要记反。记性差的话,你就想:求 X 的边缘密度,就要把 X 固定住,把另一个变量 Y 全部积掉,所以是对 dy 积分。
这里最大的拦路虎是积分上下限。题目多给一个分段密度函数,比如 f(x, y) 只在 0<x<1, 0<y<x 上有非零值,你要先画出这个区域,再确定边缘分布时 x 和 y 各自的范围。求 f_X(x) 时,x 是外部变量,它的范围直接看区域里 x 的取值;而 y 的积分上下限要看“在某个固定的 x 下,y 从哪里到哪里”。求 f_Y(y) 时反过来,y 是外部变量,y 的范围看区域里 y 的取值,x 的积分上下限看“固定 y 时 x 的区间”。
如果这些上下限没搞清楚,你算出来的边缘密度对 x 或 y 积分很可能不是1,这时候至少还能自我检查出来,就怕你算完也不验证,一路错下去。
2.3 条件分布:已知信息改变概率分布
条件分布想解决的问题:我们已经知道 X 取某个值了,那 Y 的分布会变成什么样?这个“已知之后的重新分布”就是条件分布。
离散型条件分布律的定义很直白:
P{Y=yⱼ | X=xᵢ} = P{X=xᵢ, Y=yⱼ} / P{X=xᵢ},其中 P{X=xᵢ} > 0
同理也有
P{X=xᵢ | Y=yⱼ} = P{X=xᵢ, Y=yⱼ} / P{Y=yⱼ}
我从阅卷经验里告诉你一个高频错误:分母用错边缘分布。题里给的是联合分布律,你求 P{Y=yⱼ | X=xᵢ},分母必须除以 X 的边缘 P{X=xᵢ},结果很多同学除以 Y 的边缘。一定要看清竖线后面是谁,竖线后面是已知条件,分母就是这个已知事件的边缘概率。
连续型条件分布在考试里更常见,定义式是:
f_{Y|X}(y|x) = f(x, y) / f_X(x),其中 f_X(x) > 0
这里有个容易绕晕的点:条件密度函数里 x 是当作参数的,它在整个式子中是一个固定的数,y 才是变量。所以对 y 积分必然等于1,你可以拿这来验证。同理,
f_{X|Y}(x|y) = f(x, y) / f_Y(y)
记这两个公式时,我的土办法是“分子永远是联合密度,分母是竖线后面那个变量的边缘密度”。竖线后面的变量是谁,分母就是谁的边缘密度,这样就不会记反。
条件分布还有一个非常实用的意义:当两个变量独立时,条件密度退化成了无条件密度,也就是“知道不知道另一个变量,对我的分布没有影响”。这个概念是后面独立性判定的直觉源泉。
3. 独立性判定与随机变量函数的分布:两大必考题型
3.1 独立性判定:三步套路直接秒杀
独立性是第三章的核心考试点,也是后续统计学内容的地基。判断两个随机变量独立,说白了就是看“一个变量的取值会不会改变另一个变量的分布”。
从定义出发,判定步骤可以固定为三条。
第一步,写出或者回忆各自的一维边缘分布。如果是连续型,要求出 f_X(x) 和 f_Y(y);如果是离散型,要求出 P{X=xᵢ} 和 P{Y=yⱼ}。
第二步,验证“联合分布是否等于边缘分布的乘积”。
- 离散型:对每个 i, j,验证 P{X=xᵢ, Y=yⱼ} = P{X=xᵢ} · P{Y=yⱼ}
- 连续型:验证 f(x, y) = f_X(x) · f_Y(y) 在定义域内几乎处处成立
第三步,如果等号全部成立,则 X 和 Y 独立;只要有一对变量取值不满足,就不独立。
这看起来很简单,但有一个特别细节的规定:连续型随机变量的独立性要求在密度函数定义域上“几乎处处”成立,意思是可以允许个别孤立点不相等,因为这些点上的概率为0,不影响实际分布。考试判断题通常会在这个位置做文章,比如给一个密度函数在某个点不满足乘积形式,问你是否独立。你只要抓住“连续型孤立点不影响独立性”这个规则就行。
另一个高频坑是:只验证了部分取值就下结论说独立。比如离散型给了 2×3 的联合分布律表,你只验证了第一行和第一列,没验证其他格子,就写上“独立”。这不严谨,判卷老师一般一眼就能看出你是碰巧蒙对的。
3.2 连续型和离散型“独立性检验”的区别
离散型判定时,你需要逐个检查联合分布律表格里的每一个格子。这里有个速算技巧:如果联合分布律表格可以写成“行边缘概率 × 列边缘概率”的完整外积形式,那一定独立。换句话说,你算出行边缘向量 (a₁, a₂, ..., a_m) 和列边缘向量 (b₁, b₂, ..., b_n),如果表格里的元素恰好是 aᵢ × bⱼ,那就是独立。
连续型判定时,除了验证 f(x, y) = f_X(x)·f_Y(y),还有一个特别常见的题型:给一个联合密度函数,问你其中某个参数的值,使 X 和 Y 独立。这种题的做法是,先把未知参数当成常数,写出边缘密度,再令乘积等于联合密度,解出参数。比如 f(x, y)=k·x·y,区域 0<x<1, 0<y<1,先算归一化参数 k=4,然后算边缘密度 f_X(x)=2x,f_Y(y)=2y,恰好满足乘积关系,于是直接判断独立。
这里必须强调一点:独立性不是一个可以“看出来”的性质,必须经过验证。除非题目明确说 X 与 Y 相互独立,否则你不能想当然。很多人看到联合密度是 f(x, y)=8xy 且区域是矩形 0<x<1, 0<y<1,就脱口而出“独立”,但假如区域是三角形 0<x<1, 0<y<x,哪怕密度函数再像乘积形式,由于区域本身限制 x 和 y 的取值相互牵制,两个变量也不可能独立。判断独立性时,定义域和表达式要一起看。
3.3 二维随机变量函数的分布:卷积公式和两个最常考特例
这一块是第三章的压轴戏。题目一般是:已知 (X, Y) 的联合分布,求 Z = g(X, Y) 的分布。考试里最常考的就是 Z = X + Y、Z = max(X, Y)、Z = min(X, Y)。
先看最重要的 Z = X + Y。如果 (X, Y) 是连续型随机变量,联合密度为 f(x, y),那么 Z 的分布函数是
F_Z(z) = P{X + Y ≤ z} = ∬_{x+y≤z} f(x, y) dx dy
对 z 求导,可得 Z 的密度函数:
f_Z(z) = ∫_{-∞}^{∞} f(x, z-x) dx = ∫_{-∞}^{∞} f(z-y, y) dy
这两个积分公式叫卷积公式。提醒你一下,第二个等号那两种写法都是对的,选哪种取决于你习惯对谁积分。我一般建议根据题目给的区域决定:区域里谁的取值范围更“规整”就先固定谁。比如 f(x, y) 的区域是 0<y<x<1,求 Z=X+Y 时,你把 y 固定住然后对 x 积分就比较容易,因为 y 的范围天然是 (0,1),而 x 的范围是 (y, 1),代入 x=z-y,就可以直接算上下限。
特别地,如果 X 和 Y 是独立随机变量,则联合密度等于边缘密度的乘积,于是
f_Z(z) = ∫ f_X(x) f_Y(z-x) dx
这个简化公式非常重要,大部分教材里的例题都是基于独立性来展开的。但你要记牢:不独立的变量不能这样拆,只能从最原始的联合密度出发做重积分。
再来看 max 和 min 的分布。如果 X 和 Y 相互独立,且各自分布函数为 F_X(x), F_Y(y),那么
F_{max}(z) = P{max(X, Y) ≤ z} = P{X ≤ z, Y ≤ z} = F_X(z) · F_Y(z)
F_{min}(z) = P{min(X, Y) ≤ z} = 1 - P{min(X, Y) > z} = 1 - P{X > z, Y > z} = 1 - [1 - F_X(z)]·[1 - F_Y(z)]
这两个公式不要硬背,记住思路就够:最大值小于等于 z,说明两个变量都小于等于 z;最小值大于 z,说明两个变量都大于 z。从正反两个方向想清楚,公式自然写出来了。
对于独立的连续型变量,密度函数就是分布函数求导;对于离散型变量,则要用概率直接相加。很多同学把连续型的密度结果写成概率,导致最后答案格式不对,这也是要扣步骤分的。
4. 实操演练:一道综合性真题的完整拆解
4.1 典型例题引入
光说公式,不如走一遍完整题目。我拿一道综合性比较强的例题来演示,看完你就知道这套知识链是怎么串起来的。
设二维随机变量 (X, Y) 的联合密度函数为 f(x, y) = C,当 0 < x < 1, 0 < y < x f(x, y) = 0,其他 求:常数 C;边缘密度函数 f_X(x), f_Y(y);条件密度函数 f_{Y|X}(y|x);判断 X, Y 是否独立;求 P{X+Y > 1}。
这道题包含了第三章几乎所有核心考点,非常适合期末考前自测。
4.2 逐步解析与计算过程
第一步,确定常数 C。区域 D 是 0<x<1, 0<y<x,这是一个三角形,面积等于 1/2。二维均匀分布的密度函数是面积的倒数,所以 C=2。如果你不信,可以列规范化条件:
∫₀¹ ∫₀ˣ C dy dx = C · ∫₀¹ x dx = C/2 = 1,所以 C=2。
第二步,求边缘密度。先求 f_X(x)。把 y 积掉:
f_X(x) = ∫_{-∞}^{∞} f(x, y) dy
当 0<x<1 时,y 的积分范围是 0 到 x,所以
f_X(x) = ∫₀ˣ 2 dy = 2x,0<x<1
其他情况下 f_X(x)=0。这里注意,x 是外部变量,它的范围由区域决定,即 0<x<1。
再求 f_Y(y)。把 x 积掉:
f_Y(y) = ∫_{-∞}^{∞} f(x, y) dx
当 0<y<1 时,固定 y,从区域图里看出 x 的范围是 y 到 1,于是
f_Y(y) = ∫_y¹ 2 dx = 2(1-y),0<y<1
其他情况下 f_Y(y)=0。
第三步,求条件密度。公式是
f_{Y|X}(y|x) = f(x, y) / f_X(x)
在 0<x<1 且 0<y<x 时,
f_{Y|X}(y|x) = 2 / (2x) = 1/x
所以给定 X=x 的条件下,Y 在 (0, x) 上服从均匀分布。这个结论也符合直觉:点落在三角形里时,知道 x 后,y 的取值范围就是 0 到 x,条件分布当然均匀。
第四步,判断独立性。如果 X 和 Y 独立,需要 f(x, y) = f_X(x) · f_Y(y)。但 f_X(x)·f_Y(y) = 2x · 2(1-y) = 4x(1-y),而联合密度是 2,显然不恒等,所以 X 与 Y 不独立。另一种直观判断:区域的形状是三角形,Y 的取值上限直接受 X 影响,自然不可能独立。
第五步,求 P{X+Y>1}。我们需要的是区域 D 里满足 x+y>1 的部分。先画出区域:三角形顶点是 (0,0), (1,0), (1,1)。直线 x+y=1 穿过这个三角形,把它分成两块。满足 x+y>1 的小三角形区域是 x 从 1/2 到 1,y 从 1-x 到 x。面积:
S = ∫_{1/2}¹ ∫_{1-x}ˣ dy dx = ∫_{1/2}¹ (2x-1) dx
算一下:∫_{1/2}¹ 2x dx = x²|{1/2}¹ = 1 - 1/4 = 3/4;∫{1/2}¹ (-1) dx = -1/2;合起来等于 1/4。因为密度 C=2,概率等于 2 × 1/4 = 1/2。
你也可以直接算二重积分:
P{X+Y>1} = ∫_{1/2}¹ ∫_{1-x}ˣ 2 dy dx = 2 · (1/4) = 1/2
答案 1/2 干净利落。
4.3 答题规范与阅卷视角
这道题如果放在期末考卷上,我会按步骤给分。常数 C 占 2 分左右;边缘密度每道 4 分,主要看积分上下限和分段表达;条件密度 3 分,核心是分母用对边缘密度;独立性判定 3 分,必须出现“f(x,y) ≠ f_X(x)f_Y(y)”这一个明确判断依据;最后概率 4 分,画对区域并写清积分上下限很重要。
从阅卷角度看,三段式回答最吃香:先写公式,再代数据,最后给结果。很多学生嫌烦,直接在题目旁边写个“=1/2”,跳步太多,万一答案错了一分都没有。考试不是做数学竞赛,过程分才是保命符,特别是期末考,步骤框架完整比结果漂亮更关键。
5. 常见错误与考场避坑指南
5.1 期末高频错误Top 5
我总结了历届学生在这章错得最多的五个地方,你可以对着自查。
| 错误类型 | 错误表现 | 正确做法 |
|---|---|---|
| 边缘密度积分上下限出错 | 求 f_X(x) 时把 x 的范围也规定在某个固定区间,忽略了外部变量的变化 | 先画区域,固定外部变量,再沿着另一个变量方向叠加 |
| 条件分布分母用错 | 求 f_{Y | X}(y |
| 独立性验证不完整 | 离散型只检查部分取值就下结论 | 逐一检查所有格子,缺一个都不行 |
| 不画图直接套卷积公式 | 区域变形时积分限抄错,结果算成负数 | 先画区域图,转换变量后用阴影区域确定上下限 |
| 忘了归一化检查 | 边缘密度积分结果不是1,还继续往下算 | 每求完一个密度,先积一遍看是不是1 |
第一行的边缘密度问题,我见过太多人“算得很起劲,结果全错”。根源在于对区域的几何理解不够。区域是三角形、矩形还是更复杂的形状,直接决定积分的分段方式。所以我一再强调,拿笔先画图,坐标轴画完了再列式,磨刀不误砍柴工。
第二行的条件分布错误,和公式熟练度有关,但更和心态有关。考场上一紧张,看到 f(x, y) 就开始带数字,忘了分母是谁。我建议你动笔之前,先用中文在草稿纸上写一句话:“我现在要求的是在已知某个变量取值时,另一个变量的分布”,然后把这个变量圈出来,再找分母。
独立性判定最典型的翻车现场是二维正态分布。教材里有个结论:对于二维正态分布,X 与 Y 独立当且仅当相关系数 ρ=0。不少学生把这句话记成“ρ=0 一定独立”,然后推广到任何分布。实际上只有在二维正态分布这个前提下才成立。一般分布的相关系数为0也可能不独立。考试遇到这类判断,老老实实回到 f(x,y)=f_X(x)f_Y(y),不要凭直觉。
最后这个归一化检查,我把它当成学生自带的“验算器”。你每算完一个密度函数,马上一眼看它积分是不是1。如果边缘密度积分出来不是1,说明前面的积分上下限肯定有问题,当场发现当场改,别再继续往下走。这一招能救回不少冤枉分。
5.2 考场上的时间分配与提速技巧
期末试卷题目量通常不小,第三章一般占 20~30 分,建议分配 20~30 分钟。如果遇到连续型大题,从读题到算完,建议控制在 12~15 分钟。这不是让你抢时间,而是提醒你:如果一道题卡了 20 分钟还没头绪,赶紧跳过去做后面的,别在一棵树上吊死。
提速有一个土办法:把“求边缘密度”和“判定独立性”两步合并起来。有些题目给的是联合密度函数,一看就是可分离变量形式,比如 f(x,y)=g(x)h(y),而且定义域是矩形区域,那你算边缘密度时等于直接把 g(x) 和 h(y) 分别归一化,再判断独立性几乎零成本。这种“形式可分离 + 矩形区域”的组合出现频率极高,特判能帮你省下大量计算。
但注意,如果定义域不是矩形,再好看的表达式也不能直接判定独立。这一点我在 3.2 里强调过,这里再啰嗦一次。
5.3 复习顺序建议和最后的叮嘱
如果你的期末复习时间只剩一周,我的建议是:前三天按“联合分布→边缘分布→条件分布→独立性→函数分布”的顺序过概念和基础题,第四到第六天刷综合性题目,最后一天只做错题和公式速查。第三章不要平均用力,函数分布(特别是 Z=X+Y 的卷积公式)和条件密度是两个人最薄弱的地方,多分配时间。
复习资料方面,教材课后题永远是最优先的,尤其是标星的题目。如果学校有历年期末卷,优先刷最近三年;没有的话,找一本习题集,专挑“二维随机变量”这个章节做。我个人不建议考前还抱着视频课刷,概率论这门课“看会”和“算会”完全是两回事,动手写的题量上去了,手感自然就来了。
最后再多说一句:我遇过很多学生,考完概率论回来感叹“题目其实不难,就是算得慢”。多维随机向量这章计算量确实大,但你只要能把公式推导的逻辑线在脑子里理顺,看到题目先判断“它想考我哪一步”,然后再动手,速度和准确率都会上来。别慌,把上面这张知识链走一遍,第三章没那么吓人。