分组数据的离散量度 · 中五
分组数据的离散量度:例题(KBAT)
不点明方法的真实情境:用中位数与四分位距评估一项服务承诺、由百分位数求录取门槛、以及比较平均值与中位数来描述分布的形状。适合能够判断题目真正需要哪种量度的学生。
例题 1
一家诊所记录了 60 名病人的等候时间(分钟):0–9(6)、10–19(14)、20–29(20)、30–39(10)、40–49(6)、50–59(4)。诊所宣传『半数病人在 25 分钟内获得诊治』。
估计等候时间的中位数来检验这一说法,并求四分位距作为一致性的量度。
- 『半数病人』指向中位数;一致性指向四分位距。
- 累积次数:6、20、40、50、56、60;n = 60。
- n ÷ 2 = 30 → 中位数组 20–29(L = 19.5、F = 20、f = 20、c = 10)。
- 中位数 = 19.5 + ((30 − 20) ÷ 20) × 10 = 19.5 + 5 = 24.5 分钟。
- 24.5 分钟 < 25 分钟,因此数据支持该说法。
- Q1 在 n ÷ 4 = 15 → 组别 10–19:Q1 = 9.5 + ((15 − 6) ÷ 14) × 10 = 15.93 分钟。
- Q3 在 3n ÷ 4 = 45 → 组别 30–39:Q3 = 29.5 + ((45 − 40) ÷ 10) × 10 = 34.5 分钟。
- 四分位距 = 34.5 − 15.93 = 18.57 分钟。
例题 2
一所学校为 50 份作业评分:40–49(4)、50–59(10)、60–69(16)、70–79(12)、80–89(6)、90–99(2)。『优异』颁给前 20% 的作业。
用插值法估计获得优异所需的最低分数。
- 前 20% 位于第 80 百分位数之上,因此求 P80(有 80% 作业低于该分数)。
- 位置 = 80% × 50 = 0.8 × 50 = 第 40 个值。
- 累积次数:4、14、30、42、48、50;第 40 个值落在组别 70–79。
- L = 69.5、F = 30、f = 12、c = 10。
- P80 = 69.5 + ((40 − 30) ÷ 12) × 10 = 69.5 + 8.33 = 77.83。
- 因此作业约需 78 分(77.83 向上取整)才能进入前 20%。
例题 3
一名护林员记录了 32 只巨蜥的质量(kg):1.0–1.9(8)、2.0–2.9(12)、3.0–3.9(7)、4.0–4.9(3)、5.0–5.9(2)。求估计平均值与中位数,再用它们描述分布的形状。
- 组中点 x:1.45、2.45、3.45、4.45、5.45。
- Σf = 32;Σfx = 11.6 + 29.4 + 24.15 + 13.35 + 10.9 = 89.4。
- 估计平均值 = 89.4 ÷ 32 = 2.79 kg。
- 累积次数:8、20、27、30、32;n ÷ 2 = 16 → 中位数组 2.0–2.9。
- 中位数 = 1.95 + ((16 − 8) ÷ 12) × 1.0 = 1.95 + 0.67 = 2.62 kg。
- 平均值 2.79 > 中位数 2.62,所以分布向右偏斜(少数较重的巨蜥把平均值拉高)。
例题 4
下表列出 A 批 40 个灯泡的寿命(小时):500–599(4)、600–699(10)、700–799(14)、800–899(8)、900–999(4)。(a) 估计 A 批的平均数和标准差。
(b) B 批平均数相同但标准差为 95 小时。说明哪一批更稳定,并给出理由。
- 组中值 x:549.5、649.5、749.5、849.5、949.5;Σf = 40。
- Σfx = 4(549.5) + 10(649.5) + 14(749.5) + 8(849.5) + 4(949.5) = 29 780,所以平均数 = 29 780/40 = 744.5 小时。
- Σfx² = 22 670 210;方差 = 22 670 210/40 − 744.5² = 566 755.25 − 554 280.25 = 12 475。
- A 批标准差 = √12 475 = 111.69 ≈ 111.7 小时。
- (b) B 批标准差(95 小时)小于 A 批(111.7 小时),所以 B 批更稳定,因为标准差越小表示寿命越不分散。
例题 5
某考试有 80 名考生,分数分组:30–39(6)、40–49(14)、50–59(22)、60–69(20)、70–79(12)、80–89(6)。只有成绩最高的 15% 考生获颁优异奖。
用内插法求获奖所需的最低分数,再向上取整到最接近的整数分。
- 最高的 15% 从第 85 百分位数开始,位置为 0.85 × 80 = 从下往上第 68 个数据。
- 累积频率:6、20、42、62、74、80;第 68 个数据落在组 70–79(其前累积频率 = 62)。
- 该组:L = 69.5,前累积频率 F = 62,频率 f = 12,组距 c = 10。
- P₈₅ = 69.5 + ((68 − 62)/12) × 10 = 69.5 + 5 = 74.5,所以最低整数分为 75。
例题 6
对 60 户家庭的调查记录了拥有的电子设备数量,分组为:0–4(8)、5–9(p)、10–14(18)、15–19(q)、20–24(6)。估计的平均设备数为 11。
求 p 和 q 的值。
- 总频率:8 + p + 18 + q + 6 = 60,所以 p + q = 28。……(1)
- 组中值:2、7、12、17、22;Σfx = 8(2) + 7p + 18(12) + 17q + 6(22) = 364 + 7p + 17q。
- 平均数 = 11 表示 Σfx = 11 × 60 = 660,所以 364 + 7p + 17q = 660,得 7p + 17q = 296。……(2)
- 由 (1),p = 28 − q;代入 (2):7(28 − q) + 17q = 296 → 196 + 10q = 296 → q = 10,再得 p = 18。
例题 7
某工厂记录了100批产品中每批出现的次品数量:0–4(10批),5–9(p批),10–14(34批),15–19(q批),20–24(8批)。每批次品数量的中位数为12。
求p和q的值。
- 总频数:10+p+34+q+8 = 100 → p+q = 48。
- 中位数(第50个数据)落在10–14组(L = 9.5,F = 10+p,f = 34,c = 5)。
- 应用中位数公式:12 = 9.5 + [(50 − (10+p))/34] × 5 → 2.5 = [(40−p)/34] × 5。
- (40−p)/34 = 0.5 → 40−p = 17 → p = 23。
- 由p+q = 48:q = 48 − 23 = 25。
例题 8
某驾驶学校记录了60名学员在通过考试之前所需的学时:5–9(6人),10–14(14人),15–19(22人),20–24(12人),25–29(6人)。估计需要超过18小时的学员人数,并将其表示为所有学员的百分比。
- 到14.5(10–14组结束处)为止的累积频数 = 6+14 = 20。
- 在15–19组内(组界14.5–19.5,频数22),低于18的比例为(18−14.5)/(19.5−14.5) = 3.5/5 = 0.7,即该组内约有0.7 × 22 = 15.4名学员低于18小时。
- 因此低于18小时的人数 ≈ 20 + 15.4 = 35.4,意味着超过18小时的人数 ≈ 60 − 35.4 = 24.6 ≈ 25人。
- 百分比 = (24.6/60) × 100% ≈ 41%。
资料来源:DSKP KSSM Mathematics Form 4 and 5 (Versi English)
常见问题
KBAT 题目在分组离散量上多提出了什么要求?
KBAT 题目通常会给出两组分组数据,比如两个班的考试成绩,或两家工厂的产量,要求你比较它们的离散程度,而不只是计算。你要分别算出诸如标准差或四分位距这样的量,然后写一句结论,把较小的数值和更稳定、变化更小联系起来。
考官在 KBAT 比较题的答案里看重什么?
两组数据都要有完整且标注清楚的计算,之后要用实际数字明确写出比较的结论,例如指出哪一组的标准差较小,并说明这在情境中代表什么。只有计算没有结论句,或者有结论却没有数字支撑,都会被扣分。
学生在这类 KBAT 题目中容易在哪里栽跟头?
两组的量都算对了,却忘了用文字比较;把哪个量代表更稳定搞反了(离散程度较小才是更稳定,而不是较大的那个);以及中间数值取整太早,导致比较结果出现偏差。要始终把最终的数字和题目问的实际情境联系起来。