未分组数据的离散量度 · 中四
全距还是标准差:该用哪个分散量?
全距是最快的分散量,最大值减最小值,但它只依赖两个数值,一个异常值就能把它完全带偏。标准差用上每一个数值,因此对数据的分散给出更稳定、更完整的刻画。
各自用了多少数据
全距就是最大值减最小值,所以它只注意到两个极端值,忽略中间的一切。标准差则度量每个数值离平均值有多远,并把它们全部合起来。
这个差别正是二者取舍的核心:一个是两个数值的快照,另一个概括了整组数据。
全距会在哪里失灵
因为依赖极端值,一个离群值就能把全距撑大,而其余数据仍然紧凑。分数 50、51、52、53、98 的全距是 48,可五个里有四个彼此只差 3 分之内。
标准差也会受到离群值影响,但轻微得多,因为大量普通数值会把它拉回来,正是这种稳定,使它通常是更可信的分散量。
在两者之间如何选择
如果你只想快速感受一下分散,或数值很少,用全距既合理又快。如果要公平地比较两组数据,或数据里可能有异常值,标准差是更公平的选择,而题目通常会说清楚要哪一个量。
要避免的误解是以为某个量单纯“更好”:全距并没有错,只是较粗糙,每个量在不同情形下各是合适的工具。
资料来源:DSKP KSSM Mathematics Form 4 and 5 (Versi English)
常见问题
为什么全距(range)给出的离散程度可能会造成误导?
全距只使用最大值和最小值,所以只要有一个异常高或异常低的数值,就可能让全距显得很大,即使大部分数据其实都聚集得很紧密。标准差能避免这个问题,因为它考虑了所有数值,能更公平地反映数据的实际分散程度。
在SPM离散程度题中,只求全距够吗?
全距可以作为快速检查,但大多数SPM离散程度题都期望用标准差,因为它是更完整的量数。如果题目明确要求全距,只需给出最大值减最小值;如果题目要求比较稳定性或全面描述离散程度,通常需要的是标准差。
求全距时常见的错误是什么?
常见错误是相减顺序颠倒,或从未排序的数据中挑错最大值和最小值,务必先在分组或未分组的次数表中正确找出真正的最大值和最小值。也要记得全距的单位与原始数据相同,最终答案中不可遗漏或改变单位。