1973 年,英國統計學家 Francis Anscombe 在 *The American Statistician* 期刊上發表了一篇只有四頁的論文,標題叫 "Graphs in Statistical Analysis"。他做了一件很簡單但很刺眼的事。他造了四組數據,每組的:平均數相同(全部是 9.0)、變異數相同、相關係數相同(0.816)、迴歸線相同(y = 3 + 0.5x)。
看數字的話,這四組「一模一樣」。
但他把它們畫成圖——四組完全不同。第一組是正常的線性分布。第二組是优美的曲線,線性迴歸明顯配適不良。第三組有一個極端值完全扭曲了整條線。第四組幾乎是垂直的——所有點都擠在一起,只有一個離群值決定了迴歸線。
Anscombe 的意思是:**只看摘要統計量(平均、標準差),你會以為四組數據講同一個故事。但圖形告訴你,它們講了四個完全不同的故事。**
這篇論文後來成為統計學教育的經典教材,改變了無數分析師看數據的方式。Tukey 在 1977 年出版的 *Exploratory Data Analysis* 把這個理念推到了極致——先畫圖,再看數字。
你的 4.5 分就是 Anscombe 的平均數。它把五個維度的故事壓成一個數字。不看維度分布,你不知道自己的 3.2 在哪裡。
看數字的話,這四組「一模一樣」。
但他把它們畫成圖——四組完全不同。第一組是正常的線性分布。第二組是优美的曲線,線性迴歸明顯配適不良。第三組有一個極端值完全扭曲了整條線。第四組幾乎是垂直的——所有點都擠在一起,只有一個離群值決定了迴歸線。
Anscombe 的意思是:**只看摘要統計量(平均、標準差),你會以為四組數據講同一個故事。但圖形告訴你,它們講了四個完全不同的故事。**
這篇論文後來成為統計學教育的經典教材,改變了無數分析師看數據的方式。Tukey 在 1977 年出版的 *Exploratory Data Analysis* 把這個理念推到了極致——先畫圖,再看數字。
你的 4.5 分就是 Anscombe 的平均數。它把五個維度的故事壓成一個數字。不看維度分布,你不知道自己的 3.2 在哪裡。
應用案例