來(lái)源:qz、nature等
編輯:大明、小芹
【新智元導(dǎo)讀】統(tǒng)計(jì)顯著性和p值是衡量研究可靠性的重要標(biāo)準(zhǔn)。這個(gè)標(biāo)準(zhǔn)是怎么來(lái)的?今年3月Nature上一篇主張廢除p值的文章,為何獲得800位科學(xué)家聯(lián)名支持?如果沒(méi)有p值門(mén)檻,研究質(zhì)量會(huì)出現(xiàn)大滑坡嗎?戳右邊鏈接上新智元小程序 了解更多!
每年,全球有數(shù)百萬(wàn)學(xué)生修讀統(tǒng)計(jì)學(xué)課程。隨著世界上的數(shù)據(jù)量越來(lái)越大,統(tǒng)計(jì)學(xué)已成為越來(lái)越受歡迎的話題。如果大多數(shù)學(xué)生都從這門(mén)課中記住一點(diǎn),那可能就是 “統(tǒng)計(jì)顯著性”和“p值”的概念。
這兩個(gè)概念通常用于量化研究結(jié)果是否是偶然發(fā)生的問(wèn)題。例如,某公司想要衡量?jī)蓚€(gè)不同廣告投放到Facebook上的影響。他們發(fā)現(xiàn),一個(gè)廣告吸引了10%的用戶點(diǎn)擊,而另一個(gè)廣告吸引了8%。為了弄清楚這種差異是確有意義,還是偶然發(fā)生,就可能會(huì)進(jìn)行統(tǒng)計(jì)學(xué)測(cè)試,看看結(jié)果是否“顯著”。如果發(fā)現(xiàn)這種產(chǎn)生這種差異的可能性為5%或更低,則判定為偶然,否則認(rèn)為這個(gè)差異確有意義。 通常,很多商業(yè)和醫(yī)學(xué)上的決策都是基于這個(gè)“5%原則”制定的。
“統(tǒng)計(jì)顯著”和p值的起源:從“建議”到“金標(biāo)準(zhǔn)”
“顯著”一詞最早見(jiàn)于19世紀(jì)80年代,英國(guó)經(jīng)濟(jì)學(xué)家和統(tǒng)計(jì)學(xué)家弗朗西斯·埃奇沃思(Francis Edgeworth)在統(tǒng)計(jì)檢驗(yàn)中首次使用該詞。據(jù)統(tǒng)計(jì)學(xué)家格倫·謝弗(Glenn Shafer)稱(chēng),當(dāng)時(shí)使用這個(gè)詞的方式與今天不同。Edgeworth討論了這個(gè)詞有多大幾率“標(biāo)志”了有意義的差異。當(dāng)時(shí)Edgeworth將一項(xiàng)發(fā)現(xiàn)稱(chēng)為“可能顯著的”或“一定顯著的”。
羅納德·菲舍爾(Ronald Fisher)
1925 年,英國(guó)遺傳學(xué)家、統(tǒng)計(jì)學(xué)家羅納德·菲舍爾(Ronald Fisher)出版《研究者的統(tǒng)計(jì)方法》(Statistical Methods for Research Workers)一書(shū)。這本書(shū)奠定了他現(xiàn)代統(tǒng)計(jì)學(xué)之父的地位。他在書(shū)中著重講到研究人員應(yīng)如何將統(tǒng)計(jì)檢驗(yàn)理論應(yīng)用于實(shí)際數(shù)據(jù),以便基于數(shù)據(jù)得出他們所發(fā)現(xiàn)的結(jié)論。當(dāng)使用某個(gè)統(tǒng)計(jì)假設(shè)來(lái)做檢驗(yàn)時(shí),該檢驗(yàn)?zāi)軌蚋攀鰯?shù)據(jù)與其假設(shè)的模型之間的兼容性,并生成一個(gè) p值。
菲舍爾建議,為方便起見(jiàn),可以考慮將p值設(shè)為0.05。對(duì)于這一點(diǎn),他專(zhuān)門(mén)論述道:“在判斷某個(gè)偏差是否應(yīng)該被認(rèn)為是顯著的時(shí)候,將這一閾值作為判斷標(biāo)準(zhǔn)是很方便的。”他還建議,p值低于該閾值的結(jié)論是可靠的,因此不要把時(shí)間花在大于該閾值的統(tǒng)計(jì)結(jié)論上。菲舍爾的這一建議被越來(lái)越多的人所接受, p<0.05逐漸與“統(tǒng)計(jì)顯著性”畫(huà)上了等號(hào),成為“顯著”的數(shù)學(xué)定義。
到20世紀(jì)中葉,研究人員開(kāi)始稱(chēng)某項(xiàng)結(jié)果“高度顯著”或“幾乎不顯著”。“顯著”一詞變得更像是建議,而不是判斷。后來(lái),統(tǒng)計(jì)顯著性和p值由于標(biāo)準(zhǔn)明確、計(jì)算方便逐漸成為衡量科學(xué)研究可靠性的重要標(biāo)準(zhǔn)。
Nature發(fā)文:是時(shí)候放棄“統(tǒng)計(jì)顯著性”了!獲800人簽名支持
今年3月,學(xué)者Valentin Amrhein,Sander Greenland和Blake McShane提出,如果沒(méi)有這個(gè)概念可能會(huì)更好。他們希望“統(tǒng)計(jì)學(xué)顯著”這個(gè)概念應(yīng)該退出歷史舞臺(tái),他們的觀點(diǎn)得到很多人的支持。他們?cè)凇蹲匀弧菲诳献模髮ⅰ敖y(tǒng)計(jì)顯著”這個(gè)詞從統(tǒng)計(jì)學(xué)中去掉,此文獲得800多位學(xué)者的簽名支持,其中不乏量化和統(tǒng)計(jì)學(xué)領(lǐng)域的重要人物。
他們的這篇文章名為《科學(xué)家們起來(lái)反對(duì)統(tǒng)計(jì)學(xué)意義》(Scientists rise up against statistical significance )。
標(biāo)題猶如戰(zhàn)斗檄文一樣令人振奮。在文章發(fā)出不到24小時(shí),就有250多人簽名支持,一周之內(nèi)吸引了超過(guò)800名研究人員共同反對(duì)。
大學(xué)里好不容易聽(tīng)懂的統(tǒng)計(jì)學(xué),會(huì)變成一件沒(méi)“意義”的事情嗎?
為什么要放棄統(tǒng)計(jì)學(xué)顯著性的概念?
幾代人以來(lái),研究人員一直被警告說(shuō):統(tǒng)計(jì)上不顯著的結(jié)果并不能“證明”零假設(shè)(即假設(shè)各組之間沒(méi)有差異,或者某個(gè)處理方法對(duì)某些測(cè)量結(jié)果沒(méi)有影響)。統(tǒng)計(jì)上顯著的結(jié)果也不能“證明”其他一些假設(shè)。這種誤解用夸大的觀點(diǎn)扭曲了文獻(xiàn),而且導(dǎo)致了一些研究之間的沖突。
三位統(tǒng)計(jì)學(xué)家提出一些建議,讓科學(xué)家們不至于成為這些誤解的犧牲品。
首先明確必須停止的事:永遠(yuǎn)不應(yīng)該僅僅因?yàn)镻值大于閾值(如0.05)就得出“沒(méi)有差異”或“沒(méi)有關(guān)聯(lián)”的結(jié)論;或者,僅僅因?yàn)橹眯艆^(qū)間包含0就得出這樣的結(jié)論。
同時(shí),我們也不應(yīng)該斷定兩項(xiàng)研究之間存在沖突,只因?yàn)槠渲幸豁?xiàng)研究的結(jié)果具有統(tǒng)計(jì)學(xué)意義,而另一項(xiàng)則沒(méi)有。這些錯(cuò)誤浪費(fèi)了研究工作,誤導(dǎo)了政策決策。
當(dāng)區(qū)間估計(jì)包含嚴(yán)重的風(fēng)險(xiǎn)增加時(shí),得出結(jié)論認(rèn)為統(tǒng)計(jì)上不顯著的結(jié)果顯示“無(wú)關(guān)聯(lián)”是荒謬的;同樣荒謬的是,聲稱(chēng)這些結(jié)果與先前研究中顯示相同觀察效果的結(jié)果相反。然而,這些常見(jiàn)的實(shí)踐表明,依賴(lài)統(tǒng)計(jì)意義上的閾值會(huì)誤導(dǎo)我們。
謹(jǐn)防錯(cuò)誤結(jié)論
這些錯(cuò)誤以及類(lèi)似的錯(cuò)誤普遍存在。對(duì)數(shù)百篇文章的調(diào)查發(fā)現(xiàn),統(tǒng)計(jì)上不顯著的結(jié)果被解釋為“沒(méi)有差異”或“沒(méi)有影響”的約有一半。
Amrhein,Greenland和McShane認(rèn)為,基于規(guī)則的思維是“統(tǒng)計(jì)顯著性”的最大問(wèn)題。他們認(rèn)為:“ 麻煩是人為的和認(rèn)知層面的,而不是統(tǒng)計(jì)學(xué)上的:將結(jié)果分類(lèi)為'統(tǒng)計(jì)顯著'和'統(tǒng)計(jì)不顯著',使人們認(rèn)為以這種方式劃分的對(duì)象屬于不同類(lèi)別。”
這種對(duì)“統(tǒng)計(jì)顯著性”的二元化標(biāo)準(zhǔn)的嚴(yán)重依賴(lài),可能導(dǎo)致對(duì)醫(yī)學(xué)和社會(huì)科學(xué)新發(fā)現(xiàn)的真實(shí)性信心不足甚至喪失。
造成這個(gè)問(wèn)題的重要原因是,統(tǒng)計(jì)顯著性的重要性被過(guò)分夸大。2015年,可重復(fù)性危機(jī)項(xiàng)目(現(xiàn)為開(kāi)放科學(xué)中心)開(kāi)展了一項(xiàng)實(shí)驗(yàn),對(duì)100篇重要的社會(huì)心理學(xué)論文進(jìn)行了重復(fù)性檢驗(yàn), 結(jié)果發(fā)現(xiàn)只有36.1%的論文的結(jié)論可以被重復(fù)出來(lái)。2018年,社會(huì)科學(xué)可重復(fù)性項(xiàng)目評(píng)估了《自然》與《科學(xué)》在2010年至2015年間發(fā)表的21項(xiàng)社會(huì)科學(xué)實(shí)驗(yàn)研究的可重復(fù)性。他們發(fā)現(xiàn),與原研究相比,其中只有13項(xiàng)研究中(約占總研究的62%)的重復(fù)實(shí)驗(yàn)產(chǎn)生了顯著結(jié)果。
研究人員不應(yīng)考慮結(jié)果是否“統(tǒng)計(jì)顯著性”,而是應(yīng)該對(duì)結(jié)果進(jìn)行成本效益分析,因?yàn)槲⒉蛔愕赖慕Y(jié)果可能仍然有用。比如實(shí)驗(yàn)性抗癌藥物與安慰劑之間的差異為陽(yáng)性,但達(dá)不到統(tǒng)計(jì)學(xué)顯著的標(biāo)準(zhǔn),這時(shí)將該藥物提供給某些患者仍然是值得的,尤其是藥效獲得強(qiáng)理論支持的情況下。也就是說(shuō), 應(yīng)該根據(jù)結(jié)果有用的可能性來(lái)討論結(jié)果,而不是看是否滿足一些統(tǒng)計(jì)閾值。
反對(duì)意見(jiàn):放棄p值,“無(wú)可辯駁的廢話”將充斥期刊
不過(guò),并非所有人都認(rèn)為應(yīng)該取消“統(tǒng)計(jì)顯著性”的概念和p值。統(tǒng)計(jì)學(xué)家、斯坦福大學(xué)教授約翰·約阿尼迪斯(John Ioannidis)就是其中之一。他曾對(duì)Nature這篇文章表達(dá)了明確的質(zhì)疑,并撰文總結(jié)了與該文作者Sander Greenland和Blake McShane的商榷內(nèi)容。他認(rèn)為,設(shè)立一定的門(mén)檻是有必要的,如果沒(méi)有“統(tǒng)計(jì)顯著性”作為界限,那么幾乎任何結(jié)果都可能會(huì)發(fā)表,“無(wú)可辯駁的廢話”將會(huì)占據(jù)統(tǒng)治地位。”
“放棄統(tǒng)計(jì)學(xué)意義”真的是個(gè)好主意嗎?John Ioannidis列舉了他對(duì)Nature那篇引發(fā)大討論的文章的不同意見(jiàn):
1. Natue文章的陳述(以下簡(jiǎn)稱(chēng)“陳述”):統(tǒng)計(jì)上顯著的結(jié)果也不能“證明”其他一些假設(shè)。這種誤解用夸大的觀點(diǎn)歪曲了文獻(xiàn),而且導(dǎo)致了一些研究之間的沖突。
該陳述的誤導(dǎo)性在于:完全刪除“統(tǒng)計(jì)學(xué)意義”將使任何人都可以對(duì)任何結(jié)果作出任何夸大的說(shuō)明。如果刪除了統(tǒng)計(jì)學(xué)意義,也可能有助于在研究之間確實(shí)存在沖突時(shí)聲稱(chēng)不存在沖突。
2. 陳述:讓我們明確什么是必須停止的事情:我們不應(yīng)該僅僅因?yàn)镻值大于閾值(如0.05)就得出“沒(méi)有差異”或“沒(méi)有關(guān)聯(lián)”的結(jié)論;或者,僅僅因?yàn)橹眯艆^(qū)間包含0就得出這樣的結(jié)論。
該陳述的誤導(dǎo)性在于:在大多數(shù)科學(xué)領(lǐng)域,我們需要得出結(jié)論,然后傳達(dá)我們對(duì)結(jié)論的不確定性。對(duì)于如何得出結(jié)論,明確的、預(yù)先規(guī)定的規(guī)則是必要的。否則,任何人都可以一句自己的奇想得出任何結(jié)論。在許多情況下,使用足夠嚴(yán)格的p值閾值(例如,對(duì)于許多學(xué)科而言為p = 0.005)是非常有意義的。我們需要做出一些謹(jǐn)慎的選擇,然后繼續(xù)前進(jìn)。嚴(yán)格地說(shuō),說(shuō)任何和所有的聯(lián)系都不能被100%排除是正確的,但實(shí)際上這是無(wú)稽之談。如果廢除了p值,科學(xué)將陷入癱瘓,因?yàn)槲覀儾荒芘懦锌赡軐?dǎo)致任何事情的可能性。
3. 陳述:有XX%的論文將統(tǒng)計(jì)上不顯著的結(jié)果解釋為“沒(méi)有差異”
該陳述的誤導(dǎo)性在于:在許多/大多數(shù)/所有的情況下,這可能都是完全恰當(dāng)?shù)模覀儽仨氉屑?xì)檢查每個(gè)case。剩下的100-XX%中的一些/許多沒(méi)有被解釋為“沒(méi)有差異”,這可能至少是不恰當(dāng)?shù)摹?/p>
4. 陳述:編輯們?cè)诮榻B這期特刊的時(shí)候謹(jǐn)慎地說(shuō),“不要說(shuō)’統(tǒng)計(jì)意義重大’”。另一篇數(shù)十人署名的文章呼吁作者和期刊編輯否認(rèn)這些言論。我們同意并呼吁放棄統(tǒng)計(jì)意義的整個(gè)概念。我們并不是要放棄p值,而是呼吁停止以傳統(tǒng)的二分法使用P值——來(lái)決定結(jié)果是反駁還是支持一項(xiàng)科學(xué)假設(shè)。
誤導(dǎo)性在于:我認(rèn)為在討論關(guān)于科學(xué)方法的議題時(shí)呼吁“簽名”是不恰當(dāng)?shù)摹N覀兇_實(shí)需要在大多數(shù)情況下非黑則白地得出結(jié)論:這種基因變異是否會(huì)導(dǎo)致抑郁?我應(yīng)該花10億美元來(lái)開(kāi)發(fā)基于這一途徑的治療方法嗎?這種治療是否有效?污染物是否會(huì)致癌?
5. 陳述:例如,得到P = 0.03和P = 0.06之間的差異與一次均勻拋硬幣得到正面和反面之間的差異相同。
誤導(dǎo)性在于:這個(gè)例子事實(shí)上是錯(cuò)誤的;只有在我們確定其影響確實(shí)是非空的情況下才成立。
6. 陳述:一種實(shí)用的方法是將置信區(qū)間重新命名為“兼容區(qū)間”(compatibility intervals)……
誤導(dǎo)性在于:在當(dāng)前的混亂局面下,還要添加一個(gè)新的、特殊的術(shù)語(yǔ)嗎?“兼容”甚至是一個(gè)糟糕的選擇,可能比“置信”更糟糕。由于存在偏差,結(jié)果可能是完全錯(cuò)誤的。如果存在偏差,X% CI(無(wú)論C代表什么)可能在很多情況下甚至都不包含真值。
7. 陳述:我們建議作者描述區(qū)間內(nèi)所有值的實(shí)際含義,特別是觀察到的效果和極限。
誤導(dǎo)性在于:我認(rèn)為,更重要的是考慮可能存在哪些偏差,哪個(gè)偏差可能導(dǎo)致整個(gè)區(qū)間偏離,并因此與事實(shí)不符。
8. 陳述:與0.05的閾值一樣,用于計(jì)算區(qū)間的默認(rèn)95%本身也是一種任意約定。
誤導(dǎo)性在于:確實(shí)如此,但這意味著更合適的P值閾值和X%CI區(qū)間是更可取的,這些需要預(yù)先仔細(xì)確定。否則,如果都事后確定,研究者的任何先入之見(jiàn)都是可以“支持”的。
9. 陳述:諸如背景證據(jù)、研究設(shè)計(jì)、數(shù)據(jù)質(zhì)量和對(duì)潛在機(jī)制的理解等因素往往比P值或區(qū)間等統(tǒng)計(jì)度量更重要。
誤導(dǎo)性在于:雖然聽(tīng)起來(lái)很合理,所有這些因素都很重要,但大多數(shù)因素通常都是主觀的。相反,統(tǒng)計(jì)分析至少具有一定的客觀性。如果在收集數(shù)據(jù)和運(yùn)行分析之前仔細(xì)設(shè)置規(guī)則,那么基于某些閾值(p值、Bayes因子、FDR或其他)的統(tǒng)計(jì)指導(dǎo)可能是有用的。否則,統(tǒng)計(jì)推斷也變成了完全是事后的、主觀的。
10.陳述:我們聽(tīng)到的反對(duì)放棄統(tǒng)計(jì)學(xué)意義的意見(jiàn)最多的是,科學(xué)研究需要做出是或否的決定。但是,對(duì)于監(jiān)管、政策和業(yè)務(wù)環(huán)境中經(jīng)常需要做的選擇,基于成本、收益和所有潛在后果的可能性來(lái)做決策總是勝過(guò)僅基于統(tǒng)計(jì)顯著性做的決策。此外,對(duì)于是否進(jìn)一步做某個(gè)研究的決定,p值與后續(xù)研究的可能結(jié)果之間沒(méi)有簡(jiǎn)單的聯(lián)系。
誤導(dǎo)性在于:這種說(shuō)法等同于無(wú)稽之談。確實(shí),在大多數(shù)情況下需要作出是/否的決定,這就是為什么刪除統(tǒng)計(jì)學(xué)意義無(wú)濟(jì)于事。它會(huì)導(dǎo)致“一切皆有可能”的情況。對(duì)于需要做出決定的問(wèn)題,研究設(shè)計(jì)需要提前(盡可能提前)考慮所有其他參數(shù),并設(shè)置一些預(yù)先指定的規(guī)則,確定哪些是“成功”/可操作的結(jié)果,哪些不是。這可以基于p值、貝葉斯因子、FDR或其他閾值或其他函數(shù)。但游戲需要一些規(guī)則才能公平。否則,我們將陷入比現(xiàn)在更混亂的局面,因?yàn)橹饔^解釋已經(jīng)比比皆是了。例如,任何公司都可以聲稱(chēng)其產(chǎn)品的任何試驗(yàn)結(jié)果確實(shí)支持其申請(qǐng)專(zhuān)利。
John Ioannidis教授總結(jié)道:Nature的這篇評(píng)論基于一種潛在的信念,即在統(tǒng)計(jì)學(xué)p值之外,還存在無(wú)數(shù)真實(shí)、重要的影響,而我們錯(cuò)誤地忽略了它們。但主要問(wèn)題恰恰相反: 有無(wú)數(shù)關(guān)于關(guān)聯(lián)和影響的謬論,一旦發(fā)表,就很難擺脫。三位統(tǒng)計(jì)學(xué)家呼吁放棄“統(tǒng)計(jì)學(xué)意義”,將使那些試圖通過(guò)篡改統(tǒng)計(jì)數(shù)據(jù)來(lái)作弊的人非常高興,因?yàn)楝F(xiàn)在他們根本不用擔(dān)心統(tǒng)計(jì)數(shù)據(jù)了。完全擺脫統(tǒng)計(jì)學(xué)意義和預(yù)設(shè)的、經(jīng)過(guò)仔細(xì)考慮的閾值,有可能使謬論變得無(wú)可辯駁。
總的來(lái)看,目前關(guān)于“統(tǒng)計(jì)顯著性”的根深蒂固的想法還不會(huì)很快消失。統(tǒng)計(jì)顯著性對(duì)于定量分析仍然非常重要,目前,美國(guó)統(tǒng)計(jì)協(xié)會(huì)和英國(guó)皇家統(tǒng)計(jì)協(xié)會(huì)的官方期刊都以這個(gè)詞(Significance)命名。
https://statmodeling.stat.columbia.edu/2019/03/20/retire-statistical-significance-the-discussion/


