劉自平
臺北市立大學社會暨公共事務學系 助理教授
《摘要》
本文強調相關性不等於因果關係的重要性,特別是在尋找問題成因、評估政策效果和分析社會現象後果等需要因果推論的領域。研究結論指出,要獲得不具有偏誤的因果關係及其效果,研究者要有嚴謹的研究設計,包含對變數、資料收集方法、分析途徑與相關假設的通盤考量和規劃,因為缺乏嚴謹設計將無法確保分析結果的內部效度。
關鍵字:因果推論、潛在結果、選擇偏誤、迴歸模型、實驗設計
壹、前言
在近年來資料科學取得了顯著的進步,無論是硬體上包含中央處理器(CPU)和圖形處理器(GPU)等,或者是如演算法、深度學習(deep learning)與類神經網絡(neural network)等資訊科學技術,再加上人工智慧(artificial intelligence, AI)的蓬勃發展—此些發展提供我們更為快速、精確的資料分析結果。然而,僅就觀察性資料進行分析,無論資料內容的大小多寡,事實上往往無法確定分析結果中的「因果關係」(causality)(Titiunik, 2015)。舉例而言,在不控制學習動機此一干擾變數(confounding variable)下1,若我們針對高中學生直接進行調查往往可以發現有課後補習的同學往往成績也較高。然而,這樣的分析方法會造成兩種可能的錯誤結果。
首先,在忽略學習動機對於成績的想下,即便補習對於成績具有正向的影響,其影響力事實上亦有可能被高估。除此之外,在上述學習動機的例子中,由於進行調查之時無法確保受訪同學們補習的事實發生在成績提高之前(邏輯上來說,因的變化需早於果的變化),其分析結果事實上並無法排除「具有較高學習動機的同學往往成績較高,同時亦有較高的可能接受課後補習」此一與上述因果關係(補習有助於成績)相反的因果關係。是故,若在分析時直接僅將該調查中同學是否有補習與該同學在校學習成績納入迴歸模型中,反而會造成違反統計迴歸假設—也就是「內生性」(edogeniety)(Hiyashi, 2011)—此一問題的發生,進而使分析的因果關係具有偏誤(bias)(Angrist & Pischke, 2009)。
可想而知的是,因果分析是循證治理中不可或缺的一環。舉凡政策效果的評估(例如某政策實施後與實施前是否具有顯著地不同),亦或者社會議題的來源及其影響(例如造成少子化的原因以及其可能造成的後續現象),皆需要透過因果推論(causal inference)的方法和研究設計來估計自變數(因)是否影響依變數(果),以及該兩者之間的關係大小為何。也因如此,與因果推論相關的設計與分析方法等,實為循證治理中不可或缺的一環。
貳、潛在結果(Potential Outcome)、因果關係與選擇偏誤(Selection Bias)
從實驗的角度來看,所謂的因果關係,即是分析實驗組(資料中自變數等於1)和對照組(資料中自變數等於0)兩者之間的自變數平均值是否具有差異?
也因如此,在分析中若無控制干擾變數時,當自變數與依變數本身具有相關性時,該關係往往會被高估;而當自變數與依變數兩者間無任何關聯時,則可能產生虛假相關(spurious correlation)的結論(Kronmal, 1993)。
若有,則兩者間的平均差異為何?簡言之,透過資料分析並回答上述兩項問題後,即可得知自變數是否對依變數具有影響(兩者間是否存在因果關係),以及自變數對依變數的影響有多少(因果關係的大小為何)。值得注意的是,實務上在分析因果關係時是藉由魯本因果模型(Rubin Causal Model)中的潛在結果途徑來推論和分析(Ho et. al, 2007; Holland, 1986; Little & Rubin, 2000)。假設僅有兩個不同組別的情況下,變數Di=1時表示受測者是位於實驗組(treatment group),而當Di=0時指示受測者是位於控制組(control group)。潛在結果途徑假設每一位實驗參與者在實驗組和對照組時,分別會有兩個不同的結果,即若該測驗者為實驗組的一員,則我們可以測量到其依變數(Ydi)的結果為何(通常記為Y1i 或 Yi(1));反之當該員分配至對照組時,我們可以觀察到其依變數的另外一個結果(通常記為Y0i或Yi(0))。
承上述途徑,假設要分析某一降血壓藥對於某一受測者收縮壓的影響,即分析該受測者在有服用該藥物(實驗組,Di=1)時與沒有服用該藥物(對照組,Di=0)時,其兩者間收縮壓(Yi)的差異,即Yi(1)-Yi(0)。簡言之,若該藥物對於某受測者i之收縮壓所產生的影響τi,可透過τi=Yi(1)-Yi(0)來估計出該新藥對於該受測者的因果效果數值為何(又稱為固定效果,fixed effect)。雖然從研究設計的角度來看,當我們比較受測者本人在兩種不同狀態下的結果,由於可排除所有外部因素的干擾情況,是估計因果效果最沒有偏誤的方法;然而,從邏輯上來看,因為每個人不可能同時在實驗組中並且同時在對照組中(同時有服用藥物且同時沒有服用該藥物),每一個人僅可能會有其中一種潛在結果,所以上述之估計方法實際上不可能執行。此矛盾又稱為「因果推論的基本問題(the fundamental problem of causal inference)」(Holland, 1986)。也因如此,在現實中我們往往比較相似的兩群人並估計平均因果效果(average treatment effect, ATE)(Ho et. al, 2007; Morgan & Winship, 2015)。
然而值得注意的是,由於現實中針對每一個受測者,我們僅能觀察到每一個受測者的依變數(Yi),且每一個觀察到的依變數僅是上述兩個潛在結果其中的一種,也就是Yi=Y0i+(Y1i–Yoi)Di;因此當隨機分配並非受測者們加入實驗組或對照組的原因(即非隨機實驗設計的觀察資料),我們比較實驗組和對照組受測者間的平均依變數差距(E[Y1i|Di=1]-E[Y0i|Di=0]),得到的結果並非實際上的平均因果效果,因該結果往往會無可避免地帶有選擇偏誤的問題(參見Angrist & Pischke, 2009, 頁14)。以上述的學習動機、在校成績和補習與否三者間的關係為例,由於在校成績高的同學(因為具有較高的學習動機)往往有比較高的機率參加課後補習,這表示受訪的同學是否有補習(Di)和其在校成績(Yi)具有一定的相關性而非相互獨立,進而使迴歸模型分析結果具有內生性並帶有選擇偏誤。也因如此,假設受訪者參加實驗組或對照組是僅僅單純由隨機實驗中的機率所分配時,由於Di和Yi相互獨立(受測者參加哪一組跟任何因素都無關,僅是機率非配的結果),上述E[Y1i|Di=1] 或 E[Y0i|Di=0]兩條件期望值(conditional expectation)的「條件」已不復在,即E[Y0i]=E[Y0i|Di=0]=E[Y0i|Di=1](Angrist & Pischke, 2009)。換句話說,若能就研究主題進行隨機實驗,則僅僅比較實驗組和對照組受測者間的平均依變數是可以獲得相對不具有偏誤的分析結果(例如可進行T檢定(T-test))。
參、迴歸模型和控制變數(Control Variables)
然而事實上許多研究主題若進行實驗設計必定會產生研究倫理的問題2,甚至絕大部分的主題可能也無從進行實驗起3。除此之外,上述並不表示嚴謹的因果效果分析僅能透過隨機實驗設計,事實上當特定的假設以及條件滿足下,以迴歸模型分析觀察性資料亦能分析出不具有偏誤的因果關係(Eggers & Hainmueller, 2009; Ho, et. al, 2007; Morgan & Harding, 2006)。總的來說,由於每個人都無法跟自己比較(即因果推論的基本問題),因果推論相關的研究設計主要在尋找/估計為大家所接受的「可比較」(comparable)對象,此可比較對象又稱為「反事實」(counterfactual)(Morgan & Winship, 2015)。就一般常見的迴歸模型而言,當觀察性資料中自變數(Di)變化於依變數(Yi)變化之前的假設可被接受時,若能夠正確地控制所有影響Di變化與否的其他變數(Xi),則一般多變量迴歸的分析結果,是能夠一定程度估計出不具有偏誤的因果關係效果(Angrist & Pischke, 2009)。
其中所謂「所有影響Di變化與否的Xi」,指的是若迴歸模型估計出的因果效果要不具有偏誤,則其必須要能夠控制「會影響受測者被分配到實驗組或對照組機率」的變數。其原因在於,不同於隨機實驗設計下,研究者已經知道受測者被分配到實驗組或對照組的機率(P(Di=1) )已知,可以簡單估計出無偏的E[Y0i]和E[Y1i];相較之下,在觀察性資料中每個受測者被分配到實驗組或對照組的機率會受到受測者某些個人特徵的影響,是故必須在考慮此些不同的個人特徵後,再針對其相對應的分配機率方能估計出不具偏誤的E[Y0i] 和 EY1i]。繼續以上述學習動機、在校成績和補習與否三者間的關係為例,由於不同同學間的學習動機高低不同,使得其在校成績的高低和補習與否的機率亦有所不同,進而造成內生性的問題(即無法釐清在校成績和補習與否互為因果的關係)。若我們將測量同學學習動機程度的變數控制於分析中(例如平均每天讀書的時間),由於平均每天讀書時間相近的同學具有類似的學習動機,此些同學具有相似的補習機率以及相似的在校成績分佈,故有補習和沒有補習的同學彼此之間是可以相互比較的,且迴歸模型中的內生性問題將不復在,可降低或消除其所估計因果效果中的偏誤。
肆、其他因果推論相關研究設計
除了常見的迴歸模型以外,截至目前為止已經發展出各種不同的因果推論研究設計與相關的分析方法。首先第一個是較容易為熟悉迴歸模型使用者了解的「配對法」(matching)(例如:Eggers & Hainmueller, 2009; Gordon & Huber, 2007; Ho et. al, 2007; Lyall, 2010)。與上述控制變數類似,首先釐清出哪些變數(Xi)會影響樣本分配至實驗組或對照組的機率,再比較實驗組與對照組中的具有相同Xi的受測者彼此間依變數(Yi)的差距,最後將所有實驗組和對照組之間的配對差距加以平均即為估計出來的平均因果效果。簡言之,配對法和控制變數使用相同的邏輯/條件來尋找反事實,兩者間主要不同之處在於估計平均因果效果時就Xi採用不同的加權方法(Angrist & Pischke, 2009)。
另一個常見的因果推論設計是斷點迴歸設計(regression discontinuity design, RDD)(例如:Cattaneo, 2016; Caughey & Sekhon, 2011; Díaz & Zubizarreta, 2023; Eggers et. al, 2015)。假設要分析低收入補助對低收家庭孩子教育的影響,若直接比較有領補助和沒有領補助家庭則必定會產生內生性的問題,斷點迴歸設計認為家庭收入剛剛好超過(對照組:沒有領到補助)與剛剛好低於(實驗組:有領到補助)政府低收入補助標準的家庭,理論上其各方面特徵都應該非常相似,故兩者間應該是可以相互比較的反事實。當然,該如何定義「收入剛剛好超過」和「收入剛剛好低於」的標準,則是需要透過嚴謹的資料分析和演算法來進一步決定(Skovron & Titiunik, 2015)。
除此之外,常見針對橫斷面資料(cross-sectional data)的因果推論設計還有工具變數(instrumental variable)等方法(例如:Clingingsmith et. al, 2009; Iyer, 2010)。當然,亦有針對與時間序列變數資料有關的因果推論設計:針對定群追蹤資料(panel data),常見的設計有雙重分差法(difference-in-difference, DiD)(例如:Card & Krueger, 1993; Knutsen et. al, 2017; Malesky et. al, 2014);針對時間序列資料則有合成控制法(synthetic control method)(例如:Abadie et. al, 2010; Abadie et. al, 2015)。
伍、結論
本文主要目的並非強調因果推論為資料分析的唯一途徑。如上所述,事實上很大部分的研究問題並無法應用實驗法或者其他因果推論設計加以分析,是故大多時候我們僅能透過相關性等資訊輔助我們進行決策。然而,本文所強調的重點在於「相關性不等於因果關係」,特別是當資料分析的主要目的在於尋找造成問題的成因、政策效果評估、社會現象所形成的後果等等,對於此概念和觀點一定要具有一定的認知。
在此必須要強調的是,若要估計出不具有偏誤的因果關係及其因果效果為何,研究者首先必須要有嚴謹的研究設計,即針對變數類型、資料收集方法、資料所具有的變數,以及可能的分析途徑與其相關假設等,都能有通盤的考量和規劃。如上所述,若沒有嚴謹的研究設計,無論收集再多的資料或者是使用更先進的統計分析模型,絕大部分的分析結果依舊無法確保分析結果的內部效度。
最後,本文鼓勵除了傳統以問卷方式或者近期以網路文本作為收集資料的方式以外,循證治理亦應考慮以實驗研究設計作為收集資料的可能方法,特別是要分析因果關係及其影響的時候。此類研究設計目前於學界已經相當普遍,除了傳統單變項實驗設計以外,目前亦依據實際狀況和外部環境考量等發展出新型態的實驗方法,例如聯合分析實驗(conjoint analysis experiment)(例如:Gutiérrez-Romero & LeBas , 2020; Hainmueller & Hopkins, 2015; Liu, 2022)或列項實驗(list experiment)(例如:Imai et. al, 2015; Kramon & Weghorst, 2019)等,目前皆相當普遍地被應用於各種研究中。總的而言,實驗設計其優勢在於,其所收集到的資料往往不需要太複雜的模型和過多的假設,即可分析出不具有偏誤的因果關係,可減低後期資料分析的負擔。
參考文獻
Abadie, A., Diamond, A., & Hainmueller, J. (2010). Synthetic control methods for comparative case studies: Estimating the effect of California’s tobacco control program. Journal of the American statistical Association, 105(490), 493-505.
Abadie, A., Diamond, A., & Hainmueller, J. (2015). Comparative politics and the synthetic control method. American Journal of Political Science, 59(2), 495-510.
Angrist, J. D., & Pischke, J. S. (2009). Mostly harmless econometrics: An empiricist’s companion. Princeton University Press.
Cattaneo, M. D., Titiunik, R., Vazquez-Bare, G., & Keele, L. (2016). Interpreting regression discontinuity designs with multiple cutoffs. The Journal of Politics, 78(4), 1229-1248.
Caughey, D., & Sekhon, J. S. (2011). Elections and the regression discontinuity design: Lessons from close US House races, 1942–2008. Political Analysis, 19(4), 385-408.
Card, D., & Krueger, A. B. (1993). Minimum wages and employment: A case study of the fast food industry in New Jersey and Pennsylvania. American Economic Review, 84(4), 772-793.
Clingingsmith, D., Khwaja, A. I., & Kremer, M. (2009). Estimating the impact of the Hajj: religion and tolerance in Islam’s global gathering. The Quarterly Journal of Economics, 124(3), 1133-1170.
Díaz, J. D., & Zubizarreta, J. R. (2023). Complex discontinuity designs using covariates: Impact of school grade retention on later life outcomes in Chile. The Annals of Applied Statistics, 17(1), 67-88.
Eggers, A. C., Fowler, A., Hainmueller, J., Hall, A. B., & Snyder Jr, J. M. (2015). On the validity of the regression discontinuity design for estimating electoral effects: New evidence from over 40,000 close races. American Journal of Political Science, 59(1), 259-274.
Eggers, A. C., & Hainmueller, J. (2009). MPs for sale? Returns to office in postwar British politics. American Political Science Review, 103(4), 513-533.
Gordon, S. C., & Huber, G. (2007). The effect of electoral competitiveness on incumbent behavior. Quarterly Journal of Political Science, 2(2), 107-138.
Gutiérrez-Romero, R., & LeBas, A. (2020). Does electoral violence affect vote choice and willingness to vote? Conjoint analysis of a vignette experiment. Journal of peace research, 57(1), 77-92.
Hainmueller, J., & Hopkins, D. J. (2015). The hidden American immigration consensus: A conjoint analysis of attitudes toward immigrants. American journal of political science, 59(3), 529-548.
Hayashi, F. (2011). Econometrics. Princeton University Press.
Ho, D. E., Imai, K., King, G., & Stuart, E. A. (2007). Matching as nonparametric preprocessing for reducing model dependence in parametric causal inference. Political Analysis, 15(3), 199-236.
Holland, P. W. (1986). Statistics and causal inference. Journal of the American Statistical Association, 81(396), 945-960.
Imai, K., Park, B., & Greene, K. F. (2015). Using the predicted responses from list experiments as explanatory variables in regression models. Political Analysis, 23(2), 180-196.
Iyer, L. (2010). Direct versus indirect colonial rule in India: Long-term consequences. The Review of Economics and Statistics, 92(4), 693-71.
Knutsen, C. H., Kotsadam, A., Olsen, E. H., & Wig, T. (2017). Mining and local corruption in Africa. American Journal of Political Science, 61(2), 320-334.
Kramon, E., & Weghorst, K. (2019). (Mis) measuring sensitive attitudes with the list experiment: Solutions to list experiment breakdown in Kenya. Public Opinion Quarterly, 83(S1), 236-263.
Kronmal, R. A. (1993). Spurious correlation and the fallacy of the ratio standard revisited. Journal of the Royal Statistical Society Series A: Statistics in Society, 156(3), 379-392.
Little, R. J., & Rubin, D. B. (2000). Causal effects in clinical and epidemiological studies via potential outcomes: concepts and analytical approaches. Annual Review of Public Health, 21(1), 121-145.
Liu, T. P. (2022). Consider your companions carefully: How voters perceive (coalition) governments’ poor valence images. Party Politics, 28(6), 1150-1163.
Lyall, J. (2010). Are coethnics more effective counterinsurgents? Evidence from the second Chechen war. American Political Science Review, 104(1), 1-20.
Malesky, E. J., Nguyen, C. V., & Tran, A. (2014). The impact of recentralization on public services: A difference-in-differences analysis of the abolition of elected councils in Vietnam. American Political Science Review, 108(1), 144-168.
Morgan, S. L., & Harding, D. J. (2006). Matching estimators of causal effects: Prospects and pitfalls in theory and practice. Sociological Methods & Research, 35(1), 3-60.
Morgan, S. L., & Winship, C. (2015). Counterfactuals and causal inference. Cambridge University Press.
Skovron, C., & Titiunik, R. (2015). A practical guide to regression discontinuity designs in political science. American Journal of Political Science, 2015, 1-36.Titiunik, R. (2015). Can big data solve the fundamental problem of causal inference? PS: Political Science & Politics, 48(1), 75-79.
1所謂的干擾變數即是會同時分別影響分析模型中自變數與依變數的變數。
2以上述在校成績和補習與否為例,讓不想補習的同學去補習或者不讓想補習的同學補習,皆必定會引起道德倫理的爭議。
3以分析一國民主發展對經濟發展的影響此一國際政治經濟問題為例,該如何分配哪些國家採用民主制度、哪些國家採取獨裁政府?無論如何,實務上皆不可能執行。
