跳去內容

統計模型

出自維基百科,自由嘅百科全書
線性迴歸模型嘅圖解;藍色點代表數據當中嘅個體,每個個體都喺 上有個值,條紅色線係個迴歸模型,用條線嚟預測 嘅值會俾到大致上啱,但唔完全準嘅預測。

統計模型粵拼tung2 gai3 mou4 jing4 )係一大類嘅數學模型,建基於統計學技術。統計模型通常包含一組假設,用嚟解釋數據點之間嘅規律,並透過參數嚟刻劃呢啲規律。例如迴歸模型可以用嚟分析一組變數點對點之間嘅關聯。統計模型喺好多領域裏便都有用,譬如機械學習經濟學心理學等領域,幫助人理解數據同作出預測。

基礎概念

[編輯]
睇埋:隨機過程預測

統計模型係一啲用嚟描述數據點樣產生出嚟嘅數學模型。呢啲模型通常會包含若干個參數,而呢啲參數可以根據實際情況作調整。舉個例子,想像依家研究擲銀仔,擲銀仔有兩個可能情況,或者,而呢個過程可以用伯努利分佈嚟表示,其概率質量函數 [1]

呢個模型模擬緊手上嘅現象,將現象用數學方式表達出嚟。呢個模型中只有一個參數 ,代表(或者)出現嘅概率。喺現實世界,絕大部分嘅模型,都只能夠做到近似產生數據嘅過程,亦未必可以包含晒所有會影響結果嘅因素。

無論係咩統計模型,都可以大致想像成以下呢啲結構:

應變數 = 自變數預測嘅大概趨勢 + 隨機上落
應變數 = 平均 + 喺平均周圍嘅變化
應變數 = 系統性質嘅變化 + 隨機性質嘅變化

呢種結構最簡單個款,就係線性嘅迴歸分析

相關概念

[編輯]
睇埋:推論統計
  • 參數英文parameter):參數係指一個能夠定義一個系統嘅數值;統計參數係指個統計模型裏面用嚟描述個總體嘅特性嘅數值,例如係某個變數喺個總體嗰度嘅平均值或者標準差呀噉。
  • 單變量分析:指個分析模型得一個變數[2]
  • 多變量分析:指個分析模型有多過一個變數[2]
  • 多變量統計:指個分析模型有多過一個應變數
  • 模型標明:指「講明個統計模型要包含邊啲變數喺入面,仲有係啲變數要成點樣嘅函數」嘅過程[3]
  • 適合度:一個統計模型有幾能夠準確噉描述手上嘅數據,一般係愈高愈好[4]
    • 適合度指標:指一啲用嚟衡量一個統計模型嘅適合度嘅指標數值;喺廿一世紀嘅統計學界有好多種適合度指標,用統計技術做研究嘅人會按照自己嘅情況選擇用乜嘢指標衡量手上嘅統計模型[5]
  • 多組分析:泛指「將受試者分做幾組,每組都由佢哋數據嗰度估個統計模型出嚟,並且比較唔同組喺個模型上有乜差異」;例如研究者認為變數 同變數 喺實驗組當中會成正比,而喺對照組當中會冇相關,於是就將數據分做兩份,每份對應其中一組受試者嘅數據,然後同兩組分別建立一個結構上相同嘅迴歸模型),睇吓呢兩組嘅 係咪有預期中嘅差異(即係喺實驗組當中係統計上顯著嘅正數,喺對照組當中統計上唔顯著);如果有,就能夠支持嗰位研究者嘅假說[6]。睇埋調節變數
  • 約束:指喺建立一個統計模型嗰陣,指定個模型一定要滿足某啲條件;例如喺做兩組嘅多組分析嗰陣,指定一個約束,要 呢兩個變數之間嗰段統計關係喺兩組之間一樣,而如果施加呢個約束會搞到個模型嘅適合度明顯變差,噉個研究者就有理由話兩組之間有差異(睇埋下面調節效應[7]
  • 統計模型選擇:泛指「由多個『可能描述到啲數據嘅統計模型』嗰度揀一個」嘅過程;通常係會靠「邊個模型嗰啲適合度指標最靚」嚟做基準揀。
  • 多組分析:泛指「將受試者分做幾組,每組都由佢哋數據嗰度估個統計模型出嚟,並且比較唔同組喺個模型上有乜差異」;例如研究者認為變數 同變數 喺實驗組當中會成正比,而喺對照組當中會冇相關,於是就將數據分做兩份,每份對應其中一組受試者嘅數據,然後同兩組分別建立一個結構上相同嘅迴歸模型),睇吓呢兩組嘅 係咪有預期中嘅差異(即係喺實驗組當中係統計上顯著嘅正數,喺對照組當中統計上唔顯著);如果有,就能夠支持嗰位研究者嘅假說[8]
  • 嵌套模型[9]:如果話「模型 嵌套咗喺模型 裏面」,意思即係話 參數子集;研究者可以透過比較唔同模型嘅適合度指標,睇吓「邊個模型能夠最有效噉描述手上攞住嘅數據」[10]。可以睇埋奧坎剃刀嘅概念。

可辨識度

[編輯]
内文:可辨識度

喺統計學同計量經濟學等學科上,可辨識度係指一個模型係咪具備足夠嘅資訊,去唯一噉確定佢啲參數嘅值。如果某個模型係不可辨識嘅,意思即係話縱使分析者手上有無限咁多嘅數據,佢都冇辦法分辨出邊一組參數至係真相,因為唔同嘅參數組合,都可以產生一模一樣嘅實際分佈,所以齋睇數據顯示嘅實際分佈,無法分辨邊個參數組合至係真正嗰個。[11][12]

統計學界有好多方法應付可辨識度不足嘅問題,例如係

  • 固定參數嘅值:睇返過往嘅數據或者相關嘅學術文獻,判斷某啲模型參數嘅值似會係咩數值,然後就按此嚟決定嗰啲參數係幾多,跟住先至郁手做估計—要估計嘅參數少咗,就有可能補救可辨識度不足嘅問題。
  • 區局可辨識度 (暫譯) [註 1]:將參數嘅可能值,局限喺某啲特定嘅區間,縮窄搜索範圍,就有較大機會得以將可能性減少到得一個[11]

模型類型

[編輯]
睇埋:最佳化

睇埋

[編輯]

註釋

[編輯]
  1. 英文local idenfiability

引咗

[編輯]
  1. Bertsekas, Dimitri P. (2002). Introduction to Probability. Tsitsiklis, John N., Τσιτσικλής, Γιάννης Ν. Belmont, Mass.: Athena Scientific.
  2. 1 2 Similarities of Univariate & Multivariate Statistical Analysis.
  3. Cox, D. R. (2006), Principles of Statistical Inference, Cambridge University Press, p. 197.
  4. Huber-Carol, C.; Balakrishnan, N.; Nikulin, M. S.; Mesbah, M., eds. (2002), Goodness-of-Fit Tests and Model Validity, Springer
  5. Singh, R. (2009). Does my structural model represent the real phenomenon?: a review of the appropriate use of Structural Equation Modelling (SEM) model fit indices. The Marketing Review, 9(3), 199-212.
  6. Sarstedt, M. , Henseler, J. and Ringle, C. (2011), "Multi-group analysis in partial least squares (PLS) path modeling: alternative methods and empirical results", Advances in International Marketing, Vol. 22 No. 1, pp. 195-218.
  7. Takayama, Akira (1985). Mathematical Economics (2nd ed.). New York: Cambridge University Press. p. 61.
  8. Sarstedt, M. , Henseler, J. and Ringle, C. (2011), "Multi-group analysis in partial least squares (PLS) path modeling: alternative methods and empirical results", Advances in International Marketing, Vol. 22 No. 1, pp. 195-218.
  9. 嵌套模型(nested model)
  10. Inness, M., Turner, N., Barling, J., & Stride, C. B. (2010). Transformational leadership and employee safety performance: a within-person, between-jobs design. Journal of occupational health psychology, 15(3), 279,呢份管理學研究用咗嵌套模型,剖析(簡化講)轉工同管理者嘅領導能力點影響打工仔嘅某啲行為。
  11. 1 2 Model Identifiability - By Guan-Hua Huang,佢哋一開始就開宗明義噉講:"In some statistical models, different parameter values can give rise to identical probability distributions. When this happens, there will be a number of different parameter values associated with the maximum likelihood of any set of observed data."
  12. Olukan, D., 2023. Heterogeneity in Agent-based models (Doctoral dissertation, University of Leeds), also see Jurnal of Artificial Societies and Social Simulation (JASSS).
  13. Everitt, B.S.; Hand, D.J. (1981). Finite mixture distributions. Chapman & Hall.