跳去內容

主成份分析

出自維基百科,自由嘅百科全書

主成份分析英文principal component analysis,PCA )係統計學上一種分析方法,主要功用係做降維,令到手上嘅數據集冇咁複雜。用日常化嘅用語講,主成份分析做嘅,係攞住好多個變數,將呢啲變數「砌」成若干個數量較少嘅主成份[註 1],呢啲主成份係能夠有效解釋數據中嘅變異嘅。然後分析者就可以攞呢啲主成份去做下一步嘅分析。

喺二十一世紀初,諸如 R 程式語言等嘅架生,都有套件可以做主成份分析。

基本諗頭

[編輯]

想像依家有一個數據庫,每個橫行個案喺某兩個變數 x 同 y 上都有其數值,好似下圖噉,跟住就可以畫兩條線,即係附圖嗰兩個箭咀,兩條線分別都可以係一條包含 x 同 y 嘅算式表達,當中由圖當中可以睇得到,長箭咀嗰條線成功噉捕捉更多嘅變異數-長箭咀嗰條線所代表嗰個成份[註 2]比較能夠反映數據整體變化,所以就比較「重要」,所以研究者就攞呢個主成份去做下一步嘅分析[1]


主成分分析嘅圖解;幅圖每一點代表其中一個個案,兩個箭咀代表兩個成份,長啲嗰個箭咀係比較重要嗰個成份。


舉例說明,假想有拃數據,每個個案係一隻動物,而每個個案一係就係老鼠,一係就係大笨象,x 係隻動物嘅大細,而 y 則係隻動物嘅身體色彩;假設呢拃數據做好咗標準化,用同一樣嘅單位表達 x 同 y,喺呢拃數據入面,沿身體色彩嘅變異數好細,個箭咀會好短,噉係因為老鼠同大笨象都係灰灰啡啡噉色嘅動物,但係沿大細嘅變異數就會明顯較大,個箭咀會好長,噉係因為老鼠同大笨象喺體型上爭好遠-用主成份分析嘅話,會得出

用 x 作為重心線做分辨,有用啲。

噉樣嘅結果[2]

電腦算法

[編輯]

喺最簡單嗰種情況下,做主成份分析嘅演算法大致上係噉[1]

  1. 攞數據;
  2. 視乎需要,可以做標準化先,將單位統一;
  3. 畫條線出嚟,條線有條式,而條式包含數據當中有嘅變數
  4. 計出沿呢條線嘅變異數有幾多;
  5. 改變吓條線嘅參數
  6. 再計出沿條新線嘅變異數有幾多;
  7. 一路做步驟 4 同 5,做晒所有指定咗嘅可能性[註 3],最後揀選具有最大變異數嗰條線或者具有最大變異數嗰 k 條線,做輸出。

當中 k 可以由研究者決定。

再睇

[編輯]

註釋

[編輯]
  1. 英文principal component
  2. 英文component
  3. 喺實際應用上,PCA 演算法唔會用窮舉搜尋

參攷

[編輯]
  1. 1 2 Jolliffe, I. T. (1986). Principal Component Analysis. Springer Series in Statistics. Springer-Verlag.
  2. Knowledge Representation in Neural Networks 互聯網檔案館歸檔,歸檔日期2019年3月2號,. (PDF).
  3. Factor Analysis Vs. PCA (Principal Component Analysis) – Which One to Use? 互聯網檔案館歸檔,歸檔日期2024年5月11號,.. Analytix Labs.

外拎

[編輯]