跳去內容

Tf-idf

出自維基百科,自由嘅百科全書

Tf-idf [註 1]資訊提取數碼人文學時常用到嘅概念,講緊分析文件嗰陣,要衡量啲對該文件嚟講有幾「重要」[1],呢個重要程度

  1. 會用數值反映;而且
  2. 會對啲數值作出調整,尤其係要考慮到某啲詞本質上就會出現得比較密。

粵文為例,設依家要分析用粵文寫嘅文件,高度簡化嘅做法係數下每隻詞出現咗幾多次,但咁簡單嘅做法,恐怕會得出冇咩用嘅結果,想像電腦話返畀分析者知:

呢份文件入便,出現得最密嗰三隻詞係同埋

噉樣,根本無法有效噉得知份文件係(例如)講咩主題嘅。因此,涉及教電腦處理自然語言嘅工作,做呢類計算嘅時候,好多時都有必要考慮埋該語言中唔同嘅詞嘅「自然」出現頻率[註 2]

某隻詞嘅 term frequency,係指嗰隻字喺份文件入便出現咗幾多次,除以份文件嘅總詞數。

定義

[編輯]

不過亦要留意,原則上,TF-idf 考慮嘅「自然」或者「預期」出現頻率,係講緊以手上嘅文件集合作準。例如即使都係用粵文寫,或者都係用英文寫,新聞稿中,唔同詞嘅「自然」或者「預期」出現頻率,會有別於學術文入便嘅。

用例

[編輯]

睇埋

[編輯]

文獻

[編輯]

  • Salton, G., & Buckley, C. (1988). Term-weighting approaches in automatic text retrieval. Information processing & management, 24(5), 513-523.

註釋

[編輯]
  1. 取自英文Term Frequency-Inverse Document Frequency
  2. 可以睇下語料嘅概念。

引述

[編輯]
  1. Rajaraman, A.; Ullman, J.D. (2011). "Data Mining" (PDF). Mining of Massive Datasets. pp. 1–17. doi:10.1017/CBO9781139058452.002. ISBN 978-1-139-05845-2.