Tf-idf
外表
呢篇文 需要熟悉呢方面嘅人幫手寫。 |
Tf-idf [註 1]係資訊提取同數碼人文學時常用到嘅概念,講緊分析文件嗰陣,要衡量啲詞對該文件嚟講有幾「重要」[1],呢個重要程度
- 會用數值反映;而且
- 會對啲數值作出調整,尤其係要考慮到某啲詞本質上就會出現得比較密。
以粵文為例,設依家要分析用粵文寫嘅文件,高度簡化嘅做法係數下每隻詞出現咗幾多次,但咁簡單嘅做法,恐怕會得出冇咩用嘅結果,想像電腦話返畀分析者知:
呢份文件入便,出現得最密嗰三隻詞係嘅、咗同埋嚟。
噉樣,根本無法有效噉得知份文件係(例如)講咩主題嘅。因此,涉及教電腦處理自然語言嘅工作,做呢類計算嘅時候,好多時都有必要考慮埋該語言中唔同嘅詞嘅「自然」出現頻率[註 2]。
某隻詞嘅 term frequency,係指嗰隻字喺份文件入便出現咗幾多次,除以份文件嘅總詞數。
定義
[編輯]呢節要加長。 |
不過亦要留意,原則上,TF-idf 考慮嘅「自然」或者「預期」出現頻率,係講緊以手上嘅文件集合作準。例如即使都係用粵文寫,或者都係用英文寫,新聞稿中,唔同詞嘅「自然」或者「預期」出現頻率,會有別於學術文入便嘅。
用例
[編輯]呢節要加長。 |
睇埋
[編輯]文獻
[編輯]- Salton, G., & Buckley, C. (1988). Term-weighting approaches in automatic text retrieval. Information processing & management, 24(5), 513-523.
註釋
[編輯]引述
[編輯]- ↑ Rajaraman, A.; Ullman, J.D. (2011). "Data Mining" (PDF). Mining of Massive Datasets. pp. 1–17. doi:10.1017/CBO9781139058452.002. ISBN 978-1-139-05845-2.