跳去內容

文本情感分析

出自維基百科,自由嘅百科全書
二〇一六年一場 Twitter 文本情感分析嘅結果,影像化得出嘅圖像:是次分析話到俾分析者知,有幾多用家產品持有正面嘅意見,有助理解消費者嘅諗法。

情感分析[註 1]粵拼cing4 gam2 fan1 sik1,又叫意見探ham3[註 2],係自然語言處理運算語言學相關工作上時會提到嘅概念,指緊對文本作出分析,搵出文本帶有咩意見、取態或觀感,尤其係講緊寫者對講緊嘅事物持有正定負面嘅觀感,而進一步嘅分析仲可以考慮埋寫者係表達緊咩情緒[1][2]。有啲文獻會用更廣義化嘅定位,認為情感分析唔一定係靠文本,仲可以包埋使用生物辨識技術量度意見同情感[3]

情感分析喺營銷數碼人文學等嘅領域上都有用。例如係數碼人文學噉:數碼人文學旨在用人工智能等嘅運算方法,解答人文學上嘅研究問題;當中喺文學方面嘅研究就會用到情感分析—學者研究剖析文學作品嗰陣,時常都會講到角色作者表達嘅情感,以及係呢啲情感點樣隨住作品嘅情節進展,而出現起伏;呢啲研究就有機會用到情感分析,探究情感喺情節途中有咩上落變化,以及係呢啲變化有冇特別嘅規律。

類似情感分析嘅諗頭,查實早喺一九六〇年代已經存在[4],不過當時並冇引起太大嘅迴響。自二〇一〇年代起,隨住大數據方面嘅技術全面盛行,企業以至學術界手上多咗大量嘅文本數據。而呢點令到文本情感分析開始受到重視。時至二〇二〇年代,文本情感分析已經廣受採用,不過仍然有唔少批評聲音:例如事實表明,文本嘅情感好多時係嚟自讀者嘅演繹,同一份文本由唔同嘅人睇,演繹到嘅情感都會有分別。因此,文本情感分析界依然有繼續發展進一步嘅技術,務求做到更佳嘅分析。

基本概論

[編輯]

文本情感分析,重點在於透過文本,嚟剖析人群對某啲事物有咩意見、情緒、評價同態度[5]

舉例說明,文本情感分析喺營銷上就時常會用得著:想像依家有件產品 A,出 A 呢隻產品嘅企業,想知消費者對 A 有乜嘢感覺;於是間企業嘅營銷小組就去社交媒體等嘅地方,搜集消費者寫低嘅粵文留言;再對呢啲留言做情感分析,而識得做情感分析嘅程式會做到

  • Input:攞住產品 A 真係又靚又正噉嘅句子
  • Output:睇得出寫嗰個人對 A 持有正面嘅意見。

營銷小組收集好晒數據之後,睇下消費者當中有幾多人對件產品覺得滿意,有幾多人對件產品有不滿,跟住就可以支援企業做嘅決策:及後,佢哋可以做進一步嘅分析,探討消費者點解會有噉嘅觀感,再幫手決定件產品使唔使改,或者要點改[6]。除咗營銷之外,政策等嘅工作都有興趣想知公眾對唔同事物有乜觀感,因而有機會用到文本情感分析[7]

例如下圖嘅研究噉:將英文圈新聞組織分做左派、右派同中間派三種,以三種唔同嘅線嚟代表,再分析三組嘅頭條嘅情感係正定負面;用趨勢圖畫出三者喺二〇〇〇年至一九年間嘅情感走勢,就出到下圖——



文句特性

[編輯]
心理學慣常將情緒分做若干個大致離散嘅大類。

喺實作上,做文本情感分析嘅程式嘅開頭,同典型嘅分析用程式一樣,都係首先要引入想用嘅函式庫,跟住引入想用嘅文本數據,通常會將之轉化做數據框[註 3]

數據框整好,就會做各種嘅事前數據處理,例如詞性標注同埋解析[8]等都相當常用[9]。呢啲功能喺自然語言處理工作上都好常見,自然語言工具箱等嘅架生都有提供。

然後,就要諗方法計所謂嘅「情感值」。

情感分法

[編輯]
睇埋:情緒情緒正負

喺概念上,情感分析對情感或意見嘅劃分方法,分兩大種:

  • 正負:一種較簡化嘅做法,係按一條維度,將情感分做正面負面兩大種:每句語句,一係屬於正面一係屬於負面,亦有唔少分析會加埋中性嘅分類[10],呢種做法高度簡化[註 4]但已經出到一啲有用嘅結果;稍為進階少少嘅做法,會有程度之分,即係仍然將情感分做正同負兩種,不過喺數值上會分做 +1 同 -1 ,或者 +5 同 -5 等等,表達唔同嘅情感強烈度[註 5][11]
  • 情感類型:亦有好多研究者主張另一種做法,好似心理學上嘅好多模型噉,將情感分做恐懼憤怒哀傷等嘅多個彼此間離散嘅大類;呢種做法則會用到各種嘅監督式學習,又或者係聚類分析等嘅技術[12]

決定咗要採取咩方法嚟思考情感或者意見之後,就要諗方法將文本數據轉化做情感值。要教電腦自動噉決定某段文本係咩情感,可以用到好多唔同嘅自然語言處理演算法,譬如係以下呢啲[13]

  • 詞表類嘅方法:例如用直接了當嘅法則,講明唔同嘅詞代表唔同嘅情感,sou2住每種詞出現咗幾多次,但呢種方法最簡單個版本備受批評,畀人話佢容易忽略語境,進階啲嘅做法有對此作出補救,例如 VADER 嘅套件[14],就會考慮埋否定詞標點符號等嘅因素,以及係大細階會唔會反映某啲重要資訊[註 6]
  • 向量空間模型:將詞語轉化做多維度向量,表示有關語義相似度嘅資訊。
  • 標好晒嘅文本數據:文本,唔淨只係詞有情感,連語句以至段落等都有人手標示好係咩情感。

主定客觀

[編輯]
睇埋:陳述句

情感分析時會配合主客觀嘅分類:即係拎住輸入嘅語句,輸出答呢句說話係描述緊主觀感受抑或係客觀事實,有陣時可能仲難過標邊啲句子係正面邊啲係負面[15]。而好多研究者會喺郁手做情感分析前,拎走客觀嘅語句[16]。亦可以睇睇統計分類嘅概念。

設依家喺度睇緊文本數據,分析美國人响社交媒體上嘅留言,研究嘅目的係想探究美國人點樣討論自國總統同埋對總統有咩意見。客觀語句嘅例子:[17]

要當選做美國總統,候選人必需年滿三十五歲。

主觀語句會提供到關於寫者內在狀態嘅資訊,會包含個人意見、判斷同埋預測等,例子:

我哋一定要揀一個成熟、賢能嘅人做總統。

要達致主客觀嘅分類,唔可以單靠基於規則[註 7]嘅做法:事實表明,同普遍嘅自然語言處理工作一樣嘅係,要正確判斷面前嘅語句係主定客觀,要考慮到諸多嘅語境因素,齋靠明確講到出嚟嘅法則,難以達到[18];因此,主客觀分類通常都係要靠機器學習嘅方法。

趨勢分析

[編輯]

文本情感分析,好多時都會關注情感點樣隨時間而起伏變化。例如係針對虛構作品嘅研究,就時常會提到起承轉合戲劇結構等嘅概念,於二〇一〇年,有工作者就喺一場演講中噉樣評論[19]

最基本個諗頭係,古仔有形狀,呢啲形狀可以畫做圖。

數碼人文學時常會畫所謂嘅情感曲線[註 8]:研究者可以將手上嘅文本數據[註 9]做好切割,例如每 1,000 字謂之一橛[註 10],同每橛計佢嘅情感值係幾多,就會得出一個數據列,反映情感點樣隨情節演進而出現起伏,而且呢啲數據仲可以用近似趨勢圖噉嘅形式畫出嚟[20]

順帶一提,情感曲線好多時都要做一啲處理,先可以攞去做進一步嘅分析,譬如係平滑化同埋正規化[註 11]等等[9]



情感曲線畫咗出嚟,就需要將文本分類,同埋選取分析用嘅特徵[註 12]:數碼人文等領域嘅研究問題,好多時都係講緊唔同類型嘅文本,喺情節演進相關嘅特性上有異,當中分類準則包括係文類、時期以及係作者嘅特性呀噉;寫好建立情感曲線用嘅程式,研究者就可以同每類文本,畫出嗰類文本嘅平均或者典型情感曲線,再籍此比較呢啲類型,探討呢啲類型彼此間喺情感曲線嘅特性上係咪有別[註 13]

領域應用

[編輯]
内文:數碼營銷

文本情感分析喺營銷上有一定嘅價值。喺社交媒體或者網上買賣,用戶都可以針對唔同產品提供文字評論、留言或者意見。呢啲由用戶產生嘅文本,包含咗大量資訊,反映佢哋對各種嘅產品同服務有咩觀感或者諗法,但係單靠人力嚟分析呢啲數據,會花費大量嘅時間同精神,因此,商界有理由希望用電腦自動化噉分析由消費者產生嘅文本數據—於是就有機會採用文本情感分析[21]

情感分析喺數碼人文學上有廣泛嘅應用:能夠分析文本中帶有嘅情感,有助文學方面嘅研究,譬如係將文學作品按情感嚟分類、文類故事類型之間嘅劃分、模擬古代嘅文本中嘅情感、角色之間嘅網絡關係分析等等[22]。有啲學者仲主張,情緒系統係界定一切故事嘅標準特徵[23]

情感分析相關嘅研究,甚至仲掕到落去腦神經學嗰度。有研究者透過功能磁振造影等嘅技術,監察讀者嘅腦活動,配合埋問卷訪問研究,探知佢哋對文學作品有咩情緒反應[24],帶嚟咗有用嘅洞見[註 14][25]

系統評估

[編輯]
睇埋:高氏 kappa

研究者要評估行情感分析嘅系統,方法有好多。

喺二十一世紀初,評估情感分析系統,好多時係要睇佢哋同人類做嘅判斷有幾吻合:一般嚟講,系統做嘅判斷同人類判斷嘅吻合度愈高,就愈謂之表現理想;不過喺更進階嘅應用中,呢種做法有諸多問題,例如事實表明,唔同人做判斷,得到嘅結果有陣時好唔同,如果有多個人類評判,可能就會出現一種狀況,連啲人類評判彼此間都有分歧[註 15],更加唔好講話可以用佢哋嘅判斷嚟評估情感分析系統[26];此外,電腦犯嘅錯,同人類評者犯嘅可以好唔同,所以兩者嘅評估數據未必可以直接攞嚟比—例如電腦系統好多時唔識理解否定句笑話反話,同時呢啲內容對人類嚟講極之簡單,因此電腦周不時會犯下一啲人類覺得係「好蠢」嘅錯[27]

歷史演變

[編輯]

對文本情感分析影響深遠嘅科技發展同概念:

睇埋

[編輯]

文獻

[編輯]

  • Elkins, K. and Chun, J., 2019. Can sentiment analysis reveal structure in a plotless novel?. arXiv preprint arXiv:1910.01441.
  • Öhman, E., Bizzoni, Y., Feldkamp, P. and Nielbo, K., 2024, March. EmotionArcs: Emotion arcs for 9,000 literary texts. In Proceedings of the 8th joint SIGHUM workshop on computational linguistics for cultural heritage, social sciences, humanities and literature (LaTeCH-CLfL 2024) (pp. 51-66).
  • Kim, E. and Klinger, R., 2018. A survey on sentiment and emotion analysis for computational literary studies. arXiv preprint arXiv:1808.03137,呢篇文綜觀噉討論當時嘅情感分析,仲有提到心理學上描述情緒模型,以及係呢啲模型對情感分析有咩用。
  • Reagan, A.J., Mitchell, L., Kiley, D., Danforth, C.M. and Dodds, P.S., 2016. The emotional arcs of stories are dominated by six basic shapes. EPJ data science, 5(1), p.31,呢篇文主張英文圈虛構故事可以按情感弧 (Emotional arc 嘅暫譯) 分做數量唔多嘅幾個種類,佢哋跟住郁手分析英文小說中嘅情感,用咗聚類分析自組織對映等嘅多種統計分析,剖析出自古騰堡計劃嘅數據,發現情感弧可以分六大種。

註釋

[編輯]
  1. 英文sentiment analysis
  2. 英文opinion mining
  3. 英文dataframe,通常簡稱作 df
  4. 簡化:會有資訊喪失。
  5. 但噉分喺數學上係咪有意義,相當有爭議性。可以睇埋量度層次嘅問題。
  6. 例如喺廿一世紀初嘅英文書寫中,全大階好多時都係表達緊大嗌等較激動嘅情緒表現。
  7. 基於規則:可以睇下基於規則嘅系統
  8. 英文sentiment curve
  9. 文本數據:可以係嚟自古騰堡計劃等嘅來源。
  10. 做情感曲線嗰陣,文本數據要點切割,係一個問題。
  11. 英文normalization;將每本書嘅句子位置轉換成相同尺度。例如 0% 至 100%,方便比較唔同長度文本嘅情感曲線。
  12. 英文features;可以睇埋特徵選擇等嘅概念。
  13. 技術細節:特徵可以係以列表形式存在嘅情感值,用呢啲值做基礎,行聚類分析等。
  14. 亦有學者主張:對文學作品嘅反應,本質上就係冇得還原化嘅,而單靠社科層面現象嚟解釋文學現象,有還原化之虞。
  15. 亦可以睇下評分者間信度嘅概念。

引述

[編輯]
  1. Vong Anh Ho, Duong Huynh-Cong Nguyen, Danh Hoang Nguyen, Linh Thi-Van Pham, Duc-Vu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen. "Emotion Recognition for Vietnamese Social Media Text". In Proceedings of the 2019 International Conference of the Pacific Association for Computational Linguistics (PACLING 2019), Hanoi, Vietnam (2019).
  2. Liu, B. (2012). Sentiment analysis and opinion mining. Synthesis lectures on human language technologies, 5(1), 1-167.
  3. Bordoloi, M. and Biswas, S.K., 2023. Sentiment analysis: A survey on design framework, applications and future scopes. Artificial intelligence review, 56(11), pp.12505-12560,佢哋噉講:"... including Information Retrieval (IR), web data analysis, mining of text, analysis of text, NLP, computational linguistics, and biometrics."
  4. Stone, Philip J., Dexter C. Dunphy, and Marshall S. Smith. "The general inquirer: A computer approach to content analysis." MIT Press, Cambridge, MA (1966).
  5. Liu 2015 Liu, B. Sentiment Analysis: Mining Opinions, Sentiments, and Emotions. Cambridge University Press, New York (2015).
  6. Rambocas, M., & Pacheco, B. G. (2018). Online sentiment analysis in marketing research: a review. Journal of Research in Interactive Marketing.
  7. Ceron, A., & Negri, F. (2015). Public policies go social: using sentiment analysis to support the action of policy-makers across the policy cycle. In Second International Conference on Public Policy, Milan.
  8. Dey, Lipika; Haque, S. K. Mirajul (2008). "Opinion Mining from Noisy Text Data". Proceedings of the second workshop on Analytics for noisy unstructured text data, p.83-90.
  9. 1 2 例:Somasundaran, S., Chen, X. and Flor, M., 2020, July. Emotion arcs of student narratives. In Proceedings of the First Joint Workshop on Narrative Understanding, Storylines, and Events (pp. 97-107),呢篇文 3.1 嗰度就有講,仲有講埋佢哋用咗咩演算法嚟做平滑化處理。
  10. Ribeiro, Filipe Nunes; Araujo, Matheus (2010). "A Benchmark Comparison of State-of-the-Practice Sentiment Analysis Methods". Transactions on Embedded Computing Systems. 9 (4).
  11. Thelwall, Mike; Buckley, Kevan; Paltoglou, Georgios; Cai, Di; Kappas, Arvid (2010). "Sentiment strength detection in short informal text". Journal of the American Society for Information Science and Technology. 61 (12): 2544–2558. Bibcode:2010JASIS..61.2544T. CiteSeerX 10.1.1.278.3863. doi:10.1002/asi.21416. 原著喺February 1, 2021歸檔. 喺June 20, 2011搵到.
  12. Rebora, S., 2023. Sentiment analysis in literary studies. a critical survey. Digital Humanities Quarterly, 17(2), pp.1-17. 3.1.1. Emotion theories
  13. Rebora, S., 2023. Sentiment analysis in literary studies. a critical survey. Digital Humanities Quarterly, 17(2), pp.1-17. 3.1.2. Emotion resources
  14. VADER Sentiment Analysis Explained,不過 VADER 都有其不足之處。
  15. Mihalcea, Rada; Banea, Carmen; Wiebe, Janyce (2007). "Learning Multilingual Subjective Language via Cross-Lingual Projections" (PDF). Proceedings of the Association for Computational Linguistics (ACL). pp. 976–983. 原著 (PDF)喺2010-07-08歸檔.
  16. 事實係有研究指,拎走客觀語句,可以改良情感分析嘅結果:Pang, Bo; Lee, Lillian (2004). "A Sentimental Education: Sentiment Analysis Using Subjectivity Summarization Based on Minimum Cuts". Proceedings of the Association for Computational Linguistics (ACL). pp. 271–278.
  17. Wiebe, Janyce; Riloff, Ellen (2005). "Creating Subjective and Objective Sentence Classifiers from Unannotated Texts". 出自 Gelbukh, Alexander (編). Computational Linguistics and Intelligent Text Processing. Lecture Notes in Computer Science (英文).第3406卷. Berlin, Heidelberg: Springer. pp. 486–497. doi:10.1007/978-3-540-30586-6_53. ISBN 978-3-540-30586-6.
  18. Pang, Bo; Lee, Lillian (2008). "4.1.2 Subjectivity Detection and Opinion Identification". Opinion Mining and Sentiment Analysis. Now Publishers Inc.
  19. Kurt Vonnegut (2010) Kurt Vonnegut on the shapes of stories. https://www. youtube.com/watch?v=oP3c1h8v2ZQ 原文:"The fundamental idea is that stories have shapes which can be drawn on graph paper."
  20. Reagan, A.J., Mitchell, L., Kiley, D., Danforth, C.M. and Dodds, P.S., 2016. The emotional arcs of stories are dominated by six basic shapes. EPJ data science, 5(1), p.31
  21. Subarna, Shakya (2023). Sentiment Analysis and Deep Learning: Proceedings of ICSADL 2022 (Advances in Intelligent Systems and Computing, 1432). Springer. p. 567. ISBN 978-9811954429.
  22. Kim and Klinger 2018b Kim, E. and Klinger, R. A Survey on Sentiment and Emotion Analysis for Computational Literary Studies. ArXiv:1808.03137 (2018).
  23. Hogan 2011 Hogan, P. C. Affective Narratology: The Emotional Structure of Stories. Bison, Lincoln (2011),佢哋噉講:"emotion systems define the standard features of all stories, as well as cross-culturally recurring clusters of features in universal genres." 亦可以睇下所謂嘅讀者反應研究,譯自英文reader response studies
  24. Peer et al. 2012 Peer, W. v., Hakemulder, J., and Zyngier, S. Scientific Methods for the Humanities. John Benjamins, Amsterdam; Philadelphia (2012).
  25. Rebora, S., 2023. Sentiment analysis in literary studies. a critical survey. Digital Humanities Quarterly, 17(2), pp.1-17,佢哋第 4 頁講到:"... main risk is that of an oversimplification of phenomena that necessarily escape any reductionism."
  26. Mozetič, Igor; Grčar, Miha; Smailović, Jasmina (2016-05-05). "Multilingual Twitter Sentiment Classification: The Role of Human Annotators". PLOS ONE. 11 (5). arXiv:1602.07563. Bibcode:2016PLoSO..1155036M. doi:10.1371/journal.pone.0155036. ISSN 1932-6203. PMC 4858191. PMID 27149621.
  27. Karlgren, Jussi, Magnus Sahlgren, Fredrik Olsson, Fredrik Espinoza, and Ola Hamfors. "Usefulness of sentiment analysis." In European Conference on Information Retrieval, pp. 426-435. Springer Berlin Heidelberg, 2012.

[編輯]