
2010 年 9 月 22 日嘅英文維基頭版;包括維基百科在內嘅好多網站都內有豐富嘅數據,有冇辦法教程式自動噉攞啲數據嚟用呢?

網頁刮料粵拼mong5 jip6 gwaat3 liu2英文web scraping)係指由網頁嗰度做數據刮取(攞有用嘅數據)。原則上,網頁刮料呢家嘢可以齋靠人手做,但絕大多數用家都會嫌人手慢得滯;所以喺實際應用上,網頁刮料通常都會用自動化嘅電腦程式做,呢啲程式曉用 HTTP 等嘅方法上網,再郁手由啲網頁度攞數據[1]


  • Fetch:攞用家指定嘅網頁嚟睇,當中網頁可能係用家指定網址,又或者教部電腦按某啲規則搵拃網頁返嚟;
  • Extract:由手上嘅網頁度攞數據,簡單嘅可以係睇個網頁入面有乜字符,或者數吓每隻字符出現咗幾多次呀噉;







