1. 程式人生 > >統計英文文檔頻率前n單詞

統計英文文檔頻率前n單詞

common 大小 pri counter main os.path ack lod count

#coding:utf-8
#!/usr/bin/python2.6


def statistic_eng_text():
    ‘‘‘統計出英文文檔中高頻詞匯‘‘‘
    cnt = Counter()
    np = os.path.join(get_project_path(),‘doc‘,‘jack lodon.txt‘)
    ff = open(np,‘r‘)
    words = ff.read()
    format_text = re.split(‘[\s\ \\,\;\.\!\n]+‘,words)

    for w in format_text:#比較的時候註意了大小寫,其中有一個 the是以大寫字母開始的,所以在notepad中統計出來了,而在代碼中沒有統計出來

        cnt[w.lower()] += 1#這裏需要把單詞進行一個轉換,避免大小寫導致的不匹配
    print cnt.most_common(5)

if __name__ == ‘__main__‘:
    statistic_eng_text()

  

統計英文文檔頻率前n單詞