2010年8月12日 星期四

療癒系音樂趴(下)

還記得上回我們介紹的幾首療癒歌曲嗎...什麼?忘了!?不過也沒關係啦,反正這次的歌曲一定不會讓你失望。上一次都是看女生歌手表演,這回我們換男生組來踢館囉~

電影「最遙遠的距離」劇照
03cea5fcdf611f6ad6887df7

到底是什麼歌曲會讓小鎂這麼如此陶醉呢?因為他在最遙遠的距離聽到了最動聽的歌曲!其實呢!每一首歌曲都有屬於它的聽眾,但是先決條件是要我們發現到它的存在才行。所以陽光宅男的任務呢,就是要從這種最多人都聽的流行歌曲中去找尋療癒性質的歌曲並分享出來,讓最多的人可以與這些有深刻意義的流行歌曲產生互動與共鳴,讓我們生活周遭的世界換一層新面貌,也使得我們的心情能抒解過多的紛擾與沈重︿︿

2010年8月11日 星期三

用Python也能輕鬆玩自然語言處理(2.4)

2.4 語彙資源大集合(Lexical Resources)


詞彙或語彙資源(lexicon),指的就是一些字詞或片語的集合體,它們通常會伴隨一些詞性或語意的資訊在裡頭!語彙資源算是次級的文本,因為只是用來輔助文本用的。例如我們定義了一份文本「my_text」,接著定義「vocab = sorted(set(my_text))」用來裝my_text裡面的詞彙,以及「word_freq = FreqDist(my_text)」用來計算每個字詞出現的頻率。這樣一來,「vocab」與「word_freq」就成了最基本的語彙資訊。還有向我們之前在1.1看到的「concordance 」功能也算是一種語彙資源,提供了單詞的用法(就像字典那樣)。下圖列出了標準的語彙術語:一個語彙的款目(lexical entry)由其標題字(headword or lemma)所組成,並且可能提供一些額外資訊,如詞性(part of speech)或詞義說明。如果兩組字有相同的拼法叫做同音異義詞(homonyms)。


最簡單的語彙類型就是照字順排列字詞清單,而較為精密的則會擁有複雜的結構且具有橫跨個別款目的連結功能。在這一節中我們會看到一些NLTK提供的詞彙資源!

2010年7月13日 星期二

用Python也能輕鬆玩自然語言處理(2.3)

2.3 多講一點Python嘛:可以重複使用的程式碼

這個時候,你可能已經在Python的互動式直譯器裡重新輸入了很多的程式碼。如果你不小心弄錯了哪個部分時,你通常必須再次輸入一次那複雜的程式。雖然可以使用箭頭鍵來修改之前的命令,但這還是很沒效率。因此在本節中我們將學會利用兩種可以重新使用程式碼的方式:文字編輯器Python的函數

2010年7月9日 星期五

療癒系音樂趴(上)

音樂對現代人來說是一件稀疏平常的事情,尤其在網際網路的環境底下,我們更可以輕易地取得各種音樂、在自己家房間當起私人的電台DJ。也許我們會聽過有人不喜歡唱歌,但卻很難聽到有人不喜歡「聽 音 樂」。究竟音樂為何有這種獨特的魔力可讓人人都愛不釋手呢?
電影「死神的精準度」劇照
y1pimCcxruwR_L4TKvr-rvq2EZCRhwoUZUhzMCwfh5OpCN-qhvJUn7nOrsrQ2Ab_8VK 

2010年6月17日 星期四

用Python也能輕鬆玩自然語言處理(2.2)

2.2 條件次數分配(Conditional Frequency Distributions)


我們之前在1.3有先初步介紹過了次數分配的統計函數「FreqDist(mylist)」,可以幫助我們輕鬆地計算串列中各項目的出現情形,而現在我們將在這裡好好的談它。當語料庫的文本被區分各種類別(像是種類、主題、作者等),我們則可以個別地針對不同類別的文本進行次數統計,這將會讓我們有系統地去研究不同類別的差異。在之前的章節你應該已經看到不少次NLTK裡「條件次數分配」的應用了!實際上條件次數分配就是一種次數分配,只是他所強調的是特定的「條件(condition)」!而這個所謂的條件呢,則經常會是文本的類別。下圖就是要表示兩種不同條件的次數分配結果,一邊是新聞類型、一邊是言情類型。