跳到主要內容區

關於資料庫

關於資料庫

 

1. 語料庫之簡介

      語料庫起源於13世紀研究聖經的學者將聖經文本以人工標記方式標注字串位置, 並以英文字母順序羅列字串位置 (McCarthy & O’Keeffe, 2009)。近代,由 於電腦科技的進步,語料庫文本已可藉由電腦程式的應用快速搜尋,提供使用者其所需資訊, 也因此帶動愈來愈多來自世界各地不同語言背景的研究學者建構不同語言或功能的語料庫, 讓語料庫語料學的研究更加興盛、蓬勃。不同於傳統語言學理論或心理語言學實證的研究, 語料庫著重於語言使用的面向,以量化概念,提供研究者語言實際使用的狀況 (Reppen, 2009) 。語言使用狀況也可依研究者研究核心區分為時間性(兒童、青少年、成年人等)、區域性(台灣閩南語、台灣普通話等)、狀況性(口語語料、書面語料、電視節目語料等)等。

      本語料庫基於國立中正大學語言學研究所蔡素娟教授與麥傑教授多年來國科會專題研究計畫孕育而生。 本持著語料庫建構之精神,「閩南語口語語料庫」的首要之務就是將錄音語音資料詳實且精確地轉記可以機讀的文本, 再藉由文本內字串搜尋及計算取得使用者定義之因素結果,以利於後續閩南語語料庫語言學分析研究,其中包含以音韻學、構詞學、語意學、句法學、心理語言學、語用學為本之語料庫研究。

      本語料庫採用教育部民國87年公布之「閩南語拼音系統」為標準, 並根據「中文資訊用分詞國家標準草案」(中文詞知識庫小組 1995, 中文詞知識庫小組 1996, Huang, Chen, and Chang, 1997) 修改符合閩南語的分詞標準, 以建立語料庫之辭典檔。本語料庫的語料來源是廣播節目,屬於自然語言(spontaneous speech), 在斷句上相當不易。為了使語料庫之建立能更完善,且取得一致性,我們參考國內外數個知名語料庫, 例如中研院現代漢語平衡語料庫 (Chen, Huang, Chang, & Hsu, 1996)、 世界標準的兒童語料交換系統Child Language Data Exchange System (簡稱CHILDES; MacWhinney, 1995, Sokolov & Snow, 1994)、 The Hong Kong Cantonese Child Language Corpus (簡稱CANCORP; Lee and Wong, 1998),以及與師大李櫻老師討論後,歸納了數個斷句規則,以求得語料之一致性及完整性。

      本語料庫語料來源為雲嘉電台及中廣寶島網之節目(詳細節目如表1)。目前(2012/08)完成轉記的錄音時間約六十個小時,詞頻數約800,000詞。目前語料庫公開的完成轉記的錄音約28個小時,詞頻數約315,069詞,開放供各界使用查詢。

      表1 「閩南語口語語料庫」語料來源
電台名稱 節目名稱 時間 主持人
雲嘉電台 Q鬆鬆太太俱樂部 (一)~(五) 10:00~12:00pm 賴嘉仕
雲嘉電台 歡喜看台灣 (一)~(五) 5:00~6:00pm 蔡振南、羅懿芬
中廣寶島網 輕鬆麻辣鍋涼拌小黃瓜 (一)~(五) 5:00~6:00pm 婉玲、巧玲
中廣寶島網 四神湯 (一)~(五) 10:00~12:00am 翁浩然、吳麗娟、李佳
中廣寶島網 美麗人生 (一)~(五) 4:10~5:00pm 謝英琴
中廣寶島網 中午茶 (一)~(六)1:00--2:00pm 林志烈、簡秀靜
中廣寶島網 有緣來做伙 (一)~ (六)2:00-4:00pm 吳麗華、羅冠中
中廣寶島網 寶島向前行 (一)~ (六)4:00-5:00pm 楊慶煌、葉淑芬
中廣寶島網 下班真輕鬆 (一)~ (六)4:00-5:00pm 弘林
中廣寶島網 幸福萬事通 (一)~(五)5:00-6:00pm 葉淑芬
 

2. 語料庫建立過程

      廣播節目以MP3格式錄音儲存,便利日後分析使用。本語料庫轉記步驟如下:
第一階段
      依語料庫的辭典檔為原則,本語料使用「語料庫拼音輸入程式」(Ruan, Hsu, Myers, and Tsay, 2012), 依拼音或漢字方式將廣播語料轉記成文字,即所謂的閩南語漢字,無漢字表示的則以拼音取代。 本語料庫辭典檔建立以及轉記語料所參考的辭典為以下四本: 依優先順序排列為:《臺灣閩南語辭典》、《台灣話大辭典》、《廈門方言詞典》、《閩南語詞彙》。 將每一個段落做斷句工作,讓語料以較接近口語的表達方式呈現。初步的轉記檔案內容中,每一個詞後面皆有音標 (根據87年教育部公告之閩南語拼音系統)。
//
圖1 語料庫拼音輸入程式
//
第二階段
      交由第二位轉記者重聽轉記的廣播,確認第一階段轉記好的漢字與音標在斷詞上沒有錯誤。
第三階段
      以語料庫現有之自動檢測程式(Adult Word Classification)進行詞頻的計算以及詞條的比對。 //
圖2 自動檢測程式(Adult Word Classification)
//
第四階段
      最後以人工檢測的方式完成確認工作,以期達到更精確的目標。
瀏覽數:
登入成功