詞頻統計
一整段中文不是一個詞。
本機處理完全在你的瀏覽器裡執行 —— 打開開發者工具的 Network 分頁就能驗證
詞頻表
| # | 詞 | 次數 | 佔比 |
|---|
還沒有內容 —— 輸入或貼上一些文字。
貼上文字,看你到底重複了什麼,依次數排序。英文用單字計算;中日韓改用單字或雙字、三字詞組計算 —— 因為用空白去切這些語言,只會得到一個巨大而毫無意義的詞。
為什麼多數詞頻工具算中文會得到垃圾
標準做法只有一行:用空白把文字切開,然後數。這對所有詞與詞之間有空白的語言都正確,對沒有空白的語言則是災難。一篇四百字的中文文章裡沒有任何空白,於是整篇變成一個詞、次數是 1,而「前十名」那張表裡只有一列,那一列還沒有用。
中英混排的情況更糟,因為結果看起來很合理:英文單字被正確計算、排出一張很正常的榜,而整個中文部分安靜地躺在最下面那一列。什麼都不像壞掉,於是你對自己「重複了什麼」所得到的每一個結論都是錯的。
這個工具改成算什麼
在「自動判斷」之下,統計單位是依內容決定的:以英文為主就用空白斷詞,以中日韓為主就用雙字詞。你也可以自己指定 —— 選「單字」會得到字頻,那正是中文編輯與語文老師通常要的東西;選「三字詞」則會浮出比較長的固定用語與人名。
我們唯一不做的事,是宣稱一個超出方法本身的精確度。這裡的中文詞組是 n-gram:把相鄰的兩個或三個字構成的每一個視窗都數一次。它不是字典分詞,所以清單裡會有橫跨兩個真詞的片段。用來找「我過度重複了什麼」已經非常夠用,而把這件事講清楚,比給你一張看起來很有信心但詞是錯的清單更有價值。
這些數字怎麼讀
「不重複比例」是單一篇文字裡用詞豐富度的粗略指標。長文件裡這個比例很低,通常意味著幾個詞組在撐全場;短文裡比例很高只代表沒什麼重複,那是正常而不是好。請拿同一篇的不同版本互相比較,不要跟某個絕對標準比 —— 文件越長,這個比例本來就會自然下降。
「只出現一次」那一欄在編輯時最實用。在翻譯稿或技術文件裡,只出現一次的詞,最有可能是「同一個東西在別處用了另一個說法」—— 而術語不一致正是讀者會察覺、卻說不出名字的那種瑕疵。
虛詞,以及什麼時候不該排除它
虛詞會佔滿任何一張詞頻榜:英文的 the、of、and,中文的「的」「了」「是」「在」。預設排除是因為清單少了它們才有用;而這一頁用的是與關鍵字密度工具同一份清單,兩邊的口徑才會一致。
當虛詞本身就是重點時請把排除關掉。檢查翻譯稿是不是連接詞過多而讀起來不像中文、稽核某條寫作規範、或者量一份合約裡「應」出現幾次,都需要把那些詞算進來。世界上沒有一份普遍正確的虛詞表,這正是它應該是一個開關、而不是一個藏起來的行為的原因。
在你的瀏覽器裡計算
一切都在這個分頁裡完成。詞頻分析通常是拿來跑草稿、訪談逐字稿、私人往來信件與未發表的研究 —— 那種你要當成檔案上傳會猶豫一下、但因為「只是文字」就毫不猶豫貼進網頁工具的內容。
這裡沒有任何請求可以被攔截。打開開發者工具盯著 Network 分頁然後貼上看看。你也可以把網路斷掉再重新整理:頁面照樣能用,因為這個統計從來不需要伺服器。
常見問題
為什麼別的詞頻工具把我的中文算成一個巨大的詞?
因為它們用空白斷詞,而中文沒有空白,所以整段變成一個詞。這一頁改用單字或雙字、三字詞組來計算。
中文詞組是真的分詞嗎?
不是。它是 n-gram —— 相鄰字構成的每一個視窗,所以有些項目是片段。它是估計值,用來找過度重複很可靠,但不適合拿來當詞典。
Data 和 data 會算在一起嗎?
預設會,因為那通常才是你要的。在稽核品牌名、程式識別字或縮寫時,把「區分大小寫」打開。
表格會列出幾筆?
依次數排序的前 30 筆。上方的統計數字(總詞數、不重複詞數、只出現一次的數量)涵蓋整段文字。
我的文字會被送出去嗎?
不會。分析在這個分頁裡用 JavaScript 執行,斷網也能用。