文字工具

你貼進來的東西不會被送到任何地方。

3 個工具

這個分類裡的工具

文字工具看起來是任何轉檔站裡最不起眼的一類,卻也是各家數字最容易對不上的一類。這一頁解釋為什麼會這樣,這樣當兩個工具給你不同答案時,你知道自己該相信哪一個。

為什麼每個工具算出來的字數都不一樣

「一個字」沒有唯一定義。多數軟體用空白斷詞,於是 state-of-the-art 在某些工具是一個字、在別的工具是三個;don't 可能算一個也可能算兩個;1,500 這種數字有時算字有時不算。

碰到中文、日文、韓文,分歧會嚴重得多,因為這些文字之間根本不放空白。用空白斷詞的工具會把一段 400 字的中文報成「1 個字」。那不是誤差,那是一個完全沒用的答案 —— 而這正是很大一部分以英文為本的字數工具實際給出的結果。

誠實的做法是同時報好幾個數字:含空白字元數、不含空白字元數、英文單字數,以及中日韓字元數分開列。這樣你可以挑那個真正在管你的規則所對應的數字。

這裡的工具你要哪一個

要那個「這篇有多長」的主要數字,用字數統計:字數、中日韓字元、句數、段落數與閱讀時間都在同一個畫面。上限是由程式而不是由人在把關時,用字元計數 —— 它把碼位、UTF-16 編碼單位、看得見的字元、UTF-8 位元組分開列,而只要文字裡出現一個 emoji、一個重音字母或一個中文字,那就是四個不同的數字。

問題是「我重複了什麼」而不是「我寫了多少」的時候,用詞頻統計。這一個最能看出我們跟一般實作的差別:用空白斷詞會把一整段中文變成一個詞,所以我們改用字頻或雙字、三字詞組,並且直接說明詞組抽取是估計值而不是字典分詞。

另外兩個鄰近分類值得知道。關鍵字密度檢查與可讀性分數放在 SEO 工具底下,因為搜這些詞的人是那一群;Unicode 字元檢視放在開發者工具 —— 當某一個特定字元把字串比對、資料庫寫入或檔名弄壞時,要找的是它。

真正在審你的人用的是哪一個數字

學術與出版的限制通常是字數,而且通常是 Microsoft Word 算出來的那個字數 —— 因為審稿的人會用 Word 打開你的檔案。Word 把中日韓字元當成字來算,這就是為什麼同一份中文文件在 Word 裡看起來會比在「用空白斷詞」的網頁工具裡長得驚人。

社群平台與簡訊算的是字元而不是字,而且是以編碼單位計算,所以一個表情符號或罕見符號吃掉的額度會比看起來多。表單欄位與資料庫也算字元,而且常常算的是位元組而不是字元 —— 這件事有差,因為一個中文字在 UTF-8 裡是三個位元組。

搜尋摘要與頁面標題的限制其實是「算出來的像素寬度」而不是字元數,所以兩個長度相同的標題可能一個被截斷一個不會。在那裡,字元數只是一個很粗的代理指標。

閱讀時間,以及為什麼各家估得差那麼多

成年人在螢幕上讀自己母語的散文,一般估計落在每分鐘 200 到 250 個單字之間。技術性內容會更慢,而任何精確到「分」的數字都是粗略指引而不是量測結果。

中文的慣例是算字元而不是算單字,常用的數值在原始字元數上高出許多。所以「閱讀時間 5 分鐘」是給讀者的編輯訊號,不是關於這位讀者的事實 —— 把它當成一種設定長度預期的方式就好。

為什麼「本機處理」對文字特別重要

人們貼進字數工具的東西,往往是他們絕對不會當成檔案上傳的:草擬中的合約、求職信、私人訊息、還沒發表的稿子、內部公告、病情描述。因為它「只是文字」,那個該小心的反射動作不會啟動。

伺服器端的字數工具會收到全部這些內容。這一個收不到,因為計算就發生在你打字的那個瀏覽器分頁裡,沒有任何請求夾帶它。這也是為什麼它在你斷網之後照樣能用 —— 而那正好是你自己驗證這件事最簡單的方法。

常見問題

為什麼這裡算的字數跟 Microsoft Word 不一樣?

主要是連字號單字、數字與中日韓字元的處理方式不同。如果那是一個會被嚴格執行的上限,就用執行這個上限的人所使用的軟體來算。

中文應該怎麼算才對?

算字元,而且要跟同一份文件裡的英文單字分開算。用空白去斷中文,整段會被算成 1 —— 這就是我們把中日韓字元列成獨立數字的原因。

我貼進去的文字會被儲存或送出嗎?

不會。它只存在於你瀏覽器分頁的記憶體裡,關掉或重新整理就消失。沒有伺服器參與,也沒有任何請求夾帶它。

字元數和位元組數會不一樣嗎?

經常不一樣。在 UTF-8 裡一個英文字母是 1 個位元組,一個中文字是 3 個。如果限制是以位元組為單位(資料庫與較舊的系統很常見),字元數會低估你的文字實際佔用的空間。

可以離線使用嗎?

第一次造訪之後可以。把網路斷掉再重新整理 —— 頁面照樣會算,而那是「沒有東西被送出去」最簡單的證明。

依分類瀏覽