字數統計
中文算得對,而且文字不會離開這一頁。
本機處理完全在你的瀏覽器裡執行 —— 打開開發者工具的 Network 分頁就能驗證
出現最多
輸入或貼上文字,所有統計即時更新。沒有任何東西被傳輸,所以未發表的稿件、合約,以及任何你不想貼進陌生人伺服器的內容,都可以放心用。
為什麼大多數字數統計工具算錯中文
計算字數的標準做法是用空白斷詞。這對英文、法文以及所有詞與詞之間有空白的語言都成立。中文沒有。一段三百字的中文完全沒有空白,所以用空白斷詞的工具會回報它是「1 個字」。
這不是罕見的邊緣案例。它影響每一個用中文、日文、韓文寫作的人,而且對雙語文件的傷害是雙倍的 —— 英文那半被算到了,中文那半等於沒算,加起來的總數毫無意義。
我們改成算什麼
中日韓表意文字逐字計算,因為中文裡講「字數」時,單位本來就是「字」。英文單字則依傳統的空白與標點規則計算。標題上的那個大數字是兩者相加 —— 那才是一份雙語文件實際的份量。
兩個數字也分開顯示,因為按原文字數報價的譯者、和要壓在英文字數上限內的編輯,需要從同一份文字裡取出不同的數字。
閱讀時間依語系分開估算
不同書寫系統的閱讀速度不一樣。我們以中文約每分鐘三百字、英文約每分鐘兩百二十個單字估算,再把兩者相加。
只用一個混合速率,對任何不是純單一語言的文件都會錯。這是成人默讀一般散文的平均值,技術文件會更慢、輕小說會更快,所以請把它當成規劃參考而不是量測結果。
沒有人提的隱私問題
字數統計工具被用在人們寫過最敏感的文字上:未發表的手稿、求職履歷、法律草稿、醫療信件、投稿前的學術論文。而幾乎每一個線上字數統計工具,都是把那些文字送到伺服器上去數。
這一個是在你的瀏覽器裡用 JavaScript 數的。沒有請求可以被攔截、沒有伺服器紀錄要擔心、也沒有哪份服務條款會悄悄宣稱對你貼上的內容擁有授權。打開開發者工具盯著 Network 分頁然後打字 —— 什麼都不會出去。
其他數字的意義
含空白與不含空白的字元數都會給,因為不同機構規定的是不同的那一個 —— 出版合約與翻譯報價經常用的是「不含空白的字元數」。
句數是依據句末標點偵測的,中英文都算,所以「。!?」跟英文句號一樣會被認出來。段落則是以空行分隔的區塊,這符合人們實際排版文件的方式,而不是把每一個換行都當成一段。
常見問題
為什麼我的中文在這裡算出來的字數不一樣?
因為多數工具用空白斷詞,而中文沒有空白 —— 它們會把一整段回報成 1 個字。我們是逐字計算中日韓文字,那才是「字數」的意思。
我貼進去的文字會被上傳嗎?
不會。統計是在你的瀏覽器裡用 JavaScript 執行。可以在開發者工具的 Network 分頁驗證 —— 打字的過程中不會發出任何請求。
翻譯報價該用哪個數字?
通常是「不含空白的原文字元數」,但慣例因客戶而異。字元數、中日韓字數、英文單字數都分開列出,你可以用對方指定的那一個。
閱讀時間是怎麼算的?
中日韓字元以每分鐘約 300 字、英文單字以每分鐘約 220 字計算後相加。這是對一般散文的估計值,不是量測。
這裡的「一個字元」到底怎麼算?
一個 Unicode 碼位。這對 emoji 與 CJK 擴充區的罕用漢字有差 —— JavaScript 把它們存成兩個 UTF-16 單位,所以直接回報字串長度的工具會把它們各算成 2 個。碼位也不等於 grapheme cluster(使用者感知的字元):家庭 emoji、旗幟、或字母加上獨立的組合重音符,都是好幾個碼位、螢幕上畫成一個看得見的字。一般的中文與英文內容下,這三個數字完全相同。需要並排看的話,字元計數那一頁會把碼位、UTF-16 單位、看得見的字元、UTF-8 位元組四個一起列出來。
把網路關掉還算得出字數嗎?
可以。第一次造訪之後頁面就被快取了,而且統計本來就不需要網路連線。


