資料品質申報

各層可信度與已知限制

01為何要申報

資料層的可信度並不均勻:粵拼與協音碼是逐字對齊的,覆蓋率 100%; 而語義層有相當比例由模型生成。把兩者當成同一回事,會做出錯誤的產品決策。

本頁的數字皆為目前版本的實測值,會隨版本更新而變動。 以下說明的目的是讓你知道哪些欄位可以自動化採信、哪些只適合給人挑選

這一頁講的是限制,不是免責
我們持續校正資料;申報限制是為了讓你把它用對地方,不是推卸。 發現具體錯誤歡迎來信回報。

02各層覆蓋率

詞條總數 230,317。

覆蓋佔比可信度
粵拼 · 協音碼 · 韻母全部100%高(逐字對齊,來自 rime-cantonese)
釋義175,22876.1%高(來自開放詞典)
語義關係(同/反義)124,798 個詞54.2%視來源而定,見下節
情感標註129,07856.0%
情感標註(非中性)30,86813.4%
語域 reg47,20720.5%

「非中性」是實際有分辨力的那部分 —— 大多數詞在情緒上本來就是中性的,emotion 篩選真正可用的範圍是這 13.4%。

03語義關係的來源分布

共 836,004 條(同義 475,888、反義 360,116)。

source條數佔比來源
curated89,01010.6%Chinese Open Wordnet 人工對齊
generated746,99489.4%大型模型生成
預設是 all,即包含模型生成的部分
/synonyms/antonyms/word/{text}source 預設為 all。若結果會直接寫進成品(自動替換、批次改寫),請明確傳 source=curated

詞卡回應的 relation_counts 會逐詞回報 curated 與 generated 各有多少, 可用於在介面上標示可信度。

04主題傳播的準確度

主題意象 theme 的原始標註只覆蓋約 8.3% 詞條。theme_scope=all 會把主題沿語義關係傳播到未標註的詞,合計覆蓋約19.8% —— 但傳播得來的部分約三成不準確

theme_scope涵蓋準確度適用
tagged(預設)原始標註 8.3%精確檢索、自動化
all合計 19.8%傳播部分約三成不準擴大聯想、給人挑選
inferred僅傳播結果約三成不準評估傳播效果

詞卡的 affect 把兩者分開列出(themesthemes_inferred),不會混為一談 —— 請在介面上也保持這個區分。

05分類層的已知限制

48 個語義分類覆蓋 137,978 個詞條,但其中約 69%(95,755 個)的分類 僅憑模型生成的語義群推導而來,未經人工核對。內部抽樣顯示這部分的 明顯錯誤率約四成

  • 適合:作為給人挑選的候選池、作為粗略的主題分區、 配合 quality=true 收窄到有釋義的常用詞。
  • 不適合:當成分類真值直接驅動自動化決策 (例如自動打標籤、自動過濾內容)。

若你的用途需要更高可信度的分類,這正是 Enterprise 的 「AI 增強型語義分類」所處理的問題 —— 請來信洽談

06據此選擇參數

你的用途建議參數
給人挑選的候選清單預設即可;可加 quality=true 讓常用詞優先
自動替換 / 批次改寫source=curated + theme_scope=tagged
聲韻相關的一切無須顧慮 —— 這一層覆蓋率 100%
主題聯想 / 靈感發散theme_scope=all,但要讓使用者能否決

07持續維護

詞庫並非一次性成品 —— 詞條、語義關係、情感與主題標註持續維護、擴充與校正, 上述數字會隨版本提升。

GET/api/lexicon/version

可查詢目前版本標籤與完整統計。相容性政策與如何偵測版本變動,詳見變更記錄