資料品質申報
各層可信度與已知限制
01為何要申報
資料層的可信度並不均勻:粵拼與協音碼是逐字對齊的,覆蓋率 100%; 而語義層有相當比例由模型生成。把兩者當成同一回事,會做出錯誤的產品決策。
本頁的數字皆為目前版本的實測值,會隨版本更新而變動。 以下說明的目的是讓你知道哪些欄位可以自動化採信、哪些只適合給人挑選。
這一頁講的是限制,不是免責
我們持續校正資料;申報限制是為了讓你把它用對地方,不是推卸。 發現具體錯誤歡迎來信回報。
02各層覆蓋率
詞條總數 230,317。
| 層 | 覆蓋 | 佔比 | 可信度 |
|---|---|---|---|
| 粵拼 · 協音碼 · 韻母 | 全部 | 100% | 高(逐字對齊,來自 rime-cantonese) |
| 釋義 | 175,228 | 76.1% | 高(來自開放詞典) |
| 語義關係(同/反義) | 124,798 個詞 | 54.2% | 視來源而定,見下節 |
| 情感標註 | 129,078 | 56.0% | 中 |
| 情感標註(非中性) | 30,868 | 13.4% | 中 |
| 語域 reg | 47,207 | 20.5% | 中 |
「非中性」是實際有分辨力的那部分 —— 大多數詞在情緒上本來就是中性的,emotion 篩選真正可用的範圍是這 13.4%。
03語義關係的來源分布
共 836,004 條(同義 475,888、反義 360,116)。
| source | 條數 | 佔比 | 來源 |
|---|---|---|---|
| curated | 89,010 | 10.6% | Chinese Open Wordnet 人工對齊 |
| generated | 746,994 | 89.4% | 大型模型生成 |
預設是 all,即包含模型生成的部分
/synonyms、/antonyms、/word/{text} 的source 預設為 all。若結果會直接寫進成品(自動替換、批次改寫),請明確傳 source=curated。詞卡回應的 relation_counts 會逐詞回報 curated 與 generated 各有多少, 可用於在介面上標示可信度。
04主題傳播的準確度
主題意象 theme 的原始標註只覆蓋約 8.3% 詞條。theme_scope=all 會把主題沿語義關係傳播到未標註的詞,合計覆蓋約19.8% —— 但傳播得來的部分約三成不準確。
| theme_scope | 涵蓋 | 準確度 | 適用 |
|---|---|---|---|
| tagged(預設) | 原始標註 8.3% | 高 | 精確檢索、自動化 |
| all | 合計 19.8% | 傳播部分約三成不準 | 擴大聯想、給人挑選 |
| inferred | 僅傳播結果 | 約三成不準 | 評估傳播效果 |
詞卡的 affect 把兩者分開列出(themes 與themes_inferred),不會混為一談 —— 請在介面上也保持這個區分。
05分類層的已知限制
48 個語義分類覆蓋 137,978 個詞條,但其中約 69%(95,755 個)的分類 僅憑模型生成的語義群推導而來,未經人工核對。內部抽樣顯示這部分的 明顯錯誤率約四成。
- 適合:作為給人挑選的候選池、作為粗略的主題分區、 配合
quality=true收窄到有釋義的常用詞。 - 不適合:當成分類真值直接驅動自動化決策 (例如自動打標籤、自動過濾內容)。
若你的用途需要更高可信度的分類,這正是 Enterprise 的 「AI 增強型語義分類」所處理的問題 —— 請來信洽談。
06據此選擇參數
| 你的用途 | 建議參數 |
|---|---|
| 給人挑選的候選清單 | 預設即可;可加 quality=true 讓常用詞優先 |
| 自動替換 / 批次改寫 | source=curated + theme_scope=tagged |
| 聲韻相關的一切 | 無須顧慮 —— 這一層覆蓋率 100% |
| 主題聯想 / 靈感發散 | theme_scope=all,但要讓使用者能否決 |
07持續維護
詞庫並非一次性成品 —— 詞條、語義關係、情感與主題標註持續維護、擴充與校正, 上述數字會隨版本提升。
GET
/api/lexicon/version可查詢目前版本標籤與完整統計。相容性政策與如何偵測版本變動,詳見變更記錄。
