粵語聲韻 × 語義
檢索基礎設施
收錄 230,317 個詞條與 836,004 條語義關係, 粵拼與協音碼覆蓋率 100%,並持續維護與擴充。 有別於一般粵語詞典 API,本服務可於單一查詢中同時約束 逐位聲調、押韻、語義分類、情緒與語域 —— 亦即粵語歌詞創作實際所需的多維交集。
即時試用:多維交集查詢
以下為即時呼叫本服務之結果,並非預錄示例。 以「植物類 × 悲傷 × 雙字詞」為例 —— 此類交集查詢為本服務所獨有。
能力範圍
換字:語義 × 聲韻同時約束
歌詞創作中最頻繁的動作是換字—— 在不損原意的前提下,找到符合當前旋律的替代詞。 一般詞典 API 只能返回同義詞清單,無法約束聲調; 本服務可於同一查詢中同時指定語義關係與協音條件。
關係來源可經 source 區分:curated 為 WordNet 人工基底(89,010 條),generated 為大型模型生成(746,994 條)。 回應中每個詞條亦標示其來源,可自行決定採信範圍。
方案
- 每日 24,000 個不重複詞條(16 倍)
- 提高每分鐘速率上限
- 每頁最多 100 筆
- 深層分頁
- 每日 60,000 個不重複詞條(40 倍)
- 工作流端點(倒字修正/韻腳收句)
- 每頁最多 200 筆
- 資料版本鎖定
- 每日 135,000 個不重複詞條(90 倍)
- 工作流端點
- 更高每分鐘速率上限
- 適合多產品線或代理商
各方案之差異以每日不重複詞條配額為主軸, 而非請求次數:配額才是實際上限,其目的在於防止詞庫遭逐頁擷取,而非限制正常使用。 同一詞條於同日內重複查詢僅計一次,故一般應用甚少觸及上限。可隨時透過 GET /api/lexicon/usage 查詢即時用量。企業方案請透過 來信 與我們聯絡。
資料品質申報
各維度覆蓋率差異甚大。我們於此主動列明,供貴方在導入前評估是否符合用途, 毋須事後自行查核。詞條與語義關係持續維護、開發與補充中, 以下數字為現階段實測值,會隨版本更新而提升。
| 維度 | 覆蓋 | 注意 |
|---|---|---|
| 讀音 · 協音碼 · 押韻 | 100% | 由演算法推導,不涉第三方權利 |
| 釋義 | 76% | — |
| 同義 / 反義 | 54% 詞條 | 約 89% 由大型模型生成;可設 source=curated 僅取人工基底 |
| 語義分類 | 137,978 詞條 | 其中 42,223 個有 WordNet 佐證;餘者僅由自鑄義群推得,現正裁決清洗中 |
| 主題意象 | 8.3% | 設 theme_scope=all 可達 19.8%,惟推測部分約三成不準確 |
| 語域 / 情緒 | 20.5% / 13.4% | 屬輔助維度,不宜作為主要篩選條件 |
持續開發
本詞庫並非一次性成品。詞條、語義關係、情感與主題標註 持續維護、擴充與校正。現正進行中的工作包括:自鑄語義群之逐條裁決與清洗 (已完成抽樣審計,並據此新增裁決流程)、形容詞語義類細分、 主題意象標註擴充、上下位(概念層級)關係補完,以及粵語特有詞條之增補。
資料以版本發行, GET /api/lexicon/version 可查詢目前版本;Studio 及以上方案可鎖定特定版本, 確保線上行為不因資料更新而變動,待貴方驗證後再自行升版。
開始整合
官方 TypeScript 與 Python SDK 隨發行包提供。資料來源與授權詳見 鳴謝與授權
