Separate the clustered keyword list from the keywords to merge
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
+9
-7
@@ -47,11 +47,12 @@ LLM。設計原則見 `research-plan.md`;本檔記載可重現的
|
||||
實作本步,四種模型六次執行全部無法維持完整分割,
|
||||
已棄用(詳見 `decision-log.md` 2026-08-05;棄用的
|
||||
定義檔止於 git 歷史,見 `git log -- prompts/`)。
|
||||
- **產物**:分群明細 CSV(欄位 Group、Keyword,一列一個
|
||||
成員,依兩欄排序)記錄機器算出的分割;定案碼表 JSON
|
||||
(`{"keywords": [...]}`)記錄實際交給模型的碼,即組名
|
||||
加上先驗主題詞。兩者分開,因為前者是分群結果、後者
|
||||
含研究者的介入。
|
||||
- **產物**:三份。分群明細 CSV(欄位 Group、Keyword,
|
||||
一列一個成員,依兩欄排序)記錄機器算出的分割;組名
|
||||
純文字檔(一行一個,字典序)是分群結果的可讀清單;
|
||||
定案碼表 JSON(`{"keywords": [...]}`)記錄實際交給
|
||||
模型的碼,即組名加上先驗主題詞。前兩份只含分群結果,
|
||||
只有第三份含研究者的介入。
|
||||
- **可重現性**:同一輸入、同一釘定模型、同一參數逐次
|
||||
重現。不同 CPU/BLAS 實作的浮點尾數差異可能使邊界
|
||||
詞的歸屬翻動,屬已揭露的限制;論文所用碼表逐字
|
||||
@@ -114,8 +115,9 @@ LLM。設計原則見 `research-plan.md`;本檔記載可重現的
|
||||
U+0085 等控制字元時,`str.splitlines()` 類的通用切行
|
||||
會截斷 JSON 字串,實測踩中),輸出關鍵字純文字檔與
|
||||
出處 CSV。
|
||||
- **步驟 2-1 → 2-2**:`cluster-keywords` 讀關鍵字純文字
|
||||
檔,輸出分群明細 CSV 與定案碼表 JSON。
|
||||
- **步驟 2-1 → 2-2**:`cluster-keywords` 讀關鍵字池純
|
||||
文字檔,輸出分群明細 CSV、組名純文字檔與定案碼表
|
||||
JSON。
|
||||
- **步驟 2-2 → 3 輸入檔**:`export-llm-input --extras
|
||||
<定案碼表>` 自工作儲存產出步驟 3 的輸入,每筆
|
||||
`{"id": "song-<ID>", "content": <字串>}`,`content` 為
|
||||
|
||||
Reference in New Issue
Block a user