Separate the clustered keyword list from the keywords to merge

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-08-17 22:38:30 +08:00
co-authored by Claude Opus 5
parent 04d5095e44
commit 5cf2b8ee8c
5 changed files with 164 additions and 46 deletions
+9 -7
View File
@@ -47,11 +47,12 @@ LLM。設計原則見 `research-plan.md`;本檔記載可重現的
實作本步,四種模型六次執行全部無法維持完整分割,
已棄用(詳見 `decision-log.md` 2026-08-05;棄用的
定義檔止於 git 歷史,見 `git log -- prompts/`)。
- **產物**:分群明細 CSV(欄位 Group、Keyword一列一個
成員,依兩欄排序)記錄機器算出的分割;定案碼表 JSON
`{"keywords": [...]}`)記錄實際交給模型的碼,即組名
加上先驗主題詞。兩者分開,因為前者是分群結果、後者
含研究者的介入。
- **產物**三份。分群明細 CSV(欄位 Group、Keyword
一列一個成員,依兩欄排序)記錄機器算出的分割;組名
純文字檔(一行一個,字典序)是分群結果的可讀清單;
定案碼表 JSON`{"keywords": [...]}`)記錄實際交給
模型的碼,即組名加上先驗主題詞。前兩份只含分群結果,
只有第三份含研究者的介入。
- **可重現性**:同一輸入、同一釘定模型、同一參數逐次
重現。不同 CPU/BLAS 實作的浮點尾數差異可能使邊界
詞的歸屬翻動,屬已揭露的限制;論文所用碼表逐字
@@ -114,8 +115,9 @@ LLM。設計原則見 `research-plan.md`;本檔記載可重現的
U+0085 等控制字元時,`str.splitlines()` 類的通用切行
會截斷 JSON 字串,實測踩中),輸出關鍵字純文字檔與
出處 CSV。
- **步驟 2-1 → 2-2**`cluster-keywords` 讀關鍵字純文字
檔,輸出分群明細 CSV 與定案碼表 JSON。
- **步驟 2-1 → 2-2**`cluster-keywords` 讀關鍵字
文字檔,輸出分群明細 CSV、組名純文字檔與定案碼表
JSON。
- **步驟 2-2 → 3 輸入檔**`export-llm-input --extras
<定案碼表>` 自工作儲存產出步驟 3 的輸入,每筆
`{"id": "song-<ID>", "content": <字串>}``content` 為