Drop the source-provenance artifact from cluster-keywords

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-08-17 22:38:33 +08:00
co-authored by Claude Opus 5
parent f2a80475a5
commit 949a0f9c8d
5 changed files with 54 additions and 14201 deletions
+12 -15
View File
@@ -28,9 +28,7 @@ LLM。設計原則見 `research-plan.md`;本檔記載可重現的
兩次標註執行的全部關鍵字取聯集、逐字串精確去重、字典序
排列。失敗與拒答的記錄跳過(其歌曲不貢獻關鍵字);解析
時偵測重複鍵,違規即失敗。同時記出處(欄位 Keyword、
Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
出處記錄不進任何下游輸入。
時偵測重複鍵,違規即失敗。
### 分群
@@ -59,14 +57,13 @@ Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
實作本步,四種模型六次執行全部無法維持完整分割,
已棄用(詳見 `decision-log.md` 2026-08-05;棄用的
定義檔止於 git 歷史,見 `git log -- prompts/`)。
- **產物**份,前綴分別標示來源與結果。
`source-keywords.txt`(進池後的關鍵字,一行一個)
`source-provenance.csv`(出處)記錄進來的是什麼;
`result-keywords.txt`(組名,一一個)與
`groups.csv`(欄位 Group、Keyword,一列一個成員)
記錄算出來的分割;`keywords-to-merge.json`
- **產物**份,前綴分別標示來源與結果。
`source-keywords.txt`(進池後的關鍵字,一行一個)
記錄進來的是什麼;`result-keywords.txt`(組名,一行
一個)與 `groups.csv`(欄位 Group、Keyword,一一個
成員)記錄算出來的分割;`keywords-to-merge.json`
`{"keywords": [...]}`)是實際交給模型的碼,即組名
加上先驗主題詞——份中只有這一份含研究者的介入。
加上先驗主題詞——份中只有這一份含研究者的介入。
`meta.json` 記錄執行本身:進池的兩份執行歸檔與其有效
筆數、嵌入模型與釘定 revision、分群參數與組數、外加
的先驗詞、關鍵字總數,以及產生數字的套件版本。凡命令
@@ -117,10 +114,10 @@ Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
## 軌跡對映(診斷用)
沿收斂軌跡的機械對映:原始關鍵字 →(出處記錄)歌曲、
原始關鍵字 →(分群)組,純程式查表,決定性。以其結果
與步驟 3 直接編碼的差異率作為「收斂軌跡扭曲」的診斷量,
不作主結果。
沿收斂軌跡的機械對映:原始關鍵字 →(兩份標註執行歸檔的
`output.jsonl`)歌曲、原始關鍵字 →(分群)組,純程式查表,
決定性。以其結果與步驟 3 直接編碼的差異率作為「收斂軌跡
扭曲」的診斷量,不作主結果。
## 全管線的交接契約
@@ -136,7 +133,7 @@ Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
`output.jsonl`(一律以換行字元 `\n` 切行——歌詞含
U+0085 等控制字元時,`str.splitlines()` 類的通用切行
會截斷 JSON 字串,實測踩中),進池後直接分群,一次
產出上列份檔案。
產出上列份檔案。
- **步驟 2 → 3 輸入檔**`export-llm-input --extras
<定案碼表>` 自工作儲存產出步驟 3 的輸入,每筆
`{"id": "song-<ID>", "content": <字串>}``content` 為