Record the clustering invocation in a meta file
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
+9
-3
@@ -59,14 +59,20 @@ Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
|
||||
實作本步,四種模型六次執行全部無法維持完整分割,
|
||||
已棄用(詳見 `decision-log.md` 2026-08-05;棄用的
|
||||
定義檔止於 git 歷史,見 `git log -- prompts/`)。
|
||||
- **產物**:五份,前綴分別標示來源與結果。
|
||||
- **產物**:六份,前綴分別標示來源與結果。
|
||||
`source-keywords.txt`(進池後的關鍵字,一行一個)與
|
||||
`source-provenance.csv`(出處)記錄進來的是什麼;
|
||||
`result-keywords.txt`(組名,一行一個)與
|
||||
`groups.csv`(欄位 Group、Keyword,一列一個成員)
|
||||
記錄算出來的分割;`keywords-to-merge.json`
|
||||
(`{"keywords": [...]}`)是實際交給模型的碼,即組名
|
||||
加上先驗主題詞。只有最後一份含研究者的介入。
|
||||
加上先驗主題詞——六份中只有這一份含研究者的介入。
|
||||
`meta.json` 記錄執行本身:進池的兩份執行歸檔與其有效
|
||||
筆數、嵌入模型與釘定 revision、分群參數與組數、外加
|
||||
的先驗詞、關鍵字總數,以及產生數字的套件版本。凡命令
|
||||
列上的選擇與環境事實皆在此,不記時間戳與輸入雜湊
|
||||
——前者使同環境重跑逐位元組可再生,後者只會重述 git
|
||||
已保證的事。
|
||||
- **可重現性**:同一輸入、同一釘定模型、同一參數逐次
|
||||
重現。不同 CPU/BLAS 實作的浮點尾數差異可能使邊界
|
||||
詞的歸屬翻動,屬已揭露的限制;論文所用碼表逐字
|
||||
@@ -130,7 +136,7 @@ Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
|
||||
`output.jsonl`(一律以換行字元 `\n` 切行——歌詞含
|
||||
U+0085 等控制字元時,`str.splitlines()` 類的通用切行
|
||||
會截斷 JSON 字串,實測踩中),進池後直接分群,一次
|
||||
產出上列五份檔案。
|
||||
產出上列六份檔案。
|
||||
- **步驟 2 → 3 輸入檔**:`export-llm-input --extras
|
||||
<定案碼表>` 自工作儲存產出步驟 3 的輸入,每筆
|
||||
`{"id": "song-<ID>", "content": <字串>}`,`content` 為
|
||||
|
||||
Reference in New Issue
Block a user