Raise the clustering to 100 groups

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-08-17 22:38:31 +08:00
co-authored by Claude Opus 5
parent 8cdeb3db2e
commit 15f1843cde
6 changed files with 55 additions and 14 deletions
+18 -6
View File
@@ -37,12 +37,24 @@ Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
- **嵌入**`sentence-transformers/all-mpnet-base-v2`
(釘定 revision),關鍵字的連字號先還原為空格再編碼,
輸出 768 維向量並 L2 正規化。
- **分群**:階層式聚合分群(Ward linkage),k=50。
向量既已正規化,歐氏距離與餘弦相似度單調對應Ward
在保持語意距離的同時給出大小平衡的分割。
- **分群**:階層式聚合分群(Ward linkage),k=100。
向量既已正規化,歐氏距離與餘弦相似度單調對應;三種
linkage 實測比較,Ward 於各個 k 的組內一致性均最高
average 與 complete 皆產生吞噬半數語料的巨大異質
組)。
- **組數的取捨**:k 太小則壓縮比過高,樹上層被迫併入
不相干的詞,組雖大而無主題(k=30 最大組 491 詞、
組內一致性 0.41,成員橫跨籃球、海灘、外星人綁架);
k 太大則人工難以通覽。定於 100,理由是實測顯示雜物櫃
組於此始裂解為有主題的組,且編碼實測未見碼數過多的
副作用(詞彙表外的碼歸零、僅一個碼零使用)。
- **組名**:取 medoid——與該組中心(成員向量均值後
正規化)餘弦相似度最高的成員詞。組名因此必為模型
自己產出過的關鍵字,非任何人事後撰寫。
自己產出過的關鍵字,非任何人事後撰寫。已知限制:
組越大越異質時,medoid 只是折衷詞,可能代表不了組內
內容(實測 `mutual-individuality` 組內一致 0.70 而
編碼從未使用);此類碼於結果中呈現為零使用,據實
報告,不事後改名。
- **取捨紀錄**:曾以 LLM 單發收斂(mergecap 兩步)
實作本步,四種模型六次執行全部無法維持完整分割,
已棄用(詳見 `decision-log.md` 2026-08-05;棄用的
@@ -62,8 +74,8 @@ Run、Song,一列一筆出現,依三欄排序),供收斂軌跡分析;
### women-power 的注入
定案詞彙表為 50 個分群組名再加上 `women-power` 一詞,
51 個碼。`women-power` 是研究者任意決定的先驗主題(即本
定案詞彙表為 100 個分群組名再加上 `women-power` 一詞,
共 101 個碼。`women-power` 是研究者任意決定的先驗主題(即本
論文的主題本身),不由資料產生,屬揭露的儀器介入。該詞
於執行時以 `--extra-keyword` 明示加入,不寫死在程式裏
——研究者的介入因此每次都出現在重現命令上,而非無聲