Raise the clustering to 100 groups
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -97,8 +97,9 @@
|
||||
thematic keywords:前導研究三粒度比較(keywords 過碎、
|
||||
themes 過早抽象)之繼承,於執行前鎖定,防止事後擇優。
|
||||
2. **詞彙表建構(步驟 2)**:兩次執行的關鍵字取聯集去重
|
||||
後,以句向量模型嵌入、階層式聚合分群,k=50,組名取
|
||||
medoid;進池與分群為同一個確定性子命令。完整分割由演算法
|
||||
後,以句向量模型嵌入、階層式聚合分群,k=100,組名取
|
||||
medoid;進池與分群為同一個確定性子命令。完整分割由
|
||||
演算法
|
||||
結構保證。頻次不入收斂:頻率的分析角色由步驟 3 編碼
|
||||
承擔;池中頻次含跨執行噪音。
|
||||
3. **編碼(步驟 3)**:以定稿詞彙表對全部歌曲 2+1 編碼
|
||||
@@ -110,7 +111,7 @@
|
||||
扭曲,不作主結果。
|
||||
|
||||
**先驗主題詞 `women-power` 併入詞彙表**:定案詞彙表為
|
||||
50 個分群組名再加上 `women-power`,共 51 個碼。該詞是
|
||||
100 個分群組名再加上 `women-power`,共 101 個碼。該詞是
|
||||
研究者任意決定的先驗主題,即本研究的論文主題本身,不由
|
||||
資料產生,屬據實揭露的儀器介入。不另設單目標篩選軌,理由是
|
||||
讓研究者的主題詞與模型自己收斂出的類別在同一份提示詞、
|
||||
@@ -136,7 +137,7 @@
|
||||
|---|---|---|---|
|
||||
| 0 | 基礎建設:git init、目錄結構、.gitignore、決策日誌、runner script(含 Batch API)、codebook v0 骨架 | script + 討論 | 7/30–7/31 |
|
||||
| 1 | 資料準備:`run_llm` 改走統一設定 → `build-db`(解析榜單成 songs/chart_entries/artists/song_artists)→ `import-lyrics`(pilot 2018–2025)→ `fetch-lyrics`(2016–17 與缺漏,Lyrics.ovh / LRCLIB)→ `fetch-artists`(Wikidata 快照)→ `export-llm-input` | 子命令 | 7/31–8/3 |
|
||||
| 2 | 自然編碼管線:tag ×2 進池 → 詞向量分群 k=50 → 併入 women-power → 詞彙表定稿 → code 2+1(全 883 首,附引述) | API + script | 8/4–8/7 |
|
||||
| 2 | 自然編碼管線:tag ×2 進池 → 詞向量分群 k=100 → 併入 women-power → 詞彙表定稿 → code 2+1(全 883 首,附引述) | API + script | 8/4–8/7 |
|
||||
| 3 | 黃金標準:依 codebook 人工逐首判定 genuine/peripheral/fake,附引用歌詞證據表(LLM 只做摘錄,不給判定建議);先以 10–15 首校準樣本試編並修訂 codebook 後凍結;同批校準樣本實測 Sonnet 4.6 vs Opus 5 一致率 | 人工 + script 輔助 | 8/5–8/9 |
|
||||
| 4 | 受控比較(盲點實驗):條件 A(詞彙層提示)vs 條件 B(框架感知提示),各 2+1,對照黃金標準計算假陽/假陰率 | API | 8/8–8/11 |
|
||||
| 4' | 映射分析:自然編碼結果(第 4 步)與黃金標準交叉表;軌跡對映 vs 直接編碼的扭曲診斷(分析方法先寫入 methodology.md 再看結果) | script | 與 4 並行 |
|
||||
|
||||
Reference in New Issue
Block a user