Settle the coding by a majority of three runs instead of an arbitration

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
2026-08-17 22:38:34 +08:00
co-authored by Claude Opus 5
parent 7008e14972
commit c51c9d71e1
24 changed files with 101 additions and 1575 deletions
+19 -17
View File
@@ -13,13 +13,14 @@
- **執行原則**:主會話只做討論;所有分析由 deterministic script
執行。LLM 步驟以 Python script 呼叫 Anthropic Messages API
(個人 Console 帳號、Batch API 五折),定義檔逐字作為 system
prompt。2+1 協定適用於語料層的逐首判斷(編碼)
「同一定義檔獨立執行次+一次仲裁」,仲裁只裁程式算出
的分歧。自由生成步驟(自由標註)兩次執行全數進池、不
仲裁——自由詞彙兩次輸出不共享比對單位,無物可裁。詞彙
prompt。語料層的逐首判斷(編碼)採「同一定義檔獨立
執行次+多數決」:三次條件相同,某首歌的某個標籤
三次中至少兩次標出即收入定案,計票由確定性子命令
完成。自由生成步驟(自由標註)兩次執行全數進池——
自由詞彙兩次輸出不共享比對單位,無可計之票。詞彙
表建構不經 LLM,改由詞向量嵌入+確定性分群產生——詞彙
表是揭露的儀器選擇,非量測;信度檢驗施於編碼層(詳見
`methodology.md`)。仲裁或驗證結果不符預期則修訂定義檔
`methodology.md`)。驗證結果不符預期則修訂定義檔
重跑該循環。
- **提示詞只定格式、不定語意**:研究對象是通用 LLM 以其
網路語料知識背景所做的自然編碼,編碼結果本身是批判對象。
@@ -32,8 +33,8 @@
自足設計:同語料、同模型、僅提示不同,對照黃金標準。
其他工具性環節於階段 3 以校準樣本實測 Sonnet 4.6 vs Opus 5
的一致率後決定是否升級。
- **信度與效度分工**2+1 協定量測穩定性(intra-rater
reliability,報告一致率/kappa);效度靠理論 codebook 與
- **信度與效度分工**三次獨立執行量測穩定性(intra-rater
reliability,報告兩兩一致率/kappa);效度靠理論 codebook 與
人工黃金標準終審。可重現性定義為「程序透明+可稽核」:
公開定義檔、記錄 model ID 與執行時間、保存全部原始輸出。
@@ -93,7 +94,7 @@
1. **自由標註(步驟 1**:逐首歌請模型標註 thematic
keywords,附歌詞引述;提示零語意內容。獨立執行兩次,
兩次輸出全數進池(記錄執行別),不仲裁。粒度鎖定
兩次輸出全數進池(記錄執行別)。粒度鎖定
thematic keywords:前導研究三粒度比較(keywords 過碎、
themes 過早抽象)之繼承,於執行前鎖定,防止事後擇優。
2. **詞彙表建構(步驟 2**:兩次執行的關鍵字取聯集去重
@@ -102,9 +103,11 @@
演算法
結構保證。頻次不入收斂:頻率的分析角色由步驟 3 編碼
承擔;池中頻次含跨執行噪音。
3. **編碼(步驟 3**:以定稿詞彙表對全部歌曲 2+1 編碼
——模型讀歌詞、逐標籤附引述;逐首計一致率,分歧逐首
仲裁(仲裁者看歌詞與該標籤引述)。此為主儀器,
3. **編碼(步驟 3**:以定稿詞彙表對全部歌曲編碼——
模型讀歌詞、逐標籤附引述;同一定義檔獨立執行三次,
逐首計兩兩一致率,某首歌的某個標籤三次中至少兩次
標出即收入定案(`tally-codings` 計票,詳見
`methodology.md`)。此為主儀器,
「女性力量」候選集由此浮現;亦是對前導研究「映回後
未對照歌詞」限制的明文改良。沿收斂軌跡的機械對映
(純程式)保留為零成本診斷副產品,量測收斂軌跡的
@@ -121,9 +124,8 @@
定義檔命名 `prompts/<步>-<次步>-<task>.md`——步為研究
程序的工序序,次步為步內執行順序(僅一個執行時省略),
讀者依編號先後依循:01-tag.md、03-01-code.md
03-02-arbitration.md。檔名與目錄名補零只為排序,正文
一律寫「步驟 1」「步驟 3-2」。
讀者依編號先後依循:01-tag.md、03-code.md。檔名與目錄名
補零只為排序,正文一律寫「步驟 1」「步驟 3」。
編號的所指是工序而非定義檔,因此確定性的第 2 步雖無
定義檔仍佔一個編號,其歸檔為 `runs/02-cluster/`。檔名不帶
版本號——版本即 git 歷史,失敗的版本不保留,需要回看的
@@ -137,11 +139,11 @@
|---|---|---|---|
| 0 | 基礎建設:git init、目錄結構、.gitignore、決策日誌、runner script(含 Batch API)、codebook v0 骨架 | script + 討論 | 7/307/31 |
| 1 | 資料準備:`run_llm` 改走統一設定 → `build-db`(解析榜單成 songs/chart_entries/artists/song_artists)→ `import-lyrics`pilot 20182025)→ `fetch-lyrics`201617 與缺漏,Lyrics.ovh / LRCLIB)→ `fetch-artists`Wikidata 快照)→ `export-llm-input` | 子命令 | 7/318/3 |
| 2 | 自然編碼管線:tag ×2 進池 → 詞向量分群 k=100 → 併入 women-power → 詞彙表定稿 → code 2+1(全 883 首,附引述) | API + script | 8/48/7 |
| 2 | 自然編碼管線:tag ×2 進池 → 詞向量分群 k=100 → 併入 women-power → 詞彙表定稿 → code ×3 進多數決(全 883 首,附引述) | API + script | 8/48/7 |
| 3 | 黃金標準:依 codebook 人工逐首判定 genuine/peripheral/fake,附引用歌詞證據表(LLM 只做摘錄,不給判定建議);先以 10–15 首校準樣本試編並修訂 codebook 後凍結;同批校準樣本實測 Sonnet 4.6 vs Opus 5 一致率 | 人工 + script 輔助 | 8/58/9 |
| 4 | 受控比較(盲點實驗):條件 A(詞彙層提示)vs 條件 B(框架感知提示),各 2+1,對照黃金標準計算假陽/假陰率 | API | 8/88/11 |
| 4 | 受控比較(盲點實驗):條件 A(詞彙層提示)vs 條件 B(框架感知提示),各 ×3 進多數決,對照黃金標準計算假陽/假陰率 | API | 8/88/11 |
| 4' | 映射分析:自然編碼結果(第 4 步)與黃金標準交叉表;軌跡對映 vs 直接編碼的扭曲診斷(分析方法先寫入 methodology.md 再看結果) | script | 與 4 並行 |
| 5 | pussy 修辭分析:script 找含詞歌曲 → LLM 分類(METONYM/ANATOMICAL/COWARD/OTHER + 說話者/指涉對象)2+1 → 人工核定 | script + API | 8/98/11 |
| 5 | pussy 修辭分析:script 找含詞歌曲 → LLM 分類(METONYM/ANATOMICAL/COWARD/OTHER + 說話者/指涉對象)×3 → 人工核定 | script + API | 8/98/11 |
| 6 | 統計與圖表:一致率(kappa)、污染率、類型分布、年度趨勢、映射交叉表 | scripts | 8/118/12 |
| 7 | 撰寫全文+內部審稿(subagent 以審稿人視角挑毛病,特別是嘻哈女性主義/respectability politics 一題) | 討論 + subagent | 8/118/14 |