# 研究步驟規劃 (2026-07-30 討論定案;2026-08-15 依執行現況全面改寫, 舊版規劃見 git 歷史;歷次變更與理由記於 `decision-log.md`, 程序細節見 `methodology.md`) ## 總體框架 - **研究敘事**:全文為獨立完整的正式研究(2016–2025 十年 語料共 1000 筆榜單紀錄、883 首歌,凍結程序後全量執行), **不與先導研究做比較**; 全文數字一律以正式研究結果為準。先導研究僅作為假說的 內部來源,記於決策日誌,不進入論文敘事。 - **執行原則**:主會話只做討論,分析一律由確定性程序 執行。可逐項機械比對的判斷(步驟 3 編碼、步驟 4 選群、 步驟 5d 樣態標註)採「三次獨立執行+多數決」定案, 自由生成(步驟 1 自由標註)採兩次執行全數進池,步驟 5a 至 5c 定為質性閱讀協定;程序細節見 `methodology.md`, 工作規範見 `conventions.md`。 - **提示詞只定格式、不定語意**:研究對象是通用 LLM 以其 網路語料知識背景所做的自然編碼與閱讀,其結果本身是 批判對象。定義檔只規定任務形狀(輸入、數量範圍、輸出 格式),不給任何主題的定義、判準或範例。LLM 判斷一律 要求逐項引述歌詞原句,作為檢視偏差的依據。 - **模型**:步驟 1、3 用 `claude-sonnet-4-6`;步驟 4、5 用 `claude-fable-5`——實測發現 sonnet 將「Women Power」 拆讀為 women+power 的組合語意,fable-5 讀為詞彙化 概念,語意層任務因此換用 fable-5(經過見決策日誌)。 - **信度與效度**:三次獨立執行量測穩定性(intra-rater reliability,可報告兩兩一致率);封閉母體全量檢查取代 抽樣防衛。可重現性定義為「程序透明+可稽核」:公開定義 檔、記錄 model ID 與執行時間、保存全部原始輸出。 ## 範圍性定案 - **歌手背景防火牆**:歌手背景資料只進人工解讀階段, **絕不進 LLM 輸入**——LLM 任務的 user message 維持 歌詞-only 或管線中間產物-only,避免光環偏誤。 - **Pilot 歌詞沿用**:先導歌詞沿用之來歷與細節詳見該檔 (`pilot-study.md`)。 ## 分析管線(五步驟,全部完成) 1. **自由標註(步驟 1)**:逐首歌請模型標註 thematic keywords,附歌詞引述;提示零語意內容。獨立執行兩次, 兩次輸出全數進池。 2. **詞彙表建構(步驟 2)**:聯集去重後以句向量模型嵌入、 階層式聚合分群 k=100,組名取 medoid;再併入研究者先驗 主題詞 `women-power`(據實揭露的儀器介入),共 101 碼。 3. **編碼(步驟 3)**:以定稿詞彙表對全 883 首編碼,逐 標籤附引述,×3+多數決,產出定案編碼表。「女性力量」 候選集(wp 66 首、fe 144 首、wp∪fe 145 首)由此浮現。 4. **語意編碼群(步驟 4)**:LLM 依編碼字面語意將 101 碼 選入研究者指定的四個主題群(women-power/misogyny/ masculine/vulnerable),×3+多數決,產出定案分群表; wp/fe 與各編碼、各編碼群之關聯統計(BH-FDR 校正)入 論文。 5. **女性主義問題之質性深讀(步驟 5)**:對 wp∪fe 145 首 ——5a 逐首盲讀(僅歌詞全文)×3;5b 逐首整合(收斂 註記、主清單限兩讀以上);5c 樣態統整(全體基底+ 男聲/女聲/混合三個發話脈絡分組);5d 樣態標註—— 以分組樣態表逐首標註「有問題」的 111 首,×3+多數決, 產出定案樣態表與歌×樣態定案矩陣。 ## 時程與剩餘工作 - 全文截稿 2026-08-15;已向主辦致歉延後一至二日交件。 - 分析管線與定案表全部完成;剩餘為論文撰寫:「挪用與 污染」結論(步驟 5 素材已備)、信度說明、fe 與新自由 主義敘事之詮釋標註。