Record the provenance and status of the pilot study

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
2026-08-18 23:37:28 +08:00
co-authored by Claude Fable 5
parent 245b38c306
commit e3cca7e538
3 changed files with 121 additions and 0 deletions
+13
View File
@@ -899,3 +899,16 @@
展延一至二日與剩餘撰寫工作。仍然有效的原則(先導不 展延一至二日與剩餘撰寫工作。仍然有效的原則(先導不
比較、提示只定格式、歌手背景防火牆、commit 判準、 比較、提示只定格式、歌手背景防火牆、commit 判準、
版權規則)保留。 版權規則)保留。
## 2026-08-17
- **先導研究的地位另立常設紀錄 `docs/pilot-study.md`**:論文
交件後重讀投稿摘要,認清先導研究係由當時協作的 Claude Code
設計並執行,研究者檢視的是研究問題與答案,未逐步檢視中間
過程;摘要中的具體數字未經稽核,亦無歸檔可回溯。此地位
先前僅零星散見於本日誌各條(歌詞沿用、women-power 來歷
考據、粒度繼承、簿記容量),投稿摘要本身則只是產物,不足以
記述過程。裁定:另立 `docs/pilot-study.md`,完整記述先導
研究的執行方式、沿用與棄用的成果,以及它如何促成正式研究
的可稽核設計;投稿摘要不於樹中另存副本,其內容留在 git
歷史(`paper/abstract.md` 的前身)。
+107
View File
@@ -0,0 +1,107 @@
# 先導研究的來歷與地位
2026-08-17 認清並記錄。本檔記述正式研究之前的先導研究:
它做了什麼、研究者檢視到哪一層、哪些成果被沿用、哪些被
棄用,以及它如何促成正式研究的設計。散見於
`decision-log.md` 的相關條目在文中逐一指出。)
## 一、先導研究是什麼
正式研究之前,研究者曾以 Claude Code 對 Billboard Year-End
Hot 100(20182025、684 首)的歌詞做過一輪探索性分析,檢視
「女性力量」語彙的使用狀況,並附帶分析 pussy 一詞作為女性
代稱的修辭。2026 年 8 月投出的研討會摘要即根據該輪分析撰寫。
## 二、它實際的執行方式
**研究問題與方向由研究者提出**:女性力量語彙被父權框架取用、
pussy 作為代稱的跨性別使用,都是研究者長期關注的問題。
**設計與執行由 Claude Code 進行**:分析管線、分類架構(genuine
peripheral/fake 三分類)、五種「假女性力量」類型、以及
frame-aware 提示修正實驗,均由當時協作的 Claude Code 設計並
執行。
**研究者檢視的是問題與答案,不是中間過程**:研究者確認研究
問題的方向正確、答案值得追究,即據以投稿;分類類目如何產生、
提示詞如何下、數字如何算出,並未逐步檢視。投稿摘要中的具體
數字(如「44% 屬於假女性力量」、62 首的三分類、53 首的 pussy
修辭分類、假率由 44% 降至 5% 以下)研究者未曾稽核,其產生
過程亦無歸檔可回溯。
**當時的判斷**:投稿未上即罷;若上,正式研究由研究者自行
設計與執行。事實上正式研究即是如此重做的。
## 三、被沿用的成果
- **歌詞捕捉檔**:先導研究蒐集的 lyrics.json(684 首,
2018–2025)以私人腳本(不入版本庫)匯入歌詞快取,只取
識別欄位與歌詞本文,先導的分析欄位一概不匯入;出處記於
`data/captures/lyrics-provenance.csv`,method 欄標
`pilot-import`(見 `decision-log.md` 2026-07-31、08-02 條)。
- **假說方向**:女性力量語彙的挪用與污染,成為正式研究的
研究問題。
- **粒度選擇**:正式研究鎖定 thematic keywords 這一粒度,
係繼承先導研究三種粒度的比較結果(keywords 過碎、themes
過早抽象),且於執行前鎖定以防事後擇優。
- **`women-power` 一詞的來歷**:考據先導研究的 local agent
存檔可知,其第一步指令含數十個範例 thematic keywords,
其中即有 women-power——為當時協作的 Claude Code 依研究者
長期表達的關注主動加入(研究者端播種,非明示指定);先導
的標籤 `women-power-and-empowerment` 則是第三步強制合併
兩個關鍵字的管線人工產物。正式研究的探針因此指向被播種的
本詞 `women-power`,不用合併假影(見 `decision-log.md`
2026-08-04 條)。**附帶認清:先導第一步並非零語意提示,
此即正式研究「提示詞只定格式、不定語意」設計所矯正者。**
- **簿記容量的教訓**:先導研究九百餘詞可以在單一回應內完成
分組,正式研究的 5,999 個關鍵字則四種模型六次執行全部未
通過完整分割驗證,遂改用詞向量嵌入+確定性分群(見
`decision-log.md` 2026-08-06 條)。
## 四、被棄用的成果
以下先導研究的產物未進入正式研究,論文亦未引用:
- **genuineperipheralfake 三分類與「44% 假女性力量」**:
構念與分母皆與正式研究不同(正式研究為 145 首女性力量群
歌曲中 111 首有性別問題),兩者不可對讀。
- **五種「假女性力量」類型(A–E)**:正式研究改由儀器分三個
發話脈絡各自歸納,得 43 條問題樣態(`results/patterns.csv`)。
- **pussy 一詞的修辭分類**:正式研究範圍收斂至語彙的挪用與
污染,未納入。
- **frame-aware(框架感知)提示修正法**:先導研究以框架判準
寫進提示以提高準確率;正式研究刻意不定義編碼,因為研究
對象正是 LLM 未受引導的自然編碼——把框架寫進提示,即無法
再以其輸出為批判對象。兩者的設計方向相反,故未沿用。
- **三個獨立 LLM subagent+人工仲裁的流程**:正式研究改以
Anthropic API 逐首獨立呼叫,原因是實測證實 subagent 會繼承
CLAUDE.md 與環境資訊,context 無法僅憑定義檔重現(見
`decision-log.md` 2026-07-30 條)。
## 五、它如何促成正式研究的設計
先導研究的根本限制不在結論對錯,而在**不可稽核**:沒有定義檔
快照、沒有原始輸出歸檔、沒有參數紀錄,因此任何一個數字都無法
回溯到產生它的那一次執行。正式研究的幾項設計正是針對這一點:
- 所有 LLM 步驟改以 API script 執行,每次執行自我完備歸檔於
`runs/`(定義檔快照、原始輸出、model ID 與參數、批次 ID、
token 用量);
- 可逐項機械比對的判斷採三次執行+多數決,並量測其穩定性
(見 `reliability.md`);
- 定義檔只規定任務形狀,不給主題定義、判準或範例;
- 每一筆編碼必附歌詞引述,供逐筆查核;
- 輸出的契約遵從另行查核(見 `output-validation.md`)。
換言之,正式研究對 LLM 輸出所採取的「不信任、須查核」立場,
其第一個案例就是先導研究本身。
## 六、現存的紀錄
- 投稿時的先導研究摘要:已於 git 歷史中(`paper/abstract.md`
的前身),樹中不另存副本——摘要只是產物,不足以記述過程,
故另立本檔。
- 先導研究的歌詞捕捉檔沿用事實:`data/captures/lyrics-provenance.csv`
- 相關決策條目:`decision-log.md` 2026-07-30(不與先導比較、
不用 subagent)、07-31 與 08-02(歌詞沿用與私人匯入腳本)、
08-04(women-power 來歷考據)、08-06(詞彙表改用詞向量分群)。
+1
View File
@@ -96,6 +96,7 @@ pop-fem-audit/
│ ├── decision-log.md # 決策日誌:每次改定義檔的原因 │ ├── decision-log.md # 決策日誌:每次改定義檔的原因
│ ├── run-costs.md # 每次執行的 token 用量與費用 │ ├── run-costs.md # 每次執行的 token 用量與費用
│ ├── reliability.md # 信度:量測方式與結果 │ ├── reliability.md # 信度:量測方式與結果
│ ├── pilot-study.md # 先導研究的來歷與地位
│ └── methodology.md # 方法細節(全文方法節底稿; │ └── methodology.md # 方法細節(全文方法節底稿;
│ # 映射分析方法須在看結果前寫定) │ # 映射分析方法須在看結果前寫定)
└── paper/ └── paper/