Record the provenance and status of the pilot study
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
This commit is contained in:
@@ -899,3 +899,16 @@
|
|||||||
展延一至二日與剩餘撰寫工作。仍然有效的原則(先導不
|
展延一至二日與剩餘撰寫工作。仍然有效的原則(先導不
|
||||||
比較、提示只定格式、歌手背景防火牆、commit 判準、
|
比較、提示只定格式、歌手背景防火牆、commit 判準、
|
||||||
版權規則)保留。
|
版權規則)保留。
|
||||||
|
|
||||||
|
## 2026-08-17
|
||||||
|
|
||||||
|
- **先導研究的地位另立常設紀錄 `docs/pilot-study.md`**:論文
|
||||||
|
交件後重讀投稿摘要,認清先導研究係由當時協作的 Claude Code
|
||||||
|
設計並執行,研究者檢視的是研究問題與答案,未逐步檢視中間
|
||||||
|
過程;摘要中的具體數字未經稽核,亦無歸檔可回溯。此地位
|
||||||
|
先前僅零星散見於本日誌各條(歌詞沿用、women-power 來歷
|
||||||
|
考據、粒度繼承、簿記容量),投稿摘要本身則只是產物,不足以
|
||||||
|
記述過程。裁定:另立 `docs/pilot-study.md`,完整記述先導
|
||||||
|
研究的執行方式、沿用與棄用的成果,以及它如何促成正式研究
|
||||||
|
的可稽核設計;投稿摘要不於樹中另存副本,其內容留在 git
|
||||||
|
歷史(`paper/abstract.md` 的前身)。
|
||||||
|
|||||||
@@ -0,0 +1,107 @@
|
|||||||
|
# 先導研究的來歷與地位
|
||||||
|
|
||||||
|
(2026-08-17 認清並記錄。本檔記述正式研究之前的先導研究:
|
||||||
|
它做了什麼、研究者檢視到哪一層、哪些成果被沿用、哪些被
|
||||||
|
棄用,以及它如何促成正式研究的設計。散見於
|
||||||
|
`decision-log.md` 的相關條目在文中逐一指出。)
|
||||||
|
|
||||||
|
## 一、先導研究是什麼
|
||||||
|
|
||||||
|
正式研究之前,研究者曾以 Claude Code 對 Billboard Year-End
|
||||||
|
Hot 100(2018–2025、684 首)的歌詞做過一輪探索性分析,檢視
|
||||||
|
「女性力量」語彙的使用狀況,並附帶分析 pussy 一詞作為女性
|
||||||
|
代稱的修辭。2026 年 8 月投出的研討會摘要即根據該輪分析撰寫。
|
||||||
|
|
||||||
|
## 二、它實際的執行方式
|
||||||
|
|
||||||
|
**研究問題與方向由研究者提出**:女性力量語彙被父權框架取用、
|
||||||
|
pussy 作為代稱的跨性別使用,都是研究者長期關注的問題。
|
||||||
|
|
||||||
|
**設計與執行由 Claude Code 進行**:分析管線、分類架構(genuine
|
||||||
|
/peripheral/fake 三分類)、五種「假女性力量」類型、以及
|
||||||
|
frame-aware 提示修正實驗,均由當時協作的 Claude Code 設計並
|
||||||
|
執行。
|
||||||
|
|
||||||
|
**研究者檢視的是問題與答案,不是中間過程**:研究者確認研究
|
||||||
|
問題的方向正確、答案值得追究,即據以投稿;分類類目如何產生、
|
||||||
|
提示詞如何下、數字如何算出,並未逐步檢視。投稿摘要中的具體
|
||||||
|
數字(如「44% 屬於假女性力量」、62 首的三分類、53 首的 pussy
|
||||||
|
修辭分類、假率由 44% 降至 5% 以下)研究者未曾稽核,其產生
|
||||||
|
過程亦無歸檔可回溯。
|
||||||
|
|
||||||
|
**當時的判斷**:投稿未上即罷;若上,正式研究由研究者自行
|
||||||
|
設計與執行。事實上正式研究即是如此重做的。
|
||||||
|
|
||||||
|
## 三、被沿用的成果
|
||||||
|
|
||||||
|
- **歌詞捕捉檔**:先導研究蒐集的 lyrics.json(684 首,
|
||||||
|
2018–2025)以私人腳本(不入版本庫)匯入歌詞快取,只取
|
||||||
|
識別欄位與歌詞本文,先導的分析欄位一概不匯入;出處記於
|
||||||
|
`data/captures/lyrics-provenance.csv`,method 欄標
|
||||||
|
`pilot-import`(見 `decision-log.md` 2026-07-31、08-02 條)。
|
||||||
|
- **假說方向**:女性力量語彙的挪用與污染,成為正式研究的
|
||||||
|
研究問題。
|
||||||
|
- **粒度選擇**:正式研究鎖定 thematic keywords 這一粒度,
|
||||||
|
係繼承先導研究三種粒度的比較結果(keywords 過碎、themes
|
||||||
|
過早抽象),且於執行前鎖定以防事後擇優。
|
||||||
|
- **`women-power` 一詞的來歷**:考據先導研究的 local agent
|
||||||
|
存檔可知,其第一步指令含數十個範例 thematic keywords,
|
||||||
|
其中即有 women-power——為當時協作的 Claude Code 依研究者
|
||||||
|
長期表達的關注主動加入(研究者端播種,非明示指定);先導
|
||||||
|
的標籤 `women-power-and-empowerment` 則是第三步強制合併
|
||||||
|
兩個關鍵字的管線人工產物。正式研究的探針因此指向被播種的
|
||||||
|
本詞 `women-power`,不用合併假影(見 `decision-log.md`
|
||||||
|
2026-08-04 條)。**附帶認清:先導第一步並非零語意提示,
|
||||||
|
此即正式研究「提示詞只定格式、不定語意」設計所矯正者。**
|
||||||
|
- **簿記容量的教訓**:先導研究九百餘詞可以在單一回應內完成
|
||||||
|
分組,正式研究的 5,999 個關鍵字則四種模型六次執行全部未
|
||||||
|
通過完整分割驗證,遂改用詞向量嵌入+確定性分群(見
|
||||||
|
`decision-log.md` 2026-08-06 條)。
|
||||||
|
|
||||||
|
## 四、被棄用的成果
|
||||||
|
|
||||||
|
以下先導研究的產物未進入正式研究,論文亦未引用:
|
||||||
|
|
||||||
|
- **genuine/peripheral/fake 三分類與「44% 假女性力量」**:
|
||||||
|
構念與分母皆與正式研究不同(正式研究為 145 首女性力量群
|
||||||
|
歌曲中 111 首有性別問題),兩者不可對讀。
|
||||||
|
- **五種「假女性力量」類型(A–E)**:正式研究改由儀器分三個
|
||||||
|
發話脈絡各自歸納,得 43 條問題樣態(`results/patterns.csv`)。
|
||||||
|
- **pussy 一詞的修辭分類**:正式研究範圍收斂至語彙的挪用與
|
||||||
|
污染,未納入。
|
||||||
|
- **frame-aware(框架感知)提示修正法**:先導研究以框架判準
|
||||||
|
寫進提示以提高準確率;正式研究刻意不定義編碼,因為研究
|
||||||
|
對象正是 LLM 未受引導的自然編碼——把框架寫進提示,即無法
|
||||||
|
再以其輸出為批判對象。兩者的設計方向相反,故未沿用。
|
||||||
|
- **三個獨立 LLM subagent+人工仲裁的流程**:正式研究改以
|
||||||
|
Anthropic API 逐首獨立呼叫,原因是實測證實 subagent 會繼承
|
||||||
|
CLAUDE.md 與環境資訊,context 無法僅憑定義檔重現(見
|
||||||
|
`decision-log.md` 2026-07-30 條)。
|
||||||
|
|
||||||
|
## 五、它如何促成正式研究的設計
|
||||||
|
|
||||||
|
先導研究的根本限制不在結論對錯,而在**不可稽核**:沒有定義檔
|
||||||
|
快照、沒有原始輸出歸檔、沒有參數紀錄,因此任何一個數字都無法
|
||||||
|
回溯到產生它的那一次執行。正式研究的幾項設計正是針對這一點:
|
||||||
|
|
||||||
|
- 所有 LLM 步驟改以 API script 執行,每次執行自我完備歸檔於
|
||||||
|
`runs/`(定義檔快照、原始輸出、model ID 與參數、批次 ID、
|
||||||
|
token 用量);
|
||||||
|
- 可逐項機械比對的判斷採三次執行+多數決,並量測其穩定性
|
||||||
|
(見 `reliability.md`);
|
||||||
|
- 定義檔只規定任務形狀,不給主題定義、判準或範例;
|
||||||
|
- 每一筆編碼必附歌詞引述,供逐筆查核;
|
||||||
|
- 輸出的契約遵從另行查核(見 `output-validation.md`)。
|
||||||
|
|
||||||
|
換言之,正式研究對 LLM 輸出所採取的「不信任、須查核」立場,
|
||||||
|
其第一個案例就是先導研究本身。
|
||||||
|
|
||||||
|
## 六、現存的紀錄
|
||||||
|
|
||||||
|
- 投稿時的先導研究摘要:已於 git 歷史中(`paper/abstract.md`
|
||||||
|
的前身),樹中不另存副本——摘要只是產物,不足以記述過程,
|
||||||
|
故另立本檔。
|
||||||
|
- 先導研究的歌詞捕捉檔沿用事實:`data/captures/lyrics-provenance.csv`。
|
||||||
|
- 相關決策條目:`decision-log.md` 2026-07-30(不與先導比較、
|
||||||
|
不用 subagent)、07-31 與 08-02(歌詞沿用與私人匯入腳本)、
|
||||||
|
08-04(women-power 來歷考據)、08-06(詞彙表改用詞向量分群)。
|
||||||
@@ -96,6 +96,7 @@ pop-fem-audit/
|
|||||||
│ ├── decision-log.md # 決策日誌:每次改定義檔的原因
|
│ ├── decision-log.md # 決策日誌:每次改定義檔的原因
|
||||||
│ ├── run-costs.md # 每次執行的 token 用量與費用
|
│ ├── run-costs.md # 每次執行的 token 用量與費用
|
||||||
│ ├── reliability.md # 信度:量測方式與結果
|
│ ├── reliability.md # 信度:量測方式與結果
|
||||||
|
│ ├── pilot-study.md # 先導研究的來歷與地位
|
||||||
│ └── methodology.md # 方法細節(全文方法節底稿;
|
│ └── methodology.md # 方法細節(全文方法節底稿;
|
||||||
│ # 映射分析方法須在看結果前寫定)
|
│ # 映射分析方法須在看結果前寫定)
|
||||||
└── paper/
|
└── paper/
|
||||||
|
|||||||
Reference in New Issue
Block a user