Trim the docs to their own jobs

The methodology keeps only the method that reaches the paper's
conclusions; the research plan becomes the proposal minus its
externalized method chapter; the standing rules move to a
Chinese conventions.md; the project-structure inventory, a
hand-kept mirror of the tree itself, is deleted.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
2026-08-19 20:01:54 +08:00
co-authored by Claude Opus 5
parent e1e2c86661
commit 7a625d50fc
7 changed files with 202 additions and 549 deletions
+4 -15
View File
@@ -1,8 +1,7 @@
# 信度:量測方式與結果
2026-08-16 量測。對象為步驟 3a 的三份執行歸檔
`runs/3a-code/run1``run3`,與步驟 5d 的三份執行歸檔
`runs/5d-annotate/run1``run3`;數字由原始輸出直接計算。)
2026-08-16 量測。對象為步驟 3a 與步驟 5d 各三次執行的
原始輸出;數字由原始輸出直接計算。)
## 一、本研究的信度是什麼
@@ -34,11 +33,7 @@ Krippendorff 依產生資料的設計,把信度分成三型
**精密度(precision)**,而**準確度(accuracy)** 未經量測。
若儀器是確定性的,重複性無須量測;但 LLM 不是——同樣的提示、
同樣的輸入,三次會給出不同結果,因此重複性是必須報告的儀器
規格,而非慣例儀式
這一點與 LLM 標註的近期文獻一致:同一模型重複取樣量測的是
自我一致性(self-consistency),而重複執行後取多數決可提升
標註穩定度(如 Prompt Stability Scoring,arXiv:2407.02039)。
規格。
## 二、三個常用指標
@@ -106,7 +101,7 @@ Jaccard(只看「有標到」的格子,忽略雙方都沒標的)約 0.89–0.91,
比百分比一致率低而更誠實——因為 82% 的格子是雙方都判「無」,
那些一致並不費力。
## 四、隨機性的規模與三票制的作用
## 四、隨機性的規模
信度數字回答的實際問題是:**這台儀器的隨機性,大到會不會
改變結論?**
@@ -116,12 +111,6 @@ Jaccard(只看「有標到」的格子,忽略雙方都沒標的)約 0.89–0.91,
一半會成為誤收、另一半會成為漏收。三票多數決把兩票以上者
收入、一票者剔除,處理的正是這一批。
三票制並非消除隨機性,而是**把隨機性往案例原本的傾向推**。
設某個邊緣案例的符合程度為 p,單次執行以機率 p 標出,三次
多數決則以 p³+3p²(1p) 標出:p=0.9 者由 0.9 提高到 0.972,
p=0.1 者由 0.1 壓低到 0.028,而 p=0.5 者仍是 0.5——真正
模稜兩可的案例,任何票制都救不了。
以此規模判斷,結論層的三條帶狀結構(女性力量與陽剛群共現、
與脆弱群互斥、與厭女群獨立)不可能由這個量級的雜訊翻轉。
反過來說,若一致率只有 0.6,同一組結論就不能採信——信度