Trim the docs to their own jobs
The methodology keeps only the method that reaches the paper's conclusions; the research plan becomes the proposal minus its externalized method chapter; the standing rules move to a Chinese conventions.md; the project-structure inventory, a hand-kept mirror of the tree itself, is deleted. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
+4
-15
@@ -1,8 +1,7 @@
|
||||
# 信度:量測方式與結果
|
||||
|
||||
(2026-08-16 量測。對象為步驟 3a 的三份執行歸檔
|
||||
`runs/3a-code/run1`–`run3`,與步驟 5d 的三份執行歸檔
|
||||
`runs/5d-annotate/run1`–`run3`;數字由原始輸出直接計算。)
|
||||
(2026-08-16 量測。對象為步驟 3a 與步驟 5d 各三次執行的
|
||||
原始輸出;數字由原始輸出直接計算。)
|
||||
|
||||
## 一、本研究的信度是什麼
|
||||
|
||||
@@ -34,11 +33,7 @@ Krippendorff 依產生資料的設計,把信度分成三型
|
||||
**精密度(precision)**,而**準確度(accuracy)** 未經量測。
|
||||
若儀器是確定性的,重複性無須量測;但 LLM 不是——同樣的提示、
|
||||
同樣的輸入,三次會給出不同結果,因此重複性是必須報告的儀器
|
||||
規格,而非慣例儀式。
|
||||
|
||||
這一點與 LLM 標註的近期文獻一致:同一模型重複取樣量測的是
|
||||
自我一致性(self-consistency),而重複執行後取多數決可提升
|
||||
標註穩定度(如 Prompt Stability Scoring,arXiv:2407.02039)。
|
||||
規格。
|
||||
|
||||
## 二、三個常用指標
|
||||
|
||||
@@ -106,7 +101,7 @@ Jaccard(只看「有標到」的格子,忽略雙方都沒標的)約 0.89–0.91,
|
||||
比百分比一致率低而更誠實——因為 82% 的格子是雙方都判「無」,
|
||||
那些一致並不費力。
|
||||
|
||||
## 四、隨機性的規模與三票制的作用
|
||||
## 四、隨機性的規模
|
||||
|
||||
信度數字回答的實際問題是:**這台儀器的隨機性,大到會不會
|
||||
改變結論?**
|
||||
@@ -116,12 +111,6 @@ Jaccard(只看「有標到」的格子,忽略雙方都沒標的)約 0.89–0.91,
|
||||
一半會成為誤收、另一半會成為漏收。三票多數決把兩票以上者
|
||||
收入、一票者剔除,處理的正是這一批。
|
||||
|
||||
三票制並非消除隨機性,而是**把隨機性往案例原本的傾向推**。
|
||||
設某個邊緣案例的符合程度為 p,單次執行以機率 p 標出,三次
|
||||
多數決則以 p³+3p²(1−p) 標出:p=0.9 者由 0.9 提高到 0.972,
|
||||
p=0.1 者由 0.1 壓低到 0.028,而 p=0.5 者仍是 0.5——真正
|
||||
模稜兩可的案例,任何票制都救不了。
|
||||
|
||||
以此規模判斷,結論層的三條帶狀結構(女性力量與陽剛群共現、
|
||||
與脆弱群互斥、與厭女群獨立)不可能由這個量級的雜訊翻轉。
|
||||
反過來說,若一致率只有 0.6,同一組結論就不能採信——信度
|
||||
|
||||
Reference in New Issue
Block a user