Rebuild the vocabulary step on embeddings and drop the screen track
Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
This commit is contained in:
@@ -409,3 +409,33 @@
|
||||
唯 song-775 依既有裁定缺席。平台過濾器誤排除黑人
|
||||
女性歌手賦權國歌一事,本身記為研究發現,供論文討論
|
||||
平台結構性限制。
|
||||
- **詞彙表建構改用詞向量分群,棄用 LLM 收斂**:以 LLM
|
||||
單發把進池的 5,999 個關鍵字收斂為具名分組,四種模型
|
||||
六次執行全部未通過完整分割驗證(不漏、不發明、每詞恰
|
||||
一組、組名唯一),執行紀錄見 `run-costs.md`。診斷:在
|
||||
單一回應內維持 5,999 個詞的嚴格分割,超出現有模型的
|
||||
簿記容量(先導研究九百餘詞可行),非措辭、非模型檔次、
|
||||
非推理量所能補救。裁定:改以詞向量嵌入+確定性分群
|
||||
產生結構——完整分割由演算法保證、可逐位元組重現——
|
||||
LLM 僅保留其擅長的語言工作。連帶裁定:十三步複雜收斂
|
||||
演算法(兩次執行+逐對仲裁)的比較實驗取消,其 merge
|
||||
同為整池單發且需執行兩次,必撞同一容量牆;兩版定義檔
|
||||
止於 git 歷史(`git log -- prompts/`)。
|
||||
- **管線重設計為三步驟,取消 screen 軌,women-power 併入
|
||||
編碼詞彙表**:收斂改為確定性程序後,管線重整為步驟 1
|
||||
自由標註(2 次進池)→ 步驟 2 詞彙表建構(步驟 2-1
|
||||
進池、步驟 2-2 詞向量分群,皆確定性)→ 步驟 3 編碼
|
||||
(2+1)。連帶三項決定:(1) **編號的所指由定義檔改為
|
||||
研究程序的工序**——確定性的步驟 2 無定義檔仍佔一個
|
||||
編號;有無定義檔即「該步是否為 LLM 判斷」的可見標記。
|
||||
軌前綴(01/02 軌)隨 screen 軌取消而廢除。
|
||||
(2) **檔名與目錄名的補零只為排序**,正文一律寫
|
||||
「步驟 1」「步驟 3-2」。(3) **取消 women-power 單目標
|
||||
篩選軌**,改將該詞併入步驟 3 的定案詞彙表(50 個分群
|
||||
組名再加上該詞,共 51 碼)。理由:單目標提問會把該主題的
|
||||
顯著性人為抬高,「被放大檢視」的判斷無法與其他主題
|
||||
並比;併入後研究者的先驗主題詞與模型自行收斂出的類別
|
||||
(分群已自長出 `female-empowerment` 等組)在同一份
|
||||
提示詞、同一判斷體制下受檢,兩者落點差異本身即可報告
|
||||
的結果。代價:候選集召回由雙通道減為單通道,若實測
|
||||
召回不足再議。
|
||||
|
||||
Reference in New Issue
Block a user