| 章 | 内容 |
|---|---|
| 1. はじめに | 票が割れるペアへの依頼は無駄 → 依頼前フィルタリング。しかしコスト面の評価指標が未整備 |
| 2. 関連研究 | コスト削減の諸観点の中で「事前除外の評価」などを取り上げる |
| 3. 問題設定 | コスト観点 = 支出(依頼率)と成果(保持率)の2軸で定義 |
| 4. 提案指標 | その2軸そのものである指標対「依頼率・保持率」 |
| 5. 実験 | 既存指標(acc / F1)ではこの2量が定まらないことを全パターン列挙で証明 |
| 6. 考察 | 反論への応答・一般性・適用範囲と限界 |
| 7. おわりに | まとめ・今後の課題 |
| 予測 agree(依頼する) | 予測 disagree(依頼しない) | |
|---|---|---|
| 真 agree (11,743件) |
TP:良問を依頼できた | FN:良問を捨てた(機会損失) |
| 真 disagree (8,257件) |
FP:無駄な依頼(金銭損失) | TN:無駄を正しく省いた |
| 論文 | 一言でいうと |
|---|---|
| Pavlick & Kwiatkowski (2019, TACL) | NLI の不一致は繰り返し観測される内在的なもの(ノイズではない)と示した |
| Nie et al. (2020, EMNLP):ChaosNLI | 同一ペアに 100 人アノテーションしても意見分布が安定 = 不一致は本物 |
| Plank (2022, EMNLP) | HLV(Human Label Variation)という概念整理の総説・立場論文 |
| Uma et al. (2021, JAIR) | 不一致から学ぶ手法(soft-label 等)のサーベイ |
| Leonardelli et al. (2023):SemEval-2023 Task 11 Le-Wi-Di | 不一致(の分布)自体を予測する共有タスク |
| 論文 | 一言でいうと |
|---|---|
| Northcutt et al. (2021, NeurIPS D&B) | 主要ベンチマークのテストセットにラベルエラーが蔓延し、修正するとモデル順位が変わり得る |
| Song et al. (2022, IEEE TNNLS)【候補】 | ラベルノイズ下の深層学習のサーベイ(曖昧・誤ラベルが学習を劣化させる根拠) |
| Daniel et al. (2018, ACM CSUR)【候補】 | クラウドソーシングの品質管理のサーベイ(テスト設問・ゴールド設問の慣行を含む) |
| 論文 | 観点 | 一言でいうと |
|---|---|---|
| Settles (2009)【候補】 | 選択 | 能動学習のサーベイ(不確実な例を優先的に選んでラベル付けする枠組み) |
| Sheng et al. (2008, KDD)【候補】 | 配分 | 同じ例に何票集めるべきかの費用対効果分析(repeated labeling) |
| Gilardi et al. (2023, PNAS)【候補】 | 代替 | LLM がクラウドワーカーよりテキストアノテーションを高精度にこなせる場合がある |
| Dawid & Skene (1979) | 事後管理 | 複数回答からの真値推定(回答集約)の古典 |
| Hovy et al. (2013, NAACL):MACE | 事後管理 | アノテータの信頼度を推定しながら回答集約 |
| Weber-Genzel et al. (2024, ACL):VariErr NLI | 事後管理 | 「本物の曖昧さ」と「アノテーションエラー」を事後に切り分ける |
| Swayamdipta et al. (2020, EMNLP):Dataset Cartography | 事後管理 | 学習挙動から曖昧・難例をあぶり出す(アノテーション後の分析) |
| 論文 | 一言でいうと |
|---|---|
| Elkan (2001, IJCAI)【候補】 | cost-sensitive learning の基礎(FP と FN のコストが異なるとき最適判断が変わる) |
| Davis & Goadrich (2006, ICML)【候補】 | PR 曲線と ROC 曲線の関係(不均衡データでは PR が適切) |
| Saito & Rehmsmeier (2015, PLOS ONE)【候補】 | 不均衡データで ROC が楽観的に見える問題の実証 |
| Altman & Bland (1994, BMJ)【候補】 | 検査の感度・特異度と有病率(陽性的中率は有病率に依存)= p 依存の古典的議論 |