個人MTG資料研究進捗報告

2026年7月9日(木)  佐藤 真

01先週MTGにて

02本日共有内容

03スケジュール

04ご相談したい点

論文格子

タイトル

全体の流れ

内容
1. はじめに票が割れるペアへの依頼は無駄 → 依頼前フィルタリング。しかしコスト面の評価指標が未整備
2. 関連研究コスト削減の諸観点の中で「事前除外の評価」などを取り上げる
3. 問題設定コスト観点 = 支出(依頼率)と成果(保持率)の2軸で定義
4. 提案指標その2軸そのものである指標対「依頼率・保持率」
5. 実験既存指標(acc / F1)ではこの2量が定まらないことを全パターン列挙で証明
6. 考察反論への応答・一般性・適用範囲と限界
7. おわりにまとめ・今後の課題

概要

1はじめに

2関連研究

2.1アノテータ間不一致

2.2単一ラベルを要する用途

2.3アノテーションコストの削減

2.4分類器の評価指標

3問題設定

3.1依頼前フィルタリング

3.2データと一致の定義

図1 一致人数分布

3.3混同行列

予測 agree(依頼する) 予測 disagree(依頼しない)
真 agree
(11,743件)
TP:良問を依頼できた FN:良問を捨てた(機会損失
真 disagree
(8,257件)
FP:無駄な依頼(金銭損失 TN:無駄を正しく省いた

4提案指標:依頼率と保持率

4.1定義

4.2性質

4.3評価プロトコル

Feasible region: request rate vs retention rate

5実験:混同行列全パターンのシミュレーション

5.1実験設計

5.2到達領域の解析

5.3結果

図3 Request rate vs existing metrics (full confusion-matrix sweep)
図4 Retention rate vs existing metrics (full confusion-matrix sweep)
図5 Same accuracy, very different retention

5.4まとめ

6考察

6.1想定される反論への応答

6.2クラス比への依存と一般性

6.3実運用での利用場面

6.4適用範囲と限界

7おわりに

引用論文一覧

1 章・2.1(不一致と HLV)

論文 一言でいうと
Pavlick & Kwiatkowski (2019, TACL)NLI の不一致は繰り返し観測される内在的なもの(ノイズではない)と示した
Nie et al. (2020, EMNLP):ChaosNLI同一ペアに 100 人アノテーションしても意見分布が安定 = 不一致は本物
Plank (2022, EMNLP)HLV(Human Label Variation)という概念整理の総説・立場論文
Uma et al. (2021, JAIR)不一致から学ぶ手法(soft-label 等)のサーベイ
Leonardelli et al. (2023):SemEval-2023 Task 11 Le-Wi-Di不一致(の分布)自体を予測する共有タスク

2.2(単一ラベルを要する用途)

論文 一言でいうと
Northcutt et al. (2021, NeurIPS D&B)主要ベンチマークのテストセットにラベルエラーが蔓延し、修正するとモデル順位が変わり得る
Song et al. (2022, IEEE TNNLS)【候補】ラベルノイズ下の深層学習のサーベイ(曖昧・誤ラベルが学習を劣化させる根拠)
Daniel et al. (2018, ACM CSUR)【候補】クラウドソーシングの品質管理のサーベイ(テスト設問・ゴールド設問の慣行を含む)

2.3(コスト削減の諸観点)

論文 観点 一言でいうと
Settles (2009)【候補】選択能動学習のサーベイ(不確実な例を優先的に選んでラベル付けする枠組み)
Sheng et al. (2008, KDD)【候補】配分同じ例に何票集めるべきかの費用対効果分析(repeated labeling)
Gilardi et al. (2023, PNAS)【候補】代替LLM がクラウドワーカーよりテキストアノテーションを高精度にこなせる場合がある
Dawid & Skene (1979)事後管理複数回答からの真値推定(回答集約)の古典
Hovy et al. (2013, NAACL):MACE事後管理アノテータの信頼度を推定しながら回答集約
Weber-Genzel et al. (2024, ACL):VariErr NLI事後管理「本物の曖昧さ」と「アノテーションエラー」を事後に切り分ける
Swayamdipta et al. (2020, EMNLP):Dataset Cartography事後管理学習挙動から曖昧・難例をあぶり出す(アノテーション後の分析)

2.4(評価指標と運用のずれ)

論文 一言でいうと
Elkan (2001, IJCAI)【候補】cost-sensitive learning の基礎(FP と FN のコストが異なるとき最適判断が変わる)
Davis & Goadrich (2006, ICML)【候補】PR 曲線と ROC 曲線の関係(不均衡データでは PR が適切)
Saito & Rehmsmeier (2015, PLOS ONE)【候補】不均衡データで ROC が楽観的に見える問題の実証
Altman & Bland (1994, BMJ)【候補】検査の感度・特異度と有病率(陽性的中率は有病率に依存)= p 依存の古典的議論