個人MTG資料研究進捗報告

2026年7月2日(木) 佐藤 真

論文構成案:アノテーションコスト観点からの不一致予測の評価指標

Abstractアブストラクト

  1. 背景
    • NLI アノテーションではアノテータ間不一致が生じ、近年は HLV (Human Label Variance) として複数解釈を保持する研究が進む。
  2. 問題
    • 一方、明確なラベルが必要な用途では曖昧なデータへの依頼はコストの無駄になるが、事前フィルタリングモデルの評価はコスト観点でなされていない。
  3. 提案
    • 依頼前フィルタリング運用に対応した指標対(保持率・削減率)を提案。
  4. 実験
    • MultiNLI 20,000件で二値分類・一致人数予測・LLM zero-shot を比較。
  5. 結果
    • NLI fine-tune モデルが保持率 0.83 で依頼を約32%削減でき、従来指標では見えないトレードオフを提案指標が可視化できることを示した。

01はじめに

02関連研究

2.1不一致・曖昧性のモデル化

2.2アノテーションの誤り・変動の検出

2.3アノテーションコスト削減

03問題設定と提案指標

3.1運用シナリオの定式化

予測
不一致と予測(除外) 一致と予測(依頼)
実際 不一致(陽性) TP(真陽性) FN(偽陰性)
一致(陰性) FP(偽陽性) TN(真陰性)

3.2指標の定義

R_agr = TNFP + TN
req_% = FN + TNTP + FP + TN + FN

3.3なぜ既存指標では不十分か

04実験設定

4.1データ

Agreement-count distribution (matched+mismatched)

count 5 count 4 count 3 count 2
件数 11743 4859 3045 353
share (%) 58.7% 24.3% 15.2% 1.8%

4.2一致の定義(閾値)

4.3タスク設計(2実験)

4.4モデル

4.5評価

05実験結果

実験1:直接二値分類

閾値 モデル acc f1_macro 不一致 disagree 一致 agree(主指標) 依頼率
RecallPrecisionF1 RecallPrecisionF1
閾値 4+4人以上 random(分布サンプリング) 0.7180.5000.1710.1700.1710.8290.8300.8300.829
DeBERTa-v3-base(NLI なし) 0.7830.5800.2600.3250.2890.8890.8550.8720.864
NLI DeBERTa-v3-base 0.7920.6530.4720.4030.4340.8570.8880.8720.801
Qwen3.5-9B(zero-shot) 0.6470.5140.3670.2020.2610.7040.8450.7680.692
閾値 5全員一致 random(分布サンプリング) 0.5160.5020.4200.4150.4170.5840.5890.5860.582
DeBERTa-v3-base(NLI なし) 0.6670.6460.5150.6150.5610.7730.6940.7320.654
NLI DeBERTa-v3-base 0.7100.6900.5580.6810.6130.8160.7240.7680.662
Qwen3.5-9B(zero-shot) 0.5850.5510.3710.4990.4250.7370.6250.6760.692

実験2:最大一致人数予測 (一致人数 2–5 を予測し、count= 5 のみ一致として二値化)

モデル 方式 acc f1_macro 不一致 disagree 一致 agree(主指標) MAE 依頼率
RecallPrecisionF1 RecallPrecisionF1
random(分布サンプリング) 0.5340.5200.4380.4360.4370.6010.6040.6020.7860.585
DeBERTa-v3-base(NLI なし) 回帰 0.5880.5880.6900.5010.5800.5160.7030.5950.6000.431
DeBERTa-v3-base(NLI なし) 分類 0.6530.6320.4990.5950.5430.7610.6840.7210.5480.654
NLI DeBERTa-v3-base 回帰 0.6870.6510.4400.6910.5370.8620.6860.7640.5150.737
NLI DeBERTa-v3-base 分類 0.7140.6930.5470.6960.6130.8320.7230.7740.4870.676
Qwen3.5-9B(direct) zero-shot 0.5680.5640.7950.4860.6030.4080.7390.5260.6200.324
Qwen3.5-9B(cot) zero-shot 0.6460.6280.5200.5780.5480.7340.6850.7090.7000.629
プロンプト戦略 概要 f1_macro f1_agree f1_disagree
cot 曖昧さを 1〜2 文推論させてから回答 0.6280.7090.548
distribution E/N/C の票の割れを予測 → 最大値を一致人数 0.6260.6860.566
fewshot 各人数(5/4/3/2)の例を 1 件ずつ提示 0.6240.6250.624
rubric 各人数の意味を明示したルーブリックを付与 0.5790.5320.626
direct 整数を 1 つ答えさせるだけ(最小ベースライン) 0.5640.5260.603

06考察

07適用範囲と Limitations

08まとめ

03今後