個人MTG資料研究進捗報告

2026年9月24日(木)

01先週までの流れ

内容
目標 NLI のアノテータ不一致の原因を、アノテーション前に大分類(3クラス)で予測するモデルを構築する。現在は LLM(Qwen3.8-27B)の few-shot で精度改善を進めている
先週(9/17)
  • few-shot 例を「正解ラベルの組み合わせごとに 1例(計 5例)」から「小分類ごとに 1例(計 10例)」に変更
  • macro-F1 は 0.644 → 0.632 で改善せず
  • 精度が低い要因である Coreference の正解は 12件中 2件 → 3件で変わらず
今週(9/24)
  • few-shot 例ではなく LLM の回答の仕方を変え、改善するかを確かめる
8/27 からの流れ(全体)
報告 やったこと 結果 次回やると決めたこと
8/27 ① 小分類の10クラス分類(F1 0.3〜0.4)を大分類の3クラス分類に粗くする実験計画を立てた — 大分類の3クラス分類(マルチラベル)を実装し、実験する
9/3 ② 大分類の3クラス分類の実装と実験。random / BERT / DeBERTa(fine-tuning)/ Qwen3.8-27B(zero-shot・few-shot)× ガイドライン(なし・要約・全文) Qwen3.8-27B の few-shot(正解ラベルの組み合わせごとに 1例、計 5例)+ガイドライン全文が macro-F1 0.644 で最良。fine-tuning は 0.27〜0.40 LLM の精度が良かったため、次回はどういう誤りがあったかを分析する
9/10 ③ 最良設定(few-shot)の誤りを小分類ごとに分析 3クラスのうちガイドライン未規定の F1 が最も低い(0.444)。正解 20件のうち当てられなかった 14件中 10件が Coreference(12件中 正解 2件)で、精度が低かった最大の要因 few-shot 例を小分類ごとに 1件ずつ選び直し、Coreference が改善するかを確かめる
9/17 ④ few-shot 例のみ変更:ラベルの組み合わせごとに 1例(計 5例)→ 小分類ごとに 1例(計 10例)。答えは大分類のみ / 大分類+小分類の 2条件 macro-F1 は 0.644 → 0.632 / 0.585 で改善せず。精度が低い要因である Coreference の正解も 12件中 3件 / 2件で変わらず few-shot 例を変えるだけでは改善しないため、LLM の回答の仕方を変えて再実験する
9/24 ⑤ 今回:LLM の回答の仕方のみ変更。(a) 共参照の質問に先に答えさせてからラベルを答える2段階、(b) 理由を書いてからラベルを答える thinking macro-F1 は 0.589 / 0.566 で改善せず。Coreference の正解は 12件中 3件 / 4件 §07 で相談

02予測対象:大分類(3クラス)と小分類(10クラス)

大分類 件数(valid 84件) 小分類 件数(valid 84件)
文意の不確実性Uncertainty in Sentence Meaning 58 Lexical 22
Implicature4
Presupposition3
Probabilistic Enrichment31
Imperfection3
ガイドライン未規定Underspecification in Guidelines 20 Coreference 12
Temporal Reference3
Interrogative Hypothesis6
アノテータの振る舞いAnnotator Behavior 10 Accommodating Minimally Added Content 9
High Overlap1

03今回の実験:LLM の回答の仕方を変える

条件 回答の仕方
few-shot(基準) 1回の生成でラベルだけを答える。
(a) 2段階 1段階目:「前提文と仮説文は同じ人物・物・場所・時点・出来事を指しているか」を質問し、SAME / DIFFERENT と一文の理由で答えさせる。
2段階目:その質問と答えを会話に残したまま、上と同じ指示文でラベルを答えさせる。
(b) thinking Qwen3 の think モードを使い、回答の前に推論の過程を自由に書かせてからラベルを答えさせる。
実験設定の詳細
項目 内容
データ NLI_disagreement_taxonomy(Jiang & de Marneffe, TACL 2022)。
510件のうち、分類が付いていない 11件を除いた 499件を使用。
分割 train : valid : test = 331 : 84 : 84。
評価は valid で行う。
モデル Qwen3.8-27B
入力 システムプロンプト:役割の説明+原因分類のガイドライン全文。
ユーザープロンプト:前提文・仮説文+大分類3クラスの定義+指示文。
出力 該当する大分類(MEANING / GUIDELINE / BEHAVIOR)をカンマ区切りで答える。該当なしは NONE。
few-shot 例 train から正解ラベルの組み合わせごとに 1例、計 5例(文意 / ガイドライン / 振る舞い / 文意+ガイドライン / 文意+振る舞い)。
各例を「前提文・仮説文+指示文 → 正解ラベル」の質問と答えの往復として会話に入れる。
評価指標 各大分類を該当/非該当の二値として F1 を計算し、3クラスの平均を macro-F1 とする。

04結果(valid 84件)

条件 macro-F1 文意 F1 ガイドライン F1 振る舞い F1
zero-shot 0.5590.7380.6060.333
few-shot(基準) 0.6440.8210.4440.667
(a) 2段階 0.589▼0.055 0.835▲0.014 0.645▲0.201 0.286▼0.381
(b) thinking 0.566▼0.078 0.800▼0.021 0.667▲0.223 0.231▼0.436

05どの小分類が変わったか

大分類 小分類 件数(valid 84件) 件数のうち大分類を当てられた割合
few-shot(先週) (a) 2段階 (b) thinking
文意の不確実性 Lexical22 0.950.950.77
Implicature41.000.750.75
Presupposition31.001.001.00
Probabilistic Enrichment310.940.900.84
Imperfection31.000.671.00
ガイドライン未規定 Coreference12 0.170.250.33
Temporal Reference30.000.331.00
Interrogative Hypothesis60.671.001.00
アノテータの振る舞い Accommodating Minimally Added Content9 0.670.220.56
High Overlap10.000.001.00

06所見

(a) 2段階

(b) thinking

まとめ

07次週の予定と相談