| 内容 | |
|---|---|
| 目標 | NLI のアノテータ不一致の原因を、アノテーション前に大分類(3クラス)で予測するモデルを構築する。現在は LLM(Qwen3.8-27B)の few-shot で精度改善を進めている |
| 先週(9/17) |
|
| 今週(9/24) |
|
| 報告 | やったこと | 結果 | 次回やると決めたこと |
|---|---|---|---|
| 8/27 ① | 小分類の10クラス分類(F1 0.3〜0.4)を大分類の3クラス分類に粗くする実験計画を立てた | — | 大分類の3クラス分類(マルチラベル)を実装し、実験する |
| 9/3 ② | 大分類の3クラス分類の実装と実験。random / BERT / DeBERTa(fine-tuning)/ Qwen3.8-27B(zero-shot・few-shot)× ガイドライン(なし・要約・全文) | Qwen3.8-27B の few-shot(正解ラベルの組み合わせごとに 1例、計 5例)+ガイドライン全文が macro-F1 0.644 で最良。fine-tuning は 0.27〜0.40 | LLM の精度が良かったため、次回はどういう誤りがあったかを分析する |
| 9/10 ③ | 最良設定(few-shot)の誤りを小分類ごとに分析 | 3クラスのうちガイドライン未規定の F1 が最も低い(0.444)。正解 20件のうち当てられなかった 14件中 10件が Coreference(12件中 正解 2件)で、精度が低かった最大の要因 | few-shot 例を小分類ごとに 1件ずつ選び直し、Coreference が改善するかを確かめる |
| 9/17 ④ | few-shot 例のみ変更:ラベルの組み合わせごとに 1例(計 5例)→ 小分類ごとに 1例(計 10例)。答えは大分類のみ / 大分類+小分類の 2条件 | macro-F1 は 0.644 → 0.632 / 0.585 で改善せず。精度が低い要因である Coreference の正解も 12件中 3件 / 2件で変わらず | few-shot 例を変えるだけでは改善しないため、LLM の回答の仕方を変えて再実験する |
| 9/24 ⑤ | 今回:LLM の回答の仕方のみ変更。(a) 共参照の質問に先に答えさせてからラベルを答える2段階、(b) 理由を書いてからラベルを答える thinking | macro-F1 は 0.589 / 0.566 で改善せず。Coreference の正解は 12件中 3件 / 4件 | §07 で相談 |
| 大分類 | 件数(valid 84件) | 小分類 | 件数(valid 84件) |
|---|---|---|---|
| 文意の不確実性Uncertainty in Sentence Meaning | 58 | Lexical | 22 |
| Implicature | 4 | ||
| Presupposition | 3 | ||
| Probabilistic Enrichment | 31 | ||
| Imperfection | 3 | ||
| ガイドライン未規定Underspecification in Guidelines | 20 | Coreference | 12 |
| Temporal Reference | 3 | ||
| Interrogative Hypothesis | 6 | ||
| アノテータの振る舞いAnnotator Behavior | 10 | Accommodating Minimally Added Content | 9 |
| High Overlap | 1 |
| 条件 | 回答の仕方 |
|---|---|
| few-shot(基準) | 1回の生成でラベルだけを答える。 |
| (a) 2段階 | 1段階目:「前提文と仮説文は同じ人物・物・場所・時点・出来事を指しているか」を質問し、SAME / DIFFERENT と一文の理由で答えさせる。 2段階目:その質問と答えを会話に残したまま、上と同じ指示文でラベルを答えさせる。 |
| (b) thinking | Qwen3 の think モードを使い、回答の前に推論の過程を自由に書かせてからラベルを答えさせる。 |
| 項目 | 内容 |
|---|---|
| データ | NLI_disagreement_taxonomy(Jiang & de Marneffe, TACL 2022)。 510件のうち、分類が付いていない 11件を除いた 499件を使用。 |
| 分割 | train : valid : test = 331 : 84 : 84。 評価は valid で行う。 |
| モデル | Qwen3.8-27B |
| 入力 | システムプロンプト:役割の説明+原因分類のガイドライン全文。 ユーザープロンプト:前提文・仮説文+大分類3クラスの定義+指示文。 |
| 出力 | 該当する大分類(MEANING / GUIDELINE / BEHAVIOR)をカンマ区切りで答える。該当なしは NONE。 |
| few-shot 例 | train から正解ラベルの組み合わせごとに 1例、計 5例(文意 / ガイドライン / 振る舞い / 文意+ガイドライン / 文意+振る舞い)。 各例を「前提文・仮説文+指示文 → 正解ラベル」の質問と答えの往復として会話に入れる。 |
| 評価指標 | 各大分類を該当/非該当の二値として F1 を計算し、3クラスの平均を macro-F1 とする。 |
| 条件 | macro-F1 | 文意 F1 | ガイドライン F1 | 振る舞い F1 |
|---|---|---|---|---|
| zero-shot | 0.559 | 0.738 | 0.606 | 0.333 |
| few-shot(基準) | 0.644 | 0.821 | 0.444 | 0.667 |
| (a) 2段階 | 0.589▼0.055 | 0.835▲0.014 | 0.645▲0.201 | 0.286▼0.381 |
| (b) thinking | 0.566▼0.078 | 0.800▼0.021 | 0.667▲0.223 | 0.231▼0.436 |
| 大分類 | 小分類 | 件数(valid 84件) | 件数のうち大分類を当てられた割合 | ||
|---|---|---|---|---|---|
| few-shot(先週) | (a) 2段階 | (b) thinking | |||
| 文意の不確実性 | Lexical | 22 | 0.95 | 0.95 | 0.77 |
| Implicature | 4 | 1.00 | 0.75 | 0.75 | |
| Presupposition | 3 | 1.00 | 1.00 | 1.00 | |
| Probabilistic Enrichment | 31 | 0.94 | 0.90 | 0.84 | |
| Imperfection | 3 | 1.00 | 0.67 | 1.00 | |
| ガイドライン未規定 | Coreference | 12 | 0.17 | 0.25 | 0.33 |
| Temporal Reference | 3 | 0.00 | 0.33 | 1.00 | |
| Interrogative Hypothesis | 6 | 0.67 | 1.00 | 1.00 | |
| アノテータの振る舞い | Accommodating Minimally Added Content | 9 | 0.67 | 0.22 | 0.56 |
| High Overlap | 1 | 0.00 | 0.00 | 1.00 | |