取り消し線は完了した週。今週は W7(本日 9/17 のテキスト報告④)。
| 週 | 期間(金〜木) | 報告・イベント | 主なタスク |
|---|---|---|---|
| W1 | 7/31 〜 8/6 | 8/5 投稿完了目標8/1 研究室夏季休暇開始8/6 インターン開始 | 論文を英語で仕上げ、8/5までに投稿する(投稿締切は8/15) |
| W2 | 8/7 〜 8/13 | 文献サーベイ開始、今後の方針の検討 | |
| W3 | 8/14 〜 8/20 | (8/15 投稿締切) | 文献サーベイ継続 |
| W4 | 8/21 〜 8/27 | 8/27 テキスト報告①8/21 研究室夏季休暇終了 | サーベイ内容をまとめて報告①で共有し、今後の計画を立案 |
| W5 | 8/28 〜 9/3 | 9/3 テキスト報告② | 3大分類マルチラベル分類の実装・実験を完了し結果を共有 |
| W6 | 9/4 〜 9/10 | 9/10 テキスト報告③ | 誤り分析・fine-tuningのガイドライン注入問題の切り分け |
| W7 | 9/11 〜 9/17 | 9/17 テキスト報告 ④9/18 インターン終了 | few-shot 例を小分類ごとに1件ずつ選び直して再実験 |
| W8 | 9/18 〜 9/24 | 9/24 テキスト報告 ⑤ | Coreference の判定方法を変えて再実験 |
| 項目 | 先週まで | 今回 |
|---|---|---|
| データ分割 | train 331 / valid 84 / test 84(valid で評価) | 同じ |
| プロンプト | 大分類の定義+ガイドライン全文 | 同じ(定義文・指示文は変えない) |
| few-shot 例 | 5例。大分類の組み合わせごとに train 先頭から自動抽出 | 10例。小分類ごとに1件、train から手作業で選んだ |
| 例に付ける答え | 大分類のみ(例:GUIDELINE) | (a) 大分類のみ、(b) 大分類+括弧で小分類(例:GUIDELINE (COREFERENCE))の2条件 |
(b) は「小分類の情報を few-shot に加えたら3大分類の精度が上がるか」の確認。小分類で直接答えさせる方式は過去に精度が悪かったので、答えは大分類を主にして小分類を括弧で添える形にした。
Qwen3.8-27B、ガイドライン全文。上2行は先週までの数値、下2行が今回。
| 条件 | macro-F1 | 文意 | ガイドライン | 振る舞い | 完全一致 |
|---|---|---|---|---|---|
| zero-shot | 0.559 | 0.738 | 0.606 | 0.333 | 0.536 |
| few-shot 5例(先週最良) | 0.644 | 0.821 | 0.444 | 0.667 | 0.643 |
| few-shot 10例(a) 大分類のみ | 0.632 | 0.800 | 0.625 | 0.471 | 0.679 |
| few-shot 10例(b) 大分類+小分類 | 0.585 | 0.783 | 0.552 | 0.421 | 0.631 |
値は「その小分類が正解に付いている事例のうち、対応する大分類を当てられた割合」(valid 84件)。左の列は先週の表と同じ数値。
| 小分類(大分類, 件数) | few-shot 5例(先週) | 10例(a) 大分類のみ | 10例(b) 大分類+小分類 |
|---|---|---|---|
| Probabilistic / Lexical(文意, 31 / 22) | 0.94 / 0.95 | 0.77 / 0.91 | 0.77 / 0.82 |
| Coreference(ガイドライン, 12) | 0.17 | 0.25 | 0.17 |
| Interrogative(ガイドライン, 6) | 0.67 | 1.00 | 1.00 |
| Temporal(ガイドライン, 3) | 0.00 | 0.67 | 0.00 |
| Accommodating(振る舞い, 9) | 0.67 | 0.44 | 0.44 |