個人MTG資料研究進捗報告

2026年9月17日(木)

01週次タスク計画

取り消し線は完了した週。今週は W7(本日 9/17 のテキスト報告④)。

週 期間(金〜木) 報告・イベント 主なタスク
W1 7/31 〜 8/6 8/5 投稿完了目標8/1 研究室夏季休暇開始8/6 インターン開始 論文を英語で仕上げ、8/5までに投稿する(投稿締切は8/15)
W2 8/7 〜 8/13 文献サーベイ開始、今後の方針の検討
W3 8/14 〜 8/20 (8/15 投稿締切) 文献サーベイ継続
W4 8/21 〜 8/27 8/27 テキスト報告①8/21 研究室夏季休暇終了 サーベイ内容をまとめて報告①で共有し、今後の計画を立案
W5 8/28 〜 9/3 9/3 テキスト報告② 3大分類マルチラベル分類の実装・実験を完了し結果を共有
W6 9/4 〜 9/10 9/10 テキスト報告③ 誤り分析・fine-tuningのガイドライン注入問題の切り分け
W7 9/11 〜 9/17 9/17 テキスト報告 ④9/18 インターン終了 few-shot 例を小分類ごとに1件ずつ選び直して再実験
W8 9/18 〜 9/24 9/24 テキスト報告 ⑤ Coreference の判定方法を変えて再実験

02先週までの流れ

03今回やったこと:変えたのは few-shot 例のみ

項目 先週まで 今回
データ分割 train 331 / valid 84 / test 84(valid で評価) 同じ
プロンプト 大分類の定義+ガイドライン全文 同じ(定義文・指示文は変えない)
few-shot 例 5例。大分類の組み合わせごとに train 先頭から自動抽出 10例。小分類ごとに1件、train から手作業で選んだ
例に付ける答え 大分類のみ(例:GUIDELINE) (a) 大分類のみ、(b) 大分類+括弧で小分類(例:GUIDELINE (COREFERENCE))の2条件

(b) は「小分類の情報を few-shot に加えたら3大分類の精度が上がるか」の確認。小分類で直接答えさせる方式は過去に精度が悪かったので、答えは大分類を主にして小分類を括弧で添える形にした。

04結果(valid 84件)

Qwen3.8-27B、ガイドライン全文。上2行は先週までの数値、下2行が今回。

条件 macro-F1 文意 ガイドライン 振る舞い 完全一致
zero-shot 0.5590.7380.6060.3330.536
few-shot 5例(先週最良) 0.6440.8210.4440.6670.643
few-shot 10例(a) 大分類のみ 0.6320.8000.6250.4710.679
few-shot 10例(b) 大分類+小分類 0.5850.7830.5520.4210.631

05どの小分類が変わったか

値は「その小分類が正解に付いている事例のうち、対応する大分類を当てられた割合」(valid 84件)。左の列は先週の表と同じ数値。

小分類(大分類, 件数) few-shot 5例(先週) 10例(a) 大分類のみ 10例(b) 大分類+小分類
Probabilistic / Lexical(文意, 31 / 22) 0.94 / 0.950.77 / 0.910.77 / 0.82
Coreference(ガイドライン, 12) 0.170.250.17
Interrogative(ガイドライン, 6) 0.671.001.00
Temporal(ガイドライン, 3) 0.000.670.00
Accommodating(振る舞い, 9) 0.670.440.44

06所見

07次週の予定