| 閾値4+(4人以上で一致) | 閾値5(5人全員で一致) | |||||||
|---|---|---|---|---|---|---|---|---|
| モデル | acc | f1_macro | f1_agr | f1_dis | acc | f1_macro | f1_agr | f1_dis |
| random(分布サンプリング) | 0.718 | 0.500 | 0.830 | 0.171 | 0.516 | 0.502 | 0.586 | 0.417 |
| BERT-base-uncased | 0.790 | 0.533 | 0.879 | 0.188 | 0.588 | 0.567 | 0.662 | 0.471 |
| NLI DeBERTa-v3-base | 0.792 | 0.653 | 0.872 | 0.434 | 0.710 | 0.690 | 0.768 | 0.613 |
| Qwen3.5-9B(zero-shot) | 0.647 | 0.514 | 0.768 | 0.261 | 0.585 | 0.551 | 0.676 | 0.425 |
| モデル | 方式 | 二値 acc | f1_macro | f1_agree | f1_disagree | MAE |
|---|---|---|---|---|---|---|
| random(分布サンプリング) | ― | 0.534 | 0.520 | 0.602 | 0.437 | 0.786 |
| BERT-base-uncased | 回帰 | 0.599 | 0.585 | 0.661 | 0.509 | 0.588 |
| BERT-base-uncased | 分類 | 0.594 | 0.561 | 0.682 | 0.441 | 0.629 |
| NLI DeBERTa-v3-base | 回帰 | 0.687 | 0.651 | 0.764 | 0.537 | 0.515 |
| NLI DeBERTa-v3-base | 分類 | 0.714 | 0.693 | 0.774 | 0.613 | 0.487 |
| Qwen3.5-9B(direct) | zero-shot | 0.568 | 0.564 | 0.526 | 0.603 | 0.620 |
| Qwen3.5-9B(distribution) | zero-shot | 0.635 | 0.626 | 0.686 | 0.566 | 0.613 |
| プロンプト戦略 | 概要 | f1_macro | f1_agree | f1_disagree |
|---|---|---|---|---|
| cot | 曖昧さを 1〜2文推論させてから回答 | 0.628 | 0.709 | 0.548 |
| distribution | E/N/C の票の割れを予測 → 最大値を一致人数 | 0.626 | 0.686 | 0.566 |
| fewshot | 各人数(5/4/3/2)の例を1件ずつ提示 | 0.624 | 0.625 | 0.624 |
| rubric | 各人数の意味を明示したルーブリックを付与 | 0.579 | 0.532 | 0.626 |
| direct | 整数を1つ答えさせるだけ(最小ベースライン) | 0.564 | 0.526 | 0.603 |