R_agr・副=依頼率 req% に再定義。一致のみアノテーション依頼し、不一致は依頼しない(除外する)という運用を想定。
| 予測 | |||
|---|---|---|---|
| 不一致と予測(除外) | 一致と予測(依頼) | ||
| 実際 | 不一致(陽性) | TP(真陽性) | FN(偽陰性) |
| 一致(陰性) | FP(偽陽性) | TN(真陰性) | |
R_agr:良問を取りこぼさず依頼できた割合(= recall_agree)。高いほど良問を捨てない。
R_agr =
TNFP + TN
req%:実際に依頼する割合(補数が削減率)。R_agr とトレードオフ。
req% =
FN + TNTP + FP + TN + FN
一致 agree の Recall が良問保持率 R_agr(主指標)、最右列が依頼率 req%(副指標)。
| 不一致 disagree | 一致 agree(主指標) | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|
| 閾値 | モデル | acc | f1_macro | Recall | Precision | F1 | Recall | Precision | F1 | 依頼率 |
| 閾値 4+4人以上 | random(分布サンプリング) | 0.718 | 0.500 | 0.171 | 0.170 | 0.171 | 0.829 | 0.830 | 0.830 | 0.829 |
| DeBERTa-v3-base(NLIなし) | 0.783 | 0.580 | 0.260 | 0.325 | 0.289 | 0.889 | 0.855 | 0.872 | 0.864 | |
| NLI DeBERTa-v3-base | 0.792 | 0.653 | 0.472 | 0.403 | 0.434 | 0.857 | 0.888 | 0.872 | 0.801 | |
| Qwen3.5-9B(zero-shot) | 0.647 | 0.514 | 0.367 | 0.202 | 0.261 | 0.704 | 0.845 | 0.768 | 0.692 | |
| 閾値 5全員一致 | random(分布サンプリング) | 0.516 | 0.502 | 0.420 | 0.415 | 0.417 | 0.584 | 0.589 | 0.586 | 0.582 |
| DeBERTa-v3-base(NLIなし) | 0.667 | 0.646 | 0.515 | 0.615 | 0.561 | 0.773 | 0.694 | 0.732 | 0.654 | |
| NLI DeBERTa-v3-base | 0.710 | 0.690 | 0.558 | 0.681 | 0.613 | 0.816 | 0.724 | 0.768 | 0.662 | |
| Qwen3.5-9B(zero-shot) | 0.585 | 0.551 | 0.371 | 0.499 | 0.425 | 0.737 | 0.625 | 0.676 | 0.692 | |
| 不一致 disagree | 一致 agree(主指標) | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| モデル | 方式 | acc | f1_macro | Recall | Precision | F1 | Recall | Precision | F1 | MAE | 依頼率 |
| random(分布サンプリング) | — | 0.534 | 0.520 | 0.438 | 0.436 | 0.437 | 0.601 | 0.604 | 0.602 | 0.786 | 0.585 |
| DeBERTa-v3-base(NLIなし) | 回帰 | 0.588 | 0.588 | 0.690 | 0.501 | 0.580 | 0.516 | 0.703 | 0.595 | 0.600 | 0.431 |
| DeBERTa-v3-base(NLIなし) | 分類 | 0.653 | 0.632 | 0.499 | 0.595 | 0.543 | 0.761 | 0.684 | 0.721 | 0.548 | 0.654 |
| NLI DeBERTa-v3-base | 回帰 | 0.687 | 0.651 | 0.440 | 0.691 | 0.537 | 0.862 | 0.686 | 0.764 | 0.515 | 0.737 |
| NLI DeBERTa-v3-base | 分類 | 0.714 | 0.693 | 0.547 | 0.696 | 0.613 | 0.832 | 0.723 | 0.774 | 0.487 | 0.676 |
| Qwen3.5-9B(direct) | zero-shot | 0.568 | 0.564 | 0.795 | 0.486 | 0.603 | 0.408 | 0.739 | 0.526 | 0.620 | 0.324 |
| Qwen3.5-9B(cot) | zero-shot | 0.646 | 0.628 | 0.520 | 0.578 | 0.548 | 0.734 | 0.685 | 0.709 | 0.700 | 0.629 |
R_agr=0.832 と良問をよく残しつつ req%=0.676 まで削減=コストと取りこぼしの均衡が最良。R_agr=0.816 / req%=0.662 で最良の均衡。