2026年9月28日「Just Ask Jev」解説――AIの失敗を見抜く確率と、判定に使える確率は違うJevを44のベンチマークで評価したRLCDAlignBenchを解説。質問設計、文脈、確率の較正、ラベル監査を通じて、AUROC 0.886と約63分の1の評価コストが示す範囲を整理します。