「Just Ask Jev」解説――AIの失敗を見抜く確率と、判定に使える確率は違う
Jevを44のベンチマークで評価したRLCDAlignBenchを解説。質問設計、文脈、確率の較正、ラベル監査を通じて、AUROC 0.886と約63分の1の評価コストが示す範囲を整理します。
Personal notes since 2020
技術や日々の試行錯誤を、あとから読み返せる形で残しています。
Latest
Jevを44のベンチマークで評価したRLCDAlignBenchを解説。質問設計、文脈、確率の較正、ラベル監査を通じて、AUROC 0.886と約63分の1の評価コストが示す範囲を整理します。
MIT VNAVのPDF群を、ローカルLLM、学習用UI、Tailscale Serveで個人向けのモバイル教材に変換した記録です。
ユーザー単位のLLM推論を取引パターン単位へ置き換え、検索可能な属性データベースを構築する研究を、手法、評価、実運用、再現性から解説します。