LLMの信用リスク予測は説明を信用できるか?LightGBMとSHAPで検証した論文を読む
貸付データでゼロショットLLMとLightGBMを比較した研究を解説。完済を正例にした評価指標、特徴量の寄与、Gemmaの説明とSHAPの不一致から、予測と説明を別々に検証する意味を考えます。
Personal notes since 2020
技術や日々の試行錯誤を、あとから読み返せる形で残しています。
Latest
貸付データでゼロショットLLMとLightGBMを比較した研究を解説。完済を正例にした評価指標、特徴量の寄与、Gemmaの説明とSHAPの不一致から、予測と説明を別々に検証する意味を考えます。
ドメイン専門家の知識をschemaと呼ばれる評価仕様に整理し、網羅性、多様性、内容と文体の現実性からLLM評価データを診断する手法を解説します。
MetaのHSTU論文を、推薦のsequential transduction化、pointwise attention、Stochastic Length、M-FALCON、公開実験と本番環境評価の限界から解説します。