LLMの信用リスク予測は説明を信用できるか?LightGBMとSHAPで検証した論文を読む
貸付データでゼロショットLLMとLightGBMを比較した研究を解説。完済を正例にした評価指標、特徴量の寄与、Gemmaの説明とSHAPの不一致から、予測と説明を別々に検証する意味を考えます。
Xでシェア目次
LLMに信用リスクを予測させるとき、予測の精度と、生成した説明が予測の振る舞いに合っているかは、別々に検証する必要があります。この論文では、同じ貸付データを使った比較から、LLMの説明と特徴量の寄与が食い違う例を示しています。
この記事の構成と本文はAIが作成しました。対象はSaeed AlMarriらのInterpreting LLMs as Credit Risk Classifiers: Do Their Feature Explanations Align with Classical ML?です。2025年10月29日公開のarXiv v1を読みます。arXivの書誌情報ではCIKM 2025のFinFAIワークショップ論文とされています。原文の参照先は全文HTMLとPDFです。
予測理由を文章で読めても、説明の検証は必要
借入額や年収をLLMへ渡すと、完済の確率とその理由を文章で返せます。「借入負担が大きい」「年収が高い」といった説明は読みやすく、判断の根拠を理解できたように感じるかもしれません。
しかし、その文章だけでは、入力のどの項目が予測値をどれだけ変えたかは分かりません。一般的な金融知識として自然な説明と、モデルの出力に対応する説明は区別する必要があります。
著者らはこの問題を、予測性能、特徴量の寄与、自己説明の整合性という三つの観点から調べています。比較相手には、表形式データの分類によく使われる勾配ブースティング決定木のLightGBMを選びました。
同じ21特徴量で、学習済みLightGBMとゼロショットLLMを比較
実験には、Kaggleで公開されたLendingClubの貸付データを使っています。論文の記述では2007〜2016年の約396,000件で、ラベルはFully PaidとCharged Off、つまり完済と貸し倒れです。
著者らは貸付日、最初の信用取引日、住所、職業名、貸付タイトルを除きました。カテゴリ数が40を超える項目も除外対象としています。高いカテゴリ数や冗長性、情報漏洩の可能性を抑え、両モデルの入力をそろえるための前処理です。最終的には数値12項目とカテゴリ9項目、計21特徴量を使います。借入額、期間、金利、年収、DTI、Grade、Sub-gradeなどが含まれます。
データの分割はランダムで、学習用80%、テスト用20%です。LightGBMはラベル付きデータで学習し、LLMはテスト側の79,200件をゼロショットで推論します。LLMには追加学習も、プロンプト内の正解例も与えていません。
比較したLLMはLlama-3.1-8B-Instruct、Gemma-2-9Bのinstruction-tuned版、Qwen-2.5-7B-Instructです。論文ではvLLMを使い、24GBのNVIDIA A10Gを4基用いてローカル推論しています。モデル名は当時の実験条件であり、現在のLLM全般の性能を代表する比較ではありません。
入力は貸付情報をまとめた構造化辞書です。全LLMに共通のプロンプトで、完済確率を0〜1の数値として出し、短い理由もJSONで返すよう求めています。さらに特徴量ごとに、完済予測への影響をpositive、negative、neutralから選ばせます。
ここでそろえているのは入力項目と評価対象です。LightGBMにはこのデータでの学習があり、LLMには事前学習で得た知識があります。「同じ学習条件でどちらが優れるか」という実験ではありません。原論文§4
PR-AUCの0.91は、貸し倒れ検出の精度ではない
原論文Table 2の結果は次の通りです。LLMはいずれもinstruction-tuned版です。
| モデル | ROC-AUC | PR-AUC |
|---|---|---|
| LightGBM | 0.73 | 0.91 |
| Gemma-2-9B | 0.67 | 0.88 |
| Llama-3.1-8B | 0.65 | 0.86 |
| Qwen-2.5-7B | 0.61 | 0.85 |
| LightGBM+Gemma-2-9B | 0.70 | 0.90 |
LightGBMは両指標で最も高い値を得ました。LLMの中ではGemmaが最も高く、ROC-AUCの差はLightGBMに対して0.06です。両モデルを組み合わせた結果も、LightGBM単独を上回りませんでした。ただし、この結果から、あらゆる組み合わせ方に効果がないとは言えません。原論文§5.1・Table 2
ROC-AUCは、完済した貸付を貸し倒れした貸付より高く順位づけできるかを測ります。0.73は正答率73%という意味ではありません。また、順位づけの良さだけでは、予測値0.8が実際の完済率80%に対応するかという確率校正は評価できません。
PR-AUCを読むときは、正例の定義が特に重要です。この実験では完済が正例で、完済の比率を基準とするPR-AUCは0.80です。LightGBMの0.91はこの基準を上回りますが、少数側の貸し倒れを正例にしたPR-AUCではありません。「貸し倒れを91%の精度で検出できる」と読むのは誤りです。
信用リスクの実務では、どの閾値で貸し倒れをどれだけ見逃すかも問題になります。論文のAUCだけから、審査の閾値や予想損失まで判断することはできません。
SHAPは、文章による説明と別の経路で出力を調べる
SHAPでは、特徴量を背景データで置き換えた入力に対する出力などを使い、各項目の予測への寄与を推定します。この研究では完済確率を説明対象にします。正のSHAP値は背景の基準に対して完済予測を押し上げる寄与、負の値は押し下げる寄与です。
一方、LLMの自己説明は、モデルが文章や方向のラベルとして生成した回答です。著者らはそれを未検証の説明として扱い、SHAPによる分析と照合します。
著者らは計算量を抑えるため、SHAPの説明対象をテスト側から無作為に選んだ250件に絞り、PermutationExplainerを使います。背景データはk-meansの5中心へ要約し、max_evals=200で4回の置換順序を用いる設定です。
論文の概算では、21特徴量、背景5件、4回の置換順序から、1対象あたり約440回のモデル評価と見積もっています。KernelExplainerに対する約5倍の削減も概算です。実装のバッチ処理やキャッシュ、評価予算の扱いによって呼び出し回数は変わるため、再現時の実測時間やAPIリクエスト数と同一視できません。
SHAPも、モデル内部の思考を直接取り出す手法ではありません。背景データや特徴量の置換方法に依存する、出力に対する事後的な分析です。相関する特徴量を置き換えたときの解釈にも注意が必要で、因果効果を証明するものではありません。この記事では、自己説明を外部から点検する比較材料として読みます。
同じ特徴量に注目しても、使い方は異なる
Table 3では、LightGBMのSub-gradeの重要度は0.062、Gradeは0.013です。GemmaではSub-gradeが0.046、Gradeが0.079でした。粗い格付けのGradeと、A1からG5までの細かい格付けのSub-gradeを、同じ重みで使っているわけではありません。
返済期間Termにも違いがあります。LightGBMでは0.023ですが、Gemmaでは0.002です。年収や格付けなど共通して寄与の大きい項目がある一方、重みづけはモデルごとに異なります。原論文§5.2・Table 3
この表は特徴量の重要度を比較するもので、寄与の正負を直接表していません。値が大きいから、その特徴量が高いほど完済しやすいとは言えません。方向を調べるには、特徴量の値とSHAP値を対応させた依存プロットを見る必要があります。
また、LightGBMと違う順位だからLLMが誤っている、とも断定できません。LightGBMも比較用のモデルです。ここで区別したいのは、別モデルとの違いと、同じLLMの自己説明と出力の不一致です。後者は、そのLLMの説明を信用できるかに直接関わります。
GemmaのDTI説明は、高い値でのSHAP寄与と食い違う
DTIはDebt-to-Income ratio、所得に対する債務負担の比率です。特徴量の影響を尋ねると、3モデルとも完済予測への影響をnegativeと回答しています。債務負担が重いほど返済しにくいという説明です。
ところが、Figure 5のGemmaでは高いDTIの領域に正のSHAP寄与が見られます。自己説明の方向と、出力に対して推定した寄与が一致していません。LlamaとLightGBMでは、おおむねDTIが高いほど負の寄与が大きくなる傾向が見られ、Qwenの依存は比較的弱いものでした。原論文§5.4・Figure 5
図が示すのは、DTIを上げれば必ずGemmaの完済確率が上がる、という因果関係ではありません。高いDTIを持つ対象で、背景データに対して正の寄与が推定されたという観測です。自己説明を単純な方向の回答として読むと、この挙動を説明しきれていません。
Sub-gradeでは、おおむね格付けが悪くなるほど完済予測への寄与が下がる傾向をLLMも捉えています。ただしLightGBMほど一様ではなく、局所的なばらつきがあります。自己説明が常に誤るという結果でも、常に一致するという結果でもありません。
論文§5.4には、DTIについて全モデルの説明とSHAPが一致するという記述と、直後のGemmaの不一致の記述が並んでいます。この記事では例外を省かず、Figure 5とGemmaについての具体的な分析に沿って読みます。
この研究から、どこまで言えるか
今回の設定では、学習したLightGBMがゼロショットLLMを両AUCで上回り、LLMの説明にはSHAP分析と食い違う例がありました。ただし、評価は一つの貸付データと3種類の7B〜9B級モデルに限られます。追加学習したモデルや、別のプロンプト、より大きなモデルへの結論は別途検証が必要です。
ランダム分割の結果は、将来の貸付を予測する時系列の検証とも異なります。景気や借り手の構成が変わる状況で、同じ性能を保てるかは分かりません。また、同じ入力辞書を使い、日付や住所を除いても、LLMの事前学習知識や学習データとの重複がなくなったことを証明したわけではありません。
説明の不一致についても、全件の不一致率、信頼区間、統一した忠実性スコアは報告されていません。少なくとも不一致の例があることは読めますが、どの程度の頻度で起こるかまでは分かりません。公平性や規制への適合を検証した結果として扱うこともできません。
著者らは少量データ環境でLLMを代替として使う可能性にも言及しています。しかし、学習データを段階的に減らす実験は報告されていないため、少量データで優位という実証結果には含めません。
自分のデータで試すなら、予測と説明を分けて記録する
論文にはデータへのリンクとプロンプトのひな型、LightGBMの主要設定があります。一方、本文には実験コードへのリンクがなく、ライブラリの厳密なバージョン、分割の乱数シード、生成設定、JSON解析に失敗した際の扱いなども十分には示されていません。そのまま実行して論文の数値を完全再現できる手順ではありません。
LightGBMの設定は、学習率0.01、最大10,000 estimators、early stopping 100 rounds、num_leaves=63、min_data_in_leaf=50です。feature fractionとbagging fractionは各0.8、L1/L2正則化は各0.1でした。これらは原論文の条件であり、別のデータでも最適な設定という意味ではありません。
以下は、この研究を踏まえた本記事の検証案です。まず正例を完済と貸し倒れのどちらにするか固定し、同じテスト集合でLightGBMとLLMを比較します。将来の審査を想定する場合は、時系列分割での検証も必要です。LLMの入力、モデルのバージョン、生成設定、数値の予測、説明文は対応づけて保存します。
次に、ROC-AUCと正例を明記したPR-AUCに加え、確率校正と業務上の閾値での見逃しを評価します。数値を返せなかった件数も記録する必要があります。成功した出力だけを評価対象にしないためです。
説明の検証では、同じ対象について自己説明とSHAP寄与の方向を比較します。背景データや評価予算を変えても不一致が残るかを調べ、単一の近似計算だけで結論を出さないことが大切です。説明が一つの特徴量だけに着目している場合は、他の特徴量との組み合わせを含めて確認します。
自然な理由を返せることと、その理由が予測を説明できることは別の能力です。LLMの説明文を判断の根拠として使うなら、実際の出力に対する検証結果も一緒に示す必要があります。
参照
- Saeed AlMarri, Kristof Juhasz, Mathieu Ravaut, Gautier Marti, Hamdan Al Ahbabi, Ibrahim Elfadel, Interpreting LLMs as Credit Risk Classifiers: Do Their Feature Explanations Align with Classical ML?, arXiv:2510.25701v1, 2025-10-29. 全文HTML / PDF
- 原論文が利用したデータの配布先、Loan Data。この記事ではデータの再学習やモデル評価は実施していません。