Netflixに学ぶLLM-as-a-JudgeのLifecycle――RARTと本番運用
Netflixの推薦理由文を評価するLLM judgeの研究を、課題、RART、検証結果、限界、実装手順の順に解説します。
Personal notes since 2020
技術や日々の試行錯誤を、あとから読み返せる形で残しています。
Latest
Netflixの推薦理由文を評価するLLM judgeの研究を、課題、RART、検証結果、限界、実装手順の順に解説します。
WarpがClaude上で構築したself-improving agentを、base skill、improver skill、human feedback、評価と実装の観点から解説します。
2020年製のVuePressブログをAstroへ移行した理由と、設計・移行・運用改善の内容をまとめます。