Netflixに学ぶLLM-as-a-JudgeのLifecycle――RARTと本番運用
Netflixの推薦理由文を評価するLLM judgeの研究を、課題、RART、検証結果、限界、実装手順の順に解説します。
Category
2件の記事
Netflixの推薦理由文を評価するLLM judgeの研究を、課題、RART、検証結果、限界、実装手順の順に解説します。
WarpがClaude上で構築したself-improving agentを、base skill、improver skill、human feedback、評価と実装の観点から解説します。