専門家の知識で作る、文脈に即したLLM評価ベンチマーク
ドメイン専門家の知識をschemaと呼ばれる評価仕様に整理し、網羅性、多様性、内容と文体の現実性からLLM評価データを診断する手法を解説します。
Personal notes since 2020
技術や日々の試行錯誤を、あとから読み返せる形で残しています。
Latest
ドメイン専門家の知識をschemaと呼ばれる評価仕様に整理し、網羅性、多様性、内容と文体の現実性からLLM評価データを診断する手法を解説します。
MetaのHSTU論文を、推薦のsequential transduction化、pointwise attention、Stochastic Length、M-FALCON、公開実験と本番環境評価の限界から解説します。
MetaのDV365を、Multi-slicing、Funnel Summarization、オフライン埋め込み、15モデルへの展開、精度・鮮度・コストの検証から解説します。