専門家の知識でLLM評価benchmarkを作る――context-specificな合成data生成
domain expertの知識をschemaへ落とし込み、coverage、diversity、content realism、stylistic realismでLLM評価dataを診断するframeworkを解説します。
Personal notes since 2020
技術や日々の試行錯誤を、あとから読み返せる形で残しています。
Latest
domain expertの知識をschemaへ落とし込み、coverage、diversity、content realism、stylistic realismでLLM評価dataを診断するframeworkを解説します。
MetaのHSTU論文を、推薦のsequential transduction化、pointwise attention、Stochastic Length、M-FALCON、公開実験とproduction評価の限界から解説します。
MetaのDV365を、Multi-slicing、Funnel Summarization、オフライン埋め込み、15モデルへの展開、精度・鮮度・コストの検証から解説します。