コマースエージェントの設計解剖――Anthropicの実務ガイドを読む
Anthropicのコマースエージェント設計ガイドをもとに、単一agentとskill、UI tool、遅延・cache、memory、安全策、evalのつながりと実装上の注意を解説します。
Archive
18件の記事
Anthropicのコマースエージェント設計ガイドをもとに、単一agentとskill、UI tool、遅延・cache、memory、安全策、evalのつながりと実装上の注意を解説します。
NeurIPS 2023のTIGERを、RQ-VAEによるSemantic ID、自己回帰検索、Amazon Reviewsでの評価、cold startと推論コストの限界から解説します。
MetaのA-MLEを題材に、仮説生成から学習・評価までをつなぐ5段階の設計、domain skill、shared knowledge、評価結果と再現上の限界を解説します。
LLM agentと実ユーザー行動に基づくpersonaでA/Bテストの方向を予測する手法を、質問形式、評価結果、subsampling、再現性と限界から解説します。
SIGIR 2019のGEN Encoder論文をもとに、co-click弱教師学習、multi-task fine-tuning、検索意図評価、long-tail queryへのANN活用を解説します。
KDD 2025のRPGを、OPQによる長いSemantic ID、multi-token prediction、graph-constrained decoding、評価結果と再現時の注意点から解説します。
Metaの広告ranking論文をもとに、RQ-VAEによる階層Semantic ID、prefix n-gram、long-tail・cold start・予測安定性への効果とproduction導入上の注意点を解説します。
GoogleのWWW 2020論文をもとに、価格情報の鮮度を限られたクロール予算で高めるK-armed adversarial bandits方式を解説します。
MetaがInstagram広告へ導入したAdaptive Ranking Modelを、request単位の計算共有、Wukong Turbo、FP8、multi-GPU embeddingと公開情報の限界から解説します。
KDD 2023のMLFM論文を、特徴量とフィールドの相互作用、軽量版の因子分解、広告データでの評価、再現時の注意点から解説します。
Netflixの推薦理由文を評価するLLM judgeの研究を、課題、RART、検証結果、限界、実装手順の順に解説します。
WarpがClaude上で構築したself-improving agentを、base skill、improver skill、human feedback、評価と実装の観点から解説します。
YahooがKDD 2022で報告した多言語Webページ分類を、long-tail対策、knowledge distillation、URL-only推論、本番効果と限界から解説します。
2020年製のVuePressブログをAstroへ移行した理由と、設計・移行・運用改善の内容をまとめます。
2019年に予算10万円で組んだゲーミングPCの構成と使用感を紹介します。
ブログのURLをtwitterに貼り付けたときに表示される、twitterカードを設定した備忘録です。
GitHub Pagesでブログを作成したときに参考にした情報をまとめます。
gh-pagesでブログをつくってみた