Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Prompt Cache — モジュラーアテンション再利用によるLLM推論の低レイテンシ化

本記事は Prompt Cache: Modular Attention Reuse for Low-Latency Inference の解説記事です。 論文概要(Abstract) 著者らは、LLMの推論時にプロンプトの共有部分(システムプロンプト、Few-shotサンプル等)のアテンション状態(KVキャッシュ)を事前計算・保存し、後続のリクエストで再利用するPrompt Cache...

📄 論文解説: Efficient Guided Generation for Large Language Models — 有限状態機械による構造化出力の理論基盤

本記事は arXiv:2307.09702 の解説記事です。 論文概要(Abstract) Willard & Louf (2023) は、大規模言語モデル(LLM)のテキスト生成を正規表現や文脈自由文法(CFG)で制約する手法を提案している。著者らは、テキスト生成問題を有限状態機械(FSM)の状態遷移として再定式化し、各デコードステップで文法的に有効なトークンのみを許可するマス...

📄 論文解説: DIN-SQL — 分解型In-Context Learningで実現するText-to-SQL自己修正パイプライン

本記事は DIN-SQL: Decomposed In-Context Learning of Text-to-SQL with Self-Correction の解説記事です。 論文概要(Abstract) DIN-SQLは、複雑なNL→SQLタスクを「スキーマリンキング → 難易度分類 → サブタスク別SQL生成 → 自己修正」の4ステップに分解し、各ステップでそれぞれ独立したIn-...

📄 論文解説: MTEB — 56データセット×8タスクでEmbeddingモデルを統一評価するベンチマーク

本記事は MTEB: Massive Text Embedding Benchmark (arXiv:2210.07316) の解説記事です。 論文概要(Abstract) テキスト埋め込みモデルの評価は、従来はSTSBenchmarkやMSMARCOなど少数のデータセットに限定されており、モデルの能力の一側面しか捉えられていなかった。Muennighoff et al.は、8つのタスク...