Home
0h-n0 TechBLog
キャンセル

✍️ サーベイ解説: 投機的デコーディングの包括的調査 - LLM推論高速化手法の分類と比較

論文概要(Abstract) 本記事は Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding の解説記事です。 大規模言語モデル(LLM)の自己回帰デコーディングに起因する高い推論レイテンシを軽減するため、投機的デコーディング(Specu...

📄 論文解説: EAGLE-2 - 動的ドラフトツリーによるLLM推論の高速化

本記事は EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees の解説記事です。 論文概要(Abstract) LLMの推論は自己回帰デコーディングの逐次的性質により計算コストが高く、投機的サンプリング(speculative sampling)がその有効な解決策として注目されている。著者らは、EAGL...

✍️ Elastic Linear Retriever解説: RRFを超えるスコアベースのハイブリッド検索

本記事は Elasticsearch Labs: Linear Retriever for Hybrid Search の解説記事です。 ブログ概要(Summary) Elastic社は、Elasticsearch 8.18および9.0以降で利用可能な新しいハイブリッド検索手法「Linear Retriever」を発表しました。従来のReciprocal Rank Fusion(RRF)...

📄 論文解説: vAttention - PagedAttentionを使わないLLMサービング向け動的メモリ管理

本記事は vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention の解説記事です。 論文概要 LLMサービングにおけるKVキャッシュのメモリ管理は、スループットとレイテンシの両面で重要な課題である。現在広く使われているPagedAttentionは、KVキャッシュを固定サイズのブロックに分...

📄 論文解説: DAT — ハイブリッド検索の動的Alpha調整によるRAG精度改善

本記事は DAT: Dynamic Alpha Tuning for Hybrid Retrieval in Retrieval-Augmented Generation の解説記事です。 論文概要 ハイブリッド検索(dense検索とsparse検索の統合)は、Retrieval-Augmented Generation(RAG)パイプラインにおいて広く採用されている手法である。従来のハ...

📄 論文解説: EAGLE-3 - Training-Time Test-Scalingによる投機的デコーディングの高速化

論文概要(Abstract) EAGLE-3は、LLMの投機的デコーディング(Speculative Decoding)を高速化するための手法であり、従来のEAGLE/EAGLE-2が抱えていた特徴量予測の制約を解消する。著者らは、トップ層の特徴量のみに依存する従来手法に代わり、複数層の特徴量を融合するMulti-Layer Feature Fusionと、訓練時にテスト時の挙動をシミュレ...

📄 論文解説: RAGRouter-Bench — 軽量クエリルーティングのベンチマーク評価

論文概要(Abstract) 本記事は RAGRouter-Bench: Evaluating Lightweight Query Routing for Adaptive RAG の解説記事です。 Retrieval-Augmented Generation(RAG)はLLMの応答品質を向上させる有力な手法であるが、全てのクエリに対して検索が必要なわけではない。Adaptive RAG...

📄 論文解説: FActScore — LLM生成テキストの事実精度をアトミックファクトで定量評価する

本記事は FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation の解説記事です。 論文概要(Abstract) LLMが生成する長文テキスト(人物の伝記等)には事実と非事実が混在しており、テキスト全体を「正しい/誤り」と二値判定するのは適切ではない。著者らはF...