本記事は Llumnix: Dynamic Scheduling for Large Language Model Serving の解説記事です。 論文概要(Abstract) LLMサービングにおいて、複数インスタンスへのリクエスト分配は従来のロードバランサ(round-robin、least-connections等)では不十分である。著者らは、リクエストをKVキャッシュごとインス...
19/05/2026 blog paper
LLM load-balancing scheduling +5
本記事は DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving(OSDI 2024)の解説記事です。 論文概要(Abstract) LLM推論は2つのフェーズ(prefill: プロンプト処理、decode: トークン生成)から構成されるが、両フェ...
19/05/2026 blog paper
LLM inference distributed-systems +5
本記事は GPTCache: An Open-Source Semantic Cache for LLM Applications の解説記事です。 論文概要(Abstract) LLMへのAPIリクエストには高いレイテンシとコストが伴う。著者らは、過去のクエリ-レスポンスペアを蓄積し、新規クエリに対して意味的に類似した過去の応答を返すセマンティックキャッシュシステムGPTCacheを提...
19/05/2026 blog paper
LLM semantic-cache Redis +4
本記事は Efficient Memory Management for Large Language Model Serving with PagedAttention(SOSP 2023)の解説記事です。 論文概要(Abstract) LLM推論においてGPU VRAMの60〜80%はKV(Key-Value)キャッシュに消費されるが、既存システムでは内部断片化・外部断片化・予約の過...
19/05/2026 blog paper
LLM inference GPU +5
本記事は Auditing Prompt Caching in Language Model APIs (ICML 2025) の解説記事です。 論文概要(Abstract) 本論文は、プロンプトキャッシュが広く導入されたLLM APIにおいて、キャッシュの存在がタイミングサイドチャネルを生み出し、ユーザー間のプライバシーリスクに繋がる可能性を実証的に検証した研究である。著者らは17のL...
18/05/2026 blog paper
prompt-caching security side-channel +2
本記事は Introducing New KV Cache Reuse Optimizations in NVIDIA TensorRT-LLM の解説記事です。 ブログ概要(Summary) NVIDIAが公開した本記事は、TensorRT-LLM推論フレームワークに新たに導入された2つのKVキャッシュ最適化機能を解説している。1つ目は優先度ベースのキャッシュエビクション(0-100の...
18/05/2026 blog tech_blog
nvidia tensorrt-llm kv-cache +2
本記事は CachedAttention: Cost-Efficient Large Language Model Serving for Multi-turn Conversations の解説記事です。 論文概要(Abstract) CachedAttentionは、マルチターン会話におけるKVキャッシュの再計算コストを削減するために、GPU HBMとCPUメモリの階層構造にKVキャ...
18/05/2026 blog paper
kv-cache multi-turn inference-optimization +2
本記事は Lessons from building Claude Code: Prompt caching is everything の解説記事です。 ブログ概要(Summary) Anthropicのエンジニアリングチームが公開した本記事は、Claude Code(対話型AIコーディングエージェント)の設計において、プロンプトキャッシュがいかに中核的な設計原則であるかを解説している...
18/05/2026 blog tech_blog
prompt-caching claude-code agent +2
本記事は Don’t Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks の解説記事です。 論文概要(Abstract) 本論文は、主要LLMプロバイダ(OpenAI、Anthropic、Google)が提供するプロンプトキャッシュ機能が、マルチターンのエージェントワークフローにお...
18/05/2026 blog paper
prompt-caching llm agent +2
本記事は Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence (arXiv:2407.07061) の解説記事です。 論文概要(Abstract) 本論文は、異なるフレームワーク(AutoGen、LangChain、独自実装)や異なるLLMバックエンド(GPT-4...
17/05/2026 blog paper
multi-agent agent-communication heterogeneous-agents +2