Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Llumnix — マルチインスタンスLLMサービングの動的スケジューリングとライブマイグレーション

本記事は Llumnix: Dynamic Scheduling for Large Language Model Serving の解説記事です。 論文概要(Abstract) LLMサービングにおいて、複数インスタンスへのリクエスト分配は従来のロードバランサ(round-robin、least-connections等)では不十分である。著者らは、リクエストをKVキャッシュごとインス...

📄 論文解説: DistServe — Prefill/Decode分離によるLLMサービングのGoodput最適化

本記事は DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving(OSDI 2024)の解説記事です。 論文概要(Abstract) LLM推論は2つのフェーズ(prefill: プロンプト処理、decode: トークン生成)から構成されるが、両フェ...

📄 論文解説: GPTCache — LLM向けセマンティックキャッシュによる推論コスト削減

本記事は GPTCache: An Open-Source Semantic Cache for LLM Applications の解説記事です。 論文概要(Abstract) LLMへのAPIリクエストには高いレイテンシとコストが伴う。著者らは、過去のクエリ-レスポンスペアを蓄積し、新規クエリに対して意味的に類似した過去の応答を返すセマンティックキャッシュシステムGPTCacheを提...

📄 論文解説: Efficient Memory Management for Large Language Model Serving with PagedAttention

本記事は Efficient Memory Management for Large Language Model Serving with PagedAttention(SOSP 2023)の解説記事です。 論文概要(Abstract) LLM推論においてGPU VRAMの60〜80%はKV(Key-Value)キャッシュに消費されるが、既存システムでは内部断片化・外部断片化・予約の過...

📄 ICML 2025論文解説: Auditing Prompt Caching in Language Model APIs — プロバイダのキャッシュ実装を統計的に暴く

本記事は Auditing Prompt Caching in Language Model APIs (ICML 2025) の解説記事です。 論文概要(Abstract) 本論文は、プロンプトキャッシュが広く導入されたLLM APIにおいて、キャッシュの存在がタイミングサイドチャネルを生み出し、ユーザー間のプライバシーリスクに繋がる可能性を実証的に検証した研究である。著者らは17のL...

✍️ NVIDIA TensorRT-LLM解説: KV Cache Reuse最適化 — 優先度制御とイベントAPIによる推論高速化

本記事は Introducing New KV Cache Reuse Optimizations in NVIDIA TensorRT-LLM の解説記事です。 ブログ概要(Summary) NVIDIAが公開した本記事は、TensorRT-LLM推論フレームワークに新たに導入された2つのKVキャッシュ最適化機能を解説している。1つ目は優先度ベースのキャッシュエビクション(0-100の...

📄 論文解説: CachedAttention — マルチターン会話のKVキャッシュ階層管理によるコスト50%削減

本記事は CachedAttention: Cost-Efficient Large Language Model Serving for Multi-turn Conversations の解説記事です。 論文概要(Abstract) CachedAttentionは、マルチターン会話におけるKVキャッシュの再計算コストを削減するために、GPU HBMとCPUメモリの階層構造にKVキャ...

✍️ Claude Code設計思想解説: Prompt Caching Is Everything — キャッシュファーストなエージェント設計

本記事は Lessons from building Claude Code: Prompt caching is everything の解説記事です。 ブログ概要(Summary) Anthropicのエンジニアリングチームが公開した本記事は、Claude Code(対話型AIコーディングエージェント)の設計において、プロンプトキャッシュがいかに中核的な設計原則であるかを解説している...

📄 論文解説: Don't Break the Cache — エージェントタスクにおけるプロンプトキャッシュ戦略の実証評価

本記事は Don’t Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks の解説記事です。 論文概要(Abstract) 本論文は、主要LLMプロバイダ(OpenAI、Anthropic、Google)が提供するプロンプトキャッシュ機能が、マルチターンのエージェントワークフローにお...