Home
0h-n0 TechBLog
キャンセル

📄 論文解説: ConvKV — マルチターン会話のコスト効率的KVキャッシュ管理

論文概要 本記事は、Liu et al. (2024) による論文「Cost-Efficient Large Language Model Serving for Multi-turn Conversations」(arXiv:2409.08239)の解説記事です。ConvKVは、マルチターン会話におけるLLM推論コストの増大問題に対し、会話ターン単位のセグメンテーションと3因子重要度スコ...

✍️ AWS公式ブログ解説: LLMレスポンスコストとレイテンシの効果的なキャッシュ最適化

ブログ概要 本記事はAWS公式ブログ「Optimize LLM response costs and latency with effective caching」の解説記事です。AWSはLLMアプリケーションのコスト・レイテンシ課題に対し、プロンプトキャッシュ、リクエスト応答キャッシュ、セマンティックキャッシュの3種を組み合わせた多層キャッシュ戦略を提唱しています。ブログでは、Amazo...

📄 論文解説: SGLang — RadixAttentionによる自動KVキャッシュ再利用

本記事は SGLang: Efficiently Executing Structured Language Model Programs の解説記事です。 論文概要(Abstract) SGLangは、LLMの構造化プログラム(複数のLLM呼び出しを組み合わせた処理パイプライン)を効率的に実行するためのシステムである。著者らはフロントエンドとして構造化生成のためのドメイン固有言語を、バ...

📄 SOSP 2023論文解説: vLLM — PagedAttentionによるLLMサービングのメモリ効率化

論文概要(Abstract) 本記事は、Kwon et al. による論文 “Efficient Memory Management for Large Language Model Serving with PagedAttention” の解説記事です。 LLMの高スループットサービングにはリクエストのバッチ処理が不可欠であるが、既存システムはKVキャッシュの静的連続メモリ割り当てに...

📄 論文解説: Prompt Cache — モジュラーAttention再利用による低レイテンシ推論

本記事は、Gim et al. (2024) による論文「Prompt Cache: Modular Attention Reuse for Low-Latency Inference」の解説記事です。LLM推論において、プロンプト間で共通するテキストセグメントのKVキャッシュを事前計算・再利用し、Time To First Token (TTFT) を削減する手法を、数式・実装・実験結果を...

✍️ LangChain解説: Agent Protocol — LLMエージェント間相互運用のための標準インターフェース

ブログ概要(Summary) 本記事は LangChain公式ブログ「Agent Protocol: Interoperability for LLM agents」(2024年11月19日公開、著者: Ankush Gola)の解説記事です。 LLMエージェントのフレームワークが乱立する中、異なるフレームワーク間でエージェントを連携させる標準的な方法が求められています。このブログでは、...

📄 論文解説: DPBench — 食事する哲学者問題で測るマルチエージェントLLMの協調限界

本記事は DPBench の解説記事です。 論文概要(Abstract) DPBenchは、LLMベースのマルチエージェントシステムが同時的な資源競合の下でどのように協調するかを評価するためのベンチマークである。著者らは古典的な食事する哲学者問題(Dining Philosophers Problem)をフレームワークとして採用し、行動プロトコル、通信構造、グループサイズを独立して変化さ...

✍️ LangChain解説: LangSmith Engineによるエージェント障害の自動診断と修正

本記事は Introducing LangSmith Engine の解説記事です。 ブログ概要(Summary) LangSmith Engineは、LangChainが2026年5月のInterrupt 2026カンファレンスでパブリックベータとして発表した機能である。本番環境のトレースデータを継続的に監視し、障害検出、パターンクラスタリング、根本原因診断、修正Pull Reques...

✍️ Anthropic解説: マルチエージェントリサーチシステムの構築と障害診断

本記事は How we built our multi-agent research system の解説記事です。 ブログ概要(Summary) Anthropicは、自社のResearch機能をorchestrator-workerパターンで構築したマルチエージェントシステムとして公開している。リードエージェント(Claude Opus 4)がクエリを分析して戦略を策定し、複数の特殊...