Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Lost in the Middle — LLMが長文コンテキストの中間を無視するU字型性能曲線の発見

論文概要(Abstract) 「Lost in the Middle」は、LLMが長いコンテキスト内の情報を均等に利用していないことを体系的に実証した基礎研究である。関連情報がコンテキストの先頭または末尾にある場合は高い性能を示すが、中間に位置する場合は20〜30ポイント性能が低下するU字型性能曲線を発見した。この現象はGPT-3.5-Turbo、Claude 1.3を含む複数のモデルで一...

✍️ Microsoft Research解説: LLMLinguaシリーズ — プロンプト圧縮技術の進化と20倍圧縮の実現

ブログ概要(Summary) Microsoft Researchが開発したLLMLinguaシリーズは、LLMへの入力プロンプトを圧縮し、推論コスト削減とレイテンシ短縮を実現するプロジェクトである。初代LLMLingua(EMNLP 2023)はパープレキシティベースの粗粒度→細粒度圧縮で最大20倍の圧縮を達成。LongLLMLingua(ACL 2024)は長文コンテキスト特化の拡張で...

✍️ Microsoft Research解説: How to Evaluate LLMs — 本番LLM評価のための完全メトリクスフレームワーク

ブログ概要(Summary) Microsoft Researchの「How to Evaluate LLMs: A Complete Metric Framework」は、Azure AI Foundryでの大規模LLM運用経験から導き出された包括的な評価メトリクスフレームワークを体系化した記事である。評価軸をGPU利用率・Responsible AI・パフォーマンス・ユーティリティの4...

📄 論文解説: ACON — 自然言語ガイドライン最適化による長期LLMエージェントのコンテキスト圧縮

論文概要(Abstract) LLMエージェントが動的な環境でタスクを解決する際、ツール呼び出しの繰り返しによりコンテキスト長が膨張する。ACON(Agent Context Optimization)は、自然言語空間での圧縮ガイドライン最適化というユニークなアプローチで、環境観測(observation)とインタラクション履歴(history)の両方を圧縮するフレームワークである。「圧縮...

✍️ NVIDIA技術ブログ解説: Mastering LLM Techniques: LLMOps — 本番LLMパイプラインの設計パターン

ブログ概要(Summary) NVIDIAの技術ブログ「Mastering LLM Techniques: LLMOps」は、LLMアプリケーションを本番環境で運用するためのLLMOps(LLM Operations)のフレームワークを体系化した記事である。従来のMLOpsを基盤としつつ、LLM固有の5つの運用柱—プロンプト管理、RAGアーキテクチャ、ガードレール、エージェント/チェーン管...

📄 論文解説: LLMエージェントのメモリ機構サーベイ — 記憶の源泉・形式・操作の統一的分類

論文概要(Abstract) 本論文は、LLMベースのエージェントにおけるメモリ機構を包括的にサーベイした研究である。エージェントの「自己進化能力」の基盤としてメモリを位置づけ、メモリの源泉(sources)・形式(forms)・操作(operations)の3軸で既存研究を体系的に整理している。さらに、ロールプレイ・社会シミュレーション・パーソナルアシスタント・オープンワールドゲーム・コ...

📄 論文解説: MemGPT — OS仮想メモリをLLMに適用し無限コンテキストを実現するアーキテクチャ

論文概要(Abstract) MemGPT(Memory GPT)は、オペレーティングシステムの仮想メモリ管理をLLMのコンテキスト管理に適用したシステムである。LLMの固定長コンテキストウィンドウ(メインメモリ)と外部ストレージ(ディスク)の間でデータを自律的にページング(ページイン/ページアウト)することで、原理上無限長のコンテキストを処理する。LLM自身が「メモリ管理関数」を呼び出し...

✍️ Anthropic公式ガイド解説: AIエージェントのためのContext Engineering — 4戦略と実装パターン

ブログ概要(Summary) Anthropicが公開した「Effective Context Engineering for AI Agents」は、Claude Codeの開発・運用経験から導かれたコンテキスト管理の設計原則と実装パターンを体系的にまとめた公式ガイドである。コンテキストウィンドウを「有限の注意力予算(attention budget)」として捉え、最小限の高信号トークン...

📄 論文解説: PromptOps — プロダクション向けプロンプトバージョニングとライフサイクル管理

論文概要(Abstract) 本論文は、プロンプトをコードと同等の「デプロイ可能なアーティファクト」として扱うPromptOps概念を提唱する。Gitベースのプロンプトバージョン管理、セマンティックバージョニング(major.minor.patch)によるプロンプト変更の影響度分類、自動リグレッションテスト、ステージング環境でのカナリアリリース(5%→20%→50%→100%)を統合したシ...

📄 論文解説: LLMLingua-2 — GPT-4蒸留によるタスク非依存プロンプト圧縮で3-6倍高速化

論文概要(Abstract) LLMLingua-2は、タスク非依存のプロンプト圧縮手法である。従来のLLMLinguaが情報エントロピーベースの指標で圧縮対象を決定していたのに対し、LLMLingua-2はGPT-4から圧縮知識を蒸留し、トークン分類タスクとして圧縮を定式化する。XLM-RoBERTa-largeを分類器として使用し、各トークンの保持/破棄を双方向コンテキストで判断するこ...