Home
0h-n0 TechBLog
キャンセル

✍️ NVIDIA AI Blueprint解説: コスト効率的LLMルーティングの本番実装パターン

ブログ概要(Summary) NVIDIAが公開したAI Blueprint for Cost-Efficient LLM Routingは、複数のLLMに対してタスク複雑度ベースでプロンプトを動的ルーティングする本番向けフレームワークです。Rustベースの高性能ルーターをTriton Inference Server上に構築し、NVIDIA NIMおよびサードパーティLLM(OpenAI...

✍️ AWS公式解説: Multi-Provider Generative AI Gateway — LiteLLMによるマルチプロバイダLLM統合アーキテクチャ

ブログ概要(Summary) AWS公式ブログで公開されたMulti-Provider Generative AI Gatewayリファレンスアーキテクチャは、LiteLLMをコアコンポーネントとして使用し、Amazon Bedrock・OpenAI・Azure OpenAIなど複数のLLMプロバイダへのリクエストを統一インターフェースで管理するゲートウェイパターンを提示する。組み込みリト...

📄 NeurIPS 2024論文解説: Found in the Middle — Ms-PoEでLost in the Middle問題を解決する

論文概要(Abstract) LLMは最大400万トークンの安定した言語モデリングが可能になったが、コンテキスト中間部の情報を正しく利用できない「Lost in the Middle」問題は依然として未解決であった。本論文ではMulti-scale Positional Encoding(Ms-PoE)を提案する。Ms-PoEはRoPE(Rotary Position Embedding)...

📄 論文解説: SWE-agent — エージェント・コンピュータインターフェースによる自動バグ修正

論文概要(Abstract) SWE-agentは、LLMエージェントがソフトウェアエンジニアリングタスク(バグ修正・機能追加)を効率的に実行するためのAgent-Computer Interface(ACI)を提案した論文である。従来のbashシェルを直接使う方式ではなく、エージェント専用に設計されたコマンド群(search、view、edit等)を提供することで、GPT-4ベースでSW...

📄 論文解説: RAG-Fusion — マルチクエリ生成×RRFでRAG検索の網羅性を向上させる手法

論文概要(Abstract) RAG-Fusionは、従来のRAG(Retrieval-Augmented Generation)パイプラインの検索精度を向上させるため、マルチクエリ生成とReciprocal Rank Fusion(RRF)を組み合わせた手法です。ユーザーの単一クエリからLLMで複数のクエリバリエーションを生成し、各クエリで並列に検索を実行した後、RRFで結果を統合します...

📄 論文解説: A Systematic Review of Reliability Frameworks for Production LLM Systems

論文概要(Abstract) 本論文は、本番グレードのLLMシステムにおける信頼性フレームワークの体系的レビューである。47件の本番事例・グレーリテラチャを統合し、構造化出力バリデーション、サーキットブレーカーとフォールバック機構によるグレースフルデグラデーション、プロンプトエンジニアリング戦略、LLMワークロード向け監視アプローチを包括的に分析している。LLMが従来ソフトウェアと異なる非...

📄 論文解説: Mixture-of-Agents — 複数LLMの協調で単体GPT-4oを超える品質を実現

論文概要(Abstract) Mixture-of-Agents(MoA)は、複数のLLMを層状アーキテクチャで組み合わせ、各モデルが他モデルの出力をコンテキストとして参照しながら応答品質を反復的に改善する手法です。Together AIの研究チームにより提案され、オープンソースモデルのみでGPT-4oを上回る品質(AlpacaEval 2.0 LC: 65.1% vs 57.5%)を達成...

📄 論文解説: Corrective Retrieval Augmented Generation (CRAG)

論文概要(Abstract) Corrective Retrieval Augmented Generation(CRAG)は、RAGパイプラインの検索品質を自動評価し、品質に応じて異なる補正アクションを発火させるプラグイン型フレームワークである。軽量なRetrieval Evaluator(T5ベース)が検索結果の関連性を3段階(Correct / Ambiguous / Incorre...

📄 論文解説: MetaGPT — SOP駆動マルチエージェント協調フレームワーク

論文概要(Abstract) MetaGPTは、人間のソフトウェア開発チームにおける標準業務手順(SOP: Standard Operating Procedures)をLLMエージェントに埋め込むことで、マルチエージェント協調の品質と効率を大幅に向上させたフレームワークである。Product Manager、Architect、Engineer、QA Engineerなどの役割をエージェ...

📄 論文解説: Lost in the Middle — LLMはロングコンテキストをどう使うか

論文概要(Abstract) LLMが長いコンテキストを入力として受け取れるようになった一方で、その情報をどれほど実際に活用できているかは十分に研究されていなかった。本論文では、(1)マルチドキュメント質問応答と(2)キーバリュー検索という2タスクを用いて、入力コンテキスト内の情報位置がLLMの性能にどう影響するかを体系的に分析した。関連情報がコンテキストの先頭・末尾にある場合は高精度だが...