本記事は Benchmarking Haystack Pipelines for Optimal Performance(deepset公式ブログ、2024年6月24日公開)の解説記事です。 ブログ概要(Summary) deepset社のSenior NLP EngineerであるDavid Batistaは、Haystack 2.xのRAGパイプラインを系統的にベンチマークする手法と...
本記事は Introducing Contextual Retrieval(Anthropic, 2024年9月)の解説記事です。 ブログ概要(Summary) Anthropicは、RAG(Retrieval-Augmented Generation)パイプラインにおける検索精度の課題を解決するためにContextual Retrievalを提案している。従来のチャンク分割では文書全体...
本記事は Building Effective AI Agents(Anthropic Research、2024年12月19日公開)の解説記事です。 ブログ概要(Summary) Anthropicが2024年12月に公開したAIエージェント設計の公式ガイドである。著者のErik SchluntzとBarry Zhangは、数十チームのエージェント構築を支援した経験から、ワークフロー(...
本記事は Agent Design Pattern Catalogue: A Collection of Architectural Patterns for Foundation Model based Agents(Yilmaz et al., 2024)の解説記事です。 論文概要(Abstract) 本論文は、基盤モデル(Foundation Model)ベースのAIエージェントを...
本記事は Empowering Working Memory for Large Language Model Agents(2024)の解説記事です。 論文概要(Abstract) LLMエージェントにおける作業記憶(Working Memory)は、現在のタスク実行に必要な情報を一時的に保持・操作する認知機能に対応する。本論文は、LLMのコンテキストウィンドウを作業記憶として捉え、そ...
本記事は Compound AI Systems Blueprint Architecture(ICDE 2025 DAISワークショップ)の解説記事です。 論文概要(Abstract) LLMの産業利用が進む中、単一モデルからCompound AIシステム(複数AIコンポーネントの協調システム)への移行が加速している。著者らは、エンタープライズ環境でエージェントとデータをオーケストレー...
この記事はAIによって生成されたものであり、内容の正確性については読者自身でご確認ください。 論文概要 RAGBench(Friel, Belyi, Sanyal, 2024)は、Retrieval-Augmented Generation(RAG)システムの包括的評価を目的とした大規模ベンチマークデータセットである。著者らは約10万件のラベル付き事例を12のソースデータセットか...
本記事は How Good are LLM-based Rerankers? An Empirical Analysis of State-of-the-Art Reranking Models(Abdallah et al., EMNLP 2025 Findings)の解説記事です。 論文概要(Abstract) 本論文は、LLMベース・軽量コンテキスト型・ゼロショット型を含む最先端の...
本記事は Reflexion: Language Agents with Verbal Reinforcement Learning(Shinn et al., NeurIPS 2023)の解説記事です。 論文概要(Abstract) Reflexionは、大規模言語モデル(LLM)エージェントが勾配更新なしに過去の経験から学習するためのフレームワークである。従来の強化学習がスカラー報酬...
本記事は RouteLLM: Learning to Route LLMs with Preference Data(ICLR 2025採択)の解説記事です。 論文概要(Abstract) RouteLLMは、推論時にクエリの複雑度に応じて強いLLM(GPT-4等)と弱いLLM(Mixtral-8x7B等)を動的に振り分けるルーターモデルの学習フレームワークである。Chatbot Are...