Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Large Language Models are Zero-Shot Reasoners

論文概要(Abstract) 「Large Language Models are Zero-Shot Reasoners」は、LLMがタスク固有の例示なしでも推論能力を発揮できることを示した画期的な研究です。Kojima et al.(2022, 東京大学)は、プロンプトに「Let’s think step by step」(ステップバイステップで考えよう)の一文を追加するだけで、Mul...

✍️ Microsoft Research解説: CORE — LLMのProposer-Rankerアーキテクチャで静的解析の指摘を自動修正

ブログ概要(Summary) CORE(COde REvisions)はMicrosoft Researchが開発した、静的解析ツール(CodeQL、SonarQube等)が検出したコード品質問題を自動修正するLLMベースシステムである。Proposer LLMが修正候補を生成し、Ranker LLMが人間レビュアーの受入基準に基づいて候補をスコアリングする二段構成を採用。Python 5...

✍️ Anthropic解説: Effective Context Engineering for AI Agents

ブログ概要(Summary) Anthropicの応用AIチームが公開した「Effective Context Engineering for AI Agents」は、プロンプトエンジニアリングの次の段階として「コンテキストエンジニアリング」を体系的に解説したブログ記事です。LLMに供給するトークンの設計・管理・最適化を包括的にカバーし、Context Rot問題、システムプロンプト設計、...

📄 論文解説: A-RAG — 階層的検索インターフェースによるエージェントRAGのスケーリング

論文概要(Abstract) A-RAG(Agentic Retrieval-Augmented Generation)は、LLMに階層的検索インターフェースを直接公開し、モデル自身が検索戦略を適応的に決定するフレームワークである。従来のRAGがアルゴリズム駆動で検索パイプラインを固定していたのに対し、A-RAGはLLMにキーワード検索・セマンティック検索・チャンク読み取りの3つのツールを...

📄 論文解説: MLE-bench — 75のKaggleコンペでMLエンジニアリングエージェントを評価する

論文概要(Abstract) MLE-bench(Machine Learning Engineering Benchmark)は、OpenAIが2024年に開発した、AIエージェントのMLエンジニアリング能力を評価するためのベンチマークです。Kaggleの実コンペティション75件を「データリーク防止」処置を施した上で再構成し、エージェントにデータ分析、特徴量エンジニアリング、モデル学習、...

📄 論文解説: RAGLAB — RAGアルゴリズムの公平比較を実現するモジュラー研究フレームワーク

論文概要(Abstract) RAGLABは、既存のRAGアルゴリズムを再現し、新規アルゴリズムを最小限の労力で開発するためのモジュラー・研究指向フレームワークです。6種類の既存RAGアルゴリズム(Naive RAG、Self-RAG、FLARE、Iter-RetGen、Active RAG、RRR)を統一インターフェースで実装し、10種類のベンチマークデータセットで公平な比較評価を可能に...

📄 論文解説: Searching for Best Practices in RAG — 1,400実験が示すマルチソースRAGパイプラインの最適解

論文概要(Abstract) 「Searching for Best Practices in Retrieval-Augmented Generation」は、RAGパイプラインの各コンポーネント(クエリ変換、検索戦略、リランキング、コンテキスト圧縮、生成)を1,406回の系統的実験で比較検証した論文である。特にマルチソースQAタスクでは、ソースルーティングにより精度+9.2%、Reci...

✍️ NVIDIA解説: NeMo Retrieverリランキングで実現するRAGパイプライン精度向上

ブログ概要(Summary) NVIDIAのデベロッパーブログ記事は、RAGパイプラインにリランキング(Re-Ranking)を組み込むことで検索精度を向上させる手法を解説する。NVIDIA NeMo Retriever Rerankingモデル(Mistral-7BベースのLoRAファインチューニング版)をNIM(NVIDIA Inference Microservice)として提供し、...

📄 論文解説: Reasoning Language Models: A Blueprint — 推論言語モデル構築の体系的設計図

論文概要(Abstract) 本論文は、OpenAI o1/o3、DeepSeek R1、Gemini Thinkingなど、近年急速に発展した推論言語モデル(Reasoning Language Models, RLM)の構築方法を体系的に整理したブループリントを提示する。RLMを5つの構成要素(基盤LLM、探索アルゴリズム、報酬モデル、学習パイプライン、長Chain-of-Though...

✍️ サーベイ解説: Agentic RAG — エージェント型検索拡張生成の体系的分類と実装フレームワーク

論文概要(Abstract) 本論文は、静的なRAGパイプラインから自律的なAIエージェントがリトリーバルと生成を動的にオーケストレーションするAgentic RAGへの進化を体系的にサーベイした研究です。アーキテクチャの複雑性に基づく新しい分類体系(taxonomy)を提示し、Single-Agent(Corrective RAG、Self-RAG、Adaptive RAG、ReActベ...