Home
0h-n0 TechBLog
キャンセル

📄 論文解説: GAIA — 汎用AIアシスタントの実力を測る466タスクベンチマーク

論文概要(Abstract) GAIA(General AI Assistants)は、Meta AI、HuggingFace、AutoGPTチームが共同開発した、汎用AIアシスタントの能力を評価するための466タスクベンチマークです。「人間には簡単だがAIには難しい」タスクを設計原則とし、Web検索、ファイル操作、マルチモーダル推論、複数ステップの論理推論を組み合わせた現実的なタスクで構...

📄 論文解説: Tree of Thoughts — LLMによる探索的問題解決フレームワーク

論文概要(Abstract) Tree of Thoughts(ToT)は、LLMの推論を木構造探索として定式化する推論フレームワークです。Yao et al.(2023, Princeton/DeepMind)は、Chain-of-Thought(CoT)の線形的な推論をBFS/DFSによる木探索に拡張し、複数の思考パスの並行展開・評価・バックトラックを可能にしました。Game of 2...

✍️ NVIDIA解説: LangGraphによるHuman-in-the-Loop AIエージェントの構築パターン

ブログ概要(Summary) NVIDIAの技術ブログ「Build Your First Human-in-the-Loop AI Agent with NVIDIA NIM」は、LangGraphを使ったHITL(Human-in-the-Loop)承認フロー付きAIエージェントの構築パターンを実装レベルで解説している。2つの専門エージェント(Content Creator + Digi...

✍️ サーベイ解説: リランキングモデルの進化 — ヒューリスティクスからLLMまでの体系的分類

論文概要(Abstract) 本サーベイ論文は、情報検索(IR)システムにおけるリランキング手法の進化を、ヒューリスティクス手法からLLM(大規模言語モデル)ベースの手法まで体系的に整理したものである。Cross-Encoder、T5ベースの系列生成モデル、Graph Neural Networks(GNN)、知識蒸留による効率化手法、そしてLLMのプロンプティングやファインチューニングに...

📄 論文解説: LLM4CR — RAGとイテレーティブリファインメントによるLLMベースコードレビュー自動化

論文概要(Abstract) LLM4CRは、コードレビュー自動化のための包括的なLLMベースパイプラインである。Reviewer LLM、Refiner LLM、Evaluator LLMの3エージェントが協調し、レビューコメント生成とコード改善の2タスクを同時に実行する。RAG(Retrieval-Augmented Generation)により過去のレビュー履歴を活用してコメント品質...

📄 論文解説: τ-bench — ツール・エージェント・ユーザー三者間対話の信頼性ベンチマーク

論文概要(Abstract) τ-bench(Tool-Agent-User Benchmark)は、Sierra AIのShishir G. Patilらが2024年に提案した、LLMエージェントの信頼性を評価するベンチマークです。従来のベンチマークが「1回のタスク成功率」を測定するのに対し、τ-benchは「k回連続で成功するか」を測定するpass^k指標を導入し、エージェントの一貫性...

📄 論文解説: RAGAS — 参照フリーRAGパイプライン自動評価フレームワーク

論文概要(Abstract) RAGAS(Retrieval Augmented Generation Assessment)は、RAGパイプラインを人手アノテーションなしで自動評価するフレームワークです。RAGシステムの品質を「検索品質」と「生成品質」の2軸に分解し、Faithfulness(事実整合性)、Answer Relevancy(回答関連性)、Context Precision...

📄 論文解説: Self-Consistency Improves Chain of Thought Reasoning in Language Models

論文概要(Abstract) Self-Consistencyは、Chain-of-Thought(CoT)Promptingの精度を大幅に向上させるデコーディング戦略です。Wang et al.(2022, Google Brain)は、従来のGreedyデコーディングに代えて、複数の推論パスをサンプリングし、最も一貫性の高い回答を多数決で選択する手法を提案しました。GSM8Kで+17....

✍️ NVIDIA解説: Agent Morpheus — 生成AIによるエンタープライズCVE分析の自動化

ブログ概要(Summary) NVIDIAが公開したAgent Morpheusは、生成AIを活用してコンテナイメージのCVE(Common Vulnerabilities and Exposures)トリアージを自動化するシステムです。4つのLoRAアダプタを動的に切り替える単一NIMコンテナ、イベント駆動型RAGパイプライン、Morpheusフレームワークによる非同期並列処理を組み合わ...