Home
0h-n0 TechBLog
キャンセル

📄 論文解説: When AIs Judge AIs — Agent-as-a-Judgeサーベイ

論文概要(Abstract) AIエージェントの自律性が高まる中、従来の評価指標では不十分な場面が増えている。本サーベイは、(i) ジャッジアーキテクチャの分類体系、(ii) ジャッジシステムに影響するバイアスの分析、(iii) ジャッジ評価に使用されたデータセットのカタログ化、(iv) 異なるジャッジシステムのコスト比較、の4軸で構成されている。60件以上のデータセットと複数のジャッジア...

📄 論文解説: MCPBench — MCPサーバのレイテンシ・信頼性を体系的に評価するベンチマーク

本記事は MCPBench: A Benchmark for Evaluating MCP Servers (arXiv:2506.03233) の解説記事です。 論文概要(Abstract) MCPBench は、Model Context Protocol (MCP) サーバの品質・信頼性・レイテンシ特性を体系的に評価するベンチマークである。12種の代表的な MCP サーバに対して、...

✍️ サーベイ解説: Agentic RAG — エージェント型検索拡張生成の体系的分類と設計パターン

論文概要(Abstract) Agentic Retrieval-Augmented Generation(Agentic RAG)は、従来のRAGパイプラインに自律的AIエージェントを統合するパラダイムです。本サーベイ(Singh et al., 2025)は、Naive RAGからAdvanced RAG、Modular RAG、そしてAgentic RAGへの進化を4段階で体系化し、...

📄 論文解説: Agent-as-a-Judge — エージェントでエージェントを評価する

論文概要(Abstract) 現在のAIエージェント評価は、主に最終的なアウトカムのpass/failで判断されており、中間ステップやプロセス全体の質を評価できていない。本論文は Agent-as-a-Judge フレームワークを提案する。評価者自身がエージェントであり、ツール呼び出し・反復的推論・環境とのインタラクションを通じて動的な評価を行う。さらに、55のAI開発タスクと365の要件...

📄 論文解説: Qwen2-VL — 任意解像度の画像・動画を動的トークン化するVision-Language Model

論文概要(Abstract) Qwen2-VLは、Alibaba Cloudが提案したVision-Language Model(VLM)であり、画像・動画を任意の解像度で処理できるNaive Dynamic Resolutionと、テキスト・画像・動画の位置情報を統一的にモデル化するMultimodal Rotary Position Embedding(M-RoPE)を導入している。2...

📄 論文解説: RouterBench — LLMルーターの包括的ベンチマークによるマルチソースルーティング最適化

論文概要(Abstract) LLMの急速な多様化により、モデルごとに得意タスクとコストが大きく異なる状況が生まれています。RouterBenchは、クエリに応じて最適なLLMを動的選択するLLMルーティングシステムの初の包括的ベンチマークです。12データセット×6モデルで生成した405,000推論インスタンスを用いて、10種のルーティングアルゴリズムを統一条件で評価し、品質とコストのトレ...

📄 論文解説: MMMU-Pro — マルチモーダル理解ベンチマークの堅牢化手法とOCRボトルネック

論文概要(Abstract) MMMU-Proは、MMMUベンチマークの堅牢性を強化した評価フレームワークである。著者らは3段階のパイプライン(テキストのみ正解可能な問題の除外、選択肢の10択への拡張、Vision-Only入力設定の導入)を通じて構築した。18のモデルを評価した結果、MMMUからMMMU-Proへの移行で16.8%〜26.9%の性能低下が観察された。また、Vision-O...

📄 論文解説: PyramidKV — KVキャッシュ12%でFull精度の99%を維持する動的圧縮手法

論文概要(Abstract) PyramidKVは、LLM推論時のKV(Key-Value)キャッシュを動的に圧縮する手法である。著者らは、Transformerの注意パターンがレイヤーによって異なるという観察に基づき、下位レイヤーに多くのKVキャッシュを、上位レイヤーに少ないKVキャッシュを割り当てる「ピラミッド型」の配分戦略を提案している。LLaMA-2-7B-chatでの実験において...

📄 論文解説: RAGCache — Retrieval-Augmented Generationのための効率的な知識キャッシュシステム

論文概要(Abstract) RAGCache は、Retrieval-Augmented Generation(RAG)システムに特化したマルチレベル動的キャッシュシステムである。検索された文書のKVキャッシュをGPUメモリ・CPUメモリ・SSDの3階層に配置し、Radix Tree構造で管理する。さらにRank-Based Reorder戦略により、検索結果の順序が異なっても同一文書セ...

📄 論文解説: Gemini — ネイティブマルチモーダルモデルの設計と画像・音声・動画統合処理

本記事は Gemini: A Family of Highly Capable Multimodal Models (arXiv:2312.11805) の解説記事です。 論文概要(Abstract) Google DeepMindが2023年12月に発表したGeminiは、画像・音声・動画・テキストの4モダリティをネイティブに理解・生成できるマルチモーダルモデルファミリーである。著者ら...