Home
0h-n0 TechBLog
キャンセル

📄 論文解説: StepChain GraphRAG — 質問分解×BFS推論によるマルチホップQA精度向上

論文概要(Abstract) 本記事は arXiv:2510.02827 の解説記事です。 StepChain GraphRAGは、マルチホップ質問応答(Multi-hop QA)において、質問分解(Question Decomposition)とナレッジグラフ上のBFS Reasoning Flow(BFS-RF)を組み合わせた検索拡張生成フレームワークである。著者らは、従来のRAG手...

📄 論文解説: Intelligent Router for LLM Workloads — ワークロード特性を活用したLLM推論の負荷分散

本記事は Intelligent Router for LLM Workloads: Improving Performance Through Workload-Aware Load Balancing の解説記事です。 論文概要(Abstract) LLM推論ワークロードにはprefillフェーズとdecodeフェーズという異なるリソース要求を持つ2つの段階が存在する。著者らは、既存...

📄 EMNLP 2024論文解説: GMeLLo — ナレッジグラフ統合によるLLMベースマルチホップQAの知識更新対応

論文概要 本記事は LLM-Based Multi-Hop Question Answering with Knowledge Graph Integration in Evolving Environments(Chen et al., EMNLP 2024 Findings)の解説記事です。 大規模言語モデル(LLM)は広範な知識を内部パラメータに保持しているが、現実世界の事実は絶え...

📄 論文解説: Automated Structural Testing of LLM-Based Agents — トレース・モック・アサーションによる構造テスト手法

本記事は Automated structural testing of LLM-based agents: methods, framework, and case studies の解説記事です。 論文概要(Abstract) LLMベースエージェントの自動テストにおいて、従来のユーザーレベル受入テスト(ブラックボックス)では内部動作の検証が困難である。著者らは、ソフトウェア工学の構...

📄 ICML 2026論文解説: Beyond the Final Answer — ツール利用エージェントの推論軌跡を参照フリーで評価するTRACEフレームワーク

本記事は Beyond the Final Answer: Evaluating the Reasoning Trajectories of Tool-Augmented Agents の解説記事です。 論文概要(Abstract) 従来のエージェント評価ベンチマークは最終回答の正誤(answer matching)に焦点を当てているが、ツール利用エージェントの推論プロセスには効率性(e...

📄 ACL 2026論文解説: AgentEval — DAG構造によるステップレベルエージェント評価とエラー伝播追跡

本記事は AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking の解説記事です。 論文概要(Abstract) AgentEvalは、マルチステップAIエージェントシステムの評価において、実行フローをDAG(有向非巡回グラフ)としてモデル化...

📄 論文解説: Judging the Judges — LLM-as-a-Judgeパイプラインにおけるバイアス緩和戦略の体系的評価

本記事は Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines の解説記事です。 論文概要(Abstract) LLM-as-a-Judgeは、LLM出力の自動評価において広く採用されているが、スタイルバイアス・位置バイアス・冗長性バイアス...

📄 論文解説: TRAJECT-Bench — エージェントのツール使用軌跡を細粒度で評価するベンチマーク

本記事は TRAJECT-Bench: A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use の解説記事です。 論文概要(Abstract) TRAJECT-Benchは、LLMエージェントのツール使用能力を軌跡レベルで評価するベンチマークである。従来のベンチマークが最終回答の正誤のみを評価していたのに対し、本ベンチマー...