Home
0h-n0 TechBLog
キャンセル

✍️ AWS技術ブログ解説: Amazon Bedrock AgentsをRagasとLLM-as-a-Judgeで評価する実践ガイド

ブログ概要(Summary) AWSが公開した「Evaluate Amazon Bedrock Agents with Ragas and LLM-as-a-judge」は、Amazon Bedrock上で動作するAIエージェントの品質を、RagasライブラリとLLM-as-a-Judge手法を用いて体系的に評価するフレームワークを解説した技術ブログである。エージェントの目標達成度(Cha...

📄 NAACL 2025論文解説: MMAU — 5ドメイン×5能力でLLMエージェントを網羅的に評価するベンチマーク

論文概要(Abstract) MMAU(Massive Multitask Agent Understanding)は、LLMエージェントの能力を5ドメイン×5能力次元の20タスク、3,000件以上のプロンプトで網羅的に評価するオフラインベンチマークである。NAACL 2025 Findingsに採択された本論文は、GPT-4o、Claude-3.5-Sonnet、Llama-3.1-40...

📄 論文解説: AgentBoard — マルチターンLLMエージェントの分析的評価ボード

論文概要(Abstract) AgentBoardは、マルチターンLLMエージェントをマイルストーンベースのProgress Rate(進捗率)で評価する分析的フレームワークである。ALFWorld、WebShop、WebArenaなど9つのインタラクティブ環境にわたる1,013の評価インスタンスを提供し、GPT-4やClaude-2を含む主要LLMを包括的に評価した。バイナリな成功/失敗...

✍️ Anthropic Engineering解説: Demystifying Evals for AI Agents — エージェント評価の実践的フレームワーク

ブログ概要(Summary) 「Demystifying Evals for AI Agents」は、Anthropicのエンジニアリングチームが2026年1月に公開したAIエージェント評価の包括的ガイドである。Claude Codeの開発経験と顧客企業(Descript、Bolt等)との協業から得られた知見を体系化し、3種グレーダー(Code-Based / Model-Based / ...

📄 論文解説: SWE-bench — 実世界GitHubイシューでLLMのソフトウェアエンジニアリング能力を測る

論文概要(Abstract) SWE-bench は Princeton NLP グループが提案した、実世界のGitHubイシューを用いてLLMのソフトウェアエンジニアリング能力を評価するベンチマークである。Django、Flask、scikit-learn など12の人気Pythonリポジトリから2,294件のイシュー・プルリクエストペアを収集し、モデルに対して「イシュー記述を読み解き」...

📄 COLING 2025論文解説: Benchmark Self-Evolving — マルチエージェントによる動的LLM評価フレームワーク

論文概要(Abstract) Benchmark Self-Evolvingは、マルチエージェントシステムを活用して既存のベンチマークを動的に拡張するフレームワークである。6つのリフレーミング操作を定義し、元のベンチマーク問題から派生する新しい評価インスタンスを自動生成する。これにより、データ汚染(data contamination)によるスコア膨張を回避し、LLMの真の問題解決能力をよ...

✍️ Microsoft Research解説: LLM評価のための完全メトリクスフレームワーク — GPU利用率からユーザー満足度まで

ブログ概要(Summary) Microsoft ResearchのExperimentation Platform(ExP)チームが2023年9月に発表した技術記事で、LLM機能の評価に必要なメトリクスを4カテゴリに体系化したフレームワークを提唱している。従来のA/Bテストに加え、LLM特有の評価軸(GPU利用率、Responsible AI、ストリーミング性能、ユーティリティ)を統合し...

✍️ LangChain公式解説: マルチエージェントアーキテクチャの4パターン — Subagents・Skills・Handoffs・Router徹底比較

ブログ概要(Summary) LangChainのSydney Runkleが2026年1月に公開した「Choosing the Right Multi-Agent Architecture」は、マルチエージェントシステムの4つのアーキテクチャパターン — Subagents、Skills、Handoffs、Router — を体系的に比較分析した記事である。各パターンの強み・弱み・適用場...

📄 論文解説: LLMの完全バイナリ化に挑む — W(1+1)A(1×4)ポストトレーニング量子化の技術詳細

論文概要(Abstract) 本論文は、既に学習済みのLLM(Llama等)を追加学習なしで重み1ビット+活性化1ビットに量子化する「ポストトレーニング量子化(PTQ)」手法を提案する。核となるのは W(1+1)A(1×4) 構成と呼ばれるフレームワークで、重みにはHessian情報を活用した細粒度グルーピング+EM(期待値最大化)ベースの最適量子化点決定を適用し、活性化にはINT4量子化...

📄 NeurIPS 2024論文解説: LLM-Check — LLMのHallucination検出手法の体系的評価

論文概要(Abstract) LLM-Checkは、大規模言語モデルにおけるHallucination検出手法を体系的に調査した研究である。単一モデル応答からのHallucination検出において、内部状態の分析、注意機構のパターン、出力確率スコアを活用する手法を提案・評価し、ホワイトボックスとブラックボックス両方の設定で動作する検出フレームワークを構築した。既存手法と比較して45x〜4...