Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Semantic Caching for LLM-Driven RAG Systems — コスト効率の高いセマンティックキャッシュ戦略

論文概要(Abstract) 本論文は、LLM駆動のRAG(Retrieval-Augmented Generation)システムにおけるセマンティックキャッシュの体系的な設計と評価を提示する。クエリのベクトル埋め込みに基づく類似度判定により、過去の回答を再利用する2層キャッシュ構造を提案。HotpotQA・Natural Questionsでの実験で、キャッシュヒット率40-60%時にレ...

📄 ICLR 2025論文解説: JudgeBench --- LLM-as-Judgeの評価ベンチマーク

論文概要(Abstract) JudgeBenchは、LLMを評価者(Judge)として使用する際の信頼性を体系的に測定するベンチマークである。著者らは、知識(Knowledge)、推論(Reasoning)、数学(Math)、コーディング(Coding)の4領域にわたる350問の困難な応答ペアを構築し、客観的な正解ラベルに基づいてLLM-based Judgeの判定精度を評価する。論文の...

✍️ NVIDIA解説: Traditional RAG vs Agentic RAG — AIエージェントが動的知識を必要とする理由

ブログ概要(Summary) NVIDIAが公開したテックブログ「Traditional RAG vs. Agentic RAG」(Sessions, 2025)は、従来のRAGが抱える「1回検索→1回生成」の限界を明確にし、AIエージェントがRAGを動的なツールとして活用するAgentic RAGの5段階ワークフローを体系化しています。さらに、NVIDIA AI-Q Blueprintと...

✍️ Care Accessが Amazon Bedrock プロンプトキャッシュで86%コスト削減を達成した事例解説

ブログ概要(Summary) Care Accessは医療スクリーニング参加者の健康リソース(臨床試験を含む)のマッチングを行う企業である。AWSとの協力により、Amazon Bedrockを使った医療記録レビューソリューションを6週間で立ち上げた。電子カルテ(EHR)の処理にBedrock Prompt Cachingを適用した結果、データ処理コストを86%削減し、処理速度を66%向上さ...

✍️ AWS: Amazon Bedrock AgentsをRagasとLLM-as-a-Judgeで評価する

ブログ概要(Summary) AWSが公開したこのブログは、Amazon Bedrock Agentsの評価パイプラインをオープンソースのRagasライブラリとLLM-as-a-Judgeを組み合わせて構築する実践ガイドである。RAG評価(Faithfulness、Context Recall等)、Text-to-SQL評価(Answer Correctness、SQL Semantic ...

✍️ Anthropic: AIエージェント評価の実践ガイド — Demystifying Evals

ブログ概要(Summary) Anthropicのエンジニアリングチームが公開した本ブログは、AIエージェント評価(eval)の全体像を体系的に整理したガイドである。評価の基本用語定義、3種類のグレーダー(コードベース・モデルベース・人間)、pass@kとpass^kの使い分け、そして評価システム構築の8ステップロードマップを提供している。SWE-Bench Verified、Termin...

📄 論文解説: ARC Prize 2025 Technical Report — ARC-AGI-2ベンチマークの設計と汎用知能評価

論文概要(Abstract) ARC Prize 2025 Technical Reportは、汎用人工知能(AGI)の評価を目的としたARC-AGI-2ベンチマークの設計と評価結果を報告する技術文書である。ARC-AGI-1がo3(OpenAI)により87.5%を達成し人間レベルに接近したことを受け、より高次の抽象推論を要求するARC-AGI-2を導入した。著者らは、現行の大規模言語モデ...

📄 論文解説: MAESTRO — Multi-Agent Evaluation and Testing for Real-world Orchestration

論文概要(Abstract) MAESTROは、LLMベースのマルチエージェントシステム(MAS)のテスト・信頼性・観測可能性を評価するためのスイートである。統一インタフェースを通じてMAS構成と実行を標準化し、MCP-Agent、ADK、AutoGen、LangGraphなど主要フレームワークを横断的にサポートする。著者らは12の代表的MASインスタンスを用いた制御実験により、MAS実行...