Home
0h-n0 TechBLog
キャンセル

📄 ICLR 2025 Spotlight論文解説: TheAgentCompany — 実世界タスクでのLLMエージェントベンチマーク

論文概要(Abstract) TheAgentCompanyは、LLMエージェントが実世界の業務タスクをどの程度自律的に遂行できるかを評価するベンチマークである。ソフトウェア企業の環境をセルフホスト型のインフラで再現し、GitLab・RocketChat・ownCloud・Planeなど実務で使われるツール群を統合した175の業務タスクを提供する。最も高性能なエージェントでも自律的に完了で...

✍️ NVIDIA解説: 合成データによるRAGパイプライン評価・最適化 — NeMo Curator実践ガイド

ブログ概要(Summary) NVIDIA Technical Blogの本記事は、合成データを用いたRAGパイプラインの自動評価・最適化フレームワークを解説しています。NVIDIA NeMo CuratorとNIM microservicesを活用し、(1) 高品質な合成QAペアの自動生成、(2) 埋め込みモデルの定量評価、(3) Hard-Negative Miningによるファインチ...

✍️ AWS公式ブログ解説: Amazon MemoryDBによる永続セマンティックキャッシュでLLMワークロードを高速化・コスト削減

ブログ概要(Summary) AWS公式ブログは、Amazon MemoryDB(Redis互換のインメモリデータベース)をセマンティックキャッシュとして活用し、生成AIワークロードの速度向上とコスト削減を実現するアーキテクチャを提示する。MemoryDBのベクトル検索機能を用いてクエリの意味的類似度を判定し、類似クエリに対してキャッシュから即座に応答を返す。AWSの実験では、LLM推論コ...

✍️ Anthropic解説: Code Execution with MCP — プログラマティックツール呼び出しでトークン消費98.7%削減

本記事は Anthropic Engineering Blog: Code execution with MCP: building more efficient AI agents の解説記事です。 ブログ概要(Summary) Anthropic のエンジニアリングチームは、MCP サーバと連携する LLM エージェントの効率化のために、コード実行によるプログラマティックツール呼び出...

📄 論文解説: LLMエージェント評価・ベンチマークの包括的サーベイ(KDD 2025)

論文概要(Abstract) 本論文は、LLM(大規模言語モデル)ベースのエージェントの評価とベンチマークに関する包括的なサーベイである。著者らは、急速に拡大するLLMエージェント評価の研究領域を2次元の分類体系で整理している。第1の次元は「何を評価するか」(評価目標)であり、エージェントの行動・能力・信頼性・安全性の4カテゴリに分類される。第2の次元は「どう評価するか」(評価プロセス)で...

📄 論文解説: Smart RAG — クエリ分解×知識源評価×適応生成でRAG精度を段階的に改善

論文概要(Abstract) Smart RAG(Lu et al., 2025)は、RAGシステムを3つのコンポーネント(クエリ分解・知識源評価・適応的生成)で強化するフレームワークです。従来のRAGが全クエリに同一の検索戦略を適用する「ワンサイズフィッツオール」の問題を、クエリ複雑度に応じた段階的な処理で解決します。HotpotQAで75.1%(Adaptive-RAG比+3.3%)、...

📄 論文解説: Multi-Agent Collaboration Mechanisms — LLMマルチエージェント協調の分類体系と設計指針

本記事は arXiv:2501.06322 Multi-Agent Collaboration Mechanisms: A Survey of LLMs の解説記事です。 論文概要(Summary) Tran, Dao, Nguyen ら(2025)は、LLM ベースのマルチエージェントシステム(MAS)における協調メカニズムの体系的なサーベイを提示している。著者らは、協調を 参加者(a...

📄 論文解説: MIO — 音声・テキスト・画像・動画を統一トークンで理解・生成する基盤モデル

本記事は MIO: A Foundation Model on Multimodal Tokens (arXiv:2409.17790) の解説記事です。 論文概要(Abstract) MIOは2024年9月に発表された基盤モデルであり、音声・テキスト・画像・動画の4モダリティを離散トークンに変換し、単一の自己回帰(autoregressive)Transformerで理解と生成の両方を...

📄 論文解説: CoRAG — Chain-of-Retrieval Augmented Generation

論文概要(Abstract) CoRAG(Chain-of-Retrieval Augmented Generation)は、従来の「1回検索→生成」という静的RAGパラダイムを克服し、モデルが検索クエリを動的に逐次生成しながら情報を収集した上で回答を生成するフレームワークです。Rejection Samplingにより人手アノテーション不要で連鎖検索データを自動構築し、KILTベンチマー...

📄 CVPR 2024論文解説: MMMU — 大規模マルチモーダル理解・推論ベンチマーク

本記事は arXiv:2311.16502 MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI の解説記事です。 論文概要(Abstract) MMMUは、マルチモーダルモデルの「専門家レベルの理解と推論能力」を評価するために設計された大規模ベンチ...