Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Router-R1 — 強化学習によるマルチLLMルーティングと集約

論文概要(Abstract) 本記事は https://arxiv.org/abs/2506.09033 の解説記事です。 Router-R1(Zhang et al., 2025)は、LLM自体をルーターとして訓練し、複数のLLM候補に対するマルチラウンドルーティングと応答集約を強化学習(RL)で最適化する手法を提案している。従来のLLMルーティングは1対1のマッピング(1クエリ→1モ...

📄 論文解説: Model Context Protocol (MCP) — アーキテクチャとセキュリティの全体像

論文概要(Abstract) 本記事は https://arxiv.org/abs/2503.23278 の解説記事です。 Model Context Protocol(MCP)は、AIモデルと外部ツール・リソース間の双方向通信と動的ディスカバリを標準化するオープンプロトコルである。Hou et al.(2025)は、MCPサーバーの全ライフサイクルをCreation・Deploymen...

📄 論文解説: Llama Guard — LLMベースの入出力安全性ガードレール

論文概要(Abstract) Llama Guardは、人間とAIの対話における安全性を確保するためのLLMベース入出力ガードレールモデルである。著者らはLlama2-7bを安全性リスク分類タクソノミーに基づいてfine-tuneし、ユーザ入力(プロンプト)とLLM出力(レスポンス)の両方を分類するモデルを構築している。Instruction tuning形式を採用することで、新しい安全性...

📄 論文解説: GPT Semantic Cache — LLM APIコスト削減のためのセマンティックキャッシュ手法

論文概要(Abstract) 本記事は https://arxiv.org/abs/2411.05276 の解説記事です。 GPT Semantic Cache(Regmi & Pun, 2024)は、LLM APIコールのコストとレイテンシを削減するためにセマンティック埋め込みベースのキャッシュ機構を提案している。ユーザクエリを埋め込みベクトルに変換し、Redis上のインメモリ...

📄 論文解説: MetaGPT — SOPベースのマルチエージェント協調フレームワーク

論文概要(Abstract) 本記事は https://arxiv.org/abs/2308.00352 の解説記事です。 MetaGPTは、人間の組織運営で用いられるSOP(Standard Operating Procedures)をプログラム的に定義し、ProductManager・Architect・Engineer・QAといった役割を持つLLMエージェントが構造化メッセージを介...

📄 論文解説: ToolRL — 報酬設計だけでLLMのツール使用能力を獲得する

論文概要(Abstract) 本記事は https://arxiv.org/abs/2504.10903 の解説記事です。 ToolRL(Li et al., 2025)は、LLMのツール使用能力を強化学習(RL)と原理的な報酬設計によって向上させる手法を提案している。従来のSFT(Supervised Fine-Tuning)ではフォーマットエラーや既知ツールへの過学習が問題となってい...

✍️ Google Research解説: マルチエージェントスケーリングの科学 — いつ・なぜエージェントシステムは機能するか

ブログ概要(Summary) Google Researchが2026年1月に公開したブログ記事「Towards a science of scaling agent systems」は、マルチエージェントシステムの設計選択を科学的に評価した大規模実験の報告である。180種類のエージェント構成を5つのアーキテクチャ(Single-Agent, Independent, Centralize...

📄 論文解説: ToolLLM — 16000以上の実世界APIをLLMに習得させるフレームワーク

論文概要(Abstract) 大規模言語モデル(LLM)のツール使用能力において、オープンソースモデルとChatGPTの間には大きな性能差が存在していた。著者らはこの格差を解消するため、RapidAPI Hubから収集した16,464個の実世界APIを網羅するデータセットToolBench、木構造探索による推論アルゴリズムDFSDT(Depth-First Search-based Dec...

✍️ Scale AI SWE-Bench Pro解説: データ汚染耐性を備えた次世代コーディングベンチマークの設計と結果

本記事は SWE-Bench Pro: Raising the Bar for Agentic Coding(Scale Research Team, 2025年9月)の解説記事です。 ブログ概要(Summary) SWE-Bench Proは、Scale AIのResearchチームが2025年9月に公開したLLMコーディングベンチマークである。従来のSWE-Bench Verifie...