Home
0h-n0 TechBLog
キャンセル

📄 論文解説: MemoryOS — AIエージェント用メモリオペレーティングシステムの3層階層設計

本記事は MemoryOS: A Memory Operating System for AI Agent (arXiv: 2504.01990) の解説記事です。 論文概要(Abstract) MemoryOSは、AIエージェントのメモリを短期(Short-term)・中期(Mid-term)・長期(Long-term)の3層で階層的に管理するメモリオペレーティングシステムである。各層...

✍️ AWS Blog解説: LangGraphとDynamoDBで構築するDurable AIエージェント — チェックポイントによる耐障害性設計

本記事は Build durable AI agents with LangGraph and Amazon DynamoDB (AWS Database Blog) の解説記事です。 ブログ概要(Summary) AWS Database Blogが2026年1月に公開したこの記事は、LangGraphエージェントの状態永続化にDynamoDBを使用するDynamoDBSaverチェッ...

✍️ Anthropic Advanced Tool Use解説: Claude のツール検索・プログラマティック呼び出し・使用例の3機能

ブログ概要(Summary) 本記事は Anthropic Engineering Blog: Introducing advanced tool use の解説記事です。 Anthropicは2025年11月24日、Claude向けの高度なツール呼び出し機能として3つのベータ機能を発表した。(1) Tool Search Toolはツール定義のオンデマンド読み込みによりコンテキストウィ...

📄 論文解説: Don't Break the Cache — プロンプトキャッシュでエージェントタスクのコストを41-80%削減

論文概要(Abstract) 本記事は Don’t Break the Cache (arXiv: 2601.06007) の解説記事です。 LLMプロバイダーが提供するプロンプトキャッシュ機能は、APIコストとレイテンシの削減に有効であるが、マルチターンのエージェントワークフローにおける効果は十分に検証されていなかった。著者らは、OpenAI・Anthropic・Googleの3大プロ...

📄 論文解説: Less is More — エッジデバイスでのFunction Calling最適化

本記事は Less is More: Optimizing Function Calling for LLM Execution on Edge Devices (arXiv: 2411.15399) の解説記事です。 論文概要(Abstract) エッジデバイス上でのLLMエージェント展開において、Function Calling(関数呼び出し)の性能がボトルネックとなっている。著者ら...

📄 論文解説: MemGPT — LLMをオペレーティングシステムとして扱う仮想コンテキスト管理

本記事は MemGPT: Towards LLMs as Operating Systems (arXiv: 2310.08560) の解説記事です。 論文概要(Abstract) MemGPTは、従来のオペレーティングシステム(OS)における仮想メモリとページングの概念をLLMのコンテキスト管理に応用した研究である。LLMの固定長コンテキストウィンドウを「メインメモリ(RAM)」、外部...

📄 EMNLP 2025論文解説: Tool Preferences in Agentic LLMs are Unreliable — ツール選択の脆弱性

本記事は Tool Preferences in Agentic LLMs are Unreliable (arXiv: 2505.18135) の解説記事です。 論文概要(Abstract) LLMがツール(関数)を選択する際、テキストで記述されたdescriptionのみに依存するプロセスが驚くほど脆弱であることを実証した研究である。著者らは、ツールの機能を一切変更せずdescrip...

📄 ICML 2025論文解説: Berkeley Function Calling Leaderboard (BFCL) — LLMツール呼び出し評価の標準ベンチマーク

本記事は BFCL論文 の解説記事です。 論文概要(Abstract) Berkeley Function Calling Leaderboard(BFCL)は、LLMのFunction Calling能力を包括的に評価するためのベンチマークである。著者らは、2000以上の質問-関数-回答ペアを用意し、Python・Java・JavaScript・REST APIの4言語にわたる評価を行...