Home
0h-n0 TechBLog
キャンセル

✍️ Atlassian Labs解説: mcp-compressorでMCPツール定義トークンを70-97%削減

ブログ概要 本記事は Atlassian Labs: MCP Compression: Preventing Tool Bloat in AI Agents の解説記事です。 Atlassian LabsのTim Esler氏(Senior Principal Machine Learning Engineer)が2026年3月29日に公開したこのブログ記事では、MCPサーバーのツール定...

📄 論文解説: ツールスキーマ圧縮がコンテキスト制約下のAgentic RAGを可能にする

論文概要 本記事は 論文 Tool-Schema Compression (arXiv:2605.26165) の解説記事です。 エージェンティックRAGシステムでは、ツール定義(JSONスキーマ)と検索拡張生成(RAG)のリトリーバルチャンクが同一のコンテキストウィンドウを奪い合う。著者のFurkan Sakizliは、14モデル(1.5B-32Bのローカルモデル + Claude S...

📄 論文解説: MCP-Zero — 能動的ツール探索でMCPトークン消費を98%削減

論文概要 本記事は 論文 MCP-Zero (arXiv:2506.01056) の解説記事です。 MCP-Zero は、LLM エージェントにおけるツール選択の根本的な課題に取り組むフレームワークである。現在の主流設計では、利用可能なツールのスキーマをすべてコンテキストに事前注入し、モデルがその中から受動的に選択する。ツール数が増加するとコンテキスト長が爆発し、注意の希薄化(atten...

📄 論文解説: TSCG — JSON Schemaの決定論的コンパイルでLLMツール定義トークンを52%削減

本記事は 論文 TSCG (arXiv:2605.04107) の解説記事です。 論文概要(Abstract) TSCG(Tool-Schema Compilation for Generation)は、OpenAI Function Calling・Anthropic Tool Use・MCPなど本番エージェントフレームワークが送信するJSONツールスキーマを、トークン効率の高い構造化...

📄 論文解説: Late Chunking — 長文脈Embeddingモデルによる文脈付きチャンクEmbedding

本記事は Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models の解説記事です。 論文概要(Abstract) RAGパイプラインにおいて、ドキュメントを小さなチャンクに分割して個別にEmbeddingする従来手法では、チャンク境界を跨ぐ文脈情報が失われる問題がある。著者らは「Late...

📄 論文解説: Judge-Aware Ranking Framework — ジャッジ信頼性を考慮したLLM評価の確率的ランキング

論文概要(Abstract) LLMの性能を比較する際、正解ラベルのないオープンエンドタスクでは「LLM-as-Judge」が広く使われている。しかしジャッジLLM間の信頼性には大きな差があり、全ジャッジを等しく扱うとランキングにバイアスが生じ、信頼区間も誤校正となる。本論文はBradley-Terry-Luce(BTL)モデルをジャッジ固有の識別力パラメータで拡張し、モデルの潜在品質スコ...

✍️ Milvus解説: CCKMベンチマークで検証するRAG用Embeddingモデル比較2026 — クロスモーダル・クロスリンガル・次元圧縮

ブログ概要 Milvus(Zilliz社)が公開したブログ記事 “Best Embedding Model for RAG 2026: 10 Models Compared” は、既存のMTEB(Massive Text Embedding Benchmark)が評価しないプロダクション要件を補完する独自ベンチマークCCKMを設計し、10種のEmbeddingモデルを4つの軸で定量比較して...

✍️ FutureAGI解説: 500ペア評価プロトコルによるEmbeddingモデル選定 — MTEBスコアに頼らないドメイン固有評価

ブログ概要(Summary) FutureAGI社が2026年に公開した「Evaluating Embedding Models in 2026」は、自社のプロダクションデータでEmbeddingモデルを評価するための実践ガイドである。500ペアのラベル付き評価セットを4つの層から構成し、Recall@10・MRR・NDCG@10・p95レイテンシ・コストの5指標で比較する手法を提案してい...

📄 論文解説: Reliability without Validity — LLM-as-Judgeの信頼性を541,000判定で系統的に検証

論文概要 LLM-as-a-Judge(LLMを評価者として利用する手法)の信頼性検証に関する大規模な系統的評価研究である。著者らは21のジャッジモデル(9プロバイダー)を3つのベンチマーク(MT-Bench、JudgeBench、RewardBench)で評価し、118回の実行で約541,000件の個別判定を分析した。その結果、exact-match精度とCohen’s kappaの間に...

📄 論文解説: The Harder Text Embedding Benchmark (HTEB) — 多次元ロバスト性評価でEmbeddingモデルの隠れた弱点を検出

論文概要 本記事は https://arxiv.org/abs/2605.28190 の解説記事です。 HTEB(The Harder Text Embedding Benchmark)は、Embeddingモデルのロバスト性を語彙・スタイル(Lexical/Stylistic)、長さ(Length)、言語(Language)の3軸で多次元的に評価するベンチマークである。著者らは、MTE...