Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Cost-Effective, Low Latency Vector Search with Azure Cosmos DB

本記事は https://arxiv.org/abs/2505.05885 の解説記事です。 論文概要(Abstract) 本論文は、Azure Cosmos DBにDiskANNベースのベクトル検索を統合した設計と実装を述べている。著者らは、DRAM上のPQコードとNVMe SSD上のフルベクトル・グラフエッジという階層型ストレージにより、専用ベクトルDB比で最大4倍のコスト効率を達成...

📄 論文解説: RaBitQ — 理論保証付き1ビット量子化によるベクトル検索高速化

本記事は https://arxiv.org/abs/2405.12497 の解説記事です。関連するZenn記事「クラウドDB内蔵ベクトル検索 vs 専用DB 2026:AlloyDB・Aurora・Cosmos DBの実力比較」もあわせてご参照ください。 論文概要 RaBitQ(Randomized Binary Quantization)は、高次元ベクトルの近似最近傍探索(ANN)に...

📄 論文解説: Not All Indexes Are Equal — 10億スケールベクトル検索インデックスの実測評価

論文概要(Abstract) 本記事は https://arxiv.org/abs/2401.09350 の解説記事です。 本論文は、10億(Billion)スケールの近似最近傍探索(ANN)において、7種のインデックス手法(HNSW、DiskANN、ScaNN、IVF-PQ、IVF-HNSW、NSG、SPANN)を3つのデータセットで実測評価したベンチマーク研究である。著者らは、リコー...

📄 論文解説: Filtered-DiskANN — フィルタ付きベクトル検索のためのグラフアルゴリズム

論文概要(Abstract) 本記事は https://arxiv.org/abs/2211.12850 の解説記事です。 Filtered-DiskANNは、属性フィルタ付き近似最近傍探索(Filtered ANN Search)を高精度に実現するグラフベースアルゴリズムである。著者らは、従来のpost-filtering方式がselectivityの低い条件下でrecallが著しく低...

✍️ Anthropic API解説: トークン節約アップデート — キャッシュ・ツール効率化・レート制限最適化

ブログ概要(Summary) 本記事は https://www.anthropic.com/news/token-saving-updates の解説記事です。 2025年3月13日、AnthropicはClaude APIにおけるトークン消費を削減する4つのアップデートを発表した。(1) キャッシュ対応レート制限(Cache-Aware Rate Limits)により、プロンプトキャッ...

📄 論文解説: RACE — LLM推論パイプラインのコスト事前予測フレームワーク

論文概要(Abstract) 本記事は https://arxiv.org/abs/2502.04556 の解説記事です。 RACE(Reasoning-Aware Cost Estimation)は、LLM推論パイプラインの実行コストを事前に予測するフレームワークである。LLMパイプラインのコストは出力トークン数に大きく依存するが、この出力トークン数は実行前には不明である。RACEは小...

📄 ICLR 2024論文解説: FastGen — プロファイリング駆動の適応的KVキャッシュ圧縮

論文概要(Abstract) 本記事は https://arxiv.org/abs/2310.01801 の解説記事です。 大規模言語モデル(LLM)の推論時に生成されるKey-Value(KV)キャッシュは、長いコンテキストや大きなバッチサイズにおいてGPUメモリの主要なボトルネックとなる。著者らは、Attentionモジュールの内部構造をプロファイリングし、その結果に基づいてKVキャ...