ブログ概要(Summary) Anthropicが2024年11月に公開した研究ブログ「A Statistical Approach to Model Evaluations」は、LLM評価における統計的厳密性の欠如を指摘し、5つの具体的な改善提言を行っています。核心的な問いは「モデル間の能力差は本物か、それとも質問の運で偶然そう見えただけか?」です。クラスター標準誤差がnaive計算の3...
18/02/2026 blog tech_blog
LLM evaluation statistics +4
論文概要(Abstract) LLMベースのチャットアシスタントの評価は、その広範な能力と既存ベンチマークの不十分さのため困難です。本論文は「強力なLLM(GPT-4)を審判(Judge)として使う」アプローチを体系的に研究し、MT-Bench(80問のマルチターンベンチマーク)とChatbot Arena(クラウドソーシング型対戦プラットフォーム)の2つの評価フレームワークを提案しました...
18/02/2026 blog paper
LLM evaluation A/B testing +4
論文概要(Abstract) DSPy(Declarative Self-improving Python)は、LLMパイプラインを宣言的プログラムとして記述し、プロンプトの詳細をプログラマから分離するフレームワークである。手書きプロンプトへの依存を排除し、入出力の型仕様(Signature)・LLM操作の抽象化(Module)・自動最適化コンパイラ(Teleprompter)の三層構造に...
18/02/2026 blog paper
LLMOps prompt-management DSPy +3
ブログ概要 NVIDIA Dynamoは、推論AIモデル(特にMoEアーキテクチャ)のスケーリングを目的とした低レイテンシ分散推論フレームワークである。2025年にオープンソースとして公開され(ai-dynamo/dynamoリポジトリ)、vLLM・SGLang・TensorRT-LLMと統合可能。中核技術はPrefill/Decode分離サービング、分散KVキャッシュ管理、NIXL(NV...
18/02/2026 blog tech_blog
nvidia inference moe +3
論文概要(Abstract) Qwen3はAlibaba Group Qwenチームが開発した最新世代の大規模言語モデルファミリーである。Dense(0.6B〜32B)とMoE(30B-A3B、235B-A22B)の包括的なモデルスイートを提供し、Thinking Mode(拡張推論)とNon-Thinking Mode(高速応答)を単一モデル内に統合した点が最大の特徴。約36兆トークンの...
18/02/2026 blog paper
qwen moe llm +3
論文概要(Abstract) Tri DaoとAlbert Guによる本論文は、状態空間モデル(SSM)とAttentionが半可分行列(Semiseparable Matrix)を介して数学的に等価であることを示すStructured State Space Duality(SSD)フレームワークを提案する。このフレームワークに基づき設計されたMamba-2は、状態遷移行列をスカラーに制...
18/02/2026 blog paper
mamba ssm attention +3
論文概要(Abstract) 本論文は、Scaled Dot-Product Attention(SDPA)の出力にsigmoidゲートを要素積で適用する「Gated Attention」を提案する。このシンプルな修正が3つの理論的・実験的利点をもたらすことを示した:(1) sigmoidゲートがデータ依存であるため、非線形アテンションと等価になる、(2) トークン次元でスパースな出力を生...
18/02/2026 blog paper
attention gated-attention qwen +3
論文概要(Abstract) Gated Delta Networks(GDN)は、Mamba2のスカラーゲート(状態減衰制御)とDeltaNetのランク1デルタルール(選択的状態書き込み)を統合した新しいシーケンスモデルである。各ヘッドがステップごとにデータ依存の低ランク状態更新を行える点が最大の特徴で、Mamba2のチャンクワイズ並列アルゴリズムと同様のハードウェア効率で動作するCUD...
18/02/2026 blog paper
linear-attention SSM Mamba2 +4
ブログ概要(Summary) LangChain公式ブログの「Context Engineering for Agents」は、エージェントのコンテキスト管理をWrite / Select / Compress / Isolateの4戦略に体系化し、各戦略のLangGraph実装コンポーネントとの対応を詳細に解説したガイドである。Drew Breunigのコンテキスト失敗モード(Poiso...
18/02/2026 blog tech_blog
context-engineering llm agent +4
論文概要(Abstract) 本論文は、LLM更新時のデプロイ戦略としてカナリア・ブルーグリーン・シャドウモードの3パターンを体系的に分類・比較する。各戦略の適用条件(リスク許容度・トラフィック量・評価レイテンシ)を整理し、カナリアデプロイにおいて品質メトリクスに基づくベイズ的自動昇格アルゴリズムを提案する。シミュレーション実験により、従来の固定スケジュール昇格と比較して「品質劣化ユーザー...
18/02/2026 blog paper
LLM canary-deployment blue-green +4