Home
0h-n0 TechBLog
キャンセル

✍️ Anthropic解説: A Statistical Approach to Model Evaluations — LLM評価に統計的厳密性を導入する5つの提言

ブログ概要(Summary) Anthropicが2024年11月に公開した研究ブログ「A Statistical Approach to Model Evaluations」は、LLM評価における統計的厳密性の欠如を指摘し、5つの具体的な改善提言を行っています。核心的な問いは「モデル間の能力差は本物か、それとも質問の運で偶然そう見えただけか?」です。クラスター標準誤差がnaive計算の3...

📄 論文解説: Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

論文概要(Abstract) LLMベースのチャットアシスタントの評価は、その広範な能力と既存ベンチマークの不十分さのため困難です。本論文は「強力なLLM(GPT-4)を審判(Judge)として使う」アプローチを体系的に研究し、MT-Bench(80問のマルチターンベンチマーク)とChatbot Arena(クラウドソーシング型対戦プラットフォーム)の2つの評価フレームワークを提案しました...

📄 論文解説: DSPy — 宣言的LMパイプラインを自動コンパイルするフレームワーク

論文概要(Abstract) DSPy(Declarative Self-improving Python)は、LLMパイプラインを宣言的プログラムとして記述し、プロンプトの詳細をプログラマから分離するフレームワークである。手書きプロンプトへの依存を排除し、入出力の型仕様(Signature)・LLM操作の抽象化(Module)・自動最適化コンパイラ(Teleprompter)の三層構造に...

✍️ 技術ブログ解説: NVIDIA Dynamo — MoE推論のための分散サービングフレームワーク

ブログ概要 NVIDIA Dynamoは、推論AIモデル(特にMoEアーキテクチャ)のスケーリングを目的とした低レイテンシ分散推論フレームワークである。2025年にオープンソースとして公開され(ai-dynamo/dynamoリポジトリ)、vLLM・SGLang・TensorRT-LLMと統合可能。中核技術はPrefill/Decode分離サービング、分散KVキャッシュ管理、NIXL(NV...

📄 論文解説: Qwen3 Technical Report — 4段階学習パイプラインとMoEアーキテクチャの全体像

論文概要(Abstract) Qwen3はAlibaba Group Qwenチームが開発した最新世代の大規模言語モデルファミリーである。Dense(0.6B〜32B)とMoE(30B-A3B、235B-A22B)の包括的なモデルスイートを提供し、Thinking Mode(拡張推論)とNon-Thinking Mode(高速応答)を単一モデル内に統合した点が最大の特徴。約36兆トークンの...

📄 論文解説: Transformers are SSMs — Mamba-2とStructured State Space Dualityの理論

論文概要(Abstract) Tri DaoとAlbert Guによる本論文は、状態空間モデル(SSM)とAttentionが半可分行列(Semiseparable Matrix)を介して数学的に等価であることを示すStructured State Space Duality(SSD)フレームワークを提案する。このフレームワークに基づき設計されたMamba-2は、状態遷移行列をスカラーに制...

✍️ NeurIPS 2025 Best Paper解説: Gated Attention — Sigmoidゲートが実現する非線形・スパース・Attention-Sink-Freeなアテンション

論文概要(Abstract) 本論文は、Scaled Dot-Product Attention(SDPA)の出力にsigmoidゲートを要素積で適用する「Gated Attention」を提案する。このシンプルな修正が3つの理論的・実験的利点をもたらすことを示した:(1) sigmoidゲートがデータ依存であるため、非線形アテンションと等価になる、(2) トークン次元でスパースな出力を生...

📄 論文解説: Gated Delta Networks — Mamba2にデルタルールを統合した線形アテンションの革新

論文概要(Abstract) Gated Delta Networks(GDN)は、Mamba2のスカラーゲート(状態減衰制御)とDeltaNetのランク1デルタルール(選択的状態書き込み)を統合した新しいシーケンスモデルである。各ヘッドがステップごとにデータ依存の低ランク状態更新を行える点が最大の特徴で、Mamba2のチャンクワイズ並列アルゴリズムと同様のハードウェア効率で動作するCUD...

✍️ LangChain公式ブログ解説: エージェントのためのContext Engineering — Write/Select/Compress/Isolate実装ガイド

ブログ概要(Summary) LangChain公式ブログの「Context Engineering for Agents」は、エージェントのコンテキスト管理をWrite / Select / Compress / Isolateの4戦略に体系化し、各戦略のLangGraph実装コンポーネントとの対応を詳細に解説したガイドである。Drew Breunigのコンテキスト失敗モード(Poiso...

📄 論文解説: Progressive Rollout Strategies for LLM Updates — カナリア・ブルーグリーン・シャドウの段階的ロールアウト戦略

論文概要(Abstract) 本論文は、LLM更新時のデプロイ戦略としてカナリア・ブルーグリーン・シャドウモードの3パターンを体系的に分類・比較する。各戦略の適用条件(リスク許容度・トラフィック量・評価レイテンシ)を整理し、カナリアデプロイにおいて品質メトリクスに基づくベイズ的自動昇格アルゴリズムを提案する。シミュレーション実験により、従来の固定スケジュール昇格と比較して「品質劣化ユーザー...