Home
0h-n0 TechBLog
キャンセル

📄 論文解説: Muon is Scalable for LLM Training — Newton-Schulz直交化による2倍効率のオプティマイザ

論文概要(Abstract) Muonオプティマイザは行列直交化に基づく新世代の最適化手法であり、小規模モデルでは優れた性能を示していたが、大規模LLM学習へのスケーラビリティは未検証だった。本論文は、重み減衰(weight decay)の追加とパラメータ別更新スケーリング(per-parameter update scaling)という2つの修正により、Muonをハイパーパラメータチュー...

📄 論文解説: JOrthoBench — 日本語表記ゆれによるLLM評価の盲点を暴く

論文概要(Abstract) JOrthoBenchは、日本語の表記ゆれ(漢字・ひらがな・カタカナ・旧字体・歴史的仮名遣い)がLLMの言語処理能力に与える影響を体系的に評価するベンチマークである。3ドメイン(語彙・読解・推論)×8タスク、約2,400件のデータで、GPT-4o・Claude 3.5 Sonnet・Gemini 1.5 Pro・Swallow等8モデルを評価。全モデルが非標準...

📄 論文解説: MetaLLM — Multi-Armed Banditによるコスト効率最適のLLMルーティングフレームワーク

論文概要(Abstract) MetaLLMは、複数のLLMの中からクエリごとに最適なモデルを動的に選択するルーティングフレームワークである。LLMルーティング問題をマルコフ決定過程(MDP)として定式化し、Multi-Armed Bandit(MAB)アルゴリズムを意思決定エンジンとして活用する。クエリの埋め込みベクトルを状態、LLM選択をアクション、正解率/コスト比を報酬として設計し、...

📄 論文解説: DeepSeek-V3 Technical Report — 671B MoEモデルの革新的アーキテクチャと$560万学習の全貌

論文概要(Abstract) DeepSeek-V3は671Bパラメータ(トークンあたり37Bアクティブ)のMixture-of-Experts(MoE)言語モデルである。Multi-head Latent Attention(MLA)とDeepSeekMoEアーキテクチャを採用し、補助損失フリーの負荷分散戦略とマルチトークン予測(MTP)訓練目標を導入した。14.8兆トークンで事前学習後...

📄 論文解説: AutoMix — 自己検証とPOMDPによるLLM自動カスケードルーティング

論文概要(Abstract) AutoMixは、小型LLM(sLLM)の自己検証(Self-Verification)と部分観測マルコフ決定過程(POMDP)を組み合わせたカスケードルーティングフレームワークです。RouteLLMやHybrid LLMとは異なり、追加の分類器やルーターモデルを訓練する必要がなく、sLLM自身が自分の応答品質を評価し、品質が不十分な場合のみ大型LLM(lLL...

✍️ Kokoro-82M オンデバイスTTS実装解説: モバイル・エッジで動く高品質音声合成の実践

ブログ概要(Summary) NimbleEdgeのエンジニアリングブログでは、Kokoro-82M TTSモデルをモバイルデバイス上でリアルタイム推論するための一連の最適化手法が詳細に解説されています。Kokoro-82Mは82Mパラメータの軽量TTSモデルですが、そのままではモバイル環境(iOS/Android)での推論には課題があります。NimbleEdgeはカスタムG2P(Grap...

✍️ Google Research解説: SOAR — ScaNNを加速する直交残差スピリングアルゴリズム

ブログ概要(Summary) Google Researchが公開したSOAR(Spilling with Orthogonality-Amplified Residuals)は、ScaNN(Scalable Nearest Neighbors)ライブラリの検索精度を大幅に向上させる新アルゴリズムです。NeurIPS 2023で発表され、従来のIVF(Inverted File)ベースの検...

✍️ AWS技術ブログ解説: LLM-as-a-Judge on Amazon Bedrock — マネージドLLM評価の実装ガイド

ブログ概要(Summary) AWSが2025年2月に公開した「LLM-as-a-judge on Amazon Bedrock Model Evaluation」は、Amazon BedrockのマネージドLLM評価機能を使って、LLM出力の品質を自動評価する方法を解説した技術ブログです。品質(Quality)、ユーザーエクスペリエンス(UX)、指示追従(Instruction Foll...

📄 論文解説: RouterBench — LLMルーター評価のための標準ベンチマーク

論文概要(Abstract) RouterBenchは、LLMルーティング戦略を公平かつ再現可能に評価するための標準ベンチマークです。11データセット(HellaSwag, MMLU, GSM8K, HumanEval等)、12のLLM(GPT-4, Claude-2, Llama-2-70B, Mixtral等)から生成された405,000以上の推論インスタンスを提供し、ルール型・分類器...

✍️ NVIDIA技術ブログ解説: Mastering LLM Techniques: Evaluation — LLM・RAG評価の包括的ガイド

ブログ概要(Summary) NVIDIAが2025年1月に公開した「Mastering LLM Techniques: Evaluation」は、LLMおよびRAGシステムの評価に関する包括的な技術ガイドです。学術ベンチマーク、LLM-as-a-Judge手法、類似度メトリクス、RAG専用評価フレームワークの4つのアプローチを体系的に整理し、NVIDIAのNeMo Evaluatorによ...