Home
0h-n0 TechBLog
キャンセル

✍️ NVIDIA技術ブログ解説: GitOpsベースLLMOpsパイプラインによるモデル評価の自動化

ブログ概要(Summary) NVIDIA Developer Blogに2025年6月に掲載された技術記事で、通信大手AmdocsがGitOpsベースのLLMOpsパイプラインを構築し、カスタムLLMのファインチューニングから評価・デプロイまでを自動化した事例を報告している。NVIDIA NeMoマイクロサービスによるファインチューニング、NVIDIA NIMによる推論デプロイ、Argo...

✍️ Microsoft Research解説: 低ビット量子化がエッジデバイスでのLLM展開を実現する — T-MAC・LUT Tensor Core・Ladderの技術全容

ブログ概要(Summary) Microsoft Researchは2025年2月、エッジデバイスでのLLM推論を可能にする3つの技術的ブレークスルーを発表した。(1) T-MAC: ビット単位LUT参照による混合精度GEMMライブラリで、llama.cpp比4-5倍高速化、(2) LUT Tensor Core: 従来のTensor Coreの38.3%の面積で6.93倍の推論速度を実現...

✍️ Amazon Bedrock Automated Reasoningによる数学的LLM出力検証

ブログ概要(Summary) Amazon Bedrock Guardrailsの一機能として提供されるAutomated Reasoning checks(自動推論チェック)は、形式論理と数学的検証によりLLM出力のHallucinationを検出する業界初のアプローチである。パターンマッチングではなく論理的推論で検証を行い、最大99%の検証精度を達成する。2024年12月のre:Inv...

📄 NeurIPS 2025論文解説: Multi-Agent Collaboration via Evolving Orchestration — 強化学習で進化する操り人形師パラダイム

論文概要(Abstract) 「Multi-Agent Collaboration via Evolving Orchestration」は、清華大学・OpenBMBのYufan Dang、Chen Qianらが発表し、NeurIPS 2025にポスター発表として採択された論文である。本論文は、マルチエージェントLLMシステムにおけるPuppeteer(操り人形師)パラダイムを提案する。中...

✍️ USENIX事例報告: CI/CDにLLM推論を組み込んだ際の信頼性問題と5つのガードレール設計

ブログ概要(Summary) USENIX ;login: Online に2025年9月に掲載されたGuruprasad Raghothama Raoによる事例報告である。CI/CDパイプラインにLLM推論をインラインで統合したところ、パイプライン実行時間が8分→18〜22分に膨張し、LLMの幻覚(hallucination)による誤った提案やコスト暴走が発生した。本報告は、これらの問題...

📄 論文解説: TENET — 三値LLM推論を21倍効率化するスパース対応LUTアーキテクチャ

論文概要(Summary) TENETは、BitNet b1.58等の三値重み(${-1, 0, +1}$)を持つLLMをエッジデバイス上で効率的に推論するための専用ハードウェアアーキテクチャである。従来のGPU/CPUは三値演算をネイティブにサポートしておらず、ハードウェア利用率が極めて低い。TENETはルックアップテーブル(LUT)ベースの演算コアと動的活性化スパース性を組み合わせ、N...

✍️ NVIDIA ToolOrchestra: 小型モデルで大型LLMを指揮する — Orchestrator-8Bの強化学習ベースオーケストレーション

ブログ概要(Summary) NVIDIA Researchが2025年12月に公開したToolOrchestraは、小型言語モデル(8Bパラメータ)をオーケストレータとして訓練し、大型LLMや専門ツールを最適に組み合わせて問題を解決する手法である。Qwen3-8Bをベースにわずか552件の合成データと1,296プロンプトで強化学習を行い、Humanity’s Last Examで37.1...

✍️ NVIDIA NeMo Guardrailsのストリーミング検証アーキテクチャ解説

ブログ概要(Summary) NVIDIAが開発したNeMo Guardrailsは、LLMのストリーミング出力に対してリアルタイムでガードレール検証を実行するオープンソースツールキットである。本ブログでは、応答生成と安全性検証を分離する「デカップルドストリーミングアーキテクチャ」を詳解し、ストリーミング有効化によるレイテンシ85%改善を示している。 この記事は Zenn記事: LLM出...

✍️ Magentic-One: Microsoft発の汎用マルチエージェントシステム — Orchestrator+4専門エージェントによるタスク解決

ブログ概要(Summary) Magentic-Oneは、Microsoft Researchが2024年11月に発表した汎用マルチエージェントシステムである。中央のOrchestratorエージェントが4つの専門エージェント(WebSurfer、FileSurfer、Coder、ComputerTerminal)を指揮し、複雑なマルチステップタスクを解決する。AutoGenフレームワーク...

📄 論文解説: PromptBench — LLM評価を統一するベンチマークライブラリの設計と実装

論文概要(Abstract) PromptBenchは、Microsoft Researchが開発したLLM評価のための統一ライブラリである。複数のプロンプティング手法・モデル・データセットを横断する標準化されたベンチマーク環境を提供し、LLMの能力を体系的かつ再現可能に評価する。特に注目すべきは、7種類の敵対的攻撃手法を統合し、LLMのロバスト性評価を標準ワークフローに組み込んでいる点で...