LLMモデルを整理してみた - yubeleのスライド | slidict.io
slidict.io

JA | EN

LLMモデルを整理してみた

Google Translate: 日本語 英語
yubele
yubele
フォロワー 0人
最終更新: 2026/07/30
読む時間: 00:29

共有

埋め込み用コード

通報

  • 現場では「最高性能か、オフライン運用か、コストか」の3択が絡み、最適解を決めづらい

  • クラウドとローカルの使い分けは要件次第で大きく変化

  • データ統制・機密保持の要件が現実的な壁になる

  • これからの現場は「要件に合わせた階層的なモデル選択と二層運用」が現実解

  • ローカルとクラウドの対立を前提にせず、要件で階層化して捉えるべき

  • ローカル主戦略: Llama系・Mistral系・Gemma・Qwen・Phiを軸に、LoRA/quantizationで現実的な推論コスト設計

  • クラウド主戦略: OpenAI/GPT系、Claude、Gemini、Azure OpenAI、Cohereなどの最新機能を活用

  • 中間形(Azure/Vertex AI等)は統制と利便性のバランスを取りやすい

  • 周辺実装技術(llama.cpp, vLLM, Ollama, Transformers)はローカル推論の要

  • ローカル推論の費用はGPU償却・電力・運用費で決まり、API価格だけと単純には結べない

  • 要件ごとにモデル階層を使い分けるのが現実的

  • 最高性能の中核推論はOpenAI/Claude/Geminiに委ねるケースが多い

  • 高頻度RAG・企業内検索はCohere/Mistral系が適している

  • 閉域運用・低コストはGemma/Qwen/Phi/Llama/Mistral open modelsの組み合わせが有力

  • ローカル推論は量子化(4bit等)と実行基盤(ggUF/vLLM/llama.cpp)を組み合わせるのが王道

  • 二層構成を推奨

    • ローカルで社内文書の前処理・検索・要約を実施

    • 最終長推論・高度エージェントはクラウドへ

  • 推奨組み合わせの例

    • 機密文書チャット・内部検索・業務補助: Qwen/Gemma/Mistral Small系(LoRA付き、ローカル)

    • 全社PoC・高度なエージェント: OpenAI / Claude / Gemini

    • 企業系IT基盤中心: Azure OpenAI

  • PaLMは新規導入対象を控え、Geminiへの移行を前提に検討

  • ローカル推論の周辺技術で総合力を高める

    • llama.cpp/GGUF、vLLM、Ollama、Transformersの活用

  • 要件定義を元に現場のデータ統制要件を洗い出す

  • ローカルとクラウドの二層構成の試作を開始

    • ローカル: Gemma/Qwen/Phi/Llama/Mistral open models + quantization

    • クラウド: Gemini/Claude/OpenAI/Azure OpenAIのPoC

  • コストとリスクの試算を実施(推論費用、データ保護、運用体制)

  • 導入ケース別の標準パターンを3つ用意して共有

元になったドキュメント

現状のLLMモデル整理

エグゼクティブサマリ

2026年半ばのLLM市場は、クラウド最先端モデルの高性能化と、オープンウェイトのローカル運用性向上が同時進行しています。OpenAI・Anthropic・Googleは長文脈、エージェント、マルチモーダルで先行し、Mistral・Gemma・Qwen・Phiは「社内閉域」「低コスト」「カスタム学習」で強い選択肢になっています。 [ref-1]

実務上の分岐は明確で、厳格な機密保持・データ主権・オフライン要件があるならローカルまたは自社ホスト、最高性能・最新機能・素早いPoCならクラウドが有利です。Azure OpenA
IやVertex AIのような中間形は、クラウドの利便性と企業統制を両立しやすい構成です。 [ref-2]

ローカルでは、Llama 4/3.1、Mistral open models、Gemma 4、Qwen 2.5/3.6、Phi-4が主力です。Vicuna、Alpaca、MPT、Falconは歴史的意義は大きい一方、2026年の新規導入では主役から外れつつあります。 [ref-3]

クラウドでは、OpenAI GPT-5.6系、Claude Sonnet 5、Gemini 3.x/2.5、Azure OpenAI、Cohere Command系、Mistral La Plateformeが主要プレイヤーです。なお、GoogleのPaLM系は実質的に旧系で、現在の中心はGemini APIです。 [ref-4]

比較表

ローカルLLM

系列

アーキテクチャ

代表サイズ

学習データの公開情報

参考性能

メモリ・要件・コスト

ライセンス・制約

Meta Llama 4 / 3.1

Llama 4はMoE、3.1はデコーダ型Transformer

3.1は8B、70B、405B。Llama 4は17B active

3.1は公開ソース由来約15T tokens、合成例25M超。Llama 4の詳細データは未公開

Llama 3.1は多言語・長文脈、Llama 4は単一H100向けInt4運用を明示

8Bは量子化でPC級。70B以上は48GB級GPU推奨。モデル利用料は0で、費用は自前GPU次第

Llama Community License。商用可だがOSI準拠オープンソースではない [ref-5]

Mistral open models

DenseとMoEの混在

Small 3.1、Small 4、Large 3

学習データの詳細は未公開

Small 3はMMLU 81%超、Small 3.1は約150 tok/s、Devstral 24BはSWE-bench 53.6%

Small系はローカル向き。Large 3はデータセンターまたは高級GPU向き。モデル利用料は0

Apache 2.0中心で商用利用しやすい [ref-6]

Gemma 4

オープンウェイト、マルチモーダル

E2B、E4B、26B A4B、31B

具体的なデータセットは未公開

最大256K文脈、140以上の言語。モデルカードでMMMLUなどを公開

E2B、E4Bはモバイル・エッジ向け。26B、31Bはワークステーション級。利用料は0

Responsible commercial use可の独自条件付きオープンウェイト [ref-7]

Qwen 2.5 / 3.6

DenseとMoEを併用

0.5B〜72B。3.6では27B denseなど

詳細データは限定公開

日本語を含む29以上の言語、JMMLUなど多言語評価を重視。3.6-27Bは高いコード性能を訴求

7B〜14Bはローカル運用しやすく、27Bは上位消費者GPU向き

Apache 2.0系で扱いやすい [ref-8]

Microsoft Phi-4

小型SLM、デコーダ中心

14B、mini、multimodal系

合成データ、filtered public domain、書籍、Q&Aを明記

小型ながら推論・多言語を重視

オンデバイス・エッジ寄り。GPUなしから小型GPU構成でも有力

MIT License [ref-9]

MPT / Falcon

旧世代だが商用利用しやすい基盤モデル

MPT 6.7B、Falcon 11B、180B

MPTは1T tokens、Falcon-180Bは3.5T tokens

MPT-7Bは当時LLaMA-7B級。現在は比較対象としては古い

学習・推論の教材やベースモデル用途が中心

Apache 2.0またはTII独自ライセンス [ref-10]

Vicuna / Alpaca

Llama系instruction tuning

7B、13B中心

VicunaはShareGPT会話、Alpacaは52K instruction data

Vicunaは「ChatGPTの90%品質」と報告。現在は研究・教育用途が中心

小規模GPUで扱いやすいが、最新性能では見劣りする

Alpacaは商用不可。Vicunaも基底モデルのライセンスに依存 [ref-11]

llama.cpp / GGUF

実行基盤でありモデルではない

多数のGGUF互換モデル

該当なし

4bit量子化によってサイズ縮小・高速化

CPU、Metal、CUDAで広く動作。ローカル化の中核

実行基盤はMIT系。個別モデルのライセンスに従う [ref-12]

クラウドLLM

提供形態

代表モデル

アーキテクチャ・パラメータ

参考性能

レイテンシ・速度

API単価目安

データ保持・コンプライアンス

OpenAI API

GPT-5.6 Sol、Terra、Luna

非公開。1.05M文脈、128K出力

現行主力。公開ベンチはGPT-4.1でSWE-bench 54.6%、MultiChallenge 38.3%

一般テキストの公式横並び値は未公開。Realtime系には低遅延機能あり

Terra $2.5/$15、Luna $1/$6、Sol $5/$30 / 1M tokens

API入力は学習に不使用が既定。30日保持が既定でZDRあり。SOC 2 Type 2、ISO、HIPAA対応あり [ref-13]

Anthropic API

Claude Sonnet 5

非公開

Sonnet 5が現行主力。Sonnet 4.6でTerminal-Bench 59.1%の公開例あり

最新数値はTransparency Hub参照。エージェント・コーディングを強化

Sonnet 5は導入価格 $2/$10 / MTok

商用製品では既定で学習不使用。ZDR、HIPAA-ready、SOC 2、ISO 27001、ISO 42001 [ref-14]

Google Gemini API / Vertex AI

Gemini 3.1 Pro、2.5 Pro

非公開

3.1 ProはHLE 44.4%、ARC-AGI-2 77.1%、GPQA 94.3%。2.5 ProはSWE-bench 63.8%

Gemini 2.5 ProはArtificial Analysisで135.3 tok/sの公開例。低遅延はFlash系が有利

3.1 Proは$2/$12。200K tokens以上の長いプロンプトでは上振れ

Google Cloudでは顧客データを無断で学習に使用しない。ZDR構成可、HIPAAや各種認証に対応。PaLMは旧系でGeminiへ移行 [ref-15]

Azure OpenAI

GPT-4.1、GPT-5.x系をAzure上で提供

OpenAIモデル準拠

基本性能は元モデル準拠

VNet、Private Endpointで閉域化しやすい

GPT-4.1 Globalは$3/$12 / 1M tokens

データはOpenAIへ渡らず、学習にも使われない。Azure準拠の各種認証が利用可能 [ref-16]

Cohere

Command A、Command R+

Command A技術報告あり。翻訳用A Translateは111B

Command Aは企業エージェント系で高評価。最大156 tok/sを報告

R+は128K文脈。Command Aは高速・RAG向き

R+は$2.5/$10。Command系の一般価格も公開

企業向け私設・プライベート配置を強く訴求。金融・公共・製造向けが強い [ref-17]

Mistral La Plateforme

Small 4、Large、Medium 3.5

Open weightsと商用APIを併用

Small 4は低価格・マルチモーダル。Large、Mediumは高性能寄り

Small 3.1は150 tok/s。Large、Mediumは用途別

Large $2/$6、Small 4 $0.15/$0.6、Medium 3.5 $1.5/$7.5

Team、Enterpriseでは学習不使用。SOC 2、ISO 27001、ISO 27701。オンプレミスや私設クラウドにも対応 [ref-18]

[NOTE]

クラウドモデルは、アーキテクチャ、パラメータ数、学習データの詳細が未公開であることが多いため、表では「未公開」と明記しています。

ローカル側の推論単価は、一般にAPI価格ではなく、GPUの償却費、電力費、運用費によって決まります。

Cohereは、70B〜405B級モデルを自社保有H100環境で運用した場合、100万トークン当たり約0.11ドルになるTCO例を紹介しています。ただし、これはデータセンター規模での一例です。 [ref-19]

ローカルLLMの詳細解説

現在のローカルLLMの中心は、Llama、Mistral、Gemma、Qwen、Phiの5系統です。

Llamaはエコシステムが最大、MistralはApache 2.0で企業導入しやすく、Gemmaは小型端末まで届く設計、Qwenは日本語を含む多言語とコードが強く、Phiは小型高性能です。

一方、VicunaとAlpacaはinstruction tuningの歴史を作りましたが、現在、新規導入する際の本命ではありません。 [ref-20]

Llama

2024年のLlama 3.1は、8B、70B、405Bのモデルと15T tokensの学習によって普及しました。2025年のLlama 4では、MoE化とネイティブマルチモーダル化が進みました。

ローカル利用では、Llama 3.1の8B、70BやLlama 4系の量子化モデルが主流です。

商用利用は可能ですが、ライセンスはOSI準拠のオープンソースではありません。 [ref-21]

Mistral

Mistral Small 3、3.1、4は、ローカル推論の効率に強く、Apache 2.0で扱いやすい点が最大の魅力です。

Mistralは学習データを非公開とする一方、速度、価格、携帯性を前面に出しています。コード特化モデルのDevstralも実務評価が高く、自社環境に閉じたファインチューニングやRAGと相性が良い系列です。 [ref-22]

Gemma

Gemma 4は、オープンウェイトでありながら、E2B、E4Bのエッジ向けモデルから31Bのワークステーション向けモデルまで、連続的に設計されている点が優れています。

Googleは、140以上の言語、256K文脈、マルチモーダルへの対応を示しています。QLoRAやHugging Face経由のチューニング資料も整っています。

軽量で閉域運用しやすく、社内向け日本語アシスタントを作る土台として有力です。 [ref-23]

Qwen

Qwen系は、日本語への明示的な対応が強みです。

Qwen 2.5は29以上の言語をサポートし、日本語向けのJMMLUも重視しています。

2026年のQwen 3.6-27Bは、27Bのdenseモデルで「flagship-level coding」を掲げ、ローカルでの高性能コーディング用途において存在感を増しました。

日本語チャット、コード生成、文書QAを一つのモデルで扱いたい場合、Qwenは有力な選択肢です。 [ref-24]

Phi

Phi-4は14B級で、合成データと高品質コーパスを組み合わせた、小さく強い設計です。

MITライセンスで商用利用の障壁が低く、エッジやオンデバイス実装に向いています。

大規模なGPUを用意できない社内ツール、組み込み機器、オフライン補助などで、特に利用しやすい系列です。 [ref-25]

実行基盤と量子化

実運用では、モデル本体以上に、llama.cpp、GGUF、vLLM、Ollama、Transformersなどの周辺技術が重要です。

特にllama.cppは、4bit量子化によるメモリ削減と高速化を両立し、CPU、Apple Silicon、一般的なGPUまで広くカバーします。

ローカルLLMは単一のモデル名ではなく、オープンウェイト、量子化、実行基盤の組み合わせで選ぶ時代です。 [ref-26]

クラウドLLMの詳細解説

OpenAI

OpenAIは、2026年7月時点で、APIドキュメント上の推奨起点をGPT-5.6 Sol、Terra、Lunaとしています。

広い文脈長、ツール利用、Agents SDK、Web Search、File Searchを一体で使用できる点が強みです。

APIデータは既定で学習に使用されず、ZDR、データレジデンシ、BAAも用意されています。

最高性能と開発者体験では依然としてトップクラスですが、料金はフロンティアモデルとしては安くありません。 [ref-27]

Anthropic Claude

Claudeは、長文脈、文章品質、コーディング、エージェントで強みを持ちます。

商用製品では既定で学習に使用されず、ZDRやHIPAA-ready構成があり、企業導入時の安心感が高いサービスです。

特に、レビュー、要件整理、長い仕様書、慎重な応答に向く傾向があります。

弱点は、最先端モデルの価格が上がりやすいことと、最新ベンチマークがTransparency Hubに依存し、やや追跡しにくいことです。 [ref-28]

Google Gemini

Googleの中心はPaLMからGemini API、Vertex AIへ完全に移行しています。

Gemini 3.1 Proは高難度ベンチマークに強く、Flash系は低遅延・高スループット、Live系は音声翻訳まで対応しています。

Google Cloudでは、顧客データを無断で学習に使用せず、ZDRを構成でき、HIPAAなどにも対応しています。

既存のGoogle WorkspaceやBigQueryの資産と連携しやすい点も利点です。 [ref-29]

Azure OpenAI

Azure OpenAIのモデル性能自体はOpenAIのモデルに準拠しますが、真価は統制面にあります。

Microsoftの閉域ネットワーク、Private Endpoint、Entra ID、Azureのコンプライアンス機能をそのまま利用できるため、金融、公共、大企業の本番導入で強みを持ちます。

データがOpenAIへ送信されず、学習にも使用されない点は、規制産業における大きな差別化要素です。 [ref-30]

Cohere

Cohereは、RAG、検索、企業内ナレッジ活用に最適化した立ち位置が明確です。

Command R+は長文脈、引用、tool useを備えています。Command Aは技術報告で、高速性と企業タスク性能を強調しています。

一般利用者向けのフロントチャットよりも、社内文書検索、金融、公共、製造業の業務フローで効果を発揮するタイプです。 [ref-31]

Mistral Cloud

Mistral Cloudの最大の特徴は、APIとopen weightsを往復できることです。

StudioやForgeで試験し、必要に応じてカスタムモデルや自社配置へ移行できます。

Team、Enterpriseでは学習に使用されず、SOC 2やISO系の認証も整備されています。

将来的にローカルへ戻せるクラウドとして見ると、実務的な選択肢です。 [ref-32]

導入事例と業界別ユースケース

医療

OpenAIは、HIPAA対応を前面に出した「OpenAI for Healthcare」を展開しています。AnthropicもClaudeを医療・ライフサイエンス分野へ拡張しています。

主要な用途は、要約、患者説明、問診補助、研究支援です。

医療では、モデル性能以上に、監査性とデータ統制が重要になります。 [ref-33]

金融

金融分野では、AnthropicとPwCの拡大提携、Cohereの金融業界向け展開、OpenAIの金融業務向けプロンプト集、HSBCによるMistralの自社ホスト事例が象徴的です。

主要な用途は、契約書、規制文書、リスク説明、社内ナレッジ検索です。

RAGと監査ログが必須になりやすい分野です。 [ref-34]

製造・自動車

StellantisはMistralを使った車載アシスタントを進めています。Googleは、古いSAPやメインフレームに自然言語インターフェースを追加する事例を紹介しています。

製造・自動車分野では、マルチモーダル、現場端末、低遅延が重視されます。

Gemma、Qwen、Phiのローカル運用と、クラウド大型モデルを組み合わせるハイブリッド構成が現実的です。 [ref-35]

日本企業

富士通はCohereとの戦略提携で、プライベート環境で動作するLLMを強調しています。

日本語、閉域環境、既存SIとの接続を重視する案件では、Qwen、Gemma、Mistral open modelsを社内に配置し、必要な場合のみAzure OpenAIやClaudeを併用する構成が取りやすいと考えられます。 [ref-36]

結論と推奨事項

単一の「最良モデル」はありません。現時点の最適解は、要件ごとにモデルの階層を分けることです。

用途

推奨モデル・サービス

最高性能を必要とする中核推論

OpenAI、Claude、Gemini

高頻度RAG・企業内検索

Cohere、Mistral

閉域・社内特化・低コスト

Gemma、Qwen、Phi、Llama、Mistral open models

この住み分けが最も合理的です。 [ref-37]

推奨用途を端的に整理すると、次のようになります。

  • 機密文書チャット、内部検索、業務補助では、Qwen、Gemma、Mistral Small系をLoRA付きでローカル導入する。

  • 全社PoCや高度なエージェントでは、OpenAIまたはClaudeを利用する。

  • Microsoft中心の企業では、Azure OpenAIを利用する。

  • Google基盤の企業では、Gemini on Vertex AIを利用する。

  • PaLMは新規導入対象とせず、Geminiへの移行を前提とする。 [ref-38]

実務上の指針を一つ挙げるなら、まず小さくローカルで守り、必要な箇所だけクラウドへ上げる構成が、最も失敗しにくいと考えられます。

具体的には、社内文書の前処理、検索、一次要約をローカルで実行し、最終整形や長い推論のみクラウドで実行する二層構成です。

この構成は、コスト、レイテンシ、コンプライアンスのバランスを取りやすく、各社のデータ統制機能と、オープンウェイト側の量子化・ローカル推論の成熟を踏まえた実務的な推奨です。 [ref-39]

参考文献

  1. Mistral AI, Mistral Small 3

  1. Microsoft, microsoft/phi-4

  1. Google DeepMind, Gemini 3.1 Pro

  1. Microsoft Azure, Azure OpenAI Service pricing

  1. Mistral AI, Pricing

  1. Mistral AI, Mistral Small 3

  1. Qwen, Qwen2.5-LLM

  1. Microsoft, microsoft/phi-4

  1. ggml-org, llama.cpp

  1. Cohere, Command R+

  1. Mistral AI, Mistral AI

LLMモデルを整理してみたのサムネイル(1ページ目)
1 / 9