= 現状のLLMモデル整理
:toc:
:toclevels: 3
:sectnums:
== エグゼクティブサマリ
2026年半ばのLLM市場は、クラウド最先端モデルの高性能化と、オープンウェイトのローカル運用性向上が同時進行しています。OpenAI・Anthropic・Googleは長文脈、エージェント、マルチモーダルで先行し、Mistral・Gemma・Qwen・Phiは「社内閉域」「低コスト」「カスタム学習」で強い選択肢になっています。 <<ref-1>>
実務上の分岐は明確で、厳格な機密保持・データ主権・オフライン要件があるならローカルまたは自社ホスト、最高性能・最新機能・素早いPoCならクラウドが有利です。Azure OpenAIやVertex AIのような中間形は、クラウドの利便性と企業統制を両立しやすい構成です。 <<ref-2>>
ローカルでは、Llama 4/3.1、Mistral open models、Gemma 4、Qwen 2.5/3.6、Phi-4が主力です。Vicuna、Alpaca、MPT、Falconは歴史的意義は大きい一方、2026年の新規導入では主役から外れつつあります。 <<ref-3>>
クラウドでは、OpenAI GPT-5.6系、Claude Sonnet 5、Gemini 3.x/2.5、Azure OpenAI、Cohere Command系、Mistral La Plateformeが主要プレイヤーです。なお、GoogleのPaLM系は実質的に旧系で、現在の中心はGemini APIです。 <<ref-4>>
== 比較表
=== ローカルLLM
[cols="1.3,1.3,1.2,1.6,1.8,1.8,1.6", options="header"]
|===
|系列
|アーキテクチャ
|代表サイズ
|学習データの公開情報
|参考性能
|メモリ・要件・コスト
|ライセンス・制約
|Meta Llama 4 / 3.1
|Llama 4はMoE、3.1はデコーダ型Transformer
|3.1は8B、70B、405B。Llama 4は17B active
|3.1は公開ソース由来約15T tokens、合成例25M超。Llama 4の詳細データは未公開
|Llama 3.1は多言語・長文脈、Llama 4は単一H100向けInt4運用を明示
|8Bは量子化でPC級。70B以上は48GB級GPU推奨。モデル利用料は0で、費用は自前GPU次第
|Llama Community License。商用可だがOSI準拠オープンソースではない <<ref-5>>
|Mistral open models
|DenseとMoEの混在
|Small 3.1、Small 4、Large 3
|学習データの詳細は未公開
|Small 3はMMLU 81%超、Small 3.1は約150 tok/s、Devstral 24BはSWE-bench 53.6%
|Small系はローカル向き。Large 3はデータセンターまたは高級GPU向き。モデル利用料は0
|Apache 2.0中心で商用利用しやすい <<ref-6>>
|Gemma 4
|オープンウェイト、マルチモーダル
|E2B、E4B、26B A4B、31B
|具体的なデータセットは未公開
|最大256K文脈、140以上の言語。モデルカードでMMMLUなどを公開
|E2B、E4Bはモバイル・エッジ向け。26B、31Bはワークステーション級。利用料は0
|Responsible commercial use可の独自条件付きオープンウェイト <<ref-7>>
|Qwen 2.5 / 3.6
|DenseとMoEを併用
|0.5B〜72B。3.6では27B denseなど
|詳細データは限定公開
|日本語を含む29以上の言語、JMMLUなど多言語評価を重視。3.6-27Bは高いコード性能を訴求
|7B〜14Bはローカル運用しやすく、27Bは上位消費者GPU向き
|Apache 2.0系で扱いやすい <<ref-8>>
|Microsoft Phi-4
|小型SLM、デコーダ中心
|14B、mini、multimodal系
|合成データ、filtered public domain、書籍、Q&Aを明記
|小型ながら推論・多言語を重視
|オンデバイス・エッジ寄り。GPUなしから小型GPU構成でも有力
|MIT License <<ref-9>>
|MPT / Falcon
|旧世代だが商用利用しやすい基盤モデル
|MPT 6.7B、Falcon 11B、180B
|MPTは1T tokens、Falcon-180Bは3.5T tokens
|MPT-7Bは当時LLaMA-7B級。現在は比較対象としては古い
|学習・推論の教材やベースモデル用途が中心
|Apache 2.0またはTII独自ライセンス <<ref-10>>
|Vicuna / Alpaca
|Llama系instruction tuning
|7B、13B中心
|VicunaはShareGPT会話、Alpacaは52K instruction data
|Vicunaは「ChatGPTの90%品質」と報告。現在は研究・教育用途が中心
|小規模GPUで扱いやすいが、最新性能では見劣りする
|Alpacaは商用不可。Vicunaも基底モデルのライセンスに依存 <<ref-11>>
|llama.cpp / GGUF
|実行基盤でありモデルではない
|多数のGGUF互換モデル
|該当なし
|4bit量子化によってサイズ縮小・高速化
|CPU、Metal、CUDAで広く動作。ローカル化の中核
|実行基盤はMIT系。個別モデルのライセンスに従う <<ref-12>>
|===
=== クラウドLLM
[cols="1.4,1.4,1.5,1.8,1.6,1.4,2", options="header"]
|===
|提供形態
|代表モデル
|アーキテクチャ・パラメータ
|参考性能
|レイテンシ・速度
|API単価目安
|データ保持・コンプライアンス
|OpenAI API
|GPT-5.6 Sol、Terra、Luna
|非公開。1.05M文脈、128K出力
|現行主力。公開ベンチはGPT-4.1でSWE-bench 54.6%、MultiChallenge 38.3%
|一般テキストの公式横並び値は未公開。Realtime系には低遅延機能あり
|Terra $2.5/$15、Luna $1/$6、Sol $5/$30 / 1M tokens
|API入力は学習に不使用が既定。30日保持が既定でZDRあり。SOC 2 Type 2、ISO、HIPAA対応あり <<ref-13>>
|Anthropic API
|Claude Sonnet 5
|非公開
|Sonnet 5が現行主力。Sonnet 4.6でTerminal-Bench 59.1%の公開例あり
|最新数値はTransparency Hub参照。エージェント・コーディングを強化
|Sonnet 5は導入価格 $2/$10 / MTok
|商用製品では既定で学習不使用。ZDR、HIPAA-ready、SOC 2、ISO 27001、ISO 42001 <<ref-14>>
|Google Gemini API / Vertex AI
|Gemini 3.1 Pro、2.5 Pro
|非公開
|3.1 ProはHLE 44.4%、ARC-AGI-2 77.1%、GPQA 94.3%。2.5 ProはSWE-bench 63.8%
|Gemini 2.5 ProはArtificial Analysisで135.3 tok/sの公開例。低遅延はFlash系が有利
|3.1 Proは$2/$12。200K tokens以上の長いプロンプトでは上振れ
|Google Cloudでは顧客データを無断で学習に使用しない。ZDR構成可、HIPAAや各種認証に対応。PaLMは旧系でGeminiへ移行 <<ref-15>>
|Azure OpenAI
|GPT-4.1、GPT-5.x系をAzure上で提供
|OpenAIモデル準拠
|基本性能は元モデル準拠
|VNet、Private Endpointで閉域化しやすい
|GPT-4.1 Globalは$3/$12 / 1M tokens
|データはOpenAIへ渡らず、学習にも使われない。Azure準拠の各種認証が利用可能 <<ref-16>>
|Cohere
|Command A、Command R+
|Command A技術報告あり。翻訳用A Translateは111B
|Command Aは企業エージェント系で高評価。最大156 tok/sを報告
|R+は128K文脈。Command Aは高速・RAG向き
|R+は$2.5/$10。Command系の一般価格も公開
|企業向け私設・プライベート配置を強く訴求。金融・公共・製造向けが強い <<ref-17>>
|Mistral La Plateforme
|Small 4、Large、Medium 3.5
|Open weightsと商用APIを併用
|Small 4は低価格・マルチモーダル。Large、Mediumは高性能寄り
|Small 3.1は150 tok/s。Large、Mediumは用途別
|Large $2/$6、Small 4 $0.15/$0.6、Medium 3.5 $1.5/$7.5
|Team、Enterpriseでは学習不使用。SOC 2、ISO 27001、ISO 27701。オンプレミスや私設クラウドにも対応 <<ref-18>>
|===
# [NOTE]
クラウドモデルは、アーキテクチャ、パラメータ数、学習データの詳細が未公開であることが多いため、表では「未公開」と明記しています。
ローカル側の推論単価は、一般にAPI価格ではなく、GPUの償却費、電力費、運用費によって決まります。
# Cohereは、70B〜405B級モデルを自社保有H100環境で運用した場合、100万トークン当たり約0.11ドルになるTCO例を紹介しています。ただし、これはデータセンター規模での一例です。 <<ref-19>>
== ローカルLLMの詳細解説
現在のローカルLLMの中心は、Llama、Mistral、Gemma、Qwen、Phiの5系統です。
Llamaはエコシステムが最大、MistralはApache 2.0で企業導入しやすく、Gemmaは小型端末まで届く設計、Qwenは日本語を含む多言語とコードが強く、Phiは小型高性能です。
一方、VicunaとAlpacaはinstruction tuningの歴史を作りましたが、現在、新規導入する際の本命ではありません。 <<ref-20>>
=== Llama
2024年のLlama 3.1は、8B、70B、405Bのモデルと15T tokensの学習によって普及しました。2025年のLlama 4では、MoE化とネイティブマルチモーダル化が進みました。
ローカル利用では、Llama 3.1の8B、70BやLlama 4系の量子化モデルが主流です。
商用利用は可能ですが、ライセンスはOSI準拠のオープンソースではありません。 <<ref-21>>
=== Mistral
Mistral Small 3、3.1、4は、ローカル推論の効率に強く、Apache 2.0で扱いやすい点が最大の魅力です。
Mistralは学習データを非公開とする一方、速度、価格、携帯性を前面に出しています。コード特化モデルのDevstralも実務評価が高く、自社環境に閉じたファインチューニングやRAGと相性が良い系列です。 <<ref-22>>
=== Gemma
Gemma 4は、オープンウェイトでありながら、E2B、E4Bのエッジ向けモデルから31Bのワークステーション向けモデルまで、連続的に設計されている点が優れています。
Googleは、140以上の言語、256K文脈、マルチモーダルへの対応を示しています。QLoRAやHugging Face経由のチューニング資料も整っています。
軽量で閉域運用しやすく、社内向け日本語アシスタントを作る土台として有力です。 <<ref-23>>
=== Qwen
Qwen系は、日本語への明示的な対応が強みです。
Qwen 2.5は29以上の言語をサポートし、日本語向けのJMMLUも重視しています。
2026年のQwen 3.6-27Bは、27Bのdenseモデルで「flagship-level coding」を掲げ、ローカルでの高性能コーディング用途において存在感を増しました。
日本語チャット、コード生成、文書QAを一つのモデルで扱いたい場合、Qwenは有力な選択肢です。 <<ref-24>>
=== Phi
Phi-4は14B級で、合成データと高品質コーパスを組み合わせた、小さく強い設計です。
MITライセンスで商用利用の障壁が低く、エッジやオンデバイス実装に向いています。
大規模なGPUを用意できない社内ツール、組み込み機器、オフライン補助などで、特に利用しやすい系列です。 <<ref-25>>
=== 実行基盤と量子化
実運用では、モデル本体以上に、llama.cpp、GGUF、vLLM、Ollama、Transformersなどの周辺技術が重要です。
特にllama.cppは、4bit量子化によるメモリ削減と高速化を両立し、CPU、Apple Silicon、一般的なGPUまで広くカバーします。
ローカルLLMは単一のモデル名ではなく、オープンウェイト、量子化、実行基盤の組み合わせで選ぶ時代です。 <<ref-26>>
== クラウドLLMの詳細解説
=== OpenAI
OpenAIは、2026年7月時点で、APIドキュメント上の推奨起点をGPT-5.6 Sol、Terra、Lunaとしています。
広い文脈長、ツール利用、Agents SDK、Web Search、File Searchを一体で使用できる点が強みです。
APIデータは既定で学習に使用されず、ZDR、データレジデンシ、BAAも用意されています。
最高性能と開発者体験では依然としてトップクラスですが、料金はフロンティアモデルとしては安くありません。 <<ref-27>>
=== Anthropic Claude
Claudeは、長文脈、文章品質、コーディング、エージェントで強みを持ちます。
商用製品では既定で学習に使用されず、ZDRやHIPAA-ready構成があり、企業導入時の安心感が高いサービスです。
特に、レビュー、要件整理、長い仕様書、慎重な応答に向く傾向があります。
弱点は、最先端モデルの価格が上がりやすいことと、最新ベンチマークがTransparency Hubに依存し、やや追跡しにくいことです。 <<ref-28>>
=== Google Gemini
Googleの中心はPaLMからGemini API、Vertex AIへ完全に移行しています。
Gemini 3.1 Proは高難度ベンチマークに強く、Flash系は低遅延・高スループット、Live系は音声翻訳まで対応しています。
Google Cloudでは、顧客データを無断で学習に使用せず、ZDRを構成でき、HIPAAなどにも対応しています。
既存のGoogle WorkspaceやBigQueryの資産と連携しやすい点も利点です。 <<ref-29>>
=== Azure OpenAI
Azure OpenAIのモデル性能自体はOpenAIのモデルに準拠しますが、真価は統制面にあります。
Microsoftの閉域ネットワーク、Private Endpoint、Entra ID、Azureのコンプライアンス機能をそのまま利用できるため、金融、公共、大企業の本番導入で強みを持ちます。
データがOpenAIへ送信されず、学習にも使用されない点は、規制産業における大きな差別化要素です。 <<ref-30>>
=== Cohere
Cohereは、RAG、検索、企業内ナレッジ活用に最適化した立ち位置が明確です。
Command R+は長文脈、引用、tool useを備えています。Command Aは技術報告で、高速性と企業タスク性能を強調しています。
一般利用者向けのフロントチャットよりも、社内文書検索、金融、公共、製造業の業務フローで効果を発揮するタイプです。 <<ref-31>>
=== Mistral Cloud
Mistral Cloudの最大の特徴は、APIとopen weightsを往復できることです。
StudioやForgeで試験し、必要に応じてカスタムモデルや自社配置へ移行できます。
Team、Enterpriseでは学習に使用されず、SOC 2やISO系の認証も整備されています。
将来的にローカルへ戻せるクラウドとして見ると、実務的な選択肢です。 <<ref-32>>
== 導入事例と業界別ユースケース
=== 医療
OpenAIは、HIPAA対応を前面に出した「OpenAI for Healthcare」を展開しています。AnthropicもClaudeを医療・ライフサイエンス分野へ拡張しています。
主要な用途は、要約、患者説明、問診補助、研究支援です。
医療では、モデル性能以上に、監査性とデータ統制が重要になります。 <<ref-33>>
=== 金融
金融分野では、AnthropicとPwCの拡大提携、Cohereの金融業界向け展開、OpenAIの金融業務向けプロンプト集、HSBCによるMistralの自社ホスト事例が象徴的です。
主要な用途は、契約書、規制文書、リスク説明、社内ナレッジ検索です。
RAGと監査ログが必須になりやすい分野です。 <<ref-34>>
=== 製造・自動車
StellantisはMistralを使った車載アシスタントを進めています。Googleは、古いSAPやメインフレームに自然言語インターフェースを追加する事例を紹介しています。
製造・自動車分野では、マルチモーダル、現場端末、低遅延が重視されます。
Gemma、Qwen、Phiのローカル運用と、クラウド大型モデルを組み合わせるハイブリッド構成が現実的です。 <<ref-35>>
=== 日本企業
富士通はCohereとの戦略提携で、プライベート環境で動作するLLMを強調しています。
日本語、閉域環境、既存SIとの接続を重視する案件では、Qwen、Gemma、Mistral open modelsを社内に配置し、必要な場合のみAzure OpenAIやClaudeを併用する構成が取りやすいと考えられます。 <<ref-36>>
== 結論と推奨事項
単一の「最良モデル」はありません。現時点の最適解は、要件ごとにモデルの階層を分けることです。
[cols="1.5,2", options="header"]
|===
|用途
|推奨モデル・サービス
|最高性能を必要とする中核推論
|OpenAI、Claude、Gemini
|高頻度RAG・企業内検索
|Cohere、Mistral
|閉域・社内特化・低コスト
|Gemma、Qwen、Phi、Llama、Mistral open models
|===
この住み分けが最も合理的です。 <<ref-37>>
推奨用途を端的に整理すると、次のようになります。
* 機密文書チャット、内部検索、業務補助では、Qwen、Gemma、Mistral Small系をLoRA付きでローカル導入する。
* 全社PoCや高度なエージェントでは、OpenAIまたはClaudeを利用する。
* Microsoft中心の企業では、Azure OpenAIを利用する。
* Google基盤の企業では、Gemini on Vertex AIを利用する。
* PaLMは新規導入対象とせず、Geminiへの移行を前提とする。 <<ref-38>>
実務上の指針を一つ挙げるなら、まず小さくローカルで守り、必要な箇所だけクラウドへ上げる構成が、最も失敗しにくいと考えられます。
具体的には、社内文書の前処理、検索、一次要約をローカルで実行し、最終整形や長い推論のみクラウドで実行する二層構成です。
この構成は、コスト、レイテンシ、コンプライアンスのバランスを取りやすく、各社のデータ統制機能と、オープンウェイト側の量子化・ローカル推論の成熟を踏まえた実務的な推奨です。 <<ref-39>>
== 参考文献
[[ref-1]]
. OpenAI, link:https://developers.openai.com/api/docs/models[Models | OpenAI API]
[[ref-2]]
. Microsoft, link:https://learn.microsoft.com/en-us/azure/foundry/responsible-ai/openai/data-privacy[Data, privacy, and security for Foundry Models sold by Azure in Microsoft Foundry]
[[ref-3]]
. Meta, link:https://ai.meta.com/blog/llama-4-multimodal-intelligence/[The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation]
[[ref-4]]
. OpenAI, link:https://developers.openai.com/api/docs/models[Models | OpenAI API]
[[ref-5]]
. Meta, link:https://huggingface.co/meta-llama/Llama-3.1-8B[meta-llama/Llama-3.1-8B]
[[ref-6]]
. Mistral AI, link:https://mistral.ai/news/mistral-small-3/[Mistral Small 3]
[[ref-7]]
. Google, link:https://ai.google.dev/gemma/docs/core[Gemma 4 model overview]
[[ref-8]]
. Qwen, link:https://huggingface.co/Qwen/Qwen2.5-1.5B-Instruct[Qwen2.5-1.5B-Instruct]
[[ref-9]]
. Microsoft, link:https://huggingface.co/microsoft/phi-4[microsoft/phi-4]
[[ref-10]]
. MosaicML, link:https://www.mosaicml.com/blog/mpt-7b[Introducing MPT-7B: A New Standard for Open-Source Models]
[[ref-11]]
. LMSYS, link:https://www.lmsys.org/blog/2023-03-30-vicuna/[Vicuna: An Open-Source Chatbot Impressing GPT-4]
[[ref-12]]
. ggml-org, link:https://github.com/ggml-org/llama.cpp[llama.cpp: LLM inference in C/C++]
[[ref-13]]
. OpenAI, link:https://developers.openai.com/api/docs/models[Models | OpenAI API]
[[ref-14]]
. Anthropic, link:https://docs.anthropic.com/en/docs/about-claude/models/overview[Models overview | Claude Platform Docs]
[[ref-15]]
. Google DeepMind, link:https://deepmind.google/models/gemini/pro/[Gemini 3.1 Pro]
[[ref-16]]
. Microsoft Azure, link:https://azure.microsoft.com/en-us/pricing/details/azure-openai/[Azure OpenAI Service pricing]
[[ref-17]]
. Cohere, link:https://cohere.com/research/papers/command-a-technical-report.pdf[Command A: An Enterprise-Ready Large Language Model]
[[ref-18]]
. Mistral AI, link:https://mistral.ai/pricing/[Pricing]
[[ref-19]]
. Cohere, link:https://cohere.com/blog/the-total-cost-of-ai-ownership[The Total Cost of AI Ownership]
[[ref-20]]
. Meta, link:https://ai.meta.com/blog/llama-4-multimodal-intelligence/[The Llama 4 herd]
[[ref-21]]
. Meta, link:https://huggingface.co/meta-llama/Llama-3.1-8B[meta-llama/Llama-3.1-8B]
[[ref-22]]
. Mistral AI, link:https://mistral.ai/news/mistral-small-3/[Mistral Small 3]
[[ref-23]]
. Google, link:https://ai.google.dev/gemma/docs/core[Gemma 4 model overview]
[[ref-24]]
. Qwen, link:https://qwen.ai/blog?id=qwen2.5-llm[Qwen2.5-LLM]
[[ref-25]]
. Microsoft, link:https://huggingface.co/microsoft/phi-4[microsoft/phi-4]
[[ref-26]]
. ggml-org, link:https://github.com/ggml-org/llama.cpp[llama.cpp]
[[ref-27]]
. OpenAI, link:https://developers.openai.com/api/docs/models[Models | OpenAI API]
[[ref-28]]
. Anthropic, link:https://www.anthropic.com/news/claude-sonnet-5[Introducing Claude Sonnet 5]
[[ref-29]]
. Google, link:https://ai.google.dev/gemini-api/docs[Gemini API documentation]
[[ref-30]]
. Microsoft, link:https://learn.microsoft.com/en-us/azure/foundry/responsible-ai/openai/data-privacy[Data, privacy, and security for Foundry Models]
[[ref-31]]
. Cohere, link:https://docs.cohere.com/docs/command-r-plus[Command R+]
[[ref-32]]
. Mistral AI, link:https://mistral.ai/[Mistral AI]
[[ref-33]]
. OpenAI, link:https://openai.com/index/openai-for-healthcare/[Introducing OpenAI for Healthcare]
[[ref-34]]
. Anthropic, link:https://www.anthropic.com/news/pwc-expanded-partnership[PwC expanded partnership]
[[ref-35]]
. Mistral AI, link:https://mistral.ai/customers/stellantis/[Stellantis and Mistral]
[[ref-36]]
. 富士通, link:https://info.archives.global.fujitsu/jp/news/2024/07/16.html[富士通とCohere、企業向け生成AIの提供に向けた戦略的提携]
[[ref-37]]
. OpenAI, link:https://developers.openai.com/api/docs/models[Models | OpenAI API]
[[ref-38]]
. Qwen, link:https://huggingface.co/Qwen/Qwen2.5-7B-Instruct[Qwen2.5-7B-Instruct]
[[ref-39]]
. ggml-org, link:https://github.com/ggml-org/llama.cpp/blob/master/tools/quantize/README.md[llama.cpp quantization documentation]