無料のAIモデル・文章・コード

Llama

Meta Llamaシリーズの8B・70B・405Bを比較。量子化を含むローカルPCの目安、独自ライセンス、モデル入手先とコミュニティ資料を案内します。

Meta文章・コードローカル実行ガイド
公式情報を見る

01 / OVERVIEW

概要と選び方

LlamaはMetaが公開するオープンウェイトモデル系列です。Llama 3.1には8B・70B・405Bがあり、モデルサイズに応じて個人PCから複数GPUサーバーまで必要な環境が大きく変わります。周辺ツールは豊富ですが、すべてを無条件の『オープンソース』と扱わないことが重要です。

まず確認:8Bの量子化版から検証。70B以上は重みだけでなくKVキャッシュを含むメモリ計画が必要。

02 / VERSIONS & LICENSE

主な版と利用条件

版規模向いている用途ライセンス
Llama 3.1 8B8B個人PC・小規模アプリLlama Community License
Llama 3.1 70B70B高品質な文章・分析Llama Community License
Llama 3.1 405B405B複数GPUの研究・大規模運用Llama Community License

Llama 3.1は独自のLlama Community License。利用・再配布・大規模サービスの条件と利用規定を個別に確認。 商用・再配布を始める前に対象版の公式条文を確認してください。

03 / LOCAL HARDWARE

ローカルで動かすための構成

GPUメモリ(VRAM)を最優先に見積もります。ここに示す重み容量と実際の推論時ピークメモリは異なります。

モデル・形式メモリの目安実際の構成で確認すること
8B・BF16/4bit重み約16GB/約4GB4bitなら8GB級GPUから検討。実使用量はさらに増える。
70B・BF16/4bit重み約140GB/約35GB4bitでも48GB級GPUまたは分割配置が現実的。
405B・BF16/4bit重み約810GB/約203GB複数の大容量GPUを使うサーバー向け。

VRAM以外も確認

  • ストレージにはモデルファイルに加え、ダウンロード中の一時ファイルと別形式の重みを置く余裕が必要です。公開元のファイル一覧で容量を確認してください。
  • CPUやGPUからRAMへオフロードする場合は、移す重みとOS・アプリの使用量を足して見積もります。動作しても生成速度が大きく低下することがあります。
  • Windows・Linux・macOSでは対応するGPUドライバーとランタイムが異なります。Apple Siliconの統合メモリはNVIDIAのVRAM値と単純に同一視できません。
  • 重み容量はパラメータ数×ビット数による概算で、量子化のメタデータや実行時メモリは含みません。
  • 長いコンテキストではKVキャッシュが急増します。GPU容量に余裕を確保し、遅くてもよければCPU/RAMへのオフロードを検討してください。

目安は2026年10月時点の公式資料または重み容量の概算です。保証された最低要件ではありません。量子化形式、コンテキスト長、画像解像度、ドライバー、同時実行数で変わります。

04 / GET STARTED

導入の手順

  1. 01

    Metaまたは公式Hugging Faceのモデルカードで選んだ版の条件とアクセス手続きを確認する。

  2. 02

    公式のTransformers手順、あるいは対応する正規の量子化版を使うローカルランタイムを選ぶ。

  3. 03

    Instruct版をチャット用途に選び、モデル指定のチャットテンプレートを適用する。

  4. 04

    日本語での品質、長文時のメモリ、禁止用途・再配布条件を本番前に確認する。

コマンドやファイル配置は版と実行ツールで変わります。下の公式リンクから該当する手順を選び、出所が確認できない重みやスクリプトは実行しないでください。

05 / FIT & LIMITS

得意なこと・注意点

向いていること

  • 豊富なツール、量子化版、研究資料が見つかる。
  • 8Bから405Bまで用途に応じたサイズを選べる。

注意したいこと

  • Llama Community LicenseはApache/MITとは異なり、追加条件があります。
  • 405Bを家庭用GPU一枚で快適に実行できるわけではありません。特定タスクでの品質も自分の評価セットで比較してください。

06 / TROUBLESHOOTING

困ったときはどこを見る?

モデルへのアクセスを求められる

Meta公式の入手案内とライセンスを確認

参照先を開く ↗

出力形式や会話が崩れる

公式モデルカードのチャットテンプレートを確認

参照先を開く ↗

推論実装で詰まる

Metaの公式リポジトリのIssueを調べる

参照先を開く ↗

07 / FAQ

よくある質問

8GBのGPUでLlamaを試せますか?

8Bの4bit量子化版なら検討できます。ただし重みの約4GBに加えて実行環境とコンテキスト用メモリが必要です。70Bは対象外と考えてください。

Llamaは完全なオープンソースですか?

重みは公開されていますがLlama 3.1には独自のCommunity Licenseがあります。Open Source Initiative承認ライセンスと同一視せず、対象版の条文を確認してください。

08 / OFFICIAL RESOURCES

公式資料・コミュニティ

ダウンロード、ライセンス、実装上の問題は、開発元のモデルカード・ドキュメント・Issueを優先して確認してください。