説明
OpenLLaMAは、オープンソースの大規模言語モデルにおける重要な進歩であり、Meta AIのLLaMAを許可なく利用可能なライセンスで再現したものです。openlm-researchによって開発されたこのプロジェクトは、アクセス可能なウェイトと学習手法を提供することで、強力な言語モデルへのアクセスを民主化することを目指しています。
このプロジェクトでは、3B、7B、13Bのパラメータバージョンを含む一連のモデルをリリースしており、これらはすべて1兆トークンで学習されています。これらのモデルは、既存の実装において元のLLaMAモデルのドロップイン置換として機能するように設計されています。プロジェクトは、Hugging Face transformersライブラリと互換性のあるPyTorch形式と、EasyLMフレームワークで使用するためのJAX形式の両方でウェイトを提供します。
OpenLLaMAの学習手法は、元のLLaMA論文に厳密に従っており、同じモデルアーキテクチャ、コンテキスト長、学習ステップ、学習率スケジュール、オプティマイザーを使用しています。主な違いは使用されるデータセットにあります。v1モデルはRedPajamaデータセットで学習され、v2モデルはFalcon refined-webデータセット、StarCoderデータセット、およびRedPajamaデータセットの一部(Wikipedia、ArXiv、Books、StackExchange)の混合を使用しています。オープンデータセットへのこのコミットメントは、透明性と再現性を保証します。
このプロジェクトは評価と比較を重視しており、lm-evaluation-harnessを使用して幅広いタスクでLLaMAおよびGPT-Jとの結果を提示しています。OpenLLaMAモデルは、同等のモデルと比較して同等、場合によってはそれ以上のパフォーマンスを示します。開発チームは、コード生成タスクに影響を与えるトークナイザーの設定などの潜在的な問題にも対処しており、そのようなアプリケーションにはv2モデルの使用を推奨しています。
OpenLLaMAはApache 2.0ライセンスの下でライセンスされており、広範な採用と変更を促進します。このプロジェクトは、Berkeley AI Researchからの貢献とGoogleのTPU Research Cloudプログラムからのサポートを受けた共同作業です。この取り組みは、研究者や開発者が最先端の言語モデルを基盤として構築し、革新することを可能にします。
OpenLLaMAのハイライト
Meta AIのLLaMAを許可なく利用可能なライセンスで再現したオープンソースモデル
3B、7B、13Bのパラメータサイズで利用可能
1兆トークンで学習済み
PyTorchおよびJAX形式のウェイトを提供
Hugging Face transformersおよびEasyLMフレームワークと互換性あり
元のLLaMAアーキテクチャおよび学習ハイパーパラメータに準拠
RedPajama、Falcon refined-web、StarCoderなどのオープンデータセットを使用
元のLLaMAおよびGPT-Jと同等のパフォーマンス
広範な利用を促進するApache 2.0ライセンス
評価結果と比較を含む
T5と同様に、複数の空きスペースをマージするように設計されたトークナイザー
OpenLLaMAをはじめる
モデルウェイトへのアクセス: Hugging Face HubまたはEasyLMリポジトリからPyTorchまたはJAXウェイトをダウンロードします。
環境設定: transformers、PyTorch、またはJAXなどの必要なライブラリをインストールします。
トークナイザーのロード: トークン化の問題を回避するために、`use_fast=False`を指定してLlamaTokenizerまたはAutoTokenizerを使用します。
モデルのロード: Hugging Face transformersからLlamaForCausalLM、またはEasyLMの同等のものをインスタンス化します。
API経由での統合: ロードされたモデルをテキスト生成、推論、またはファインチューニングタスクに利用します。
パフォーマンスの評価: lm-evaluation-harnessを使用してベンチマークを行い、正しいトークナイザーの使用を確認します。
OpenLLaMAの使用例
- テキスト生成
- 言語理解
- モデル再現
- 研究開発
- チャットボット開発
- コード生成






