メインコンテンツへスキップ
ToolPotion

OpenLLaMA

OpenLLaMAは、Meta AIのLLaMA 7Bモデルを許可なく利用可能なライセンスで再現したオープンソースモデルです。RedPajamaデータセットで学習され、3B、7B、13Bのパラメータバージョンを提供し、既存のLLaMA実装にシームレスに統合するためのPyTorchおよびJAXウェイトを提供します。

URLを訪問

説明

OpenLLaMAは、オープンソースの大規模言語モデルにおける重要な進歩であり、Meta AIのLLaMAを許可なく利用可能なライセンスで再現したものです。openlm-researchによって開発されたこのプロジェクトは、アクセス可能なウェイトと学習手法を提供することで、強力な言語モデルへのアクセスを民主化することを目指しています。

このプロジェクトでは、3B、7B、13Bのパラメータバージョンを含む一連のモデルをリリースしており、これらはすべて1兆トークンで学習されています。これらのモデルは、既存の実装において元のLLaMAモデルのドロップイン置換として機能するように設計されています。プロジェクトは、Hugging Face transformersライブラリと互換性のあるPyTorch形式と、EasyLMフレームワークで使用するためのJAX形式の両方でウェイトを提供します。

OpenLLaMAの学習手法は、元のLLaMA論文に厳密に従っており、同じモデルアーキテクチャ、コンテキスト長、学習ステップ、学習率スケジュール、オプティマイザーを使用しています。主な違いは使用されるデータセットにあります。v1モデルはRedPajamaデータセットで学習され、v2モデルはFalcon refined-webデータセット、StarCoderデータセット、およびRedPajamaデータセットの一部(Wikipedia、ArXiv、Books、StackExchange)の混合を使用しています。オープンデータセットへのこのコミットメントは、透明性と再現性を保証します。

このプロジェクトは評価と比較を重視しており、lm-evaluation-harnessを使用して幅広いタスクでLLaMAおよびGPT-Jとの結果を提示しています。OpenLLaMAモデルは、同等のモデルと比較して同等、場合によってはそれ以上のパフォーマンスを示します。開発チームは、コード生成タスクに影響を与えるトークナイザーの設定などの潜在的な問題にも対処しており、そのようなアプリケーションにはv2モデルの使用を推奨しています。

OpenLLaMAはApache 2.0ライセンスの下でライセンスされており、広範な採用と変更を促進します。このプロジェクトは、Berkeley AI Researchからの貢献とGoogleのTPU Research Cloudプログラムからのサポートを受けた共同作業です。この取り組みは、研究者や開発者が最先端の言語モデルを基盤として構築し、革新することを可能にします。

OpenLLaMAのハイライト

  • Meta AIのLLaMAを許可なく利用可能なライセンスで再現したオープンソースモデル

  • 3B、7B、13Bのパラメータサイズで利用可能

  • 1兆トークンで学習済み

  • PyTorchおよびJAX形式のウェイトを提供

  • Hugging Face transformersおよびEasyLMフレームワークと互換性あり

  • 元のLLaMAアーキテクチャおよび学習ハイパーパラメータに準拠

  • RedPajama、Falcon refined-web、StarCoderなどのオープンデータセットを使用

  • 元のLLaMAおよびGPT-Jと同等のパフォーマンス

  • 広範な利用を促進するApache 2.0ライセンス

  • 評価結果と比較を含む

  • T5と同様に、複数の空きスペースをマージするように設計されたトークナイザー

OpenLLaMAをはじめる

  1. モデルウェイトへのアクセス: Hugging Face HubまたはEasyLMリポジトリからPyTorchまたはJAXウェイトをダウンロードします。

  2. 環境設定: transformers、PyTorch、またはJAXなどの必要なライブラリをインストールします。

  3. トークナイザーのロード: トークン化の問題を回避するために、`use_fast=False`を指定してLlamaTokenizerまたはAutoTokenizerを使用します。

  4. モデルのロード: Hugging Face transformersからLlamaForCausalLM、またはEasyLMの同等のものをインスタンス化します。

  5. API経由での統合: ロードされたモデルをテキスト生成、推論、またはファインチューニングタスクに利用します。

  6. パフォーマンスの評価: lm-evaluation-harnessを使用してベンチマークを行い、正しいトークナイザーの使用を確認します。

OpenLLaMAの使用例

  • テキスト生成
  • 言語理解
  • モデル再現
  • 研究開発
  • チャットボット開発
  • コード生成

OpenLLaMAのFAQ

OpenLLaMA のレビュー

読み込み中...

OpenLLaMA に似た人気のAIツール

OpenELMは、Apple Machine Learning Researchが開発した最先端のオープン言語モデルファミリーです。精度向上のためのレイヤーごとのスケーリング戦略を特徴とし、ログやチェックポイントを含む公開データセットでのトレーニングと評価のための完全なフレームワークを提供します。また、AppleデバイスでのMLX統合用のコードも含まれていま…

AIモデルとLLM

Mistral-7B-v0.1は、70億のパラメータを持つ事前学習済みの生成テキストモデルで、オープンソースを通じて人工知能を進化させることを目的としています。さまざまなベンチマークでLlama 2 13Bを上回り、自然言語処理タスクにおいて強力なツールとなっています。

注目AIモデルとLLM

AI エージェント

OpenRouterは、複数のプロバイダーから提供される膨大な数の大規模言語モデル(LLM)にアクセスするための統一APIインターフェースを提供します。競争力のある価格設定、分散インフラストラクチャによる高い可用性、カスタムデータポリシーを備え、開発者がベンダーロックインなしで多様なAIモデルを効率的に統合できるようにします。

注目AIモデルとLLM

RWKVは、効率的な推論と柔軟なファインチューニング機能を提供する強力な言語モデルです。デスクトップGUI、Webベースの推論、モバイルアプリなど、さまざまなアプリケーションをサポートし、多様なタスクのために複数のプラットフォームやデバイスで高度なAIへのアクセスを可能にします。

AIモデルとLLM

これは、Llama 2 13bをファインチューニングし、Llama 33bの追加アテンションヘッドで強化されたバージョンです。これらの新しいコンポーネントをより良く統合するために、RedPajamaから約1000万トークンで学習されました。このモデルは、標準の13bモデルよりも学習能力の向上を目指し、さらなる開発の基盤として意図されています。

AIモデルとLLM

AI アプリ

AIモデルとデータセットを探索、実行、ファインチューニング、デプロイするためのオープンソースモデルコミュニティおよびプラットフォームで、AIアプリケーションを構築するためのPythonライブラリとホスティングスタジオを提供します。

AIモデルとLLM

AI フレームワーク

Mac、Windows、Linux上でAIモデルをローカルに実行およびトレーニングするための無料のオープンソースデスクトップアプリで、ノーコードUI、エージェント接続、およびOpenAI互換APIを備えています。

注目AIモデルとLLM

This research empirically analyzes the optimal trade-off between model size and training data for large language models given a fixed compute budget. It reveals that current large…

AIモデルとLLM