メインコンテンツへスキップ
ToolPotion

SpanBERT

SpanBERTは、テキストの範囲(スパン)の表現と予測に焦点を当てることで、事前学習の改善を目指すAIモデルです。HuggingFace BERTフォーマットと互換性のある、事前学習済みのベースモデルとラージモデルを提供します。このリポジトリには、質問応答や関係抽出を含む様々なNLPタスクでSpanBERTを使用および評価するためのコードが含まれています。

URLを訪問

説明

SpanBERTは、Facebook Researchによって開発された高度なAIモデルであり、テキストスパンの表現と予測に焦点を当てることで、事前学習技術を強化するように設計されています。このリポジトリは、研究者や開発者がSpanBERTの能力を利用および評価するために必要なコードとモデルを提供します。

このプロジェクトでは、ベースモデルとラージモデルの両方の事前学習済みモデルを提供しています。これらのモデルはBERTと同じ設定を共有していますが、関連論文で詳述されているように、異なるマスキングスキームとトレーニング目標を組み込んでいます。SpanBERT(ベース&ケーシング)モデルは、768の隠れユニットと12のヘッドを持つ12層のアーキテクチャを備え、合計1億1000万のパラメータを持ちます。より大きなSpanBERT(ラージ&ケーシング)モデルは、24層のアーキテクチャ、1024の隠れユニット、16のヘッド、および3億4000万のパラメータを誇ります。これらのモデルは、HuggingFace BERTモデルの形式を採用し、シームレスな統合のために設計されており、簡単に置き換えることができます。

このリポジトリには、様々な自然言語処理(NLP)タスクでSpanBERTをファインチューニングするための包括的なコードが含まれています。SQuAD 1.1およびSQuAD 2.0質問応答データセット、関係抽出のためのTACRED、そしてNewsQA、TriviaQA、SearchQA、HotpotQA、NaturalQuestionsなどのデータセットを含むMRQAベンチマークでのファインチューニング用のスクリプトが提供されています。さらに、RTEなどのGLUEタスクでのファインチューニング用のコードも利用可能です。コアファレンス解決タスクについては、別のTensorFlow実装がリンクされています。

パフォーマンスベンチマークが提示されており、Coref、TACREDデータセットだけでなく、SQuAD 1.1、SQuAD 2.0でもBERTと比較してSpanBERTの優れた結果を示しています。例えば、SpanBERT(ラージ)はSQuAD 1.1で94.6、SQuAD 2.0で88.7のF1スコアを達成し、BERT(ラージ)を上回っています。このプロジェクトは、ダウンストリームタスク用のファインチューニング済みモデルのダウンロードも容易にし、ユーザーの採用プロセスを簡素化します。

SpanBERTはCC-BY-NC 4.0ライセンスの下でリリースされており、コードと事前学習済みモデルの両方に適用されます。これにより、非商用研究および開発で利用可能になります。リポジトリは貢献を奨励し、問い合わせやサポートのための連絡先情報を提供しています。

SpanBERTのハイライト

  • 事前学習済みSpanBERTモデル(ベースおよびラージ、ケーシング対応)

  • SpanBERTの使用および評価用コード

  • SQuAD 1.1およびSQuAD 2.0用ファインチューニングスクリプト

  • TACRED関係抽出用ファインチューニングスクリプト

  • MRQAデータセット(NewsQA、TriviaQAなど)用ファインチューニングスクリプト

  • GLUEタスク(RTE)用ファインチューニングスクリプト

  • HuggingFace BERTモデルフォーマットとの互換性

  • コアファレンス解決ファインチューニングコード利用可能

  • BERTとのパフォーマンスベンチマーク

  • ダウンストリームタスク用のダウンロード可能なファインチューニング済みモデル

  • SpanBERT: スパンの表現と予測による事前学習の改善論文の実装

SpanBERTをはじめる

  1. コードへのアクセス: SpanBERT GitHubリポジトリをクローンします。

  2. 環境設定: Apex(特定のコミットを推奨)を含む必要な依存関係をインストールします。

  3. 事前学習済みモデルのロード: 提供されているスクリプトを使用して、ベースまたはラージのケーシング対応SpanBERTモデルをロードします。

  4. モデルのファインチューニング: SQuAD、TACRED、MRQA、またはGLUEなどのタスクについて、提供されているPythonスクリプトを実行します。

  5. API経由での統合: HuggingFace互換性を活用して、カスタムアプリケーションでのモデル使用を適応させます。

  6. パフォーマンスの評価: 評価スクリプトを実行して、特定のNLPタスクでのモデルパフォーマンスを評価します。

  7. ファインチューニング済みモデルのダウンロード: 提供されているスクリプトを使用して、ダウンストリームタスク用の事前学習済みモデルを取得します。

SpanBERTの使用例

  • 質問応答
  • 関係抽出
  • コアファレンス解決
  • 自然言語理解
  • テキストスパン予測
  • 研究開発
  • ベンチマーク評価

SpanBERTのFAQ

SpanBERT のレビュー

読み込み中...

SpanBERT に似た人気のAIツール

DeBERTaは、Microsoft Researchによって開発された大規模事前学習済み言語モデルです。T5 11Bモデルを性能で凌駕し、SuperGLUEベンチマークで人間レベルの結果を達成しています。この先進的なモデルは、自然言語理解タスクに顕著な能力を提供します。

AIモデルとLLM

BERTは、100以上の言語をサポートするCasedとUncasedの2つの多言語モデルを提供しています。Casedモデルは、ラテン文字以外のアルファベットや一般的な用途に推奨され、Uncasedモデルは旧バージョンです。これらのモデルは自然言語理解タスク向けに設計されており、特定のアプリケーションに合わせてファインチューニングできます。

AIモデルとLLM

BigBirdベースモデルは、ブロック疎行列アテンションを使用して、はるかに長いシーケンスを処理できるように拡張されたBERTのTransformerです。マスク言語モデリングのために英語テキストで事前学習されており、最大4096トークンのシーケンスを効率的に処理でき、長文タスクで最先端の結果を達成しています。

AIモデルとLLM

AI モデル

MPNetは、BERTやXLNetを改良した言語理解タスク向けの新しい事前学習手法です。様々な事前学習モデルの統一的な実装を提供し、GLUEやSQuADなどの多様な言語理解タスクにおける事前学習およびファインチューニング用のコードをサポートします。

AIモデルとLLM

GODELは、目標指向型対話生成のための大規模事前学習済みTransformerベースモデルです。外部テキストに基づいた応答生成に優れており、様々な対話タスクに対して効率的なファインチューニングを可能にします。リポジトリには、研究開発用のコード、データセット、事前学習済みモデルが提供されています。

AIモデルとLLM

AI モデル

ConvBERTは、スパンベースの動的畳み込みを特徴とする新しいアーキテクチャを持つ、言語モデルの事前学習のためのオープンソースAIモデルです。このGitHubリポジトリには、V100 GPUでテストされたConvBERTモデルの事前学習およびファインチューニング用のコードが含まれており、TensorFlowでの使用方法も記載されています。

AIモデルとLLM

RETRO(Retrieval Enhanced Transformers)は、検索機能をトランスフォーマーアーキテクチャに組み込んだAIモデルです。ウェブページ、書籍、ニュース、コードなど、膨大なテキストデータベースにアクセスし、言語生成の精度と事実の一貫性を向上させます。この手法は、標準的なトランスフォーマーと比較して大幅なパフォーマンス向上をもたらしま…

AIモデルとLLM

RAG(Retrieval-Augmented Generation)は、事前学習済み言語モデルと外部データソースを組み合わせたものです。関連するパッセージを取得して生成を条件付け、事実の正確性を向上させ、モデル全体の再学習なしでの知識更新を可能にします。このアプローチは、パラメトリックメモリと非パラメトリックメモリを統合することで、応答の質を向上させます。

AIモデルとLLM