본문으로 건너뛰기
ToolPotion

ConvBERT GitHub

ConvBERT는 스팬 기반 동적 컨볼루션이라는 새로운 아키텍처를 도입한 오픈 소스 언어 모델 사전 학습 AI 모델입니다. 이 GitHub 리포지토리는 V100 GPU에서 테스트된 ConvBERT 모델의 사전 학습 및 미세 조정을 위한 코드를 제공하며, TensorFlow 사용 지침을 포함합니다.

URL 방문

설명

ConvBERT는 스팬 기반 동적 컨볼루션을 통합하여 기존 BERT 모델을 향상시키는 사전 학습 언어 모델 아키텍처입니다. 이 접근 방식은 인간 언어를 이해하고 생성하는 모델의 효율성과 성능을 개선하는 것을 목표로 합니다. ConvBERT의 공식 구현 및 코드베이스는 yitu-opensource 조직에서 관리하는 GitHub에서 공개적으로 사용할 수 있습니다.

이 리포지토리는 ConvBERT를 활용하거나 기여하는 데 관심 있는 연구원 및 개발자를 위한 포괄적인 리소스를 제공합니다. 처음부터 ConvBERT 모델을 사전 학습하고 GLUE 벤치마크와 같은 특정 다운스트림 작업에 대해 사전 학습된 모델을 미세 조정하는 방법에 대한 자세한 지침이 포함되어 있습니다. 코드는 TensorFlow 버전 1.15를 사용하여 개발 및 테스트되었으며 Python 3 환경과 호환됩니다.

사전 학습을 위해 이 리포지토리는 OpenWebText 코퍼스를 사용하여 중간-소형 ConvBERT 모델(약 1,700만 개의 매개변수)을 구축하는 단계를 설명합니다. 이 프로세스에는 `build_data.sh` 및 `build_openwebtext_pretraining_dataset.py`와 같은 제공된 스크립트를 사용한 데이터 준비와 `pretrain.sh`를 통한 모델 학습이 포함됩니다. 미세 조정 섹션은 사용자가 GLUE와 같은 작업에 대해 사전 학습된 ConvBERT 모델을 조정하는 방법을 안내하며, `download_glue_data.py` 및 `finetune.sh`와 같은 스크립트를 제공합니다. `configure_pretraining.py` 및 `configure_finetuning.py`와 같은 구성 파일을 통해 하이퍼파라미터를 사용자 정의할 수 있습니다.

이 프로젝트는 ELECTRA 코드베이스를 기반으로 하며 동적 컨볼루션 구현을 통합합니다. ConvBERT 아키텍처는 "ConvBERT: Improving BERT with Span-based Dynamic Convolution"이라는 제목의 NeurIPS 2020 논문에서 자세히 설명합니다. 리포지토리에는 TensorFlow, NumPy 및 scikit-learn과 같은 종속성이 나열되어 있으며 편의를 위해 사전 학습된 모델에 대한 링크도 제공합니다. 이 오픈 소스 이니셔티브는 자연어 처리 분야의 협업과 발전을 촉진합니다.

ConvBERT GitHub 하이라이트

  • 스팬 기반 동적 컨볼루션 아키텍처

  • 언어 모델 사전 학습

  • 다운스트림 작업(예: GLUE) 미세 조정

  • TensorFlow 1.15 호환성

  • Python 3 지원

  • GitHub에서 사용 가능한 오픈 소스 코드

  • 데이터 구축 및 모델 학습을 위한 스크립트 포함

  • 사전 학습 및 미세 조정을 위한 자세한 지침

  • V100 GPU에서 테스트된 모델

  • 자세한 설명을 위해 NeurIPS 2020 논문 참조

  • ELECTRA 기반 코드베이스

  • 사전 학습된 모델 링크 제공

ConvBERT GitHub 시작하기

  1. 코드 액세스: GitHub에서 ConvBERT 리포지토리를 클론합니다.

  2. 환경 설정: Python 3, TensorFlow 1.15, NumPy 및 scikit-learn을 설치합니다.

  3. 모델 사전 학습: OpenWebText 코퍼스를 다운로드하고 `build_data.sh` 및 `pretrain.sh`를 실행합니다.

  4. 모델 미세 조정: GLUE 데이터를 다운로드하고 `download_glue_data.py` 및 `finetune.sh`를 실행합니다.

  5. 하이퍼파라미터 구성: `configure_pretraining.py` 또는 `configure_finetuning.py`에서 설정을 수정합니다.

  6. 모델 통합: 제공된 스크립트와 사전 학습된 가중치를 NLP 작업에 활용합니다.

ConvBERT GitHub의 사용 사례

  • 언어 모델 사전 학습
  • 텍스트 분류
  • 자연어 이해
  • 시퀀스 레이블링
  • 질의응답
  • 텍스트 생성
  • 연구 개발

ConvBERT GitHub의 FAQ

ConvBERT GitHub 리뷰

로딩 중...

ConvBERT GitHub와(과) 비슷한 인기 AI 도구

TensorFlow Models는 TensorFlow로 구축된 모델 및 예제 모음을 제공하는 GitHub 리포지토리입니다. 다양한 애플리케이션을 위한 사전 구축된 머신러닝 모델에 액세스하고, 기여하고, 학습할 수 있는 중앙 허브 역할을 합니다. 최첨단 AI 솔루션을 탐색하고 구현해 보세요.

머신러닝 플랫폼

AI 모델

MPNet은 BERT와 XLNet을 개선한 언어 이해 작업을 위한 새로운 사전 학습 방법입니다. 다양한 사전 학습 모델에 대한 통합 구현을 제공하며, GLUE 및 SQuAD와 같은 다양한 언어 이해 작업에 대한 사전 학습 및 미세 조정을 위한 코드를 지원합니다.

AI 모델 및 LLM

이 리포지토리는 이미지 인식 작업을 위한 컨볼루션 신경망 아키텍처인 ConvMixer의 구현을 제공합니다. "Patches Are All You Need? 🤷" 논문을 기반으로 하며, 평가를 위한 사전 학습된 모델 가중치와 ImageNet-1k 및 CIFAR-10과 같은 데이터셋에서 학습하기 위한 코드를 제공합니다.

AI 모델 및 LLM

FNet는 푸리에 변환으로 자체 주의 메커니즘을 대체하는 효율적인 트랜스포머 유사 인코더 아키텍처입니다. Google Research에서 개발했으며, 자연어 처리 작업에 대한 고성능 대안을 제공합니다. 이 모델은 Jax/Flax로 구현되었으며 GitHub에서 사전 학습 및 미세 조정을 위해 사용할 수 있습니다.

AI 모델 및 LLM

AI 모델

SpanBERT는 텍스트 스팬의 표현 및 예측을 통해 사전 학습을 개선하는 데 중점을 둔 AI 모델입니다. HuggingFace BERT 형식과 호환되는 사전 학습된 기본 및 대형 cased 모델을 제공합니다. 이 리포지토리는 질문 답변 및 관계 추출을 포함한 다양한 NLP 작업에서 SpanBERT를 사용하고 평가하기…

AI 모델 및 LLM

UniLM은 Microsoft에서 개발한 대규모 자체 지도 사전 학습 프레임워크입니다. 텍스트, 이미지, 오디오를 포함한 다양한 작업, 언어 및 모달리티에 걸쳐 모델이 학습할 수 있도록 지원합니다. 이 프로젝트는 고급 AI 연구 및 개발을 위한 기반 모델과 툴킷을 제공합니다.

AI 모델 및 LLM

AI 모델과 데이터셋을 탐색하고 실행하며 미세 조정하고 배포할 수 있는 오픈 소스 모델 커뮤니티 및 플랫폼으로, AI 애플리케이션 구축을 위한 Python 라이브러리와 호스팅 스튜디오를 제공합니다.

AI 모델 및 LLM

Funnel-Transformer는 계산 비용을 줄이기 위해 은닉 상태를 압축하는 AI 모델입니다. 동일한 FLOPs로 더 깊거나 넓은 모델을 만들 수 있으며, 표준 사전 학습을 위한 토큰 수준 표현을 복구할 수 있습니다. 이 모델은 TensorFlow 및 PyTorch 구현으로 제공됩니다.

AI 모델 및 LLM