설명
Stability AI가 GitHub에서 호스팅하는 StableLM 프로젝트는 오픈 소스 대규모 언어 모델(LLM) 개발에 있어 중요한 노력을 나타냅니다. 이 리포지토리는 StableLM 시리즈의 지속적인 연구 및 개발을 위한 중앙 허브 역할을 하며, 새로운 모델 체크포인트와 발전을 통해 지속적으로 업데이트됩니다.
StableLM의 핵심은 AI 커뮤니티에 강력하고 접근 가능한 언어 모델을 제공하는 것입니다. 이 프로젝트는 30억 개의 매개변수를 가진 모델인 StableLM-3B-4E1T를 포함한 여러 주목할 만한 모델을 출시했습니다. 이 모델은 반복되는 토큰이 성능에 미치는 영향을 조사하기 위해 다중 에포크 체제 하에서 사전 훈련되었습니다. 이 모델은 4 에포크 동안 1조 개의 토큰으로 훈련되었으며, 데이터 제약이 있는 언어 모델의 확장 연구에서 영감을 얻었습니다. 아키텍처는 LLaMA와 유사한 디코더 전용 트랜스포머이며, Rotary Position Embeddings 및 LayerNorm과 같은 특정 수정 사항이 적용되었습니다.
추가 반복에는 3B 및 7B 매개변수 크기로 제공되는 StableLM-Alpha v2 모델이 포함됩니다. 이러한 모델은 SwiGLU와 같은 아키텍처 개선 사항을 통합하고 더 높은 품질의 데이터 소스를 활용하여 다운스트림 성능을 크게 향상시킵니다. 이러한 모델의 훈련 데이터에는 Falcon RefinedWeb, RedPajama-Data, The Pile, StarCoder와 같은 오픈 소스 데이터셋의 필터링된 혼합이 포함되며, 웹 텍스트에 중점을 둡니다. 이러한 모델의 컨텍스트 길이는 4096 토큰입니다.
Stability AI는 또한 Vicuna-13B의 RLHF 파인튜닝 모델인 StableVicuna를 개발하여 오픈 소스 RLHF LLM 챗봇을 만드는 것을 목표로 합니다. LLaMA의 비상업적 라이선스로 인해 StableVicuna의 가중치는 원본 모델에 대한 델타로 릴리스됩니다.
리포지토리는 개발자가 시작할 수 있도록 Hugging Face에서 StableLM-Tuned-Alpha-7B와 같은 모델로 추론을 실행하기 위한 빠른 시작 가이드 및 예제 코드 스니펫을 포함한 리소스를 제공합니다. 이 프로젝트는 llama.cpp 포팅 및 피드백 데이터 수집을 위한 Open Assistant와의 통합에 대한 기여를 구하며 커뮤니티 참여를 장려합니다. 사용자는 사전 훈련된 LLM과 마찬가지로 응답의 품질이 다양할 수 있으며 공격적인 콘텐츠를 포함할 수 있으며, 이는 추가 개발 및 커뮤니티 피드백을 통해 개선될 것으로 예상된다는 점에 유의해야 합니다.
StableLM 언어 모델의 핵심 기능
오픈 소스 언어 모델 개발 리포지토리
StableLM 언어 모델 시리즈 호스팅
새로운 체크포인트로 지속적으로 업데이트
StableLM-3B-4E1T와 같은 모델 포함
StableLM-Alpha v2 모델(3B 및 7B) 제공
RLHF 파인튜닝 모델인 StableVicuna 제공
기술 보고서 및 모델 개요 제공
추론을 위한 예제 코드 포함
커뮤니티 기여 및 피드백 장려
CC BY-SA-4.0 및 CC BY-NC-SA-4.0 라이선스로 모델 제공
Apache License 2.0에 따라 라이선스가 부여된 코드
StableLM 언어 모델 시작하기
클론: 리포지토리를 로컬 머신으로 클론합니다.
종속성 설치: 필요한 라이브러리 및 프레임워크를 설치합니다.
모델 다운로드: Hugging Face에서 원하는 StableLM 모델 체크포인트를 가져옵니다.
구성: 추론 또는 파인튜닝을 위한 환경 및 매개변수를 설정합니다.
실행: 추론 또는 사용자 지정 모델 사용을 위해 제공된 스크립트를 실행합니다.
통합: 모델을 애플리케이션 또는 연구 프로젝트에 통합합니다.
StableLM 언어 모델의 사용 사례
- 언어 모델 연구
- AI 챗봇 개발
- 텍스트 생성
- 자연어 이해
- 특정 작업에 대한 파인튜닝
- 오픈 소스 AI 개발







