본문으로 건너뛰기
ToolPotion

Intel® Neural Compressor

Intel® Neural Compressor는 PyTorch, TensorFlow 및 JAX를 위한 인기 있는 모델 압축 기법을 제공하는 오픈 소스 Python 라이브러리입니다. LLM 및 VLM에 대한 고급 양자화를 지원하며, 광범위한 테스트를 통해 다양한 Intel 하드웨어 및 기타 플랫폼에서 성능을 최적화합니다.

URL 방문

설명

Intel® Neural Compressor는 다양한 압축 기법을 통해 딥러닝 모델의 성능을 향상시키도록 설계된 강력한 오픈 소스 Python 라이브러리입니다. PyTorch, TensorFlow 및 JAX와 같은 주류 프레임워크와 원활하게 통합되어 개발자 및 연구자에게 다용도 도구입니다.

이 라이브러리는 정적 양자화, 동적 양자화, SmoothQuant, 가중치 전용 양자화, 양자화 인식 학습 및 혼합 정밀도를 포함한 포괄적인 모델 압축 방법 세트를 제공합니다. 주요 기능은 LLaMA, Qwen, DeepSeek와 같은 대규모 언어 모델(LLM) 및 비전-언어 모델(VLM)에 대한 고급 양자화 지원으로, AutoRound와의 통합을 활용하여 최적화된 저정밀도 데이터 유형을 지원합니다.

Intel® Neural Compressor는 광범위한 하드웨어 호환성을 위해 설계되었습니다. Intel Gaudi AI 가속기, Intel Core Ultra 프로세서, Intel Xeon 확장 가능 프로세서, Intel Xeon CPU Max 시리즈, Intel 데이터 센터 GPU Flex 시리즈 및 Intel 데이터 센터 GPU Max 시리즈를 포함한 다양한 Intel 하드웨어에 대한 광범위한 테스트 및 지원을 제공합니다. 또한 AMD CPU, ARM CPU 및 NVIDIA GPU에 대한 제한적인 테스트 지원을 제공합니다.

라이브러리 문서는 다양한 프레임워크 및 하드웨어에 대한 설치 절차를 자세히 설명합니다. 사용자는 pip를 통해 PyTorch의 경우 `neural-compressor-pt` 또는 TensorFlow의 경우 `neural-compressor-tf`와 같이 특정 프레임워크 종속성을 사용하여 Neural Compressor를 설치할 수 있습니다. JAX의 경우 소스에서 빌드하는 설치 방법이 제공됩니다. 문서에는 Intel Gaudi2 AI 가속기에서의 FP8 양자화 및 가중치 전용 LLM 로딩과 같은 기법에 대한 예제 코드가 포함된 시작 가이드도 포함되어 있습니다.

최신 업데이트는 Keras/JAX의 FP8 양자화, AutoRound를 사용한 FP8 KV 캐시/어텐션 정적 양자화, NVFP4/MXFP4 양자화에 대한 실험적 지원을 강조합니다. 이 프로젝트는 GitHub Issues 및 이메일을 통해 버그 보고서, 기능 요청 및 연구 아이디어에 대한 명확한 지침을 제공하며 기여 및 협업을 적극적으로 장려합니다.

Intel® Neural Compressor의 핵심 기능

  • PyTorch, TensorFlow 및 JAX 프레임워크 지원

  • 정적 양자화, 동적 양자화, SmoothQuant, 가중치 전용 양자화 제공

  • 양자화 인식 학습 및 혼합 정밀도 활성화

  • LLM 및 VLM(예: LLaMA, Qwen)에 대한 고급 양자화

  • 최적화된 저정밀도 데이터 유형을 위한 AutoRound와의 통합

  • Intel 하드웨어(Gaudi, Xeon, Core Ultra, 데이터 센터 GPU)에 대한 광범위한 지원

  • AMD CPU, ARM CPU 및 NVIDIA GPU에 대한 제한적인 지원

  • Keras/JAX에 대한 실험적 FP8 양자화 지원

  • 실험적 FP8 KV 캐시/어텐션 정적 양자화

  • 실험적 NVFP4 및 MXFP4 양자화 지원

  • 가중치 전용 대규모 언어 모델 로딩

Intel® Neural Compressor 시작하기

  1. 프레임워크 종속성 설치: 배포 환경에 따라 필요한 패키지를 선택하고 설치합니다(예: `pip install neural-compressor-pt`).

  2. 양자화 구성: 모델에 대한 FP8Config와 같은 양자화 구성을 정의합니다.

  3. 모델 준비: `prepare` 함수를 사용하여 양자화 구성을 모델에 통합합니다.

  4. 모델 변환: `convert` 함수를 적용하여 모델 압축을 완료합니다.

  5. 배포 및 최적화: 압축된 모델을 애플리케이션에 통합하여 추론 성능을 향상시킵니다.

Intel® Neural Compressor의 사용 사례

  • LLM 양자화
  • VLM 최적화
  • 하드웨어 가속
  • 프레임워크 통합
  • 성능 튜닝
  • 혼합 정밀도 학습

Intel® Neural Compressor의 FAQ

Intel® Neural Compressor 리뷰

로딩 중...

Intel® Neural Compressor와(과) 비슷한 인기 AI 도구

AI 프레임워크

Ludwig는 오픈 소스 로우 코드 딥러닝 프레임워크입니다. 사용자는 사용자 지정 코드를 작성할 필요 없이 간단한 YAML 구성 파일을 사용하여 텍스트, 이미지, LLM을 포함한 다양한 데이터 유형에 대한 AI 모델을 구축, 미세 조정 및 배포할 수 있습니다.

머신러닝 플랫폼

AI 프레임워크

fastai는 실무자와 연구자를 위해 설계된 딥러닝 라이브러리입니다. 최첨단 결과를 신속하게 개발하기 위한 고수준 구성 요소와 새로운 접근 방식을 위한 저수준 구성 요소를 제공합니다. 계층적 아키텍처와 Python의 동적 기능을 통해 사용 편의성, 유연성 및 성능을 목표로 합니다.

추천머신러닝 플랫폼

AI 프레임워크

DeepSpeed는 AI 모델의 분산 학습 효율성을 간소화하고 향상하도록 설계된 딥러닝 최적화 라이브러리입니다. 연구원 및 개발자가 대규모 모델 학습을 쉽게 접근하고 효과적으로 사용할 수 있도록 하여 고급 AI 솔루션의 실험 및 배포를 가속화합니다.

머신러닝 플랫폼

AI 프레임워크

BigDL-LLM은 노트북부터 클라우드 GPU까지 Intel XPU 하드웨어에서 대규모 언어 모델(LLM)을 실행하기 위한 오픈 소스 라이브러리입니다. 낮은 지연 시간 추론을 위한 INT4/FP4/INT8/FP8 양자화를 지원하며 PyTorch 모델에 대한 포괄적인 파인튜닝 기능을 제공합니다.

MLOps 및 모델 배포

AI 프레임워크

Eclipse Deeplearning4j는 JVM을 위한 오픈 소스 분산 딥러닝 프레임워크입니다. Java 및 Scala에서 신경망을 구축, 학습 및 배포하기 위한 포괄적인 생태계를 제공하며, 네이티브 GPU 가속 및 고성능 CPU 연산을 지원합니다. 데이터 로딩, 변환 및 모델 가져오기를 위한 다양한 라이브러리를…

머신러닝 플랫폼

AI 프레임워크

DeepSpeed는 분산 훈련을 간소화하기 위해 설계된 딥 러닝 최적화 라이브러리입니다. ZeRO 및 3D-Parallelism과 같은 고급 기술을 통해 대규모 모델 훈련의 효율성과 효과성을 향상시킵니다.

추천머신러닝 플랫폼

tinygrad는 딥 러닝을 위해 설계된 직관적인 신경망 프레임워크입니다. 복잡한 네트워크를 세 가지 작업 유형으로 단순화하여 기계 학습 솔루션을 효율적으로 구현하려는 개발자에게 접근성을 제공합니다.

추천머신러닝 플랫폼

AI 프레임워크

TensorFlow는 머신러닝을 위한 오픈소스 프레임워크로, 초보자와 전문가 모두 데스크톱, 모바일, 웹, 클라우드를 포함한 다양한 플랫폼에서 모델을 구축하고 배포할 수 있도록 지원합니다. 데이터 준비, 모델 구축, 학습, 배포를 위한 도구를 제공하며 엔드투엔드 ML 파이프라인을 지원합니다.

머신러닝 플랫폼