설명
Intel® Neural Compressor는 다양한 압축 기법을 통해 딥러닝 모델의 성능을 향상시키도록 설계된 강력한 오픈 소스 Python 라이브러리입니다. PyTorch, TensorFlow 및 JAX와 같은 주류 프레임워크와 원활하게 통합되어 개발자 및 연구자에게 다용도 도구입니다.
이 라이브러리는 정적 양자화, 동적 양자화, SmoothQuant, 가중치 전용 양자화, 양자화 인식 학습 및 혼합 정밀도를 포함한 포괄적인 모델 압축 방법 세트를 제공합니다. 주요 기능은 LLaMA, Qwen, DeepSeek와 같은 대규모 언어 모델(LLM) 및 비전-언어 모델(VLM)에 대한 고급 양자화 지원으로, AutoRound와의 통합을 활용하여 최적화된 저정밀도 데이터 유형을 지원합니다.
Intel® Neural Compressor는 광범위한 하드웨어 호환성을 위해 설계되었습니다. Intel Gaudi AI 가속기, Intel Core Ultra 프로세서, Intel Xeon 확장 가능 프로세서, Intel Xeon CPU Max 시리즈, Intel 데이터 센터 GPU Flex 시리즈 및 Intel 데이터 센터 GPU Max 시리즈를 포함한 다양한 Intel 하드웨어에 대한 광범위한 테스트 및 지원을 제공합니다. 또한 AMD CPU, ARM CPU 및 NVIDIA GPU에 대한 제한적인 테스트 지원을 제공합니다.
라이브러리 문서는 다양한 프레임워크 및 하드웨어에 대한 설치 절차를 자세히 설명합니다. 사용자는 pip를 통해 PyTorch의 경우 `neural-compressor-pt` 또는 TensorFlow의 경우 `neural-compressor-tf`와 같이 특정 프레임워크 종속성을 사용하여 Neural Compressor를 설치할 수 있습니다. JAX의 경우 소스에서 빌드하는 설치 방법이 제공됩니다. 문서에는 Intel Gaudi2 AI 가속기에서의 FP8 양자화 및 가중치 전용 LLM 로딩과 같은 기법에 대한 예제 코드가 포함된 시작 가이드도 포함되어 있습니다.
최신 업데이트는 Keras/JAX의 FP8 양자화, AutoRound를 사용한 FP8 KV 캐시/어텐션 정적 양자화, NVFP4/MXFP4 양자화에 대한 실험적 지원을 강조합니다. 이 프로젝트는 GitHub Issues 및 이메일을 통해 버그 보고서, 기능 요청 및 연구 아이디어에 대한 명확한 지침을 제공하며 기여 및 협업을 적극적으로 장려합니다.
Intel® Neural Compressor의 핵심 기능
PyTorch, TensorFlow 및 JAX 프레임워크 지원
정적 양자화, 동적 양자화, SmoothQuant, 가중치 전용 양자화 제공
양자화 인식 학습 및 혼합 정밀도 활성화
LLM 및 VLM(예: LLaMA, Qwen)에 대한 고급 양자화
최적화된 저정밀도 데이터 유형을 위한 AutoRound와의 통합
Intel 하드웨어(Gaudi, Xeon, Core Ultra, 데이터 센터 GPU)에 대한 광범위한 지원
AMD CPU, ARM CPU 및 NVIDIA GPU에 대한 제한적인 지원
Keras/JAX에 대한 실험적 FP8 양자화 지원
실험적 FP8 KV 캐시/어텐션 정적 양자화
실험적 NVFP4 및 MXFP4 양자화 지원
가중치 전용 대규모 언어 모델 로딩
Intel® Neural Compressor 시작하기
프레임워크 종속성 설치: 배포 환경에 따라 필요한 패키지를 선택하고 설치합니다(예: `pip install neural-compressor-pt`).
양자화 구성: 모델에 대한 FP8Config와 같은 양자화 구성을 정의합니다.
모델 준비: `prepare` 함수를 사용하여 양자화 구성을 모델에 통합합니다.
모델 변환: `convert` 함수를 적용하여 모델 압축을 완료합니다.
배포 및 최적화: 압축된 모델을 애플리케이션에 통합하여 추론 성능을 향상시킵니다.
Intel® Neural Compressor의 사용 사례
- LLM 양자화
- VLM 최적화
- 하드웨어 가속
- 프레임워크 통합
- 성능 튜닝
- 혼합 정밀도 학습



