Deskripsi
Hugging Face Transformers berfungsi sebagai kerangka kerja definisi model fundamental untuk model machine learning mutakhir di berbagai domain, termasuk teks, visi komputer, audio, video, dan aplikasi multimodal. Tujuan utamanya adalah untuk memusatkan definisi model, mendorong kesepakatan dan kompatibilitas di seluruh ekosistem AI. Kerangka kerja ini bertindak sebagai poros penting, memastikan bahwa model yang didefinisikan di dalamnya kompatibel dengan berbagai kerangka kerja pelatihan seperti Axolotl, Unsloth, DeepSpeed, FSDP, dan PyTorch-Lightning. Selain itu, ia terintegrasi secara mulus dengan mesin inferensi seperti vLLM, SGLang, dan TGI, serta pustaka pemodelan yang berdekatan seperti llama.cpp dan mlx, yang semuanya memanfaatkan definisi model yang disediakan oleh Transformers.
Hugging Face berkomitmen untuk mendukung model mutakhir terbaru dan mendemokratisasi aksesibilitasnya. Hal ini dicapai dengan membuat definisi model menjadi sederhana, dapat disesuaikan, dan efisien. Hugging Face Hub menampung lebih dari 1 juta checkpoint model Transformers, yang siap tersedia bagi pengguna untuk dijelajahi dan diintegrasikan ke dalam proyek mereka. Platform ini juga menawarkan linimasa model, yang menampilkan arsitektur terbaru dalam domain teks, visi, audio, dan multimodal.
Kerangka kerja Transformers dirancang untuk memberi pengguna segala yang diperlukan untuk inferensi dan pelatihan dengan model pra-terlatih canggih. Fitur-fitur utama meliputi kelas `Pipeline`, yang menawarkan antarmuka inferensi yang sederhana dan dioptimalkan untuk berbagai tugas machine learning seperti pembuatan teks, segmentasi gambar, pengenalan ucapan otomatis, dan tanya jawab dokumen. Untuk pelatihan, kelas `Trainer` menyediakan dukungan komprehensif untuk fitur-fitur seperti presisi campuran, torch.compile, dan FlashAttention, memfasilitasi pelatihan pada satu perangkat dan terdistribusi untuk model PyTorch. Selain itu, fungsi `generate` memungkinkan pembuatan teks cepat dengan large language models (LLM) dan vision-language models (VLM), mendukung streaming dan berbagai strategi decoding.
Prinsip desain Transformers menekankan kecepatan dan kemudahan penggunaan. Setiap model diimplementasikan hanya menggunakan tiga kelas inti: konfigurasi, model, dan preprocessor, yang memungkinkan penerapan cepat dalam skenario inferensi atau pelatihan melalui `Pipeline` atau `Trainer`. Kerangka kerja ini sangat menganjurkan penggunaan model pra-terlatih untuk mengurangi jejak karbon, biaya komputasi, dan waktu pengembangan. Setiap model pra-terlatih direproduksi dengan cermat agar sedekat mungkin dengan aslinya, memberikan kinerja mutakhir. Bagi mereka yang baru mengenal Transformers atau ingin memperdalam pemahaman mereka, Hugging Face menawarkan kursus LLM yang mencakup dasar-dasar model, aplikasi praktis, kurasi dataset, fine-tuning, dan kemampuan penalaran, menampilkan konten teoretis dan latihan langsung.
Fitur Inti Transformers Hugging Face
Definisi model terpusat untuk model teks, visi, audio, video, dan multimodal
Kompatibilitas dengan kerangka kerja pelatihan utama (Axolotl, Unsloth, DeepSpeed, FSDP, PyTorch-Lightning)
Integrasi dengan mesin inferensi (vLLM, SGLang, TGI)
Dukungan untuk pustaka pemodelan yang berdekatan (llama.cpp, mlx)
Lebih dari 1 juta checkpoint model Transformers tersedia di Hugging Face Hub
Kelas Pipeline untuk inferensi sederhana dan dioptimalkan di berbagai tugas ML
Kelas Trainer untuk fitur pelatihan komprehensif termasuk presisi campuran dan pelatihan terdistribusi
Pembuatan teks cepat dengan LLM dan VLM, termasuk dukungan streaming
Model diimplementasikan menggunakan kelas konfigurasi, model, dan preprocessor untuk kemudahan penggunaan
Penekanan pada penggunaan model pra-terlatih untuk menghemat komputasi dan waktu
Akses ke linimasa arsitektur model terbaru
Kursus LLM tersedia untuk mempelajari model dan aplikasi Transformer
Memulai dengan Transformers Hugging Face
Instalasi: Instal pustaka Transformers menggunakan manajer paket pilihan Anda.
Konfigurasi: Tentukan konfigurasi model, termasuk parameter dan detail arsitektur.
Pemuatan Model: Muat model pra-terlatih atau model yang dilatih khusus dari Hugging Face Hub atau penyimpanan lokal.
Inferensi: Gunakan kelas Pipeline untuk inferensi yang mudah pada berbagai tugas.
Pelatihan: Gunakan kelas Trainer untuk pelatihan dan fine-tuning model yang efisien.
Penerapan: Integrasikan model yang dilatih ke dalam aplikasi untuk penggunaan produksi.
Optimasi: Manfaatkan fitur seperti presisi campuran dan FlashAttention untuk peningkatan kinerja.
Kasus Penggunaan Transformers Hugging Face
- Pembuatan Teks
- Segmentasi Gambar
- Pengenalan Ucapan
- Tanya Jawab Dokumen
- Pelatihan Model
- Inferensi Model
- Aplikasi Multimodal







