Deskripsi
Sentence Transformers, juga dikenal sebagai SBERT, adalah modul Python yang kuat yang dirancang untuk memanfaatkan dan melatih model embedding dan reranker canggih. Modul ini menyediakan antarmuka yang disederhanakan untuk menghasilkan embedding padat (dense) dari berbagai jenis data termasuk teks, gambar, audio, dan video. Embedding ini kemudian dapat digunakan untuk menghitung skor kesamaan antara berbagai bagian konten, memfasilitasi aplikasi seperti pencarian semantik, kesamaan tekstual semantik, dan penambangan parafrasa.
Modul ini juga mendukung model Cross-Encoder, yang dirancang khusus untuk menghitung skor kesamaan antara pasangan teks, menjadikannya ideal untuk menyusun ulang hasil pencarian atau mengidentifikasi konten duplikat. Selain itu, Sentence Transformers menyertakan model Sparse Encoder, yang memungkinkan pembuatan embedding yang jarang (sparse) yang dapat diintegrasikan dengan mesin pencari tradisional untuk kemampuan pengambilan yang ditingkatkan.
Pengguna dapat mengakses repositori besar yang berisi lebih dari 10.000 model pra-pelatihan di Hugging Face, termasuk banyak model berkinerja teratas dari leaderboard Massive Text Embeddings Benchmark (MTEB). Koleksi ekstensif ini memungkinkan penggunaan langsung dalam berbagai tugas. Untuk kebutuhan khusus, Sentence Transformers mempermudah pelatihan atau penyetelan halus (fine-tuning) model embedding, reranker, atau sparse encoder kustom, memberdayakan pengguna untuk menyesuaikan solusi dengan kasus penggunaan unik mereka.
Dikembangkan oleh UKP Lab dan dikelola oleh Hugging Face, Sentence Transformers adalah proyek yang didorong oleh komunitas. Pengguna didorong untuk melaporkan masalah atau mengajukan pertanyaan di repositori GitHub Sentence Transformers. Dokumentasi menyediakan panduan komprehensif tentang penggunaan, model pra-pelatihan, dan optimasi kinerja untuk model embedding, reranker, dan sparse encoder, bersama dengan informasi terperinci tentang kemampuan pelatihan dan multimodal.
Fitur Inti Sentence Transformers
Menghitung embedding dari teks, gambar, audio, dan video
Menghitung skor kesamaan menggunakan model Cross-Encoder
Menghasilkan embedding yang jarang (sparse) menggunakan model Sparse Encoder
Mengakses lebih dari 10.000 model pra-pelatihan di Hugging Face
Mendukung pelatihan dan penyetelan halus (fine-tuning) model kustom
Memungkinkan pencarian semantik dan penambangan parafrasa
Kemampuan embedding dan reranker multimodal
Integrasi dengan agen pengkodean AI untuk pelatihan
Model embedding dan reranker mutakhir
Modul Python yang mudah digunakan
Memulai dengan Sentence Transformers
Muat model Sentence Transformer pra-pelatihan
Enkode kalimat atau data multimodal menggunakan model
Hitung kesamaan embedding atau susun ulang bagian
Integrasikan dengan agen pengkodean AI untuk pelatihan kustom
Kasus Penggunaan Sentence Transformers
- Pencarian Semantik
- Kesamaan Teks
- Penambangan Parafrasa
- Menyusun Ulang Hasil Pencarian
- Pengambilan Multimodal
- Pelatihan Model Kustom



