Deskripsi
AudioLM mewakili kerangka kerja baru untuk menghasilkan audio berkualitas tinggi dengan konsistensi jangka panjang yang luar biasa. Inti dari AudioLM adalah mengubah tugas kompleks generasi audio menjadi masalah pemodelan bahasa. Hal ini dicapai dengan memetakan audio masukan ke urutan token diskrit, secara efektif memperlakukan audio sebagai bentuk bahasa.
Model ini memanfaatkan skema tokenisasi hibrida untuk menyeimbangkan kualitas rekonstruksi dengan koherensi struktural jangka panjang. Model ini menggunakan aktivasi diskrit dari model bahasa yang di-masking yang telah dilatih sebelumnya pada audio untuk menangkap dependensi jangka panjang, sambil menggunakan kode diskrit dari codec audio neural untuk sintesis fidelitas tinggi. Pendekatan ganda ini memungkinkan AudioLM untuk belajar dari korpus besar gelombang audio mentah.
Ketika dilatih pada data ucapan, AudioLM dapat menghasilkan kelanjutan ucapan yang masuk akal secara sintaksis dan semantik. Yang terpenting, model ini mempertahankan identitas pembicara, prosodi, aksen, dan kondisi rekaman dari prompt awal, bahkan untuk pembicara yang tidak ditemui selama pelatihan. Kemampuan ini melampaui ucapan, sebagaimana ditunjukkan oleh kemampuannya untuk menghasilkan kelanjutan musik piano yang koheren tanpa bergantung pada representasi musik simbolik.
Arsitektur AudioLM memungkinkan berbagai mode generasi. Kelanjutan ucapan melibatkan pemberian prompt audio singkat dan menerima ekstensi yang alami dan koheren. Generasi akustik berfokus pada pengambilan sampel token akustik untuk menghasilkan sampel audio yang beragam dengan konten semantik yang identik tetapi identitas pembicara dan kondisi rekaman yang bervariasi. Generasi tanpa syarat menghasilkan urutan audio yang sepenuhnya baru tanpa prompt apa pun, menunjukkan keluasan generatif model. Kerangka kerja ini juga menyoroti pentingnya token semantik untuk koherensi linguistik, menunjukkan bahwa token akustik saja menghasilkan konten yang kurang konsisten.
Fleksibilitas model ini semakin dibuktikan dengan aplikasinya pada generasi musik, khususnya kelanjutan piano. Dengan melatih audio piano mentah, AudioLM belajar menghasilkan urutan yang koheren secara musikal, mengungguli model yang dilatih hanya pada token akustik. Hal ini menunjukkan pemahaman yang kuat tentang struktur dan konten audio, yang dapat diterapkan di berbagai domain.
Sorotan AudioLM
Generasi audio berkualitas tinggi
Konsistensi audio jangka panjang
Pendekatan pemodelan bahasa untuk audio
Skema tokenisasi hibrida
Generasi kelanjutan ucapan
Pelestarian identitas pembicara
Pemeliharaan prosodi dan aksen
Generasi kelanjutan musik (misalnya, piano)
Generasi audio tanpa syarat
Generasi akustik dengan kondisi bervariasi
Belajar dari gelombang audio mentah
Menghasilkan kelanjutan yang masuk akal secara sintaksis dan semantik
Memulai dengan AudioLM
Akses model: Dapatkan akses ke model AudioLM atau implementasinya.
Autentikasi: Jika diperlukan, autentikasi kredensial akses Anda.
Siapkan lingkungan: Siapkan lingkungan pengembangan Anda dengan pustaka dan dependensi yang diperlukan.
Integrasi melalui API: Gunakan titik akhir API yang disediakan untuk mengirim prompt audio dan menerima audio yang dihasilkan.
Konfigurasi parameter: Sesuaikan parameter model untuk karakteristik audio dan mode generasi yang diinginkan.
Optimalkan keluaran: Sempurnakan pengaturan generasi untuk mencapai target kualitas dan konsistensi tertentu.
Kasus Penggunaan AudioLM
- Sintesis Ucapan
- Komposisi Musik
- Pembuatan Konten Audio
- Desain Suara
- Kloning Suara
- Prototyping AI Audio


