Deskripsi
Jukebox, yang dikembangkan oleh OpenAI, adalah jaringan saraf canggih yang dirancang untuk pembuatan musik yang didukung AI. Model ini menghasilkan musik langsung sebagai audio mentah, mampu menyertakan nyanyian rudimenter dan meniru berbagai genre serta gaya artis. Ini mewakili kemajuan signifikan dalam model generatif, melampaui pembuatan musik simbolik untuk menangkap nuansa audio mentah.
Pada intinya, Jukebox menggunakan model VQ-VAE (Vector Quantized Variational Autoencoder) hierarkis untuk mengompresi audio mentah ke dalam ruang diskrit berdimensi lebih rendah. Kompresi ini sangat penting untuk menangani urutan yang sangat panjang yang melekat pada data audio, memungkinkan model untuk mempelajari struktur semantik tingkat tinggi. Arsitektur VQ-VAE terinspirasi oleh VQ-VAE-2, dengan modifikasi untuk mengatasi keruntuhan buku kode dan meningkatkan kualitas rekonstruksi, termasuk penambahan kerugian spektral. Model ini menggunakan tiga tingkat kompresi, menurunkan sampel audio mentah 44kHz sebesar 8x, 32x, dan 128x, mempertahankan informasi musik penting seperti nada, timbre, dan volume.
Setelah kompresi audio, model transformer dilatih sebagai model prior untuk mempelajari distribusi kode audio terkompresi ini. Prioritas ini menghasilkan musik dalam ruang diskrit, dengan prior tingkat atas menangkap struktur jarak jauh dan prior tingkat bawah menambahkan detail musik lokal. Model dilatih secara autoregresif menggunakan varian Sparse Transformers yang disederhanakan, dengan setiap model menampilkan 72 lapisan perhatian diri terfaktorisasi. Pendekatan hierarkis ini memungkinkan Jukebox untuk menghasilkan karya musik yang koheren dengan kualitas audio yang mengesankan.
Jukebox dapat dikondisikan pada berbagai masukan, termasuk genre, artis, dan lirik. Dengan menyediakan ini sebagai masukan, pengguna dapat mengarahkan proses generasi untuk menghasilkan musik dalam gaya yang diinginkan. Model ini dilatih pada kumpulan data besar yang terdiri dari 1,2 juta lagu, dipasangkan dengan lirik dan metadata dari LyricWiki. Pengkondisian pada lirik, khususnya, memerlukan teknik penyelarasan yang canggih untuk mencocokkan konten lirik dengan segmen audio yang sesuai, meningkatkan kemampuan model untuk menghasilkan nyanyian.
Meskipun memiliki kemampuannya, Jukebox memiliki keterbatasan. Lagu yang dihasilkan mungkin kekurangan struktur musik besar yang familiar seperti chorus yang berulang, dan proses penurunan/peningkatan sampel dapat menimbulkan kebisingan yang dapat dikenali. Proses pengambilan sampel juga lambat, membutuhkan waktu sekitar 9 jam untuk merender satu menit audio, membuatnya tidak cocok untuk aplikasi interaktif. Pekerjaan di masa depan bertujuan untuk meningkatkan musikalitas, mengurangi kebisingan, dan meningkatkan kecepatan pengambilan sampel, berpotensi melalui distilasi ke dalam pengambil sampel paralel. OpenAI juga berencana untuk memperluas cakupan model untuk mencakup lagu-lagu dari bahasa dan wilayah lain, mendorong kolaborasi manusia-model dalam penciptaan musik.
Sorotan Jukebox
Menghasilkan musik sebagai audio mentah
Menyertakan kemampuan menyanyi rudimenter
Mendukung pengkondisian pada genre, artis, dan lirik
Meniru berbagai genre musik
Meniru berbagai gaya artis
Menggunakan VQ-VAE hierarkis untuk kompresi audio
Menggunakan model transformer untuk pembuatan kode
Dilatih pada kumpulan data besar 1,2 juta lagu
Bobot model dan kode dirilis untuk umum
Menyertakan alat untuk menjelajahi sampel yang dihasilkan
Menghasilkan musik dalam beberapa tingkat kompresi
Mempelajari struktur musik jarak jauh
Memulai dengan Jukebox
Akses bobot model dan kode: Unduh model Jukebox yang dirilis dan kode terkait dari repositori GitHub yang disediakan.
Siapkan data masukan: Kumpulkan informasi genre, artis, dan lirik yang diinginkan untuk pembuatan musik.
Konfigurasi parameter generasi: Atur parameter untuk kualitas audio, panjang, dan masukan pengkondisian yang diinginkan.
Jalankan proses generasi: Eksekusi model Jukebox untuk menghasilkan sampel musik audio mentah.
Jelajahi sampel yang dihasilkan: Gunakan alat yang disediakan untuk mendengarkan dan menganalisis keluaran.
Integrasikan ke dalam proyek: Adaptasi kode yang dirilis untuk aplikasi pembuatan musik kustom.
Kasus Penggunaan Jukebox
- Pembuatan Musik AI
- Mimikri Gaya Musik
- Sintesis Nyanyian Rudimenter
- Eksplorasi Musik Kreatif
- Komposisi Soundtrack
- Penelitian Musik




