Deskripsi
MusicLM adalah model AI canggih yang dikembangkan oleh Google Research untuk menghasilkan musik berkualitas tinggi langsung dari deskripsi teks. Sistem inovatif ini mengubah proses kompleks pembuatan musik bersyarat menjadi tugas pemodelan sekuens-ke-sekuens hierarkis. Model ini mampu menghasilkan musik pada laju sampel 24 kHz, mempertahankan konsistensi yang luar biasa selama durasi yang diperpanjang hingga beberapa menit.
Eksperimen telah menunjukkan bahwa MusicLM secara signifikan mengungguli sistem yang ada baik dalam kualitas audio yang dihasilkan maupun kepatuhannya terhadap perintah teks yang diberikan. Selain pembuatan musik dari teks sederhana, MusicLM menawarkan kemampuan canggih, termasuk pengkondisian pada teks dan melodi yang ada. Hal ini memungkinkan pengguna untuk mengubah melodi yang dicicitkan atau didengungkan sesuai dengan gaya yang ditentukan dalam keterangan teks, membuka jalan baru untuk kreativitas dan manipulasi musik.
Fleksibilitas model ini semakin disorot oleh kemampuannya untuk menghasilkan musik berdasarkan keterangan yang kaya, menghasilkan audio yang sesuai dengan deskripsi rinci tentang genre, instrumen, dan suasana hati. Misalnya, model ini dapat membuat soundtrack utama untuk game arcade, perpaduan musik reggaeton dan musik dansa elektronik dengan suara yang futuristik, atau lagu reggae tempo lambat dengan nuansa santai.
MusicLM juga mendukung pembuatan 'mode cerita', di mana urutan perintah teks memengaruhi cara model melanjutkan musik, menciptakan lanskap suara yang berkembang. Selain itu, model ini dapat dikondisikan pada seni visual, menghasilkan musik yang terinspirasi oleh lukisan seperti 'The Persistence of Memory' karya Salvador Dalí atau 'Dance' karya Henri Matisse.
Untuk mendorong penelitian dan pengembangan lebih lanjut di domain ini, Google Research telah merilis MusicCaps secara publik, sebuah dataset yang terdiri dari 5,5 ribu pasangan musik-teks, menampilkan deskripsi teks yang kaya yang disediakan dengan cermat oleh para ahli. Rilis ini bertujuan untuk mempercepat kemajuan dalam pembuatan dan analisis musik yang didorong oleh AI.
Sorotan MusicLM
Menghasilkan musik berkualitas tinggi dari deskripsi teks
Menghasilkan audio pada laju sampel 24 kHz
Mempertahankan konsistensi musik selama beberapa menit
Mengungguli sistem sebelumnya dalam kualitas audio
Mencapai kepatuhan tinggi terhadap deskripsi teks
Mendukung pengkondisian pada teks dan melodi
Mengubah melodi yang dicicitkan dan didengungkan berdasarkan gaya teks
Menghasilkan musik dari keterangan kaya
Mendukung perintah teks berurutan untuk musik yang berkembang ('mode cerita')
Dapat menghasilkan musik yang terinspirasi oleh seni visual (lukisan)
Dataset MusicCaps dirilis publik (5,5 ribu pasangan musik-teks)
Memulai dengan MusicLM
Akses model: Gunakan model MusicLM melalui antarmuka atau API yang tersedia.
Berikan perintah teks: Masukkan deskripsi teks terperinci tentang musik yang diinginkan.
Pengkondisian melodi opsional: Berikan melodi (dengungkan atau cicitkan) untuk memandu pembuatan.
Hasilkan audio: Mulai proses pembuatan musik.
Sempurnakan keluaran: Sesuaikan perintah atau melodi untuk karakteristik musik yang diinginkan.
Integrasikan: Masukkan musik yang dihasilkan ke dalam proyek atau aplikasi.
Kasus Penggunaan MusicLM
- Pembuatan Musik
- Pembuatan Soundtrack
- Transformasi Melodi
- Eksplorasi Kreatif
- Augmentasi Dataset
- Inspirasi Artistik


