Voicebox merupakan model AI audio Meta yang dirancang untuk membantu pengguna dalam mengolah ucapan, seperti edit audio, pengambilan sampel, dan penataan gaya.
Meta mengumumkan model AI generatif terbarunya, Voicebox, yang dirancang untuk membantu pengguna dalam mengolah ucapan, seperti edit audio, pengambilan sampel, dan penataan gaya.
Meta mengatakan model AI baru ini akan bermanfaat bagi banyak orang di seluruh dunia , terutama untuk membantu orang tunanetra mendengar pesan tertulis dari teman dengan suara mereka. Selain itu, ini juga memungkinkan orang untuk berbicara bahasa asing dengan suara mereka sendiri.
Dilansir dari Neowin (17/6), Voicebox juga dapat menghasilkan klip audio berkualitas tinggi dan menghilangkan gangguan yang tidak diinginkan dalam audio, seperti suara klakson mobil. Memiliki kemampuan multibahasa, model AI ini mampu menghasilkan ucapan dalam enam bahasa.
Meta juga membandingkan Voicebox dengan model AI audio lainnya di luar sana, khususnya menyebut Vall-E dan YourTTS sebagai pesaing. Perusahaan menunjukkan bahwa Voicebox lebih maju dan mengungguli kedua model jika dibandingkan tingkat kesalahan kata dan kesamaan gayanya.
Voicebox dibangun di atas model Flow Matching, yang merupakan model generatif non-autoregresif Meta terbaru, yang dapat mempelajari pemetaan yang sangat tidak deterministik antara teks dan ucapan. Ini memungkinkan Voicebox untuk belajar dari berbagai data ucapan tanpa harus diberi label sehingga data menjadi lebih beragam dan dalam skala yang lebih besar.
Dari segi keamanan untuk menghindari penyalahgunaan bahasa, Meta membangun pengklasifikasi yang sangat efektif yang dapat membedakan antara ucapan otentik dan ucapan yang dihasilkan oleh Voicebox. Terlepas dari itu, Meta tidak akan merilis kode sumber Voicebox.
Source link














