ByteDance Meluncurkan Seed Audio 1.0, Menghasilkan Dialog dan Efek Suara dari Satu Prompt

Menurut Beating, Seed Audio 1.0 milik ByteDance diluncurkan pada 22 Juli. Model ini memungkinkan pembuatan dialog, efek suara, dan audio ambient hanya dengan satu prompt, dengan presisi timing 100 ms. Model ini mendukung input teks dan audio referensi, dapat menghasilkan sekitar dua menit audio per generasi, serta memiliki kemampuan yang diperluas untuk menjaga konsistensi suara karakter di seluruh output.

Audio tersebut menunjukkan tingkat kegunaan lebih dari 90% dalam sebagian besar skenario, dengan Mean Opinion Score (MOS) melebihi 4 di sebagian besar bahasa yang didukung. Seed Audio 1.0 mendukung lebih dari 20 bahasa, termasuk transfer suara lintas-bahasa, serta kustomisasi nada. Model ini kini tersedia melalui pusat pengalaman Volcano Ark dengan integrasi API terbuka.

Penafian: Informasi di halaman ini mungkin berasal dari sumber pihak ketiga dan hanya untuk referensi. Ini tidak mewakili pandangan atau pendapat Gate dan bukan merupakan nasihat keuangan, investasi, atau hukum. Perdagangan aset virtual melibatkan risiko tinggi. Mohon jangan hanya mengandalkan informasi di halaman ini saat membuat keputusan. Untuk detailnya, lihat Penafian.
Komentar
0/400
Tidak ada komentar