AI-generated voice ماڊلز لاءِ مارڪيٽ تمام وڏي آھي. تخليقي استعمال جا ڪيس AI وائس ماڊلز کي وڌيڪ اظهار ڪندڙ هجڻ جي ضرورت آهي، جڏهن ته ادارا جيڪي ڪسٽمر سپورٽ ۽ سيلز آپشن کي خودڪار ڪرڻ چاهيندا آهن انهن کي وڌيڪ هلائڻ جي ضرورت آهي.
پالو آلٽو تي ٻڌل فش آڊيو 15000 کان وڌيڪ قدرتي ٻولي ڪنٽرولن جي لائبريري سان انهن سڀني استعمال جي ڪيسن کي پورو ڪرڻ چاهي ٿو. گذريل سال شروع ڪرڻ کان وٺي، اڄڪلهه 8 ملين کان وڌيڪ ماڻهو آهن اوپن سورس استعمال ڪري رهيا آهن يا ان جي ماڊلز جي ميزباني ڪيل ورزن، ۽ هاڻي 21 ملين ڊالر جي سالياني ورهاڱي واري آمدني پيدا ڪري ٿي.
انهي ڪشش تي تعمير جاري رکڻ لاءِ ، ا Tuesdayاري تي شروعاتي چيو ته اهو هڪ ٻج جي راؤنڈ ۾ 50 ملين ڊالر گڏ ڪيو آهي جنهن جي اڳواڻي ڪئي وئي ڪورين وينچرز ۽ ڪيپيٽل Today. فنڊنگ پڻ 359 ڪيپيٽل، تمثيل، راند جو وقت، الفاسٽ پارٽنرز، بي هائوس وينچرز، ڪيريا وينچر پارٽنرز، ۽ HF0 کان شرڪت ڪئي.
فش آڊيو هڪ ننڍڙي منصوبي جي طور تي NVIDIA جي اڳوڻي محقق شيجيا ليو پاران شروع ڪيو ويو، جيڪو، مارڪيٽ تي موجود غير اظهاري مصنوعي آوازن کان مايوس ٿي، هڪ واحد GPU تي آواز جي نسل جي ماڊل کي تربيت ڏني، جنهن کي هن اوپن سورس ڪيو. GitHub تي Fish Speech Repository هاڻي 31000 ستارن کان وڌيڪ آهي، ۽ انڊي ڊولپرز، ويڊيو گيم ڊيزائنرز ۽ تخليقڪارن طرفان استعمال ڪيو ويندو آهي.
ڪمپني گذريل سال ۾ پنج ماڊل شروع ڪيا آهن: چار تقرير جي نسل جا ماڊل ۽ هڪ تقرير کان ٽيڪسٽ ماڊل. ان جي ٽي اسپيچ جنريشن ماڊلز کي اوپن سورس ڪيو آهي، پر ان جو جديد S2.1 پرو ماڊل صرف ان جي ادا ڪيل API ذريعي موجود آهي.
فش آڊيو پيش ڪري ٿو ادا ڪيل مھينا منصوبا ٺاھيندڙن ۽ ٽيمن لاءِ موزون جيڪي انلاڪ ڪن ٿا سيٽن جي تعداد جي منٽ، گڏوگڏ آواز ڪلوننگ خاصيتون. ڪمپني پڻ پيش ڪري ٿي انٽرپرائز ورزن جو ان جي APIs ۽ پليٽ فارم، ۽ چوي ٿو تنظيمون جهڙوڪ HeyGen، Sanas ۽ Plaud اڳ ۾ ئي استعمال ڪري رهيا آهن.
"هر ڪمپني جا مختلف استعمال جا ڪيس ۽ مختلف ترجيحون هونديون آهن. مثال طور، HeyGen جهڙيون ڪمپنيون، جيڪي اسان جي آوازن کي AI اوتارن کي طاقت ڏيڻ لاءِ استعمال ڪن ٿيون، آوازن ۾ حقيقت پسندي چاهين ٿيون؛ هڪ گيمنگ اسٽوڊيو پنهنجي ڪردارن لاءِ اظهاري آواز چاهي ٿو؛ ۽ لائيو ڪيٽ جهڙيون وائس ايجنٽ ڪمپنيون وڌيڪ قدرتي ۽ گهٽ ويڪرائيندڙ آوازون چاهين ٿيون جيڪي ڪالن لاءِ ڪافي اظهار ڪندڙ هجن،" Caoo چيو.
هڪ طريقو اهو آهي ته شروعاتي آوازن جي پنهنجي لائبريري ٺاهي آهي صرف صارفين کان پڇڻ لاء انهن جي پنهنجي آوازن کي پنهنجي ماڊل کي تربيت ڏيڻ لاء، ۽ انهن کي معاوضو ڏيڻ جي صورت ۾ انهن جي آوازن کي استعمال ڪيو وڃي. انهي جي نتيجي ۾ ڪجهه مهينا اڳ ڪجهه مصيبت هئي، جڏهن ته، ڪجهه تخليق ڪندڙن الزام لڳايو ته انهن جي آوازن کي فش آڊيو تي اپلوڊ ڪيو ويو انهن جي رضامندي کان سواء. اهڙين خدشن کي منهن ڏيڻ لاءِ شروعاتي طور تي DMCA مواد کي ختم ڪرڻ وارو عمل هو، پر ٽيڪ-ڊائون پاڻ ۾ گهڻو وقت ورتو.
فش آڊيو جي سي اي او ۽ ڪو باني رسا ڪائو TechCrunch کي ٻڌايو ته ڪمپني هاڻي خودڪار طريقي سان کڻڻ واري عمل کي خودڪار ڪري ڇڏيو آهي. تخليقڪار آساني سان هڪ مختصر آواز جو نمونو يا هڪ معاهدو پيش ڪري سگھن ٿا اهو ثابت ڪرڻ لاءِ ته هڪ اپ لوڊ ڪيل آواز انهن جو آهي، ۽ انهن جو آواز 3 منٽن کان به گهٽ وقت ۾ شروعاتي پليٽ فارم تان هٽايو ويندو، هن چيو.
اڃا تائين، اهو ڪنهن کي روڪي نٿو سگهي ته ڪنهن به فنڪار جي آواز کي اپلوڊ ڪرڻ کان سواء انهن جي ڄاڻ کان سواء. ۽ جيستائين فنڪار کي معلوم نه ٿيندو، تيستائين سندن آواز پليٽ فارم تي استعمال ٿيندو رهندو، جيستائين اهي ان کي ڪڍڻ لاءِ فائل نه ڪندا.
Oskue Honda، Coreline Ventures ۾ هڪ پارٽنر، چيو ته ڪميونٽي تي هلندڙ ماڊل صرف ڪم ڪري ٿو جڏهن تخليق ڪندڙ پليٽ فارم تي ڀروسو ڪن ٿا.
"ڪميونٽي-مرڪزي وارو طريقو صرف هڪ پائيدار فائدو بڻجي سگهي ٿو جيڪڏهن تخليق ڪندڙ پليٽ فارم تي ڀروسو ڪن ٿا. مطلب ته رضامندي، شفافيت، ۽ انتساب کي پيداوار ۾ تعمير ڪيو وڃي بلڪه بعد ۾ سوچڻ جي طور تي. مان سمجهان ٿو ته صنعت کي تصديق ٿيل آواز جي ملڪيت، واضح لائسنس جي شرطن، آسان رپورٽنگ ۽ ختم ڪرڻ جي عملن ڏانهن منتقل ڪرڻ جي ضرورت آهي، ۽ آخرڪار، "آخرڪار مالي طور تي لائسنس يا تجارتي طور تي استعمال ڪندڙ لائسنس يا مالياتي فائدي جا ماڊل استعمال ڪيا ويا آهن. هن چيو.
Cao چيو جڏهن شروعاتي طور تي صرف پنهنجو پراڊڪٽ پيش ڪري رهيو هو هڪ اوپن سورس پروجيڪٽ جي طور تي تخليق ڪندڙن لاءِ منصوبن سان ، اهو موثر طريقي سان هلي رهيو هو ۽ پئسن جي ضرورت نه هئي. پر اهو وڌيڪ ترقي يافته ماڊل ٺاهڻ چاهيندو هو، ۽ پڻ ادارن کي گڏ ڪرڻ چاهيندو هو جيئن سيڙپڪار جي دلچسپي وڌي رهي هئي، جنهن جي نتيجي ۾ اهو سرمائي ڳولڻ لاء.
اڳتي ڏسي رهيا آهيو، فش آڊيو هن سال هڪ آڊيو سمجهڻ وارو ماڊل جاري ڪرڻ جو منصوبو آهي. اهو پڻ هڪ تقرير کان تقرير ماڊل ٺاهي رهيو آهي.
تقرير جي نسل جو مارڪيٽ ڀريل آهي، ڪمپنين جهڙوڪ ElevenLabs، WellSaid، Cartesia، Speechify، Async (اڳوڻي Podcastle)، ۽ Krisp ٺاهيندڙن ۽ ادارن جي والٽ لاءِ مقابلو ڪري رهيا آهن. ريڪو مالوززي جي مطابق، 359 ڪيپيٽل ۾ هڪ پارٽنر، ڊولپرز لاءِ بهتر ڪنٽرول ڪنٽرول ۽ قيمتي موثر ماڊل ٽريننگ فش آڊيو کي وڏي اي آئي ليبز سان بهتر مقابلو ڪرڻ ۾ مدد ڪندي.
"منهنجو خيال آهي ته اهي جيڪي تعمير ڪرڻ جي قابل ٿي ويا آهن، اسٽيٽ آف دي آرٽ ماڊل، انهن جي ٽيم سان گڏ، انهن مان ڪجهه ٻين سٺي فنڊ ڪيل AI ليبز يا ڪمپنين جي مقابلي ۾، ناقابل يقين آهي. اهو انهن جي فني صلاحيتن کي ظاهر ڪري ٿو مصنوعي آوازن ۽ انسانن وانگر آوازن جي وچ ۾ فرق کي ختم ڪرڻ ۾،" مالوززي هڪ ڪال تي TechCrunch کي ٻڌايو.