AI سے تیار کردہ صوتی ماڈلز کی مارکیٹ بہت بڑی ہے۔ تخلیقی استعمال کے معاملات میں AI صوتی ماڈلز کو زیادہ اظہار خیال کرنے کی ضرورت ہوتی ہے، جب کہ کسٹمر سپورٹ اور سیلز آپس کو خودکار بنانے کی کوشش کرنے والے کاروباری اداروں کو ان کے زیادہ چلنے کے قابل ہونے کی ضرورت ہوتی ہے۔

پالو آلٹو پر مبنی فش آڈیو 15000 سے زیادہ قدرتی لینگویج کنٹرولز کی اپنی لائبریری کے ساتھ ان تمام استعمال کے معاملات کو پورا کرنا چاہتا ہے۔ پچھلے سال شروع ہونے کے بعد سے، سٹارٹ اپ کے پاس آج 8 ملین سے زیادہ لوگ ہیں جو اس کے ماڈلز کے اوپن سورس یا ہوسٹڈ ورژن استعمال کر رہے ہیں، اور اب اس سے سالانہ 21 ملین ڈالر کی آمدنی ہوتی ہے۔

اس کرشن پر تعمیر جاری رکھنے کے لیے، مَنگَل کو اسٹارٹ اپ نے کہا کہ اس نے سیڈ راؤنڈ میں 50 ملین ڈالر اکٹھے کیے ہیں جس کی قیادت کور لائن وینچرز اور کیپٹل ٹوڈے کر رہے تھے۔ فنڈنگ ​​میں 359 کیپٹل، پِیرابل، پلے ٹائم، الفا لسٹ پارٹنرز، بے ہاؤس وینچرز، کیریا وینچر پارٹنرز، اور HF0 کی شرکت بھی دیکھی گئی۔

فش آڈیو کا آغاز NVIDIA کے سابق محقق شیجیا لیاو کے ایک چھوٹے پراجیکٹ کے طور پر ہوا، جس نے مارکیٹ میں دستیاب غیر اظہاری مصنوعی آوازوں سے مایوس ہو کر، ایک واحد GPU پر آواز پیدا کرنے والے ماڈل کو تربیت دی، جسے اس نے اوپن سورس کیا۔ GitHub پر فش اسپیچ ریپوزٹری میں اب 31000 سے زیادہ ستارے ہیں، اور اسے انڈی ڈویلپرز، ویڈیو گیم ڈیزائنرز، اور تخلیق کار استعمال کرتے ہیں۔

کمپنی نے پچھلے سال پانچ ماڈلز لانچ کیے ہیں: چار اسپیچ جنریشن ماڈل اور ایک اسپیچ ٹو ٹیکسٹ ماڈل۔ اس نے اپنے تین اسپیچ جنریشن ماڈلز کو اوپن سورس کیا ہے، لیکن اس کا تازہ ترین S2.1 پرو ماڈل صرف اس کے ادا شدہ API کے ذریعے دستیاب ہے۔

فش آڈیو بامعاوضہ ماہانہ منصوبے پیش کرتا ہے جو تخلیق کاروں اور ٹیموں کے لیے موزوں ہے جو کہ جنریشن کے منٹوں کی ایک مقررہ تعداد کو کھولتے ہیں، نیز صوتی کلوننگ کی خصوصیات۔ کمپنی اپنے APIs اور پلیٹ فارم کا انٹرپرائز ورژن بھی پیش کرتی ہے، اور کہتی ہے کہ HeyGen، Sanas اور Plaud جیسی تنظیمیں پہلے ہی اسے استعمال کر رہی ہیں۔

"ہر انٹرپرائز کے مختلف استعمال کے معاملات اور مختلف ترجیحات ہوتی ہیں۔ مثال کے طور پر، HeyGen جیسی کمپنیاں، جو ہماری آوازوں کو AI اوتاروں کو طاقت دینے کے لیے استعمال کرتی ہیں، آوازوں میں حقیقت پسندی چاہتی ہیں؛ ایک گیمنگ اسٹوڈیو اپنے کرداروں کے لیے تاثراتی آواز چاہتا ہے؛ اور LiveKit جیسی وائس ایجنٹ کمپنیاں زیادہ قدرتی آواز والی اور کم تاخیر والی آوازیں چاہتی ہیں جو کالوں کے لیے کافی اظہار کرتی ہیں،" Caoo نے کہا۔

اسٹارٹ اپ نے آوازوں کی اپنی لائبریری بنانے کا ایک طریقہ یہ ہے کہ صارفین کو اس کے ماڈلز کی تربیت کے لیے اپنی آوازیں جمع کرانے کے لیے، اور اگر ان کی آوازیں استعمال کی جائیں تو انھیں معاوضہ دینا ہے۔ اس کے نتیجے میں کچھ مہینے پہلے کچھ پریشانی ہوئی، تاہم، کچھ تخلیق کاروں نے الزام لگایا کہ ان کی آوازیں ان کی رضامندی کے بغیر فش آڈیو پر اپ لوڈ کی گئیں۔ اس طرح کے خدشات کو دور کرنے کے لیے سٹارٹ اپ کے پاس DMCA مواد کو اتارنے کا عمل تھا، لیکن ٹیک ڈاؤن میں خود کافی وقت لگا۔

فش آڈیو کے سی ای او اور شریک بانی رسا کاو نے ٹیک کرنچ کو بتایا کہ کمپنی نے اب اتارنے کے عمل کو خودکار کر دیا ہے۔ انہوں نے کہا کہ تخلیق کار آسانی سے یہ ثابت کرنے کے لیے ایک مختصر آواز کا نمونہ یا معاہدہ جمع کرا سکتے ہیں کہ اپ لوڈ کردہ آواز ان کی ہے، اور ان کی آواز کو 3 منٹ سے بھی کم وقت میں اسٹارٹ اپ کے پلیٹ فارم سے ہٹا دیا جائے گا۔

پھر بھی، یہ کسی کو بھی فنکار کی آواز کو ان کے علم کے بغیر اپ لوڈ کرنے سے نہیں روکتا۔ اور جب تک فنکار کو پتہ نہیں چل جاتا، ان کی آواز پلیٹ فارم پر استعمال ہوتی رہے گی جب تک کہ وہ اسے اتارنے کے لیے فائل نہیں کر دیتے۔

Coreline Ventures کے ایک پارٹنر Oskue Honda نے کہا کہ کمیونٹی سے چلنے والا ماڈل صرف اس وقت کام کرتا ہے جب تخلیق کار پلیٹ فارم پر بھروسہ کرتے ہیں۔

"کمیونٹی پر مبنی نقطہ نظر تب ہی ایک پائیدار فائدہ بن سکتا ہے جب تخلیق کاروں کو پلیٹ فارم پر بھروسہ ہو۔ اس کا مطلب ہے کہ رضامندی، شفافیت، اور انتساب کو پروڈکٹ میں شامل کیا جانا چاہیے بجائے اس کے کہ بعد میں سوچا جائے۔ میرا ماننا ہے کہ صنعت کو تصدیق شدہ آواز کی ملکیت، لائسنس کی واضح شرائط، آسان رپورٹنگ اور ہٹانے کے عمل کی طرف بڑھنے کی ضرورت ہے، اور آخر کار جب لائسنس یا مالیاتی شراکت داروں کے مالیاتی فوائد کا استعمال کیا جاتا ہے تو اس کے لیے لائسنس یا آواز کا استعمال کیا جاتا ہے۔ انہوں نے کہا.

Cao نے کہا کہ جب سٹارٹ اپ صرف تخلیق کاروں کے لیے منصوبوں کے ساتھ اوپن سورس پروجیکٹ کے طور پر اپنی پروڈکٹ پیش کر رہا تھا، تو یہ مؤثر طریقے سے چل رہا تھا اور اسے پیسے کی ضرورت نہیں تھی۔ لیکن یہ مزید جدید ماڈل تیار کرنا چاہتا تھا، اور کاروباری اداروں کو بھی ایڈجسٹ کرنا چاہتا تھا کیونکہ سرمایہ کاروں کی دلچسپی بڑھ رہی تھی، جس کی وجہ سے اس نے سرمایہ تلاش کیا۔

آگے دیکھتے ہوئے، فش آڈیو اس سال آڈیو سمجھنے کا ماڈل جاری کرنے کا ارادہ رکھتا ہے۔ یہ اسپیچ ٹو اسپیچ ماڈل بھی بنا رہا ہے۔

اسپیچ جنریشن مارکیٹ میں ہجوم ہے، جس میں ElevenLabs، WellSaid، Cartesia، Speechify، Async (پہلے Podcastle)، اور Krisp جیسی کمپنیاں تخلیق کاروں اور کاروباری اداروں کے بٹوے کے لیے مقابلہ کر رہی ہیں۔ 359 کیپیٹل کے ایک پارٹنر، ریکو مالوزی کے مطابق، ڈویلپرز کے لیے عمدہ کنٹرول اور لاگت سے متعلق ماڈل ٹریننگ فش آڈیو کو بڑی AI لیبز کے ساتھ بہتر مقابلہ کرنے میں مدد کرے گی۔

مالوززی نے ایک کال پر TechCrunch کو بتایا، "میرے خیال میں وہ جو کچھ بنانے میں کامیاب رہے ہیں، ان کے پاس موجود ٹیم کے ساتھ، ان میں سے کچھ اچھی طرح سے فنڈڈ AI لیبز یا کمپنیوں کے مقابلے میں، ناقابل یقین ہے۔ یہ مصنوعی آواز اور انسان جیسی آوازوں کے درمیان فرق کو ختم کرنے میں ان کی تکنیکی مہارت کو ظاہر کرتا ہے۔"