سوق النماذج الصوتية المولدة بالذكاء الاصطناعي ضخم. تتطلب حالات الاستخدام الإبداعي أن تكون النماذج الصوتية للذكاء الاصطناعي أكثر تعبيرًا، بينما تحتاج المؤسسات التي تتطلع إلى أتمتة دعم العملاء وعمليات المبيعات إلى أن تكون أكثر قابلية للتوجيه.

تريد شركة Fish Audio التي يقع مقرها في بالو ألتو تلبية جميع حالات الاستخدام هذه من خلال مكتبتها التي تضم أكثر من 15000 عنصر تحكم في اللغة الطبيعية. منذ إطلاقها العام الماضي، تضم الشركة الناشئة اليوم أكثر من 8 ملايين شخص يستخدمون الإصدارات مفتوحة المصدر أو المستضافة من نماذجها، وتدر الآن إيرادات سنوية متكررة تبلغ 21 مليون دولار.

لمواصلة البناء على هذا الجذب، قالت الشركة الناشئة يوم الثلاثاء إنها جمعت 50 مليون دولار في جولة أولية قادتها Coreline Ventures وCapital Today. وشهد التمويل أيضًا مشاركة من 359 Capital، وParable، وPlay Time، وAlphalist Partners، وBayhouse Ventures، وCarya Venture Partners، وHF0.

بدأت شركة Fish Audio كمشروع صغير على يد الباحث السابق في NVIDIA Shijia Liao، الذي شعر بالإحباط بسبب الأصوات الاصطناعية غير المعبرة المتوفرة في السوق، وقام بتدريب نموذج لتوليد الصوت على وحدة معالجة رسومات واحدة، والتي جعلها مفتوحة المصدر. يحتوي مستودع Fish Speech على GitHub الآن على أكثر من 31000 نجمة، ويستخدمه المطورون المستقلون ومصممو ألعاب الفيديو والمبدعون.

أطلقت الشركة خمسة نماذج في العام الماضي: أربعة نماذج لتوليد الكلام ونموذج واحد لتحويل الكلام إلى نص. لديها ثلاثة من نماذج توليد الكلام مفتوحة المصدر، ولكن أحدث طراز S2.1 Pro متاح فقط من خلال واجهة برمجة التطبيقات المدفوعة.

تقدم Fish Audio خططًا شهرية مدفوعة تناسب المبدعين والفرق والتي تفتح عددًا محددًا من دقائق الإنشاء، بالإضافة إلى ميزات استنساخ الصوت. وتقدم الشركة أيضًا إصدارًا مؤسسيًا لواجهات برمجة التطبيقات والمنصة الخاصة بها، وتقول إن مؤسسات مثل HeyGen وSanas وPlaud تستخدمها بالفعل.

قال كاو: “لكل مؤسسة حالات استخدام مختلفة وتفضيلات مختلفة. على سبيل المثال، تريد شركات مثل HeyGen، التي تستخدم أصواتنا لتشغيل الصور الرمزية للذكاء الاصطناعي، واقعية في الأصوات؛ وقد يرغب استوديو الألعاب في الحصول على صوت معبر لشخصياتها؛ وتريد شركات وكلاء الصوت مثل LiveKit المزيد من الأصوات الطبيعية ذات الكمون المنخفض والتي تكون معبرة بدرجة كافية لإجراء المكالمات”.

إحدى الطرق التي قامت بها الشركة الناشئة ببناء مكتبتها من الأصوات هي ببساطة أن تطلب من المستخدمين إرسال أصواتهم الخاصة لتدريب نماذجها، وتعويضهم إذا تم استخدام أصواتهم. وقد أدى ذلك إلى حدوث بعض المشاكل قبل بضعة أشهر، حيث زعم بعض المبدعين أنه تم تحميل أصواتهم على Fish Audio دون موافقتهم. كان لدى الشركة الناشئة عملية إزالة محتوى بموجب قانون الألفية الجديدة لحقوق طبع ونشر المواد الرقمية لمعالجة هذه المخاوف، ولكن عمليات الإزالة نفسها استغرقت وقتًا طويلاً.

صرح ريسا كاو، الرئيس التنفيذي والمؤسس المشارك لشركة Fish Audio، لـ TechCrunch أن الشركة قامت الآن بأتمتة عملية الإزالة. وقالت إنه يمكن لمنشئي المحتوى بسهولة تقديم عينة صوتية قصيرة أو عقد لإثبات أن الصوت الذي تم تحميله يخصهم، وسيتم إزالة صوتهم من منصة الشركة الناشئة في أقل من 3 دقائق.

ومع ذلك، فإن هذا لا يمنع أي شخص من تحميل صوت الفنان دون علمه. وإلى أن يكتشف الفنان ذلك، سيستمر استخدام صوته على المنصة حتى يقدم طلبًا لإزالته.

قال أوسكوي هوندا، الشريك في Coreline Ventures، إن النموذج الموجه من المجتمع لا يعمل إلا عندما يثق المبدعون في المنصة.

وقال: “لا يمكن للنهج المرتكز على المجتمع أن يصبح ميزة دائمة إلا إذا وثق المبدعون في المنصة. وهذا يعني أن الموافقة والشفافية والإسناد يجب أن تكون مدمجة في المنتج بدلاً من التعامل معها كأفكار لاحقة. أعتقد أن الصناعة بحاجة إلى التحرك نحو ملكية صوتية تم التحقق منها، وشروط ترخيص واضحة، وعمليات إعداد تقارير وإزالة سهلة، وفي نهاية المطاف نماذج تقاسم الإيرادات حيث يستفيد المبدعون مالياً عندما يتم ترخيص أصواتهم أو استخدامها تجارياً”.

وقال تساو إنه عندما كانت الشركة الناشئة تقدم منتجها فقط كمشروع مفتوح المصدر مع خطط للمبدعين، كانت تعمل بكفاءة ولم تكن بحاجة إلى المال. لكنها أرادت تطوير نماذج أكثر تقدما، وأرادت أيضا استيعاب الشركات مع تزايد اهتمام المستثمرين، مما دفعها إلى البحث عن رأس المال.

وبالنظر إلى المستقبل، تخطط شركة Fish Audio لإصدار نموذج لفهم الصوت هذا العام. كما أنها تقوم ببناء نموذج تحويل الكلام إلى كلام.

سوق توليد الكلام مزدحم، حيث تتنافس شركات مثل ElevenLabs، وWellSaid، وCartesia، وSpeechify، وAsync (Podcastle سابقًا)، وKrisp على المبدعين ومحافظ الشركات.

وفقًا لريكو مالوزي، الشريك في 359 Capital، فإن الضوابط الدقيقة للمطورين والتدريب النموذجي الفعال من حيث التكلفة سيساعد شركة Fish Audio على التنافس بشكل أفضل مع مختبرات الذكاء الاصطناعي الكبيرة.

“أعتقد أن ما تمكنوا من بناءه، أحدث النماذج، مع فريقهم، مقارنة ببعض مختبرات أو شركات الذكاء الاصطناعي الممولة جيدًا، أمر لا يصدق. وقال مالوزي لـ TechCrunch عبر مكالمة هاتفية: “إنه يُظهر فطنتهم التقنية في سد الفجوة بين الأصوات الاصطناعية والأصوات الشبيهة بالبشر”.

عندما تقوم بالشراء من خلال الروابط الموجودة في مقالاتنا، قد نكسب عمولة صغيرة. هذا لا يؤثر على استقلالنا التحريري.



Source link


اكتشاف المزيد من صحيفة في بي دبليو الشاملة

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من صحيفة في بي دبليو الشاملة

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة