أصدرت OpenAI اليوم نماذج محادثة جديدة، تسمى GPT-Live-1 وGPT-Live-1 mini، مدعية أنها تبدو أكثر طبيعية ويمكنها التعامل مع تبادل الأدوار بشكل أفضل. هذه نماذج مزدوجة الاتجاه، مما يعني أنها تستطيع التحدث والاستماع في نفس الوقت، مما يسمح للمستخدمين بالمقاطعة بشكل طبيعي وتمكين ميزات مثل الترجمة المباشرة.

تقوم الشركة أيضًا باستبدال وضع الصوت المتقدم الحالي في ChatGPT بـ GPT-Live-1 mini افتراضيًا. سيتمكن مستخدمو المستويات المدفوعة من الوصول إلى نموذج GPT-Live-1 الأكبر. يجمع النموذج السابق بين نموذج تحويل الكلام إلى نص لتدوين الكلام، ونموذج لغة كبير لتوليد الاستجابات، ونموذج تحويل النص إلى كلام لتقديم الإجابة النهائية.

وقالت الشركة في مؤتمر صحفي إن النماذج الجديدة تحل مشكلات مثل مقاطعة المستخدمين أثناء تحدثهم وعدم وجود ما يكفي من الذكاء للإجابة على الأسئلة. سترسل نماذج OpenAI الجديدة الاستعلام إلى أحدث نماذجها النصية مثل GPT-5.5 للبحث أو الاستدلال أو إمكانات الوكيل أثناء مواصلة المحادثة.

أظهر OpenAI أيضًا أن النموذج يمكنه البقاء صامتًا لفترة طويلة واستيعاب سياق المحادثة حتى يتم استدعاؤه. بالإضافة إلى ذلك، نظرًا لأن الوضع الصوتي الجديد لديه إمكانية الوصول إلى نماذج GPT الأحدث، فيمكنه أيضًا تقديم بعض المعلومات بتنسيق مرئي. شركات ناشئة أخرى مثل Monogram، التي جمعت 40 مليون دولار من التمويل الأولي من DST وLux Capital، تميل أيضًا إلى الاستجابات المرئية لجعل المساعدين أكثر تفاعلية.

وقالت الشركة إن الوضع الصوتي الجديد في ChatGPT مصمم لإجراء محادثات أطول. خلال المؤتمر الصحفي، قال Atty Eleti، رئيس منتج ChatGPT Voice، إنه أجرى محادثات لمدة تتراوح بين 30 إلى 40 دقيقة مع الميزة الصوتية أثناء المشي.

تعتقد شركة OpenAI أن الصوت يمكن أن يكون الواجهة الأساسية للحوسبة في الأعمال المعقدة. أشارت التقارير إلى أنها قد تطلق زوجًا من سماعات الأذن بقدرات الذكاء الاصطناعي هذا العام. ومع ذلك، فإنه لم يقدم أي معلومات عن منتجات الأجهزة.

“بمرور الوقت، نعتقد أن هذا سيفتح أيضًا القدرة على استخدام الصوت كنوع من الواجهة الأساسية للحوسبة، وإدارة العمل الوكيل طويل الأمد والمعقد بشكل متزايد. وقال إليتي: “هذا النوع من حالات الاستخدام المذهلة التي نرى الأشخاص يستخدمون Codex وChatGPT لإنجازها، نعتقد أن الصوت يمكن أن يكون الواجهة المستقبلية لجميع أنواع العمل”.

عملت OpenAI على تعزيز الميزات المستندة إلى الصوت على مدى السنوات القليلة الماضية لجعل الوضع الصوتي في ChatGPT يبدو أكثر طبيعية. وقالت الشركة إن أكثر من 150 مليون شخص يتحدثون إلى ChatGPT باستخدام ميزات مثل الصوت والإملاء.

يحاول المنافسون أيضًا جعل المساعدين أكثر تعبيرًا.

قامت كل من Apple وAmazon بتحديث مساعديهما ليكونا أكثر تحادثًا مع معالجة أفضل للسياق. كما أطلقت الشركات الناشئة مثل Sesame، التي أسسها المؤسس المشارك لشركة Oculus Brendan Iribe وAnkit Kumar، مساعدين للذكاء الاصطناعي يتمتعون بمحادثة أكثر طبيعية أثناء إكمال المهام في الخلفية.

وتتحرك شركة OpenAI في نفس الاتجاه، حيث تهدف إلى السماح للمستخدمين بالتحدث إلى مساعدها بدون استخدام اليدين لفترة أطول. وعلى الرغم من ادعائها بأن الوضع الصوتي الجديد يبدو أكثر طبيعية، فقد أكدت الشركة أنها لا تهدف إلى جعل هذا الوضع رفيقًا للذكاء الاصطناعي. وأشارت إلى أن النماذج الجديدة تحتوي على ضمانات مدمجة لإعطاء استجابات مناسبة لعمر المراهقين وتوفير الموارد إذا تحولت المحادثة إلى مواضيع مثل إيذاء النفس.

لا يزال الوضع الصوتي الجديد بحاجة إلى العمل. أثناء العرض التوضيحي، عندما عرضت الشركة ميزة الترجمة المباشرة باللغة الهندية، كان المساعد يتحدث بلكنة أمريكية ثقيلة ويتحدث باللغة الهندية التي كانت تبدو غير طبيعية ولها لهجة كتابية بعض الشيء. وقالت الشركة إن الوضع الجديد مُحسّن “لمعظم اللغات المنطوقة” لكنها لم تحدد أي منها.

عندما تقوم بالشراء من خلال الروابط الموجودة في مقالاتنا، قد نكسب عمولة صغيرة. هذا لا يؤثر على استقلالنا التحريري.



Source link


اكتشاف المزيد من صحيفة في بي دبليو الشاملة

اشترك للحصول على أحدث التدوينات المرسلة إلى بريدك الإلكتروني.

شاركها.
اترك تعليقاً

اكتشاف المزيد من صحيفة في بي دبليو الشاملة

اشترك الآن للاستمرار في القراءة والحصول على حق الوصول إلى الأرشيف الكامل.

متابعة القراءة