بوابة الوفد الإلكترونية
رئيس حزب الوفد ورئيس مجلس الإدارة
د. السيد البدوي شحاتة
رئيس التحرير
ياسر شورى

كيف تستخدم الوضع الصوتي الجديد في ChatGPT لإجراء محادثات أكثر طبيعية

ChatGPT
ChatGPT

تتطور المساعدات الذكية مثل ChatGPT بوتيرة ثابتة، مع توفير إمكانات أكبر ودقة أفضل واستجابات أسرع مع كل نموذج جديد. 

الذكاء الاصطناعي التوليدي ليس مثاليًا، ولا ينبغي التعامل معه باعتباره مصدرًا للمعلومات لا يمكن التشكيك فيه، لكن بالنسبة إلى الأشخاص الذين تبنوا هذه التقنية، قد يكون الانتقال إلى المحادثات الصوتية أكثر راحة من كتابة كل شيء.

كان الوضع الصوتي الأصلي في ChatGPT عام 2023 يعتمد على ثلاثة أنظمة منفصلة لتشغيله، ففي البداية كان يحول كلامك إلى نص، ثم يولد إجابة باستخدام نموذج لغوي، وبعد ذلك يستخدم نموذج تحويل النص إلى كلام لقراءة الإجابة بصوت مرتفع.

ثم جاء الوضع الصوتي المتقدم، الذي اعتمد على نموذج واحد متعدد الوسائط وحسن التجربة بشكل كبير.

 ويأتي ChatGPT الآن مزودًا بنموذج GPT-Live للتعامل مع المحادثات الصوتية، وهو يمثل خطوة كبيرة إلى الأمام من حيث طبيعية المحادثات.

وتطلق OpenAI على هذه البنية اسم "full-duplex"، وهي تتيح له الاستماع والتحدث في الوقت نفسه. 

ويعالج ذلك مشكلة ربما واجهتها مع نموذج الصوت السابق، الذي كان يمكنه أحيانًا اعتبار التوقف القصير نهاية لدورك والبدء في الرد قبل أن تنتهي فعليًا من جملتك.

وستسمع الآن ChatGPT أحيانًا ينطق بتأكيدات قصيرة مثل "مممم" أو "نعم" أثناء حديثك، بطريقة تشبه استجابة الشخص أثناء محادثة حقيقية.

كما يستطيع GPT-Live تمرير المهام الأكثر تعقيدًا إلى نماذج أخرى قادرة، مثل GPT-5.5، في الخلفية عندما يتطلب السؤال استدلالًا أو بحثًا.

بدء محادثة مع GPT-Live

يتوفر نموذج الصوت GPT-Live من خلال تطبيق ChatGPT على أجهزة Android وiOS، وكذلك عبر الويب باستخدام أي متصفح.

وسيحصل مستخدمو ChatGPT Pro وPlus وGo على نموذج GPT-Live-1، بينما يمكن للمستخدمين على الخطة المجانية الوصول إلى نموذج GPT-Live-1 mini.

ويحل GPT-Live محل نموذج Advanced Voice السابق القائم على تبادل الأدوار باعتباره الخيار الافتراضي.

وللبدء، اضغط ببساطة على أيقونة ChatGPT Voice، التي تظهر على شكل رمز موجة صوتية، في أقصى يمين مربع النص، وإذا كانت هذه هي المرة الأولى التي تستخدم فيها صوتك للتحدث مع ChatGPT، فقد يُطلب منك منحه صلاحية الوصول إلى ميكروفون جهازك.

وبمجرد الدخول إلى الوضع الصوتي، ستظهر كرة عائمة متجاوبة على الشاشة. ويمكنك الآن البدء في التحدث بشكل طبيعي.

وإذا ضغطت على أيقونة الإعدادات في الزاوية العلوية اليمنى، يمكنك تغيير مستوى ذكاء النموذج الصوتي، وهناك ثلاثة خيارات يمكنك الاختيار من بينها: Instant وMedium وHigh.

ولا يتوفر هذا التخصيص على نموذج GPT-Live-1 mini، ولذلك يتطلب حاليًا خطة مدفوعة.

وسيظل ChatGPT Voice نشطًا حتى إذا انتقلت إلى تطبيق آخر أو أغلقت جهازك.

وعلى الرغم من أن التجربة الإجمالية تمثل ترقية مقارنة بالإصدارات السابقة من الوضع الصوتي في ChatGPT، فإن GPT-Live لا يدعم حاليًا مشاركة الشاشة أو الفيديو.

ولحسن الحظ، يمكنك العودة إلى نموذج الصوت الأقدم من خلال الانتقال إلى إعدادات ChatGPT، ثم الدخول إلى Voice واختيار نموذج مختلف.

ومن هنا يمكنك أيضًا اختيار صوت مختلف لـChatGPT، أو تغيير لغته، أو ضبط ChatGPT Voice ليكون الوضع الافتراضي عند تشغيل التطبيق.

ما الذي يتفوق فيه GPT-Live؟

يفضل البعض كتابة الأشياء، ولذلك ربما لم يكن الإصدار المطور من ChatGPT Voice محل اهتمام كبير في البداية، لكن التجربة الفعلية للمحادثات الطويلة تكشف اختلافًا واضحًا.

والأمر الأكثر إثارة للإعجاب ليس مستوى الذكاء، وإنما السرعة التي يمكن أن تنسى معها أنك تتحدث إلى ذكاء اصطناعي.

لم يعد ChatGPT Voice يقاطعك أثناء الجملة، كما أنك لم تعد بحاجة إلى الانتظار بشكل محرج حتى ينتهي من الحديث قبل أن تعود إلى الكلام.

ومع الاستفسارات الطويلة، يمكن أن تشعر تقريبًا بأن GPT-Live قادر على توقع ما ستقوله بعد ذلك.

وتجعل سرعة استجابة GPT-Live منه أداة جيدة أيضًا لإجراء الترجمات المباشرة، وفي أي وقت أثناء محادثتك مع GPT-Live، يمكنك التمرير إلى الأسفل لإظهار النص المكتوب لكل ما يتم قوله.

وإذا طرحت على ChatGPT سؤالًا يعتقد أنه يمكن الإجابة عنه بشكل أفضل باستخدام عنصر مرئي، فسيقوم بإنشاء أداة تفاعلية إلى جانب رده الصوتي.

يتم ضبط مستوى ذكاء GPT-Live افتراضيًا على Instant، وهو يتعامل بسهولة مع معظم الأسئلة اليومية مع إعطاء الأولوية للاستجابات السريعة.

ولا يزال بإمكانه تنفيذ عمليات البحث والمهام التي تتطلب استدلالًا أعمق من خلال نماذج أكثر قدرة في الخلفية، بينما يواصل المحادثة بسلاسة.

وإذا كنت تخطط لمناقشة موضوعات معقدة مع GPT-Live بصورة أكثر انتظامًا، فإن الانتقال إلى مستويي Medium وHigh يضيف جزءًا من الثانية أو ثانيتين من وقت التفكير، لكن هذا التأخير الإضافي لا يؤثر على طبيعية تدفق المحادثة.