نماذج تحويل النص إلى كلام
يدعم AI-Public نماذج تحويل النص إلى كلام التي تحول النص إلى صوت. تُستخدم هذه النماذج في النص إلى صوت على لوحة التحكم وفي الوظائف التي تولد صوتًا من محادثة.
الكتالوج الحالي
| المزود | النموذج | ملاحظة |
|---|---|---|
| OpenAI | GPT-4o mini TTS | كلام طبيعي مع تحكم جيد في النغمة والأسلوب. |
| Gemini 3.1 Flash TTS Preview | نموذج كلام Gemini جديد مع تحكم دقيق في الأسلوب والسرعة والنغمة. | |
| الذكاء الاصطناعي الأوروبي | Voxtral Mini TTS | تحويل النص إلى كلام أوروبي يعتمد على Mistral Voxtral Mini. |
لا يمتلك Claude نموذج تحويل نص إلى كلام خاص به في الكتالوج. إذا تم تفعيل Claude كمزود، تظل نماذج الكلام تعتمد على المزودين الآخرين المكونين.
المحادثة الصوتية في الوقت الحقيقي
تستخدم المحادثة الصوتية نموذجًا منفصلًا في الوقت الحقيقي يجمع بين الاستماع والرد في محادثة مباشرة واحدة. يستخدم AI-Public بشكل افتراضي GPT-Realtime 2.1 لـ OpenAI. يتم تحديث الإعدادات الحالية التي تستخدم GPT-Realtime 1.5 أو GPT-Realtime 2 تلقائيًا إلى هذا الإصدار. يظل Gemini Live متاحًا كبديل عندما يتم تكوين Google للصوت في الوقت الحقيقي.
اللغة الأساسية ولغة الدعم
في مساعد الصوت، تحدد اللغة المضبوطة اللغة التي يتحدث بها المساعد بشكل رئيسي. تظل لغة واجهة المستخدم متاحة كلغة دعم. على سبيل المثال، يمكن لشخص ما ممارسة محادثة بالإسبانية وطلب شرح قصير بلغته الخاصة. ثم يعود المساعد إلى الإسبانية.
يقوم مساعد الصوت المخصص بتحميل تكوينه الكامل، بما في ذلك موجه النظام، اللغة، الصوت، الملفات وإعدادات الأدوات. يمكنك استخدام موجه النظام لتحديد مهمة المحادثة، المستوى المطلوب وطريقة تقديم الملاحظات.
الأدوات أثناء المحادثة الصوتية
يمكن لمساعدي الصوت، حسب البيئة وإعداداتهم، استخدام أدوات للقراءة فقط تلقائيًا لمعلومات الإنترنت، الدليل، المحادثات السابقة، الطقس وويكيبيديا. في نموذج المساعد، يمكنك تشغيل أو إيقاف أداة مناسبة. الأداة المفعلة تكون على تلقائي: يقرر المساعد متى يكون الاستخدام مفيدًا.
ما يحدده نموذج الصوت
يحدد نموذج الصوت كيفية نطق النص والخيارات المتاحة. مثل:
- الأصوات المتوفرة؛
- اللغات التي يدعمها الصوت؛
- جودة وطبيعية النطق؛
- كيفية اتباع التعليمات المتعلقة بالسرعة، النغمة، اللكنة والنطق.
الأصوات واللغات
تختلف الأصوات المتاحة حسب المزود. يعرض AI-Public في النص إلى صوت فقط الأصوات التي تم اختبارها للغة المختارة، أو الأصوات التي صنفها المزود كثنائية اللغة. إذا كان الصوت مخصصًا فقط لبعض اللغات، تُذكر تلك اللغة بجانب الصوت.
يدعم OpenAI وGoogle معظم اللغات في الكتالوج. يمكن لـ Voxtral Mini TTS معالجة عدة لغات، لكن كتالوج الأصوات الحالي يحتوي على أصوات مختبرة للإنجليزية والفرنسية فقط. لذلك يبدأ هذا النموذج افتراضيًا بمزيج إنجليزي مناسب ولا يرتبط ضمنيًا بالنص الهولندي. إذا لم يتوفر صوت مختبر للغة المختارة، يعرض AI-Public تحذيرًا وتختار لغة أخرى أو نموذج صوت آخر.
يمكن أن يسبب صوت من لغة أخرى لهجة أجنبية. لذلك لا يُستخدم صوت متعدد اللغات تلقائيًا كافتراضي أو تفضيل محفوظ. يمكن للربط التقني طلب هذا التراجع في الجودة صراحةً فقط.
موجه النظام
في النص إلى صوت، يمكن استخدام موجه النظام للتحكم في النطق والأسلوب. يملأ AI-Public تعليمات أساسية مناسبة للغة. بالنسبة للهولندية، يطلب ذلك حروف العلة الهولندية، التشديد، الإيقاع والتنغيم بدون لهجة إنجليزية. يمكن للكلمات مثل AI، AI-Public، ChatGPT وOpenAI أن تحتفظ بالنطق الإنجليزي وClaude يُنطق كاسم فرنسي. يمكنك تعديل التعليمات مثل السرعة، النغمة أو جمهور معين.
جودة الصوت والتراجع
يتم فحص الصوت المولد من OpenAI وGoogle وMistral وتخزينه كملف PCM16-WAV موحد. تحتوي البيانات التقنية الوصفية على تردد العينة، عدد القنوات، اللغة، الصوت ومسار الجودة. هذا يحافظ على قابلية التحقق من جودة الصوت ولا يتم تخزين استجابة مزود مختلفة كتنسيق صوت آخر دون ملاحظة.
يمكن لزر القراءة في النص الموجود استخدام صوت النظام في المتصفح أو الجهاز كجودة تراجع. تختار التطبيق صوت نظام مناسب للغة حيثما أمكن، لكن النطق والتوفر قد يختلفان حسب الجهاز.
التفضيلات
يمكن للمستخدمين حفظ إعدادات النص إلى صوت كتفضيلات شخصية. بذلك لا يحتاجون لاختيار النموذج، اللغة، الصوت وتعليمات النطق في كل مرة.