مدلهای تبدیل متن به گفتار
AI-Public از مدلهای تبدیل متن به گفتار پشتیبانی میکند که متن را به صوت تبدیل میکنند. این مدلها در بخش متن به صوت در داشبورد و در قابلیتهایی که صوت را از چت تولید میکنند، استفاده میشوند.
فهرست فعلی
| ارائهدهنده | مدل | توضیح |
|---|---|---|
| OpenAI | GPT-4o mini TTS | گفتار طبیعی با کنترل خوب بر لحن و سبک. |
| Gemini 3.1 Flash TTS Preview | مدل گفتار جدید Gemini با کنترل دقیق بر سبک، سرعت و لحن. | |
| اروپای AI | Voxtral Mini TTS | تبدیل متن به گفتار اروپایی بر پایه Mistral Voxtral Mini. |
Claude مدل تبدیل متن به گفتار اختصاصی در فهرست ندارد. اگر Claude به عنوان ارائهدهنده فعال باشد، مدلهای گفتار به ارائهدهندگان دیگر پیکربندی شده وابسته خواهند بود.
گفتگوی صوتی بلادرنگ
گفتگوی صوتی از یک مدل بلادرنگ جداگانه استفاده میکند که گوش دادن و پاسخ دادن را در یک مکالمه زنده ترکیب میکند. برای OpenAI، AI-Public به طور پیشفرض از GPT-Realtime 2.1 استفاده میکند. تنظیمات موجود با GPT-Realtime 1.5 یا GPT-Realtime 2 به طور خودکار به این نسخه بهروزرسانی میشوند. Gemini Live به عنوان جایگزین زمانی که Google برای گفتار بلادرنگ پیکربندی شده است، در دسترس باقی میماند.
زبان اصلی و زبان پشتیبانی
در یک دستیار صوتی، زبان تنظیم شده تعیین میکند که دستیار عمدتاً به چه زبانی صحبت کند. زبان رابط کاربری کاربر نیز به عنوان زبان پشتیبانی در دسترس باقی میماند. به این ترتیب، فرد میتواند مثلاً مکالمهای به زبان اسپانیایی تمرین کند و به طور کوتاه درخواست توضیح به زبان خود را داشته باشد. سپس دستیار دوباره به زبان اسپانیایی بازمیگردد.
یک دستیار صوتی ساخته شده، پیکربندی کامل خود را بارگذاری میکند، از جمله سیستمپرومت، زبان، صدا، فایلها و تنظیمات ابزارها. میتوانید از سیستمپرومت برای تعیین وظیفه مکالمه، سطح مورد نظر و نحوه ارائه بازخورد استفاده کنید.
ابزارها در طول گفتگوی صوتی
دستیارهای صوتی میتوانند، بسته به محیط و تنظیماتشان، به طور خودکار از ابزارهای فقط خواندنی برای اطلاعات اینترنتی، راهنما، چتهای قبلی، وضعیت هوا و ویکیپدیا استفاده کنند. در فرم دستیار میتوانید یک ابزار مناسب را روشن یا خاموش کنید. ابزاری که فعال باشد در حالت خودکار قرار دارد: دستیار خودش تصمیم میگیرد که چه زمانی استفاده مفید است.
آنچه یک مدل گفتار تعیین میکند
یک مدل گفتار تعیین میکند که متن چگونه تلفظ شود و چه امکاناتی در دسترس باشد. مانند:
- صداهای موجود؛
- زبانهایی که یک صدا پشتیبانی میکند؛
- کیفیت و طبیعی بودن تلفظ؛
- نحوه پیروی از دستورالعملها درباره سرعت، لحن، لهجه و تلفظ.
صداها و زبانها
صداهای موجود بسته به ارائهدهنده متفاوت هستند. AI-Public در تبدیل متن به صوت فقط صداهایی را نشان میدهد که برای زبان انتخاب شده آزمایش شدهاند یا صداهایی که توسط ارائهدهنده به عنوان چندزبانه مشخص شدهاند. اگر یک صدا فقط برای زبانهای خاصی در نظر گرفته شده باشد، آن زبان در کنار صدا ذکر شده است.
OpenAI و Google بیشتر زبانها را در فهرست پشتیبانی میکنند. Voxtral Mini TTS میتواند چند زبان را پردازش کند، اما فهرست صداهای فعلی شامل صداهای آزمایش شده برای انگلیسی و فرانسوی است. بنابراین این مدل به طور پیشفرض با ترکیب مناسب انگلیسی شروع میکند و به طور خودکار به متن هلندی متصل نمیشود. اگر برای زبان انتخاب شده صدای آزمایش شدهای موجود نباشد، AI-Public هشدار میدهد و شما باید زبان یا مدل گفتار دیگری انتخاب کنید.
صدایی از زبان دیگر ممکن است لهجه خارجی ایجاد کند. بنابراین چنین صدای چندزبانه هرگز به طور خودکار به عنوان پیشفرض یا ترجیح ذخیره شده استفاده نمیشود. اتصالهای فنی فقط در صورت درخواست صریح میتوانند این کاهش کیفیت را اعمال کنند.
سیستمپرومت
در تبدیل متن به صوت میتوان از سیستمپرومت برای هدایت تلفظ و سبک استفاده کرد. AI-Public یک دستورالعمل پایه متناسب با زبان را پر میکند. برای زبان هلندی، این دستورالعمل شامل واکهها، تأکید، ریتم و آهنگ بدون لهجه انگلیسی است. اصطلاحاتی مانند AI، AI-Public، ChatGPT و OpenAI میتوانند تلفظ انگلیسی داشته باشند و Claude به عنوان نام فرانسوی تلفظ میشود. میتوانید دستورالعمل را برای سرعت، لحن یا گروه هدف خاص تنظیم کنید.
کیفیت صوت و جایگزین
صدای تولید شده توسط OpenAI، Google و Mistral کنترل شده و به صورت فایل استاندارد PCM16-WAV ذخیره میشود. فراداده فنی شامل نرخ نمونهبرداری، تعداد کانالها، زبان، صدا و مسیر کیفیت است. این باعث میشود کیفیت صوت قابل کنترل باقی بماند و پاسخ غیرمعمول ارائهدهنده به طور ناخواسته به فرمت صوتی دیگری ذخیره نشود.
دکمه خواندن متن موجود همچنین میتواند از صدای سیستم مرورگر یا دستگاه استفاده کند. این به عنوان کیفیت جایگزین قابل مشاهده است. برنامه در صورت امکان صدای سیستمی متناسب با زبان را انتخاب میکند، اما تلفظ و در دسترس بودن ممکن است بسته به دستگاه متفاوت باشد.
ترجیحات
کاربران میتوانند تنظیمات تبدیل متن به صوت خود را به عنوان ترجیح شخصی ذخیره کنند. بنابراین نیازی نیست مدل، زبان، صدا و دستورالعملهای تلفظ را هر بار دوباره انتخاب کنند.