برو به محتوای اصلی

مدل‌های تبدیل متن به گفتار

AI-Public از مدل‌های تبدیل متن به گفتار پشتیبانی می‌کند که متن را به صوت تبدیل می‌کنند. این مدل‌ها در بخش متن به صوت در داشبورد و در قابلیت‌هایی که صوت را از چت تولید می‌کنند، استفاده می‌شوند.

فهرست فعلی

ارائه‌دهندهمدلتوضیح
OpenAIGPT-4o mini TTSگفتار طبیعی با کنترل خوب بر لحن و سبک.
GoogleGemini 3.1 Flash TTS Previewمدل گفتار جدید Gemini با کنترل دقیق بر سبک، سرعت و لحن.
اروپای AIVoxtral Mini TTSتبدیل متن به گفتار اروپایی بر پایه Mistral Voxtral Mini.

Claude مدل تبدیل متن به گفتار اختصاصی در فهرست ندارد. اگر Claude به عنوان ارائه‌دهنده فعال باشد، مدل‌های گفتار به ارائه‌دهندگان دیگر پیکربندی شده وابسته خواهند بود.

گفتگوی صوتی بلادرنگ

گفتگوی صوتی از یک مدل بلادرنگ جداگانه استفاده می‌کند که گوش دادن و پاسخ دادن را در یک مکالمه زنده ترکیب می‌کند. برای OpenAI، AI-Public به طور پیش‌فرض از GPT-Realtime 2.1 استفاده می‌کند. تنظیمات موجود با GPT-Realtime 1.5 یا GPT-Realtime 2 به طور خودکار به این نسخه به‌روزرسانی می‌شوند. Gemini Live به عنوان جایگزین زمانی که Google برای گفتار بلادرنگ پیکربندی شده است، در دسترس باقی می‌ماند.

زبان اصلی و زبان پشتیبانی

در یک دستیار صوتی، زبان تنظیم شده تعیین می‌کند که دستیار عمدتاً به چه زبانی صحبت کند. زبان رابط کاربری کاربر نیز به عنوان زبان پشتیبانی در دسترس باقی می‌ماند. به این ترتیب، فرد می‌تواند مثلاً مکالمه‌ای به زبان اسپانیایی تمرین کند و به طور کوتاه درخواست توضیح به زبان خود را داشته باشد. سپس دستیار دوباره به زبان اسپانیایی بازمی‌گردد.

یک دستیار صوتی ساخته شده، پیکربندی کامل خود را بارگذاری می‌کند، از جمله سیستم‌پرومت، زبان، صدا، فایل‌ها و تنظیمات ابزارها. می‌توانید از سیستم‌پرومت برای تعیین وظیفه مکالمه، سطح مورد نظر و نحوه ارائه بازخورد استفاده کنید.

ابزارها در طول گفتگوی صوتی

دستیارهای صوتی می‌توانند، بسته به محیط و تنظیماتشان، به طور خودکار از ابزارهای فقط خواندنی برای اطلاعات اینترنتی، راهنما، چت‌های قبلی، وضعیت هوا و ویکی‌پدیا استفاده کنند. در فرم دستیار می‌توانید یک ابزار مناسب را روشن یا خاموش کنید. ابزاری که فعال باشد در حالت خودکار قرار دارد: دستیار خودش تصمیم می‌گیرد که چه زمانی استفاده مفید است.

آنچه یک مدل گفتار تعیین می‌کند

یک مدل گفتار تعیین می‌کند که متن چگونه تلفظ شود و چه امکاناتی در دسترس باشد. مانند:

  • صداهای موجود؛
  • زبان‌هایی که یک صدا پشتیبانی می‌کند؛
  • کیفیت و طبیعی بودن تلفظ؛
  • نحوه پیروی از دستورالعمل‌ها درباره سرعت، لحن، لهجه و تلفظ.

صداها و زبان‌ها

صداهای موجود بسته به ارائه‌دهنده متفاوت هستند. AI-Public در تبدیل متن به صوت فقط صداهایی را نشان می‌دهد که برای زبان انتخاب شده آزمایش شده‌اند یا صداهایی که توسط ارائه‌دهنده به عنوان چندزبانه مشخص شده‌اند. اگر یک صدا فقط برای زبان‌های خاصی در نظر گرفته شده باشد، آن زبان در کنار صدا ذکر شده است.

OpenAI و Google بیشتر زبان‌ها را در فهرست پشتیبانی می‌کنند. Voxtral Mini TTS می‌تواند چند زبان را پردازش کند، اما فهرست صداهای فعلی شامل صداهای آزمایش شده برای انگلیسی و فرانسوی است. بنابراین این مدل به طور پیش‌فرض با ترکیب مناسب انگلیسی شروع می‌کند و به طور خودکار به متن هلندی متصل نمی‌شود. اگر برای زبان انتخاب شده صدای آزمایش شده‌ای موجود نباشد، AI-Public هشدار می‌دهد و شما باید زبان یا مدل گفتار دیگری انتخاب کنید.

صدایی از زبان دیگر ممکن است لهجه خارجی ایجاد کند. بنابراین چنین صدای چندزبانه هرگز به طور خودکار به عنوان پیش‌فرض یا ترجیح ذخیره شده استفاده نمی‌شود. اتصال‌های فنی فقط در صورت درخواست صریح می‌توانند این کاهش کیفیت را اعمال کنند.

سیستم‌پرومت

در تبدیل متن به صوت می‌توان از سیستم‌پرومت برای هدایت تلفظ و سبک استفاده کرد. AI-Public یک دستورالعمل پایه متناسب با زبان را پر می‌کند. برای زبان هلندی، این دستورالعمل شامل واکه‌ها، تأکید، ریتم و آهنگ بدون لهجه انگلیسی است. اصطلاحاتی مانند AI، AI-Public، ChatGPT و OpenAI می‌توانند تلفظ انگلیسی داشته باشند و Claude به عنوان نام فرانسوی تلفظ می‌شود. می‌توانید دستورالعمل را برای سرعت، لحن یا گروه هدف خاص تنظیم کنید.

کیفیت صوت و جایگزین

صدای تولید شده توسط OpenAI، Google و Mistral کنترل شده و به صورت فایل استاندارد PCM16-WAV ذخیره می‌شود. فراداده فنی شامل نرخ نمونه‌برداری، تعداد کانال‌ها، زبان، صدا و مسیر کیفیت است. این باعث می‌شود کیفیت صوت قابل کنترل باقی بماند و پاسخ غیرمعمول ارائه‌دهنده به طور ناخواسته به فرمت صوتی دیگری ذخیره نشود.

دکمه خواندن متن موجود همچنین می‌تواند از صدای سیستم مرورگر یا دستگاه استفاده کند. این به عنوان کیفیت جایگزین قابل مشاهده است. برنامه در صورت امکان صدای سیستمی متناسب با زبان را انتخاب می‌کند، اما تلفظ و در دسترس بودن ممکن است بسته به دستگاه متفاوت باشد.

ترجیحات

کاربران می‌توانند تنظیمات تبدیل متن به صوت خود را به عنوان ترجیح شخصی ذخیره کنند. بنابراین نیازی نیست مدل، زبان، صدا و دستورالعمل‌های تلفظ را هر بار دوباره انتخاب کنند.

WhatsApp