Перейти до основного змісту

Моделі текст-в-мову

AI-Public підтримує моделі текст-в-мову, які дозволяють перетворювати текст в аудіо. Ці моделі використовуються у функції Текст в аудіо на панелі керування та у функціях, що генерують аудіо з чату.

Поточний каталог

ПостачальникМодельПримітка
OpenAIGPT-4o mini TTSПриродне звучання мови з хорошим контролем тону та стилю.
GoogleGemini 3.1 Flash TTS PreviewНова модель мови Gemini з точним контролем стилю, темпу та тону.
Європейський AIVoxtral Mini TTSЄвропейський текст-в-мову на основі Mistral Voxtral Mini.

Claude не має власної моделі текст-в-мову в каталозі. Якщо Claude увімкнено як постачальник, моделі мови залежать від інших налаштованих постачальників.

Голосовий чат у реальному часі

Голосовий чат використовує окрему модель у реальному часі, яка поєднує прослуховування та відповіді в одному живому діалозі. Для OpenAI AI-Public за замовчуванням використовує GPT-Realtime 2.1. Існуючі налаштування з GPT-Realtime 1.5 або GPT-Realtime 2 автоматично оновлюються до цієї версії. Gemini Live залишається доступним як альтернатива, коли Google налаштовано для голосу в реальному часі.

Основна мова та мова підтримки

У голосового асистента встановлена мова визначає, якою мовою він переважно говорить. Мова інтерфейсу користувача залишається доступною як мова підтримки. Наприклад, можна практикувати розмову іспанською та коротко запитати пояснення рідною мовою. Потім асистент повертається до іспанської.

Саморобний голосовий асистент завантажує повну конфігурацію, включно з системним підказом, мовою, голосом, файлами та налаштуваннями інструментів. Ви можете використовувати системний підказ для визначення завдання розмови, бажаного рівня та способу надання зворотного зв’язку.

Інструменти під час голосового чату

Голосові асистенти можуть, залежно від середовища та налаштувань, автоматично використовувати інструменти лише для читання, наприклад, для інформації з інтернету, посібника, попередніх чатів, погоди та Вікіпедії. У формі асистента ви можете увімкнути або вимкнути відповідний інструмент. Увімкнений інструмент стоїть на Автоматично: тоді асистент сам вирішує, коли його використання корисне.

Що визначає модель мови

Модель мови визначає, як вимовляється текст і які можливості доступні. Наприклад:

  • доступні голоси;
  • мови, які підтримує голос;
  • якість і природність вимови;
  • спосіб виконання інструкцій щодо темпу, тону, акценту та вимови.

Голоси та мови

Доступні голоси відрізняються залежно від постачальника. AI-Public показує у тексті в аудіо лише голоси, які протестовані для вибраної мови, або голоси, які постачальник позначив як багатомовні. Якщо голос призначений лише для певних мов, ця мова вказана поруч із голосом.

OpenAI та Google підтримують більшість мов у каталозі. Voxtral Mini TTS може обробляти кілька мов, але поточний каталог голосів містить протестовані голоси для англійської та французької. Тому ця модель за замовчуванням запускається з відповідною англійською комбінацією і не прив’язується мовчки до нідерландського тексту. Якщо для вибраної мови немає протестованого голосу, AI-Public показує попередження, і ви можете вибрати іншу мову або іншу модель мови.

Голос іншою мовою може викликати іноземний акцент. Такий крослінгвальний голос ніколи не використовується автоматично як стандартний або збережений пріоритет. Технічні інтеграції можуть явно запитувати цей запас якості.

Системний підказ

У тексті в аудіо системний підказ можна використовувати для керування вимовою та стилем. AI-Public заповнює відповідну мовну базову інструкцію. Для нідерландської це прохання про нідерландські голосні, наголос, ритм і інтонацію без англійського акценту. Терміни як AI, AI-Public, ChatGPT та OpenAI можуть зберігати англійську вимову, а Claude вимовляється як французьке ім’я. Ви можете змінити інструкцію, наприклад, для темпу, тону або конкретної аудиторії.

Якість аудіо та запасний варіант

Згенероване аудіо від OpenAI, Google та Mistral перевіряється і зберігається у стандартизованому файлі PCM16-WAV. Технічні метадані містять, зокрема, частоту дискретизації, кількість каналів, мову, голос і маршрут якості. Це забезпечує контроль якості аудіо і запобігає непомітному збереженню іншого аудіоформату через відмінну відповідь постачальника.

Кнопка озвучення існуючого тексту також може використовувати системний голос браузера або пристрою. Це видно як запасна якість. Додаток за можливості вибирає системний голос, що відповідає мові, але вимова і доступність можуть відрізнятися залежно від пристрою.

Налаштування

Користувачі можуть зберігати свої налаштування текст-в-аудіо як особисті уподобання. Тоді не потрібно щоразу знову вибирати модель, мову, голос і інструкції з вимови.

WhatsApp