Перейти к основному содержимому

Модели преобразования текста в речь

AI-Public поддерживает модели преобразования текста в речь, которые позволяют преобразовывать текст в аудио. Эти модели используются в разделе Текст в аудио на панели управления и в функциях, генерирующих аудио из чата.

Текущий каталог

ПоставщикМодельПримечание
OpenAIGPT-4o mini TTSЕстественное звучание речи с хорошим управлением тоном и стилем.
GoogleGemini 3.1 Flash TTS PreviewНовая модель речи Gemini с точным управлением стилем, темпом и тоном.
Европейский ИИVoxtral Mini TTSЕвропейский текст-в-речь на базе Mistral Voxtral Mini.

Claude не имеет собственной модели преобразования текста в речь в каталоге. Если Claude включён как поставщик, модели речи зависят от других настроенных поставщиков.

Речевой чат в реальном времени

Речевой чат использует отдельную модель реального времени, которая объединяет прослушивание и ответ в одном живом разговоре. Для OpenAI AI-Public по умолчанию использует GPT-Realtime 2.1. Существующие настройки с GPT-Realtime 1.5 или GPT-Realtime 2 автоматически обновляются до этой версии. Gemini Live остаётся доступным в качестве альтернативы, если для реального времени настроен Google.

Основной язык и язык поддержки

Для голосового ассистента установленный язык определяет, на каком языке ассистент в основном говорит. Язык интерфейса пользователя при этом остаётся доступным как язык поддержки. Например, можно практиковать разговор на испанском и кратко запрашивать объяснения на родном языке. Затем ассистент возвращается к испанскому.

Самодельный голосовой ассистент загружает всю свою конфигурацию, включая системный запрос, язык, голос, файлы и настройки инструментов. Вы можете использовать системный запрос для задания задачи разговора, желаемого уровня и способа предоставления обратной связи.

Инструменты во время речевого чата

Голосовые ассистенты могут, в зависимости от окружения и настроек, автоматически использовать инструменты только для чтения, например, для информации из интернета, руководства, предыдущих чатов, погоды и Википедии. В форме ассистента вы можете включать или отключать подходящие инструменты. Включённый инструмент находится в режиме Автоматически: ассистент сам решает, когда его использование полезно.

Что определяет модель речи

Модель речи определяет, как произносится текст и какие возможности доступны. Например:

  • доступные голоса;
  • языки, которые поддерживает голос;
  • качество и естественность произношения;
  • способ выполнения инструкций по темпу, тону, акценту и произношению.

Голоса и языки

Доступные голоса различаются у разных поставщиков. AI-Public при преобразовании текста в аудио показывает только голоса, протестированные для выбранного языка, или голоса, отмеченные поставщиком как многоязычные. Если голос предназначен только для определённых языков, эти языки указаны рядом с голосом.

OpenAI и Google поддерживают большинство языков в каталоге. Voxtral Mini TTS может обрабатывать несколько языков, но текущий каталог голосов содержит протестированные голоса для английского и французского. Поэтому эта модель по умолчанию запускается с подходящей английской комбинацией и не связывается молчаливо с нидерландским текстом. Если для выбранного языка нет протестированного голоса, AI-Public показывает предупреждение, и вы выбираете другой язык или другую модель речи.

Голос на другом языке может вызвать иностранный акцент. Такой кросс-лингвальный голос никогда не используется автоматически как стандартный или сохранённый предпочтительный. Технические интеграции могут запрашивать этот запас качества только явно.

Системный запрос

При преобразовании текста в аудио системный запрос можно использовать для управления произношением и стилем. AI-Public заполняет для этого базовую инструкцию, соответствующую языку. Для нидерландского это запрос на нидерландские гласные, ударение, ритм и интонацию без английского акцента. Термины, такие как AI, AI-Public, ChatGPT и OpenAI, могут сохранять английское произношение, а Claude произносится как французское имя. Вы можете изменить инструкцию, например, для темпа, тона или конкретной целевой аудитории.

Качество аудио и запасной вариант

Сгенерированное аудио от OpenAI, Google и Mistral проверяется и сохраняется как стандартизированный PCM16-WAV файл. Технические метаданные включают частоту дискретизации, количество каналов, язык, голос и маршрут качества. Это позволяет контролировать качество аудио и предотвращает незаметное сохранение ответа другого поставщика в другом аудиоформате.

Кнопка воспроизведения для существующего текста также может использовать системный голос браузера или устройства. Это видно как запасное качество. Приложение по возможности выбирает системный голос, подходящий для языка, но произношение и доступность могут различаться в зависимости от устройства.

Предпочтения

Пользователи могут сохранять свои настройки преобразования текста в аудио как личные предпочтения. Так не нужно каждый раз заново выбирать модель, язык, голос и инструкции по произношению.

WhatsApp