Modelos de texto para fala
AI-Public suporta modelos de texto para fala que convertem texto em áudio. Esses modelos são usados em Texto para áudio no painel e em funções que geram áudio a partir de um chat.
Catálogo atual
| Provedor | Modelo | Observação |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Fala com som natural e bom controle de tom e estilo. |
| Gemini 3.1 Flash TTS Preview | Novo modelo de fala Gemini com controle preciso de estilo, ritmo e tom. | |
| AI Europeia | Voxtral Mini TTS | Texto para fala europeu baseado no Mistral Voxtral Mini. |
Claude não possui um modelo de texto para fala próprio no catálogo. Se Claude estiver ativado como provedor, os modelos de fala dependem dos demais provedores configurados.
Chat de voz em tempo real
O chat de voz usa um modelo separado em tempo real que combina ouvir e responder em uma conversa ao vivo. Para OpenAI, o AI-Public usa por padrão o GPT-Realtime 2.1. Configurações existentes com GPT-Realtime 1.5 ou GPT-Realtime 2 são atualizadas automaticamente para esta versão. O Gemini Live permanece disponível como alternativa quando o Google está configurado para voz em tempo real.
Idioma principal e idioma de suporte
Em um assistente de voz, o idioma configurado determina em qual idioma o assistente fala principalmente. O idioma da interface do usuário permanece disponível como idioma de suporte. Assim, alguém pode praticar uma conversa em espanhol e pedir uma breve explicação em seu idioma nativo. Depois, o assistente volta a falar em espanhol.
Um assistente de voz personalizado carrega toda a sua configuração, incluindo prompt do sistema, idioma, voz, arquivos e configurações de ferramentas. Você pode usar o prompt do sistema para definir a tarefa da conversa, o nível desejado e a forma de fornecer feedback.
Ferramentas durante o chat de voz
Assistentes de voz podem, dependendo do ambiente e configurações, usar automaticamente ferramentas somente leitura para, por exemplo, informações da internet, manual, chats anteriores, clima e Wikipedia. No formulário do assistente, você ativa ou desativa uma ferramenta adequada. Uma ferramenta ativada fica em Automático: o assistente decide quando o uso é útil.
O que um modelo de voz determina
Um modelo de voz determina como o texto é pronunciado e quais recursos estão disponíveis. Pense em:
- as vozes disponíveis;
- os idiomas que uma voz suporta;
- a qualidade e naturalidade da pronúncia;
- a forma como instruções sobre ritmo, tom, sotaque e pronúncia são seguidas.
Vozes e idiomas
As vozes disponíveis variam por provedor. O AI-Public mostra em texto para áudio apenas vozes testadas para o idioma escolhido, ou vozes marcadas pelo provedor como multilíngues. Se uma voz for destinada apenas a certos idiomas, esse idioma é indicado junto à voz.
OpenAI e Google suportam a maioria dos idiomas do catálogo. Voxtral Mini TTS pode processar vários idiomas, mas o catálogo atual contém vozes testadas para inglês e francês. Por isso, este modelo inicia por padrão com uma combinação inglesa adequada e não é automaticamente associado a texto em holandês. Se não houver voz testada para o idioma escolhido, o AI-Public exibe um aviso e você deve escolher outro idioma ou outro modelo de voz.
Uma voz de outro idioma pode causar um sotaque estrangeiro. Por isso, uma voz cross-lingual nunca é usada automaticamente como padrão ou preferência salva. Integrações técnicas só podem solicitar explicitamente essa opção de fallback de qualidade.
Prompt do sistema
Em texto para áudio, o prompt do sistema pode ser usado para controlar a pronúncia e o estilo. O AI-Public preenche uma instrução básica adequada ao idioma. Para holandês, isso pede vogais, acentuação, ritmo e entonação holandeses sem sotaque inglês. Termos como AI, AI-Public, ChatGPT e OpenAI podem manter pronúncia inglesa e Claude é pronunciado como nome francês. Você pode ajustar a instrução para ritmo, tom ou público específico.
Qualidade do áudio e fallback
O áudio gerado por OpenAI, Google e Mistral é verificado e armazenado como arquivo PCM16-WAV padronizado. Os metadados técnicos incluem frequência de amostragem, número de canais, idioma, voz e rota de qualidade. Isso mantém a qualidade do áudio verificável e evita que uma resposta diferente do provedor seja armazenada inadvertidamente em outro formato.
O botão de leitura em texto existente também pode usar a voz do sistema do navegador ou dispositivo. Isso é visível como qualidade de fallback. A aplicação escolhe, quando possível, uma voz do sistema compatível com o idioma, mas pronúncia e disponibilidade podem variar por dispositivo.
Preferências
Usuários podem salvar suas configurações de texto para áudio como preferência pessoal. Assim, modelo, idioma, voz e instruções de pronúncia não precisam ser escolhidos toda vez.