Modelos de texto a voz
AI-Public soporta modelos de texto a voz que permiten convertir texto en audio. Estos modelos se utilizan en Texto a audio en el panel de control y en funciones que generan audio a partir de un chat.
Catálogo actual
| Proveedor | Modelo | Comentario |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Voz natural con buen control sobre el tono y estilo. |
| Gemini 3.1 Flash TTS Preview | Nuevo modelo de voz Gemini con control preciso sobre estilo, ritmo y tono. | |
| Europea AI | Voxtral Mini TTS | Texto a voz europeo basado en Mistral Voxtral Mini. |
Claude no tiene un modelo de texto a voz propio en el catálogo. Si Claude está habilitado como proveedor, los modelos de voz dependen de los demás proveedores configurados.
Chat de voz en tiempo real
El chat de voz utiliza un modelo en tiempo real separado que combina escuchar y responder en una conversación en vivo. Para OpenAI, AI-Public usa por defecto GPT-Realtime 2.1. Las configuraciones existentes con GPT-Realtime 1.5 o GPT-Realtime 2 se actualizan automáticamente a esta versión. Gemini Live sigue disponible como alternativa cuando Google está configurado para voz en tiempo real.
Idioma principal y idioma de soporte
En un asistente de voz, el idioma configurado determina en qué idioma habla principalmente el asistente. Además, el idioma de la interfaz del usuario permanece disponible como idioma de soporte. Por ejemplo, alguien puede practicar una conversación en español y pedir brevemente explicaciones en su idioma nativo. Luego, el asistente vuelve al español.
Un asistente de voz personalizado carga toda su configuración, incluyendo el prompt del sistema, idioma, voz, archivos y configuraciones de herramientas. Puedes usar el prompt del sistema para definir la tarea de la conversación, el nivel deseado y la forma de dar retroalimentación.
Herramientas durante el chat de voz
Los asistentes de voz pueden, según el entorno y su configuración, usar automáticamente herramientas de solo lectura para información de internet, el manual, chats anteriores, el clima y Wikipedia. En el formulario del asistente puedes activar o desactivar una herramienta adecuada. Una herramienta activada está en Automático: el asistente decide cuándo es útil usarla.
Qué determina un modelo de voz
Un modelo de voz determina cómo se pronuncia el texto y qué posibilidades están disponibles. Por ejemplo:
- las voces disponibles;
- los idiomas que soporta una voz;
- la calidad y naturalidad de la pronunciación;
- la forma en que se siguen las instrucciones sobre ritmo, tono, acento y pronunciación.
Voces e idiomas
Las voces disponibles varían según el proveedor. AI-Public muestra en texto a audio solo voces que han sido probadas para el idioma elegido, o voces que el proveedor ha marcado como multilingües. Si una voz está destinada solo para ciertos idiomas, ese idioma aparece junto a la voz.
OpenAI y Google soportan la mayoría de idiomas en el catálogo. Voxtral Mini TTS puede procesar varios idiomas, pero el catálogo actual de voces contiene voces probadas para inglés y francés. Por eso este modelo inicia por defecto con una combinación inglesa adecuada y no se asocia silenciosamente con texto en neerlandés. Si no hay una voz probada disponible para un idioma elegido, AI-Public muestra una advertencia y debes elegir otro idioma o modelo de voz.
Una voz de otro idioma puede causar un acento extranjero. Por eso, una voz cross-lingual nunca se usa automáticamente como predeterminada o preferencia guardada. Las integraciones técnicas solo pueden solicitar explícitamente esta opción de calidad inferior.
Prompt del sistema
En texto a audio, el prompt del sistema puede usarse para controlar la pronunciación y el estilo. AI-Public rellena una instrucción base adecuada al idioma. Para neerlandés, esta pide vocales neerlandesas, acento, ritmo e entonación sin acento inglés. Términos como AI, AI-Public, ChatGPT y OpenAI pueden mantener pronunciación inglesa y Claude se pronuncia como nombre francés. Puedes ajustar la instrucción para ritmo, tono o un público específico.
Calidad de audio y fallback
El audio generado por OpenAI, Google y Mistral se verifica y se guarda como archivo PCM16-WAV estandarizado. Los metadatos técnicos incluyen frecuencia de muestreo, número de canales, idioma, voz y ruta de calidad. Esto mantiene la calidad de audio controlable y evita que una respuesta diferente del proveedor se guarde inadvertidamente en otro formato de audio.
El botón de lectura en texto existente también puede usar la voz del sistema del navegador o dispositivo. Esto se muestra como calidad fallback. La aplicación elige cuando es posible una voz del sistema que coincida con el idioma, pero la pronunciación y disponibilidad pueden variar según el dispositivo.
Preferencias
Los usuarios pueden guardar sus configuraciones de texto a audio como preferencia personal. Así no es necesario elegir modelo, idioma, voz e instrucciones de pronunciación cada vez.