Modelli di testo in voce
AI-Public supporta modelli di testo in voce che permettono di convertire il testo in audio. Questi modelli sono utilizzati in Testo in audio nella dashboard e nelle funzioni che generano audio da una chat.
Catalogo attuale
| Fornitore | Modello | Nota |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Voce naturale con buon controllo su tono e stile. |
| Gemini 3.1 Flash TTS Preview | Nuovo modello vocale Gemini con controllo preciso su stile, ritmo e tono. | |
| AI Europea | Voxtral Mini TTS | Text-to-speech europeo basato su Mistral Voxtral Mini. |
Claude non ha un proprio modello di testo in voce nel catalogo. Se Claude è abilitato come fornitore, i modelli vocali dipendono dagli altri fornitori configurati.
Chat vocale in tempo reale
La chat vocale utilizza un modello separato in tempo reale che combina ascolto e risposta in una singola conversazione live. Per OpenAI, AI-Public usa di default GPT-Realtime 2.1. Le impostazioni esistenti con GPT-Realtime 1.5 o GPT-Realtime 2 vengono aggiornate automaticamente a questa versione. Gemini Live rimane disponibile come alternativa quando Google è configurato per la voce in tempo reale.
Lingua primaria e lingua di supporto
In un assistente vocale, la lingua impostata determina la lingua principale in cui l'assistente parla. La lingua dell'interfaccia utente rimane disponibile come lingua di supporto. Ad esempio, qualcuno può esercitarsi in una conversazione in spagnolo e chiedere brevemente spiegazioni nella propria lingua. Poi l'assistente torna a parlare in spagnolo.
Un assistente vocale personalizzato carica la sua configurazione completa, inclusi prompt di sistema, lingua, voce, file e impostazioni degli strumenti. Puoi usare il prompt di sistema per definire il compito della conversazione, il livello desiderato e il modo di fornire feedback.
Strumenti durante la chat vocale
Gli assistenti vocali possono, a seconda dell'ambiente e delle impostazioni, usare automaticamente strumenti in sola lettura per informazioni da internet, manuali, chat precedenti, meteo e Wikipedia. Nel modulo assistente puoi attivare o disattivare uno strumento appropriato. Uno strumento attivato è su Automatico: l'assistente decide quando è utile usarlo.
Cosa determina un modello vocale
Un modello vocale determina come il testo viene pronunciato e quali funzionalità sono disponibili. Ad esempio:
- le voci disponibili;
- le lingue supportate da una voce;
- la qualità e naturalezza della pronuncia;
- il modo in cui vengono seguite le istruzioni su ritmo, tono, accento e pronuncia.
Voci e lingue
Le voci disponibili variano per fornitore. AI-Public mostra in testo in audio solo le voci testate per la lingua scelta, o voci che il fornitore ha indicato come multilingue. Se una voce è destinata solo a certe lingue, queste sono indicate accanto alla voce.
OpenAI e Google supportano la maggior parte delle lingue nel catalogo. Voxtral Mini TTS può gestire più lingue, ma l'attuale catalogo di voci contiene voci testate per inglese e francese. Perciò questo modello parte di default con una combinazione inglese appropriata e non viene associato silenziosamente a testo in olandese. Se per una lingua scelta non è disponibile una voce testata, AI-Public mostra un avviso e puoi scegliere un'altra lingua o un altro modello vocale.
Una voce di un'altra lingua può causare un accento straniero. Una voce cross-lingual non viene mai usata automaticamente come predefinita o preferenza salvata. Le integrazioni tecniche possono richiedere esplicitamente questo fallback di qualità.
Prompt di sistema
In testo in audio il prompt di sistema può essere usato per guidare pronuncia e stile. AI-Public inserisce un'istruzione base adatta alla lingua. Per l’olandese si richiedono vocali olandesi, accento, ritmo e intonazione senza accento inglese. Termini come AI, AI-Public, ChatGPT e OpenAI possono mantenere pronuncia inglese e Claude viene pronunciato come nome francese. Puoi modificare l’istruzione per esempio per ritmo, tono o un pubblico specifico.
Qualità audio e fallback
L’audio generato da OpenAI, Google e Mistral viene controllato e salvato come file PCM16-WAV standardizzato. I metadati tecnici includono frequenza di campionamento, numero di canali, lingua, voce e percorso di qualità. Questo mantiene la qualità audio verificabile e impedisce che una risposta anomala del fornitore venga salvata silenziosamente in un formato audio diverso.
Il pulsante di lettura per testo esistente può anche usare la voce di sistema del browser o del dispositivo. Questo è visibile come qualità di fallback. L’app sceglie dove possibile una voce di sistema adatta alla lingua, ma pronuncia e disponibilità possono variare per dispositivo.
Preferenze
Gli utenti possono salvare le impostazioni di testo in audio come preferenze personali. Così non devono scegliere ogni volta modello, lingua, voce e istruzioni di pronuncia.