Sari la conținutul principal

Modele text-în-vorbire

AI-Public suportă modele text-în-vorbire care pot converti textul în audio. Aceste modele sunt utilizate în Text în audio pe tabloul de bord și în funcțiile care generează audio dintr-un chat.

Catalogul actual

FurnizorModelObservație
OpenAIGPT-4o mini TTSVorbire cu sunet natural și control bun asupra tonului și stilului.
GoogleGemini 3.1 Flash TTS PreviewModel nou Gemini pentru vorbire cu control precis asupra stilului, ritmului și tonului.
AI EuropeanăVoxtral Mini TTSText-to-speech european bazat pe Mistral Voxtral Mini.

Claude nu are un model text-în-vorbire propriu în catalog. Dacă Claude este activat ca furnizor, modelele de vorbire depind de ceilalți furnizori configurați.

Chat vocal în timp real

Chat-ul vocal folosește un model separat în timp real care combină ascultarea și răspunsul într-o singură conversație live. Pentru OpenAI, AI-Public folosește implicit GPT-Realtime 2.1. Setările existente cu GPT-Realtime 1.5 sau GPT-Realtime 2 sunt actualizate automat la această versiune. Gemini Live rămâne disponibil ca alternativă când Google este configurat pentru vorbire în timp real.

Limba principală și limba de suport

La un asistent vocal, limba setată determină limba principală în care vorbește asistentul. Limba interfeței utilizatorului rămâne disponibilă ca limbă de suport. Astfel, cineva poate exersa o conversație în spaniolă și poate cere scurt explicații în propria limbă. Apoi asistentul revine la spaniolă.

Un asistent vocal personalizat încarcă configurația completă, inclusiv promptul de sistem, limba, vocea, fișierele și setările instrumentelor. Poți folosi promptul de sistem pentru a defini sarcina conversației, nivelul dorit și modul de oferire a feedback-ului.

Instrumente în timpul chat-ului vocal

Asistenții vocali pot folosi automat, în funcție de mediu și setări, doar instrumente în modul doar-citire pentru informații de pe internet, manual, chat-uri anterioare, vreme și Wikipedia. În formularul asistentului activezi sau dezactivezi un instrument potrivit. Un instrument activat este pe Automat: asistentul decide singur când este util să-l folosească.

Ce determină un model vocal

Un model vocal determină cum este pronunțat textul și ce opțiuni sunt disponibile. De exemplu:

  • vocile disponibile;
  • limbile suportate de o voce;
  • calitatea și naturalitatea pronunției;
  • modul în care sunt respectate instrucțiunile privind ritmul, tonul, accentul și pronunția.

Voci și limbi

Vocile disponibile diferă în funcție de furnizor. AI-Public afișează la text în audio doar vocile testate pentru limba aleasă sau vocile marcate de furnizor ca fiind multilingve. Dacă o voce este destinată doar anumitor limbi, acele limbi sunt indicate lângă voce.

OpenAI și Google suportă majoritatea limbilor din catalog. Voxtral Mini TTS poate procesa mai multe limbi, dar catalogul actual de voci conține voci testate pentru engleză și franceză. De aceea, acest model pornește implicit cu o combinație potrivită în engleză și nu este asociat tacit cu textul în olandeză. Dacă pentru o limbă aleasă nu există o voce testată, AI-Public afișează un avertisment și poți alege o altă limbă sau un alt model vocal.

O voce dintr-o altă limbă poate cauza un accent străin. O astfel de voce cross-lingual nu este folosită niciodată automat ca implicită sau preferință salvată. Legăturile tehnice pot solicita explicit această soluție de rezervă de calitate.

Prompt de sistem

La text în audio, promptul de sistem poate fi folosit pentru a controla pronunția și stilul. AI-Public completează o instrucțiune de bază potrivită limbii. Pentru olandeză, aceasta cere vocale olandeze, accent, ritm și intonație fără accent englezesc. Termeni precum AI, AI-Public, ChatGPT și OpenAI pot păstra pronunția engleză, iar Claude este pronunțat ca un nume francez. Poți ajusta instrucțiunea pentru ritm, ton sau un anumit public țintă.

Calitatea audio și fallback

Audio generat de OpenAI, Google și Mistral este verificat și salvat ca fișier standardizat PCM16-WAV. Metadatele tehnice includ frecvența de eșantionare, numărul de canale, limba, vocea și ruta de calitate. Astfel, calitatea audio rămâne verificabilă și un răspuns diferit al furnizorului nu este salvat neobservat ca un alt format audio.

Butonul de citire a textului existent poate folosi și vocea sistemului browserului sau dispozitivului. Aceasta este vizibilă ca fallback de calitate. Aplicația alege, dacă este posibil, o voce de sistem potrivită limbii, dar pronunția și disponibilitatea pot varia în funcție de dispozitiv.

Preferințe

Utilizatorii pot salva setările text-în-audio ca preferințe personale. Astfel, modelul, limba, vocea și instrucțiunile de pronunție nu trebuie alese de fiecare dată.

WhatsApp