Gå till huvudinnehållet

Text-till-tal-modeller

AI-Public stöder text-till-tal-modeller som kan omvandla text till ljud. Dessa modeller används i Text till ljud på instrumentpanelen och i funktioner som genererar ljud från en chatt.

Nuvarande katalog

LeverantörModellKommentar
OpenAIGPT-4o mini TTSNaturligt klingande tal med bra styrning av ton och stil.
GoogleGemini 3.1 Flash TTS PreviewNytt Gemini-talmodell med exakt styrning av stil, tempo och ton.
Europeisk AIVoxtral Mini TTSEuropeisk text-till-tal baserad på Mistral Voxtral Mini.

Claude har ingen egen text-till-tal-modell i katalogen. Om Claude är aktiverad som leverantör, förblir talmodeller beroende av övriga konfigurerade leverantörer.

Realtids röstchatt

Röstchatt använder en separat realtidsmodell som kombinerar lyssnande och svar i ett live-samtal. För OpenAI använder AI-Public som standard GPT-Realtime 2.1. Befintliga inställningar med GPT-Realtime 1.5 eller GPT-Realtime 2 uppdateras automatiskt till denna version. Gemini Live finns kvar som alternativ när Google är konfigurerat för realtidstal.

Primärt språk och stödspråk

I en röstassistent bestämmer det inställda språket vilket språk assistenten huvudsakligen talar. Användarens gränssnittsspråk finns dessutom tillgängligt som stödspråk. På så sätt kan någon till exempel öva en konversation på spanska och kort be om förklaring på sitt eget språk. Därefter återgår assistenten till spanska.

En egenbyggd röstassistent laddar sin fullständiga konfiguration, inklusive systemprompt, språk, röst, filer och verktygsinställningar. Du kan använda systemprompten för att fastställa samtalsuppgiften, önskad nivå och sättet för återkoppling.

Verktyg under röstchatt

Röstassistenter kan, beroende på miljö och inställningar, automatiskt använda skrivskyddade verktyg för exempelvis internetinformation, manualen, tidigare chattar, väder och Wikipedia. I assistentformuläret slår du på eller av ett lämpligt verktyg. Ett aktiverat verktyg står på Automatiskt: assistenten bestämmer då själv när användning är meningsfull.

Vad en röstmodell bestämmer

En röstmodell bestämmer hur text uttalas och vilka möjligheter som finns. Tänk på:

  • tillgängliga röster;
  • vilka språk en röst stöder;
  • kvalitet och naturlighet i uttalet;
  • hur instruktioner om tempo, ton, accent och uttal följs.

Röster och språk

De tillgängliga rösterna varierar per leverantör. AI-Public visar vid text till ljud endast röster som testats för valt språk, eller röster som leverantören har markerat som flerspråkiga. Om en röst endast är avsedd för vissa språk anges detta vid rösten.

OpenAI och Google stöder de flesta språk i katalogen. Voxtral Mini TTS kan hantera flera språk, men den nuvarande röstkatalogen innehåller testade röster för engelska och franska. Därför startar denna modell som standard med en passande engelsk kombination och kopplas inte tyst till nederländsk text. Om det inte finns någon testad röst för valt språk visar AI-Public en varning och du väljer ett annat språk eller en annan röstmodell.

En röst från ett annat språk kan ge en utländsk accent. En sådan korsspråklig röst används därför aldrig automatiskt som standard eller sparad preferens. Tekniska kopplingar kan endast uttryckligen begära denna kvalitetsfallback.

Systemprompt

Vid text till ljud kan systemprompten användas för att styra uttal och stil. AI-Public fyller i en språkpassande grundinstruktion. För nederländska efterfrågas nederländska vokaler, betoning, rytm och intonation utan engelsk accent. Termer som AI, AI-Public, ChatGPT och OpenAI får behålla engelsk uttal och Claude uttalas som ett franskt namn. Du kan anpassa instruktionen för exempelvis tempo, ton eller en specifik målgrupp.

Ljudkvalitet och fallback

Genererat ljud från OpenAI, Google och Mistral kontrolleras och sparas som standardiserad PCM16-WAV-fil. Den tekniska metadata innehåller bland annat samplingsfrekvens, antal kanaler, språk, röst och kvalitetsrutt. Detta gör att ljudkvaliteten kan kontrolleras och att en avvikande leverantörsrespons inte tyst sparas som ett annat ljudformat.

Uppspelningsknappen vid befintlig text kan också använda systemrösten i webbläsaren eller enheten. Detta syns som fallback-kvalitet. Applikationen väljer där det är möjligt en systemröst som passar språket, men uttal och tillgänglighet kan variera per enhet.

Preferenser

Användare kan spara sina text-till-ljud-inställningar som personliga preferenser. Då behöver modell, språk, röst och uttalsinstruktioner inte väljas om varje gång.

WhatsApp