Gå til hovedinnhold

Tekst-til-tale-modeller

AI-Public støtter tekst-til-tale-modeller som kan konvertere tekst til lyd. Disse modellene brukes i Tekst til lyd på dashbordet og i funksjoner som genererer lyd fra en chat.

Nåværende katalog

LeverandørModellMerknad
OpenAIGPT-4o mini TTSNaturlig klingende tale med god kontroll på tone og stil.
GoogleGemini 3.1 Flash TTS PreviewNytt Gemini-talemodell med presis kontroll på stil, tempo og tone.
Europeisk AIVoxtral Mini TTSEuropeisk tekst-til-tale basert på Mistral Voxtral Mini.

Claude har ikke en egen tekst-til-tale-modell i katalogen. Hvis Claude er aktivert som leverandør, forblir tale-modellene avhengige av de andre konfigurerte leverandørene.

Sanntids talechat

Talechat bruker en egen sanntidsmodell som kombinerer lytting og svar i én live samtale. For OpenAI bruker AI-Public som standard GPT-Realtime 2.1. Eksisterende innstillinger med GPT-Realtime 1.5 eller GPT-Realtime 2 oppdateres automatisk til denne versjonen. Gemini Live forblir tilgjengelig som alternativ når Google er konfigurert for sanntids tale.

Primærspråk og støttespråk

For en taleassistent bestemmer det innstilte språket hvilket språk assistenten hovedsakelig snakker. Brukerens grensesnittspråk forblir tilgjengelig som støttespråk. På denne måten kan man for eksempel øve på en samtale på spansk og kort be om forklaring på eget språk. Deretter går assistenten tilbake til spansk.

En egendefinert taleassistent laster sin fullstendige konfigurasjon, inkludert systemprompt, språk, stemme, filer og verktøyinnstillinger. Du kan bruke systemprompten til å fastsette samtaleoppgaven, ønsket nivå og måten tilbakemelding gis på.

Verktøy under talechat

Taleassistenter kan, avhengig av miljø og innstillinger, automatisk bruke skrivebeskyttede verktøy for for eksempel internettinformasjon, manualer, tidligere chatter, vær og Wikipedia. I assistentskjemaet kan du slå et passende verktøy på eller av. Et aktivert verktøy står på Automatisk: assistenten bestemmer da selv når bruk er nyttig.

Hva en talemodell bestemmer

En talemodell bestemmer hvordan tekst uttales og hvilke muligheter som er tilgjengelige. Tenk på:

  • tilgjengelige stemmer;
  • språk en stemme støtter;
  • kvalitet og naturlighet i uttalen;
  • hvordan instruksjoner om tempo, tone, aksent og uttale følges.

Stemmer og språk

De tilgjengelige stemmene varierer per leverandør. AI-Public viser ved tekst til lyd kun stemmer som er testet for valgt språk, eller stemmer som leverandøren har merket som flerspråklige. Hvis en stemme kun er ment for visse språk, står disse språkene oppført ved stemmen.

OpenAI og Google støtter de fleste språk i katalogen. Voxtral Mini TTS kan håndtere flere språk, men den nåværende stemmekatalogen inneholder testede stemmer for engelsk og fransk. Derfor starter denne modellen som standard med en passende engelsk kombinasjon og kobles ikke stille til nederlandsk tekst. Hvis det ikke finnes en testet stemme for valgt språk, viser AI-Public en advarsel, og du må velge et annet språk eller en annen talemodell.

En stemme fra et annet språk kan gi en utenlandsk aksent. En slik kryss-språklig stemme brukes derfor aldri automatisk som standard eller lagret preferanse. Tekniske koblinger kan bare eksplisitt be om denne kvalitetsfallbacken.

Systemprompt

Ved tekst til lyd kan systemprompten brukes til å styre uttale og stil. AI-Public fyller inn en språktilpasset basisinstruksjon. For nederlandsk ber den om nederlandske vokaler, trykk, rytme og intonasjon uten engelsk aksent. Begreper som AI, AI-Public, ChatGPT og OpenAI kan beholde engelsk uttale, og Claude uttales som et fransk navn. Du kan tilpasse instruksjonen for for eksempel tempo, tone eller en spesifikk målgruppe.

Lydkvalitet og fallback

Generert lyd fra OpenAI, Google og Mistral kontrolleres og lagres som standardisert PCM16-WAV-fil. Den tekniske metadataen inneholder blant annet samplingsfrekvens, antall kanaler, språk, stemme og kvalitetsrute. Dette sikrer at lydkvaliteten kan kontrolleres, og at en avvikende leverandørrespons ikke lagres ubemerket som et annet lydformat.

Leseknappen ved eksisterende tekst kan også bruke systemstemmen til nettleseren eller enheten. Dette vises som fallback-kvalitet. Applikasjonen velger der det er mulig en systemstemme som passer til språket, men uttale og tilgjengelighet kan variere mellom enheter.

Preferanser

Brukere kan lagre sine tekst-til-lyd-innstillinger som personlige preferanser. På denne måten trenger man ikke velge modell, språk, stemme og uttaleinstruksjoner på nytt hver gang.

WhatsApp