Tekst-til-tale-modeller
AI-Public understøtter tekst-til-tale-modeller, som kan konvertere tekst til lyd. Disse modeller bruges i Tekst til lyd på dashboardet og i funktioner, der genererer lyd fra en chat.
Nuværende katalog
| Udbyder | Model | Bemærkning |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Naturligt klingende tale med god styring af tone og stil. |
| Gemini 3.1 Flash TTS Preview | Ny Gemini-talermodel med præcis styring af stil, tempo og tone. | |
| Europæisk AI | Voxtral Mini TTS | Europæisk tekst-til-tale baseret på Mistral Voxtral Mini. |
Claude har ikke sin egen tekst-til-tale-model i kataloget. Hvis Claude er aktiveret som udbyder, forbliver talemodeller afhængige af de øvrige konfigurerede udbydere.
Realtids talechat
Talechat bruger en separat realtidsmodel, der kombinerer lytning og svar i én live samtale. For OpenAI bruger AI-Public som standard GPT-Realtime 2.1. Eksisterende indstillinger med GPT-Realtime 1.5 eller GPT-Realtime 2 opdateres automatisk til denne version. Gemini Live forbliver tilgængelig som alternativ, når Google er konfigureret til realtids tale.
Primært sprog og støttesprog
Ved en taleassistent bestemmer det indstillede sprog, hvilket sprog assistenten hovedsageligt taler. Brugerens interfacesprog forbliver desuden tilgængeligt som støttesprog. På den måde kan man for eksempel øve en samtale på spansk og kort bede om forklaring på sit eget sprog. Derefter skifter assistenten tilbage til spansk.
En selvbygget taleassistent indlæser sin fulde konfiguration, herunder systemprompt, sprog, stemme, filer og værktøjsindstillinger. Du kan bruge systemprompten til at fastlægge samtaleopgaven, det ønskede niveau og måden at give feedback på.
Værktøjer under talechat
Taleassistenter kan, afhængigt af miljø og deres indstillinger, automatisk bruge skrivebeskyttede værktøjer til for eksempel internetinformation, manualen, tidligere chats, vejret og Wikipedia. I assistentformularen kan du tænde eller slukke for et passende værktøj. Et aktiveret værktøj står på Automatisk: assistenten beslutter så selv, hvornår brug er nyttigt.
Hvad en talermodel bestemmer
En talermodel bestemmer, hvordan tekst udtales, og hvilke muligheder der er tilgængelige. Tænk på:
- de tilgængelige stemmer;
- de sprog, en stemme understøtter;
- kvaliteten og naturligheden af udtalen;
- måden instruktioner om tempo, tone, accent og udtale følges på.
Stemmer og sprog
De tilgængelige stemmer varierer efter udbyder. AI-Public viser ved tekst til lyd kun stemmer, der er testet til det valgte sprog, eller stemmer, som udbyderen har markeret som flersprogede. Hvis en stemme kun er beregnet til bestemte sprog, er det sprog angivet ved stemmen.
OpenAI og Google understøtter de fleste sprog i kataloget. Voxtral Mini TTS kan håndtere flere sprog, men den nuværende stemmekatalog indeholder testede stemmer til engelsk og fransk. Derfor starter denne model som standard med en passende engelsk kombination og kobles ikke tavst til dansk tekst. Hvis der ikke findes en testet stemme til et valgt sprog, viser AI-Public en advarsel, og du vælger et andet sprog eller en anden talermodel.
En stemme fra et andet sprog kan give en udenlandsk accent. En sådan tvær-sproglig stemme bruges derfor aldrig automatisk som standard eller gemt præference. Tekniske integrationer kan kun eksplicit anmode om denne kvalitetsfallback.
Systemprompt
Ved tekst til lyd kan systemprompten bruges til at styre udtale og stil. AI-Public udfylder en sprogtilpasset basisinstruktion til dette. For dansk beder den om danske vokaler, tryk, rytme og intonation uden engelsk accent. Termer som AI, AI-Public, ChatGPT og OpenAI må beholde engelsk udtale, og Claude udtales som et fransk navn. Du kan tilpasse instruktionen for eksempel til tempo, tone eller en specifik målgruppe.
Lydkvalitet og fallback
Genereret lyd fra OpenAI, Google og Mistral kontrolleres og gemmes som standardiseret PCM16-WAV-fil. Den tekniske metadata indeholder blandt andet samplefrekvens, antal kanaler, sprog, stemme og kvalitetsrute. Det sikrer, at lydkvaliteten kan kontrolleres, og at en afvigende udbyderrespons ikke gemmes ubemærket som et andet lydformat.
Læs-knappen ved eksisterende tekst kan også bruge systemstemmen i browseren eller på enheden. Dette vises som fallback-kvalitet. Applikationen vælger, hvor muligt, en systemstemme, der passer til sproget, men udtale og tilgængelighed kan variere pr. enhed.
Præferencer
Brugere kan gemme deres tekst-til-lyd-indstillinger som personlige præferencer. Så behøver model, sprog, stemme og udtaleinstruktioner ikke vælges hver gang.