Modèles de texte en parole
AI-Public prend en charge des modèles de texte en parole permettant de convertir du texte en audio. Ces modèles sont utilisés dans Texte vers audio sur le tableau de bord et dans les fonctions générant de l’audio à partir d’un chat.
Catalogue actuel
| Fournisseur | Modèle | Remarque |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Voix naturelle avec un bon contrôle du ton et du style. |
| Gemini 3.1 Flash TTS Preview | Nouveau modèle vocal Gemini avec un contrôle précis du style, du rythme et du ton. | |
| IA européenne | Voxtral Mini TTS | Synthèse vocale européenne basée sur Mistral Voxtral Mini. |
Claude ne dispose pas de son propre modèle de texte en parole dans le catalogue. Si Claude est activé comme fournisseur, les modèles vocaux dépendent des autres fournisseurs configurés.
Chat vocal en temps réel
Le chat vocal utilise un modèle temps réel distinct qui combine écoute et réponse dans une conversation en direct. Pour OpenAI, AI-Public utilise par défaut GPT-Realtime 2.1. Les configurations existantes avec GPT-Realtime 1.5 ou GPT-Realtime 2 sont automatiquement mises à jour vers cette version. Gemini Live reste disponible en alternative lorsque Google est configuré pour la parole en temps réel.
Langue principale et langue de support
Pour un assistant vocal, la langue définie détermine la langue principale parlée par l’assistant. La langue de l’interface utilisateur reste disponible comme langue de support. Par exemple, quelqu’un peut pratiquer une conversation en espagnol et demander brièvement des explications dans sa langue maternelle. Ensuite, l’assistant revient à l’espagnol.
Un assistant vocal personnalisé charge sa configuration complète, y compris la prompt système, la langue, la voix, les fichiers et les paramètres des outils. Vous pouvez utiliser la prompt système pour définir la tâche de conversation, le niveau souhaité et la manière de fournir des retours.
Outils pendant le chat vocal
Les assistants vocaux peuvent, selon l’environnement et leurs paramètres, utiliser automatiquement des outils en lecture seule pour des informations internet, le manuel, les chats précédents, la météo et Wikipédia. Dans le formulaire de l’assistant, vous activez ou désactivez un outil approprié. Un outil activé est en Automatique : l’assistant décide alors lui-même quand son usage est utile.
Ce que détermine un modèle vocal
Un modèle vocal détermine comment le texte est prononcé et quelles fonctionnalités sont disponibles. Par exemple :
- les voix disponibles ;
- les langues supportées par une voix ;
- la qualité et la naturalité de la prononciation ;
- la manière dont les instructions sur le rythme, le ton, l’accent et la prononciation sont suivies.
Voix et langues
Les voix disponibles varient selon le fournisseur. AI-Public affiche dans texte vers audio uniquement les voix testées pour la langue choisie, ou les voix désignées comme multilingues par le fournisseur. Si une voix est destinée uniquement à certaines langues, cette langue est indiquée avec la voix.
OpenAI et Google supportent la plupart des langues du catalogue. Voxtral Mini TTS peut traiter plusieurs langues, mais le catalogue actuel contient des voix testées pour l’anglais et le français. Ce modèle démarre donc par défaut avec une combinaison anglaise adaptée et n’est pas automatiquement associé à du texte néerlandais. Si aucune voix testée n’est disponible pour une langue choisie, AI-Public affiche un avertissement et vous invite à choisir une autre langue ou un autre modèle vocal.
Une voix d’une autre langue peut provoquer un accent étranger. Une telle voix cross-linguale n’est donc jamais utilisée automatiquement comme voix par défaut ou préférence enregistrée. Les intégrations techniques peuvent demander explicitement ce fallback de qualité.
Prompt système
Dans texte vers audio, la prompt système peut être utilisée pour orienter la prononciation et le style. AI-Public remplit pour cela une instruction de base adaptée à la langue. Pour le néerlandais, elle demande des voyelles, accent, rythme et intonation néerlandais sans accent anglais. Des termes comme AI, AI-Public, ChatGPT et OpenAI peuvent garder une prononciation anglaise et Claude est prononcé comme un nom français. Vous pouvez ajuster l’instruction pour le rythme, le ton ou un public spécifique.
Qualité audio et fallback
L’audio généré par OpenAI, Google et Mistral est contrôlé et enregistré comme fichier PCM16-WAV standardisé. Les métadonnées techniques contiennent notamment la fréquence d’échantillonnage, le nombre de canaux, la langue, la voix et la route de qualité. Cela permet de contrôler la qualité audio et d’éviter qu’une réponse différente du fournisseur soit enregistrée silencieusement dans un autre format audio.
Le bouton de lecture sur un texte existant peut aussi utiliser la voix système du navigateur ou de l’appareil. Cela apparaît comme une qualité fallback. L’application choisit si possible une voix système adaptée à la langue, mais la prononciation et la disponibilité peuvent varier selon l’appareil.
Préférences
Les utilisateurs peuvent enregistrer leurs réglages texte vers audio comme préférences personnelles. Ainsi, modèle, langue, voix et instructions de prononciation n’ont pas besoin d’être choisis à chaque fois.