Zum Hauptinhalt springen

Text-zu-Sprache-Modelle

AI-Public unterstützt Text-zu-Sprache-Modelle, mit denen Text in Audio umgewandelt werden kann. Diese Modelle werden bei Text zu Audio im Dashboard und bei Funktionen verwendet, die Audio aus einem Chat generieren.

Aktueller Katalog

AnbieterModellAnmerkung
OpenAIGPT-4o mini TTSNatürlich klingende Sprache mit guter Steuerung von Ton und Stil.
GoogleGemini 3.1 Flash TTS PreviewNeues Gemini-Sprachmodell mit präziser Steuerung von Stil, Tempo und Ton.
Europäische KIVoxtral Mini TTSEuropäische Text-zu-Sprache basierend auf Mistral Voxtral Mini.

Claude hat kein eigenes Text-zu-Sprache-Modell im Katalog. Wenn Claude als Anbieter aktiviert ist, bleiben die Sprachmodelle von den übrigen konfigurierten Anbietern abhängig.

Echtzeit-Sprachchat

Der Sprachchat verwendet ein separates Echtzeitmodell, das Zuhören und Antworten in einem Live-Gespräch kombiniert. Für OpenAI verwendet AI-Public standardmäßig GPT-Realtime 2.1. Bestehende Einstellungen mit GPT-Realtime 1.5 oder GPT-Realtime 2 werden automatisch auf diese Version aktualisiert. Gemini Live bleibt als Alternative verfügbar, wenn Google für Echtzeit-Sprachfunktionen konfiguriert ist.

Primäre Sprache und Unterstützungssprache

Bei einem Sprachassistenten bestimmt die eingestellte Sprache, in welcher Sprache der Assistent hauptsächlich spricht. Die Benutzerschnittstellensprache bleibt zusätzlich als Unterstützungssprache verfügbar. So kann jemand beispielsweise ein Gespräch auf Spanisch üben und kurz um eine Erklärung in der eigenen Sprache bitten. Danach wechselt der Assistent wieder zurück zum Spanischen.

Ein selbst erstellter Sprachassistent lädt seine vollständige Konfiguration, einschließlich Systemprompt, Sprache, Stimme, Dateien und Tool-Einstellungen. Du kannst den Systemprompt verwenden, um die Gesprächsaufgabe, das gewünschte Niveau und die Art der Rückmeldung festzulegen.

Tools während des Sprachchats

Sprachassistenten können, abhängig von der Umgebung und ihren Einstellungen, automatisch Nur-Lese-Tools verwenden, z. B. für Internetinformationen, das Handbuch, frühere Chats, Wetter und Wikipedia. Im Assistentenformular kannst du ein geeignetes Tool ein- oder ausschalten. Ein aktiviertes Tool steht auf Automatisch: Der Assistent entscheidet dann selbst, wann die Nutzung sinnvoll ist.

Was ein Sprachmodell bestimmt

Ein Sprachmodell bestimmt, wie Text ausgesprochen wird und welche Möglichkeiten verfügbar sind. Zum Beispiel:

  • die verfügbaren Stimmen;
  • die Sprachen, die eine Stimme unterstützt;
  • die Qualität und Natürlichkeit der Aussprache;
  • die Art und Weise, wie Anweisungen zu Tempo, Ton, Akzent und Aussprache befolgt werden.

Stimmen und Sprachen

Die verfügbaren Stimmen unterscheiden sich je nach Anbieter. AI-Public zeigt bei Text zu Audio nur Stimmen an, die für die gewählte Sprache getestet wurden oder vom Anbieter als mehrsprachig gekennzeichnet sind. Wenn eine Stimme nur für bestimmte Sprachen gedacht ist, wird diese Sprache bei der Stimme angegeben.

OpenAI und Google unterstützen die meisten Sprachen im Katalog. Voxtral Mini TTS kann mehrere Sprachen verarbeiten, aber der aktuelle Stimmkatalog enthält getestete Stimmen für Englisch und Französisch. Daher startet dieses Modell standardmäßig mit einer passenden englischen Kombination und wird nicht stillschweigend mit niederländischem Text gekoppelt. Wenn für eine gewählte Sprache keine getestete Stimme verfügbar ist, zeigt AI-Public eine Warnung an und du kannst eine andere Sprache oder ein anderes Sprachmodell wählen.

Eine Stimme aus einer anderen Sprache kann einen ausländischen Akzent verursachen. Eine solche cross-linguale Stimme wird daher niemals automatisch als Standard oder gespeicherte Präferenz verwendet. Technische Verknüpfungen können diesen Qualitäts-Fallback nur explizit anfordern.

Systemprompt

Bei Text zu Audio kann der Systemprompt verwendet werden, um Aussprache und Stil zu steuern. AI-Public füllt dafür eine sprachangepasste Basisanweisung aus. Für Niederländisch wird um niederländische Vokale, Betonung, Rhythmus und Intonation ohne englischen Akzent gebeten. Begriffe wie AI, AI-Public, ChatGPT und OpenAI dürfen eine englische Aussprache behalten und Claude wird als französischer Name ausgesprochen. Du kannst die Anweisung anpassen, z. B. für Tempo, Ton oder eine bestimmte Zielgruppe.

Audioqualität und Fallback

Generierte Audiodateien von OpenAI, Google und Mistral werden geprüft und als standardisierte PCM16-WAV-Datei gespeichert. Die technischen Metadaten enthalten unter anderem Abtastrate, Anzahl der Kanäle, Sprache, Stimme und Qualitätsroute. Dadurch bleibt die Audioqualität kontrollierbar und eine abweichende Anbieterantwort wird nicht unbemerkt als anderes Audioformat gespeichert.

Die Vorlesetaste bei vorhandenem Text kann auch die Systemstimme des Browsers oder Geräts verwenden. Dies ist als Fallback-Qualität sichtbar. Die Anwendung wählt, wenn möglich, eine Systemstimme, die zur Sprache passt, aber Aussprache und Verfügbarkeit können je nach Gerät variieren.

Präferenzen

Benutzer können ihre Text-zu-Audio-Einstellungen als persönliche Präferenz speichern. So müssen Modell, Sprache, Stimme und Ausspracheanweisungen nicht jedes Mal neu ausgewählt werden.

WhatsApp