Modele tekst-na-mowę
AI-Public obsługuje modele tekst-na-mowę, które umożliwiają konwersję tekstu na dźwięk. Modele te są używane w funkcji Tekst na audio na pulpicie oraz w funkcjach generujących dźwięk z czatu.
Aktualny katalog
| Dostawca | Model | Uwagi |
|---|---|---|
| OpenAI | GPT-4o mini TTS | Naturalnie brzmiąca mowa z dobrą kontrolą tonu i stylu. |
| Gemini 3.1 Flash TTS Preview | Nowy model mowy Gemini z precyzyjną kontrolą stylu, tempa i tonu. | |
| Europejska AI | Voxtral Mini TTS | Europejski tekst-na-mowę oparty na Mistral Voxtral Mini. |
Claude nie posiada własnego modelu tekst-na-mowę w katalogu. Jeśli Claude jest włączony jako dostawca, modele mowy zależą od pozostałych skonfigurowanych dostawców.
Czaty głosowe w czasie rzeczywistym
Czat głosowy używa osobnego modelu czasu rzeczywistego, który łączy słuchanie i odpowiadanie w jednej rozmowie na żywo. Dla OpenAI AI-Public domyślnie używa GPT-Realtime 2.1. Istniejące ustawienia z GPT-Realtime 1.5 lub GPT-Realtime 2 są automatycznie aktualizowane do tej wersji. Gemini Live pozostaje dostępny jako alternatywa, gdy Google jest skonfigurowany do mowy w czasie rzeczywistym.
Język główny i język wsparcia
W asystencie głosowym ustawiony język określa, w jakim języku asystent mówi głównie. Język interfejsu użytkownika pozostaje dostępny jako język wsparcia. Na przykład ktoś może ćwiczyć rozmowę po hiszpańsku i krótko poprosić o wyjaśnienie w swoim języku. Następnie asystent wraca do hiszpańskiego.
Własnoręcznie stworzony asystent głosowy ładuje swoją pełną konfigurację, w tym prompt systemowy, język, głos, pliki i ustawienia narzędzi. Możesz użyć promptu systemowego, aby określić zadanie rozmowy, pożądany poziom i sposób udzielania informacji zwrotnej.
Narzędzia podczas czatu głosowego
Asystenci głosowi mogą, w zależności od środowiska i ustawień, automatycznie używać narzędzi tylko do odczytu, np. do informacji z internetu, instrukcji, wcześniejszych czatów, pogody i Wikipedii. W formularzu asystenta możesz włączyć lub wyłączyć odpowiednie narzędzie. Włączone narzędzie jest ustawione na Automatycznie: asystent sam decyduje, kiedy jego użycie jest przydatne.
Co określa model mowy
Model mowy określa, jak tekst jest wymawiany i jakie możliwości są dostępne. Na przykład:
- dostępne głosy;
- języki obsługiwane przez dany głos;
- jakość i naturalność wymowy;
- sposób realizacji instrukcji dotyczących tempa, tonu, akcentu i wymowy.
Głosy i języki
Dostępne głosy różnią się w zależności od dostawcy. AI-Public pokazuje przy tekście na audio tylko głosy przetestowane dla wybranego języka lub głosy oznaczone przez dostawcę jako wielojęzyczne. Jeśli głos jest przeznaczony tylko dla określonych języków, język ten jest podany przy głosie.
OpenAI i Google obsługują większość języków w katalogu. Voxtral Mini TTS może obsługiwać wiele języków, ale obecny katalog głosów zawiera przetestowane głosy dla angielskiego i francuskiego. Dlatego ten model domyślnie startuje z odpowiednią kombinacją angielską i nie jest automatycznie przypisywany do tekstu w języku niderlandzkim. Jeśli dla wybranego języka nie ma przetestowanego głosu, AI-Public wyświetla ostrzeżenie i możesz wybrać inny język lub inny model mowy.
Głos z innego języka może powodować obcy akcent. Taki głos międzyjęzykowy nigdy nie jest automatycznie używany jako domyślny lub preferowany. Połączenia techniczne mogą wyraźnie zażądać tego rozwiązania awaryjnego.
Prompt systemowy
Przy tekście na audio prompt systemowy może być użyty do sterowania wymową i stylem. AI-Public wypełnia wtedy podstawową instrukcję dopasowaną do języka. Dla niderlandzkiego prosi o niderlandzkie samogłoski, akcent, rytm i intonację bez angielskiego akcentu. Terminy takie jak AI, AI-Public, ChatGPT i OpenAI mogą zachować angielską wymowę, a Claude jest wymawiane jako francuskie imię. Możesz dostosować instrukcję np. pod kątem tempa, tonu lub konkretnej grupy odbiorców.
Jakość dźwięku i fallback
Generowany dźwięk z OpenAI, Google i Mistral jest kontrolowany i zapisywany jako ustandaryzowany plik PCM16-WAV. Metadane techniczne zawierają m.in. częstotliwość próbkowania, liczbę kanałów, język, głos i ścieżkę jakości. Dzięki temu jakość dźwięku pozostaje kontrolowana, a nietypowa odpowiedź dostawcy nie jest niepostrzeżenie zapisywana w innym formacie audio.
Przycisk odczytu istniejącego tekstu może również używać głosu systemowego przeglądarki lub urządzenia. Jest to widoczne jako jakość zapasowa (fallback). Aplikacja wybiera, jeśli to możliwe, głos systemowy pasujący do języka, ale wymowa i dostępność mogą się różnić w zależności od urządzenia.
Preferencje
Użytkownicy mogą zapisać swoje ustawienia tekst-na-audio jako preferencje osobiste. Dzięki temu nie trzeba za każdym razem wybierać modelu, języka, głosu i instrukcji wymowy.