टेक्स्ट-टू-स्पीच मॉडल
AI-Public टेक्स्ट-टू-स्पीच मॉडल का समर्थन करता है जो टेक्स्ट को ऑडियो में बदल सकते हैं। ये मॉडल डैशबोर्ड पर टेक्स्ट से ऑडियो और चैट से ऑडियो उत्पन्न करने वाले फ़ंक्शंस में उपयोग किए जाते हैं।
वर्तमान कैटलॉग
| प्रदाता | मॉडल | टिप्पणी |
|---|---|---|
| OpenAI | GPT-4o मिनी TTS | स्वाभाविक सुनाई देने वाली आवाज़, टोन और शैली पर अच्छी नियंत्रण के साथ। |
| Gemini 3.1 Flash TTS Preview | नया Gemini स्पीच मॉडल, शैली, गति और टोन पर सटीक नियंत्रण के साथ। | |
| यूरोपीय AI | Voxtral Mini TTS | Mistral Voxtral Mini आधारित यूरोपीय टेक्स्ट-टू-स्पीच। |
Claude के पास कैटलॉग में अपना कोई टेक्स्ट-टू-स्पीच मॉडल नहीं है। यदि Claude प्रदाता के रूप में सक्षम है, तो स्पीच मॉडल अन्य कॉन्फ़िगर किए गए प्रदाताओं पर निर्भर रहेंगे।
रियलटाइम स्पीच चैट
स्पीच चैट एक अलग रियलटाइम मॉडल का उपयोग करता है जो एक लाइव बातचीत में सुनना और जवाब देना दोनों को जोड़ता है। OpenAI के लिए AI-Public डिफ़ॉल्ट रूप से GPT-Realtime 2.1 का उपयोग करता है। GPT-Realtime 1.5 या GPT-Realtime 2 वाले मौजूदा सेटिंग्स स्वचालित रूप से इस संस्करण में अपडेट हो जाते हैं। Google के लिए रियलटाइम स्पीच कॉन्फ़िगर होने पर Gemini Live वैकल्पिक रूप में उपलब्ध रहता है।
प्राथमिक भाषा और समर्थन भाषा
एक स्पीच असिस्टेंट में सेट की गई भाषा निर्धारित करती है कि असिस्टेंट मुख्य रूप से किस भाषा में बोलेगा। उपयोगकर्ता की इंटरफ़ेस भाषा समर्थन भाषा के रूप में उपलब्ध रहती है। उदाहरण के लिए, कोई व्यक्ति स्पेनिश में बातचीत का अभ्यास कर सकता है और अपनी भाषा में संक्षिप्त स्पष्टीकरण मांग सकता है। उसके बाद असिस्टेंट फिर से स्पेनिश में स्विच कर जाता है।
एक स्वयं निर्मित स्पीच असिस्टेंट अपनी पूरी कॉन्फ़िगरेशन लोड करता है, जिसमें सिस्टम प्रॉम्प्ट, भाषा, आवाज़, फ़ाइलें और टूल सेटिंग्स शामिल हैं। आप सिस्टम प्रॉम्प्ट का उपयोग बातचीत के कार्य, वांछित स्तर और प्रतिक्रिया देने के तरीके को निर्धारित करने के लिए कर सकते हैं।
स्पीच चैट के दौरान टूल्स
स्पीच असिस्टेंट्स, उनके पर्यावरण और सेटिंग्स के आधार पर, इंटरनेट जानकारी, मैनुअल, पिछली चैट्स, मौसम और विकिपीडिया जैसे केवल-पढ़ने वाले टूल्स का स्वचालित उपयोग कर सकते हैं। असिस्टेंट फॉर्म में आप उपयुक्त टूल को चालू या बंद कर सकते हैं। चालू टूल स्वचालित पर होता है: असिस्टेंट तब निर्णय लेता है कि उपयोग कब उपयोगी होगा।
एक स्पीच मॉडल क्या निर्धारित करता है
एक स्पीच मॉडल यह निर्धारित करता है कि टेक्स्ट कैसे उच्चारित किया जाएगा और कौन-कौन से विकल्प उपलब्ध होंगे। उदाहरण के लिए:
- उपलब्ध आवाज़ें;
- एक आवाज़ किन भाषाओं का समर्थन करती है;
- उच्चारण की गुणवत्ता और स्वाभाविकता;
- गति, टोन, उच्चारण और लहजे के निर्देशों का पालन करने का तरीका।
आवाज़ें और भाषाएँ
उपलब्ध आवाज़ें प्रदाता के अनुसार भिन्न होती हैं। AI-Public टेक्स्ट से ऑडियो में केवल उन आवाज़ों को दिखाता है जो चुनी गई भाषा के लिए परीक्षण की गई हैं, या जो प्रदाता द्वारा बहुभाषी के रूप में चिह्नित हैं। यदि कोई आवाज़ केवल कुछ भाषाओं के लिए है, तो वह भाषा आवाज़ के साथ सूचीबद्ध होती है।
OpenAI और Google कैटलॉग में अधिकांश भाषाओं का समर्थन करते हैं। Voxtral Mini TTS कई भाषाओं को संभाल सकता है, लेकिन वर्तमान आवाज़ कैटलॉग में अंग्रेज़ी और फ्रेंच के लिए परीक्षण की गई आवाज़ें शामिल हैं। इसलिए यह मॉडल डिफ़ॉल्ट रूप से एक उपयुक्त अंग्रेज़ी संयोजन के साथ शुरू होता है और इसे चुपचाप डच टेक्स्ट से जोड़ा नहीं जाता। यदि चुनी गई भाषा के लिए कोई परीक्षण की गई आवाज़ उपलब्ध नहीं है, तो AI-Public एक चेतावनी दिखाता है और आप किसी अन्य भाषा या स्पीच मॉडल का चयन कर सकते हैं।
किसी अन्य भाषा की आवाज़ विदेशी लहजे का कारण बन सकती है। ऐसी क्रॉस-लिंगुअल आवाज़ कभी भी डिफ़ॉल्ट या सहेजे गए प्राथमिकता के रूप में स्वचालित रूप से उपयोग नहीं की जाती। तकनीकी कनेक्शन केवल स्पष्ट रूप से इस गुणवत्ता फॉलबैक का अनुरोध कर सकते हैं।
सिस्टम प्रॉम्प्ट
टेक्स्ट से ऑडियो में सिस्टम प्रॉम्प्ट का उपयोग उच्चारण और शैली को नियंत्रित करने के लिए किया जा सकता है। AI-Public इसके लिए भाषा-उपयुक्त मूल निर्देश भरता है। डच के लिए यह डच स्वर, ज़ोर, लय और स्वर के बिना अंग्रेज़ी लहजे की मांग करता है। जैसे शब्द AI, AI-Public, ChatGPT और OpenAI अंग्रेज़ी उच्चारण रख सकते हैं और Claude को फ्रेंच नाम के रूप में उच्चारित किया जाता है। आप निर्देश को गति, टोन या किसी विशिष्ट लक्षित समूह के लिए समायोजित कर सकते हैं।
ऑडियो गुणवत्ता और फॉलबैक
OpenAI, Google और Mistral द्वारा उत्पन्न ऑडियो की जांच की जाती है और इसे मानकीकृत PCM16-WAV फ़ाइल के रूप में संग्रहीत किया जाता है। तकनीकी मेटाडेटा में सैंपल दर, चैनल संख्या, भाषा, आवाज़ और गुणवत्ता मार्ग शामिल हैं। इससे ऑडियो गुणवत्ता नियंत्रित रहती है और एक असामान्य प्रदाता प्रतिक्रिया को बिना ध्यान दिए किसी अन्य ऑडियो फ़ॉर्मेट के रूप में संग्रहीत नहीं किया जाता।
मौजूदा टेक्स्ट के लिए पढ़ने का बटन ब्राउज़र या डिवाइस की सिस्टम आवाज़ का भी उपयोग कर सकता है। यह फॉलबैक गुणवत्ता के रूप में दिखाई देता है। एप्लिकेशन संभव हो तो भाषा के अनुरूप सिस्टम आवाज़ चुनता है, लेकिन उच्चारण और उपलब्धता डिवाइस के अनुसार भिन्न हो सकते हैं।
प्राथमिकताएँ
उपयोगकर्ता अपनी टेक्स्ट-टू-ऑडियो सेटिंग्स को व्यक्तिगत प्राथमिकता के रूप में सहेज सकते हैं। इससे मॉडल, भाषा, आवाज़ और उच्चारण निर्देश बार-बार चुनने की आवश्यकता नहीं रहती।