Ana içeriğe atla

Metinden Sese Modeller

AI-Public, metni sese dönüştürmek için metinden sese modelleri destekler. Bu modeller, kontrol panelindeki Metinden sese ve sohbetten ses üreten işlevlerde kullanılır.

Mevcut katalog

SağlayıcıModelAçıklama
OpenAIGPT-4o mini TTSTon ve stil üzerinde iyi kontrol ile doğal seslendirme.
GoogleGemini 3.1 Flash TTS ÖnizlemeStil, tempo ve ton üzerinde hassas kontrol sağlayan yeni Gemini ses modeli.
Avrupa AIVoxtral Mini TTSMistral Voxtral Mini tabanlı Avrupa metinden sese modeli.

Claude'un katalogda kendi metinden sese modeli yoktur. Claude sağlayıcı olarak etkinleştirildiğinde, ses modelleri diğer yapılandırılmış sağlayıcılara bağlı kalır.

Gerçek zamanlı sesli sohbet

Sesli sohbet, dinleme ve yanıt vermeyi tek bir canlı görüşmede birleştiren ayrı bir gerçek zamanlı model kullanır. OpenAI için AI-Public varsayılan olarak GPT-Realtime 2.1 kullanır. GPT-Realtime 1.5 veya GPT-Realtime 2 ile mevcut ayarlar otomatik olarak bu sürüme güncellenir. Google gerçek zamanlı ses için yapılandırıldığında Gemini Live alternatif olarak kullanılmaya devam eder.

Birincil dil ve destek dili

Bir sesli asistanda ayarlanan dil, asistanın öncelikle hangi dilde konuşacağını belirler. Kullanıcı arayüz dili ise destek dili olarak kullanılmaya devam eder. Örneğin biri İspanyolca bir konuşma pratiği yapabilir ve kısa süreli kendi dilinde açıklama isteyebilir. Ardından asistan tekrar İspanyolcaya döner.

Kendi oluşturduğunuz sesli asistan, sistem istemi, dil, ses, dosyalar ve araç ayarları dahil tüm yapılandırmasını yükler. Sistem istemini, konuşma görevini, istenen seviyeyi ve geri bildirim verme şeklini belirlemek için kullanabilirsiniz.

Sesli sohbet sırasında araçlar

Sesli asistanlar, ortam ve ayarlarına bağlı olarak, internet bilgisi, kullanım kılavuzu, önceki sohbetler, hava durumu ve Wikipedia gibi yalnızca-okuma araçlarını otomatik olarak kullanabilir. Asistan formunda uygun bir aracı açıp kapatabilirsiniz. Etkinleştirilen araç Otomatik konumundadır: asistan ne zaman kullanmanın faydalı olduğuna kendisi karar verir.

Bir ses modelinin belirledikleri

Bir ses modeli, metnin nasıl telaffuz edileceğini ve hangi özelliklerin kullanılabilir olduğunu belirler. Örneğin:

  • mevcut sesler;
  • bir sesin desteklediği diller;
  • telaffuzun kalitesi ve doğallığı;
  • tempo, ton, aksan ve telaffuz talimatlarının nasıl uygulandığı.

Sesler ve diller

Mevcut sesler sağlayıcıya göre değişir. AI-Public, metinden sese yalnızca seçilen dil için test edilmiş sesleri veya sağlayıcı tarafından çok dilli olarak işaretlenmiş sesleri gösterir. Bir ses yalnızca belirli diller içinse, o dil sesin yanında belirtilir.

OpenAI ve Google katalogdaki çoğu dili destekler. Voxtral Mini TTS birden fazla dili işleyebilir, ancak mevcut ses kataloğu İngilizce ve Fransızca için test edilmiş sesler içerir. Bu nedenle model varsayılan olarak uygun bir İngilizce kombinasyonla başlar ve sessizce Hollandaca metne bağlanmaz. Seçilen dil için test edilmiş bir ses yoksa, AI-Public bir uyarı gösterir ve başka bir dil veya ses modeli seçmenizi ister.

Başka bir dilden bir ses, yabancı aksan oluşturabilir. Böyle çapraz-dilli bir ses asla otomatik olarak varsayılan veya kaydedilmiş tercih olarak kullanılmaz. Teknik bağlantılar bu kalite geri dönüşünü yalnızca açıkça talep edebilir.

Sistem istemi

Metinden sese için sistem istemi, telaffuz ve stili yönlendirmek için kullanılabilir. AI-Public bunun için dil uyumlu temel bir talimat doldurur. Hollandaca için bu, İngiliz aksanı olmadan Hollandaca ünlüler, vurgu, ritim ve intonasyon ister. AI, AI-Public, ChatGPT ve OpenAI gibi terimler İngilizce telaffuzda kalabilir ve Claude Fransızca isim olarak telaffuz edilir. Talimatı tempo, ton veya belirli bir hedef kitle için değiştirebilirsiniz.

Ses kalitesi ve geri dönüş

OpenAI, Google ve Mistral tarafından oluşturulan sesler kontrol edilir ve standartlaştırılmış PCM16-WAV dosyası olarak kaydedilir. Teknik meta veriler örnekleme frekansı, kanal sayısı, dil, ses ve kalite yolu gibi bilgileri içerir. Böylece ses kalitesi kontrol edilebilir kalır ve farklı bir sağlayıcı yanıtı fark edilmeden başka bir ses formatı olarak kaydedilmez.

Mevcut metindeki okuma düğmesi ayrıca tarayıcı veya cihazın sistem sesini kullanabilir. Bu geri dönüş kalitesi olarak görünür. Uygulama mümkün olduğunda dile uygun bir sistem sesi seçer, ancak telaffuz ve kullanılabilirlik cihazdan cihaza değişebilir.

Tercihler

Kullanıcılar metinden sese ayarlarını kişisel tercih olarak kaydedebilir. Böylece model, dil, ses ve telaffuz talimatlarını her seferinde yeniden seçmek zorunda kalmazlar.

WhatsApp