テキスト読み上げモデル
AI-Publicはテキストを音声に変換するテキスト読み上げモデルをサポートしています。これらのモデルは、ダッシュボードのテキストから音声へ機能やチャットから音声を生成する機能で使用されます。
現在のカタログ
| 提供者 | モデル | 備考 |
|---|---|---|
| OpenAI | GPT-4o mini TTS | 自然な発話で、トーンやスタイルの制御が優れています。 |
| Gemini 3.1 Flash TTS Preview | 新しいGemini音声モデルで、スタイル、速度、トーンの正確な制御が可能です。 | |
| 欧州AI | Voxtral Mini TTS | Mistral Voxtral Miniに基づく欧州のテキスト読み上げモデル。 |
Claudeはカタログに独自のテキスト読み上げモデルを持っていません。Claudeが提供者として有効になっている場合、音声モデルは他に設定されている提供者に依存します。
リアルタイム音声チャット
音声チャットは、聞き取りと応答を1つのライブ会話で組み合わせる専用のリアルタイムモデルを使用します。OpenAIの場合、AI-PublicはデフォルトでGPT-Realtime 2.1を使用します。既存のGPT-Realtime 1.5またはGPT-Realtime 2の設定は自動的にこのバージョンに更新されます。Googleがリアルタイム音声に設定されている場合は、代替としてGemini Liveも利用可能です。
主言語とサポート言語
音声アシスタントでは、設定された言語が主に話す言語を決定します。ユーザーのインターフェース言語はサポート言語として引き続き利用可能です。例えば、スペイン語で会話を練習しつつ、短く自分の言語で説明を求めることができます。その後、アシスタントは再びスペイン語に戻ります。
自作の音声アシスタントは、システムプロンプト、言語、声、ファイル、ツール設定などの完全な構成を読み込みます。システムプロンプトを使って会話のタスク、望ましいレベル、フィードバックの方法を指定できます。
音声チャット中のツール
音声アシスタントは環境や設定に応じて、インターネット情報、マニュアル、過去のチャット、天気、Wikipediaなどの読み取り専用ツールを自動的に使用できます。アシスタントフォームで適切なツールをオンまたはオフにできます。有効なツールは自動に設定され、アシスタントが使用のタイミングを判断します。
音声モデルが決定すること
音声モデルは、テキストの発音方法や利用可能な機能を決定します。例えば:
- 利用可能な声の種類
- 声が対応する言語
- 発音の品質と自然さ
- 速度、トーン、アクセント、発音に関する指示の遵守方法
声と対応言語
利用可能な声は提供者によって異なります。AI-Publicはテキストから音声への変換で、選択された言語に対してテスト済みの声、または提供者が多言語対応とした声のみを表示します。特定の言語向けの声には、その言語が声の説明に記載されています。
OpenAIとGoogleはカタログ内のほとんどの言語をサポートしています。Voxtral Mini TTSは複数言語を処理できますが、現在の声カタログには英語とフランス語のテスト済み声のみが含まれています。そのため、このモデルはデフォルトで適切な英語の組み合わせで開始し、オランダ語テキストに対しては自動的に割り当てられません。選択した言語にテスト済みの声がない場合、AI-Publicは警告を表示し、別の言語または音声モデルを選択するよう促します。
異なる言語の声は外国語アクセントを生じる可能性があります。そのため、そのようなクロスリンガルな声は標準や保存された優先設定として自動的に使用されることはありません。技術的な連携でのみ明示的にこの品質のフォールバックを要求できます。
システムプロンプト
テキストから音声への変換では、システムプロンプトを使って発音やスタイルを制御できます。AI-Publicは言語に適した基本指示を自動で補完します。オランダ語の場合は、英語アクセントのないオランダ語の母音、強勢、リズム、イントネーションを求めます。AI、AI-Public、ChatGPT、OpenAIなどの用語は英語発音のままでよく、Claudeはフランス語の名前として発音されます。速度、トーン、特定の対象者向けなどに合わせて指示を調整可能です。
音声品質とフォールバック
OpenAI、Google、Mistralから生成された音声は検査され、標準化されたPCM16-WAVファイルとして保存されます。技術的なメタデータにはサンプルレート、チャンネル数、言語、声、品質ルートなどが含まれます。これにより音声品質の管理が可能で、異なる提供者の応答が別の音声フォーマットとして誤って保存されることを防ぎます。
既存テキストの読み上げボタンは、ブラウザやデバイスのシステム音声を使用することもあります。これはフォールバック品質として表示されます。アプリケーションは可能な限り言語に合ったシステム音声を選択しますが、発音や利用可能性はデバイスによって異なる場合があります。
設定の保存
ユーザーはテキストから音声への設定を個人の好みとして保存できます。これにより、モデル、言語、声、発音指示を毎回選択する必要がなくなります。