文本转语音模型
AI-Public 支持文本转语音模型,可将文本转换为音频。这些模型用于仪表板上的文本转音频功能以及从聊天生成音频的功能。
当前目录
| 提供商 | 模型 | 备注 |
|---|---|---|
| OpenAI | GPT-4o mini TTS | 自然语音,具有良好的语调和风格控制。 |
| Gemini 3.1 Flash TTS Preview | 新的 Gemini 语音模型,精确控制风格、语速和语调。 | |
| 欧洲 AI | Voxtral Mini TTS | 基于 Mistral Voxtral Mini 的欧洲文本转语音。 |
Claude 在目录中没有自己的文本转语音模型。如果启用了 Claude 作为提供商,语音模型将依赖于其他已配置的提供商。
实时语音聊天
语音聊天使用一个独立的实时模型,将听和答结合在一个实时对话中。对于 OpenAI,AI-Public 默认使用 GPT-Realtime 2.1。现有使用 GPT-Realtime 1.5 或 GPT-Realtime 2 的设置会自动升级到此版本。当配置了 Google 实时语音时,Gemini Live 仍作为替代方案可用。
主要语言和辅助语言
语音助手的设置语言决定助手主要使用的语言。用户界面语言则作为辅助语言保持可用。例如,用户可以用西班牙语练习对话,并偶尔用自己的语言请求解释。之后助手会切换回西班牙语。
自定义语音助手会加载其完整配置,包括系统提示、语言、声音、文件和工具设置。你可以使用系统提示来定义对话任务、期望水平和反馈方式。
语音聊天中的工具
语音助手可根据环境和设置,自动使用只读工具,例如互联网信息、手册、历史聊天、天气和维基百科。在助手表单中,你可以开启或关闭合适的工具。启用的工具显示为 自动:助手会自行决定何时使用最有用。
语音模型决定的内容
语音模型决定文本的发音方式及可用功能。例如:
- 可用的声音;
- 声音支持的语言;
- 发音的质量和自然度;
- 对语速、语调、口音和发音指令的执行方式。
声音和语言
可用声音因提供商而异。AI-Public 在文本转音频时仅显示已测试的所选语言声音,或被提供商标记为多语言的声音。如果声音仅适用于特定语言,则该语言会在声音旁标明。
OpenAI 和 Google 支持目录中的大多数语言。Voxtral Mini TTS 可处理多种语言,但当前声音目录仅包含经过测试的英语和法语声音。因此,该模型默认启动时使用合适的英语组合,不会默认匹配荷兰语文本。如果所选语言无测试声音,AI-Public 会显示警告,需选择其他语言或语音模型。
使用其他语言的声音可能带有外语口音。因此,这类跨语言声音不会自动作为默认或保存的偏好使用。技术接口只能显式请求此类质量回退。
系统提示
在文本转音频中,系统提示可用于控制发音和风格。AI-Public 会填写符合语言的基础指令。对于荷兰语,要求荷兰语元音、重音、节奏和语调,无英语口音。术语如 AI、AI-Public、ChatGPT 和 OpenAI 可保持英语发音,Claude 则按法语名发音。你可以调整指令以控制语速、语调或针对特定受众。
音频质量和回退
OpenAI、Google 和 Mistral 生成的音频会被检查,并以标准化的 PCM16-WAV 文件保存。技术元数据包括采样率、声道数、语言、声音和质量路径等。这样音频质量可控,异常提供商响应不会无声无息地保存为其他音频格式。
现有文本的朗读按钮也可使用浏览器或设备的系统声音,作为回退质量显示。应用会尽可能选择与语言匹配的系统声音,但发音和可用性因设备而异。
偏好设置
用户可以将文本转音频设置保存为个人偏好。这样无需每次都重新选择模型、语言、声音和发音指令。