语音与音乐

音频模型

文本转语音、语音与音乐生成模型——从富有表现力的旁白到可直接发布的歌曲与商用安全音频。

Suno

Suno v5.5

领先的 AI 音乐生成器,能产出完整、可直接上电台的歌曲——自然人声、真实歌曲结构、声音克隆与 30+ 流派,仅需一条文本提示。

免费档 · 付费 Pro 与 Premier 方案
ACE Studio / StepFun 开源

ACE-Step

开源的整曲生成器——免费、可自托管、带人声的音乐,可在单块消费级 GPU 上运行。

免费(开源,自托管)
ElevenLabs

ElevenLabs v3

业界标准的文本转语音模型——最具表现力、情感丰富的语音合成,支持 70+ 语言与多说话人对话。

约 $0.12 / 分钟(v3) · Flash/Turbo 约 $0.06 / 分钟
MiniMax

MiniMax Speech 2.8

名列前茅的文本转语音模型——富表现力、多语言的语音合成,支持快速声音克隆与庞大的内置音色库。

经 MiniMax 平台按用量计费(随用量而异)
ElevenLabs

ElevenLabs Music v2

商用最安全的 AI 音乐生成器——与唱片公司及出版商合作打造,支持逐段编辑、完整 API 与录音室级导出。

$11 / 月(30 首)至 $99 / 月(Scale,含 API)
Google

Lyria 3

Google DeepMind 的音乐生成模型——最长三分钟的高保真 48kHz 音频,通过 Vertex AI 与 Gemini API 提供。

经 Vertex AI / Gemini API(按用量计费)
Stability AI

Stable Audio 2.5

Stability 的音乐与声音模型——快速、商用已清权的器乐曲目与声音设计,配企业友好的 API。

经 Stability AI 订阅 / API(按用量计费)
Udio

Udio v4

AI 音乐工具中的音质领跑者——48kHz 渲染、同类最干净的乐器分离,面向电影与品牌级音乐。

约 $10 / 月(Standard) · 约 $30 / 月(Pro)