语音与音乐
音频模型
文本转语音、语音与音乐生成模型——从富有表现力的旁白到可直接发布的歌曲与商用安全音频。
Suno
Suno v5.5
领先的 AI 音乐生成器,能产出完整、可直接上电台的歌曲——自然人声、真实歌曲结构、声音克隆与 30+ 流派,仅需一条文本提示。
免费档 · 付费 Pro 与 Premier 方案
ACE Studio / StepFun 开源
ACE-Step
开源的整曲生成器——免费、可自托管、带人声的音乐,可在单块消费级 GPU 上运行。
免费(开源,自托管)
ElevenLabs
ElevenLabs v3
业界标准的文本转语音模型——最具表现力、情感丰富的语音合成,支持 70+ 语言与多说话人对话。
约 $0.12 / 分钟(v3) · Flash/Turbo 约 $0.06 / 分钟
MiniMax
MiniMax Speech 2.8
名列前茅的文本转语音模型——富表现力、多语言的语音合成,支持快速声音克隆与庞大的内置音色库。
经 MiniMax 平台按用量计费(随用量而异)
ElevenLabs
ElevenLabs Music v2
商用最安全的 AI 音乐生成器——与唱片公司及出版商合作打造,支持逐段编辑、完整 API 与录音室级导出。
$11 / 月(30 首)至 $99 / 月(Scale,含 API)
Google
Lyria 3
Google DeepMind 的音乐生成模型——最长三分钟的高保真 48kHz 音频,通过 Vertex AI 与 Gemini API 提供。
经 Vertex AI / Gemini API(按用量计费)
Stability AI
Stable Audio 2.5
Stability 的音乐与声音模型——快速、商用已清权的器乐曲目与声音设计,配企业友好的 API。
经 Stability AI 订阅 / API(按用量计费)
Udio
Udio v4
AI 音乐工具中的音质领跑者——48kHz 渲染、同类最干净的乐器分离,面向电影与品牌级音乐。
约 $10 / 月(Standard) · 约 $30 / 月(Pro)