Stable-Audio-2.0

Stable-Audio-2.0是基于文本生成高质量音乐和音效的API,支持生成最长3分钟的44.1kHz立体声音频。

本页面仅提供API测试,调用的API服务由 Stability AI 提供,用量购买及管理请前往其官网。浏览器直调API,易源不做代理转发。

Stable Audio 2.0 功能体验

密钥仅在浏览器端存储,易源不做转发

生成参数

创意自由 7 严格匹配

功能示例

文本生成背景音乐

咖啡馆爵士背景音乐

输入: 轻松的爵士风格背景音乐,包含钢琴、低音贝斯和轻柔的鼓点

输出: 30秒舒缓爵士背景音乐,钢琴为主旋律,营造轻松惬意氛围

音频风格转换

木吉他旋律转摇滚

输入: 木吉他旋律片段,转为激昂摇滚风格,加入电吉他和架子鼓

输出: 45秒激昂摇滚改编曲,保留原旋律核心,风格热烈奔放

文本生成音效

卡通风格跑步音效

输入: 卡通风格欢快跑步音效,包含木琴、铃铛声和小鼓点

输出: 10秒卡通跑步音效,节奏活泼跳跃,适合儿童动画场景

古典音乐现代化

莫扎特小夜曲电子改编

输入: 将莫扎特《小夜曲》改编为现代电子舞曲,加入合成器和4/4拍鼓点

输出: 60秒电子舞曲改编版,古典与现代风格融合自然

环境音乐生成

冥想放松助眠音乐

输入: 冥想放松音乐,包含自然雨声、柔和钢琴和弦和悠远长笛

输出: 5分钟冥想放松音乐,音量渐弱,帮助快速进入平静状态

音效设计

短视频转场音效

输入: 短促电子脉冲音,带有"咻"的上升滑音,适合视频场景切换

输出: 2秒紧凑转场音效,增强视频镜头切换动感

使用场景

视频内容创作

为短视频、广告和电影片段快速生成匹配场景的背景音乐和音效,提升内容吸引力。

游戏开发

生成游戏角色动作音效、场景背景音乐和互动反馈音,丰富游戏音频体验。

播客与音频节目

为播客、有声书和音频广告创建过渡音乐、片头片尾曲和情绪背景音乐。

移动应用开发

为各类应用程序生成UI交互音效、通知提示音和场景背景音乐,提升用户体验。

电商与广告

为产品展示视频、促销广告和品牌内容定制独特背景音乐,增强品牌识别度。

教育与儿童内容

为教育视频、儿童故事和互动学习应用创建适合儿童的音乐和音效,提升趣味性。

价格信息

价格由API服务商Stability AI设定,具体定价方案和用量管理请参考官方文档获取最新信息。

查看官方价格详情

常见问题

生成的音频最长可以达到多久?

Stable-Audio-2.0支持生成最长3分钟(190秒)的音频文件,采样率为44.1kHz的立体声,确保高质量的音频输出。

支持哪些音频输出格式?

目前API支持两种主流音频格式:MP3和WAV。MP3格式文件体积较小,适合网络传输;WAV格式为无损音频,质量更高但文件体积较大。

如何提高生成音频与文本描述的匹配度?

可以通过调整cfg_scale参数来控制匹配程度,取值范围为1-25。较高的值(如10-15)会使生成结果更严格匹配文本描述,较低的值则会增加创造性。同时,提供详细、具体的文本描述也能显著提高匹配度。

音频生成需要多长时间?

生成时间取决于音频时长和采样步数,通常30秒音频需要3-5秒,3分钟的最大长度音频可能需要20-30秒。采样步数越多,生成质量越高,但所需时间也越长。

是否可以基于现有音频进行修改?

是的,Stable-Audio-2.0提供音频转音频功能,可以上传现有音频作为起点,通过文本描述指导风格转换,同时通过strength参数(0-1)控制原音频的影响程度。

生成的音频是否有版权问题?

根据Stability AI的使用条款,使用API生成的音频归用户所有,可用于商业和非商业项目。但请注意,不要使用受版权保护的材料作为输入或在提示中提及受版权保护的内容。