Stability AI发布可运行在智能手机上的音频生成模型

摘要：AI初创公司 Stability AI 推出了 Stable Audio Open Small，一款“立体声”音频生成 AI 模型。公司宣称该模型是市场上速度最快的，同时高效到足以在智能手机上运行。

AI初创公司 Stability AI 推出了 Stable Audio Open Small，一款“立体声”音频生成 AI 模型。公司宣称该模型是市场上速度最快的，同时高效到足以在智能手机上运行。

Stable Audio Open Small 是 Stability AI 与处理器制造商 Arm 合作的结晶。Arm 生产许多平板、手机及其他移动设备内的处理器。虽然已有不少利用 AI 技术生成音频的应用（如 Suno 和 Udio），但大多数依赖云端处理，这意味着它们无法离线使用。

Stability 同时宣称，Stable Audio Open Small 的训练数据集完全由免版权音频库 Free Music Archive 和 Freesound 中的歌曲构成。这与前述 Suno 和 Udio 的训练数据集形成了对比，后者据称包含受版权保护的内容，从而带来知识产权风险。

Stable Audio Open Small 拥有 341 百万个参数，并经过针对 Arm CPU 的优化。（参数，有时也称作“权重”，是指导模型行为的内部组件。）该模型专为快速生成短音频样本和音效（例如，鼓点及乐器即兴旋律）而设计。Stability AI 表示，它可以在智能手机上于不到 8 秒内生成多达 11 秒的音频。

该模型并非没有局限性。Stable Audio Open Small 目前仅支持英文提示，并且 Stability 在其文档中指出，该模型无法生成逼真的人声或高质量的歌曲。Stability 警告称，模型在不同音乐风格上的表现也存在差异，这主要是由于训练数据偏向西方音乐所致。

对于开发者而言，另一个潜在问题在于 Stable Audio Open Small 的使用条款较为严格。研究人员、爱好者以及年收入不足 100 万美元的企业可以免费使用，但开发者和年收入超过 100 万美元的组织则必须支付 Stability 的企业许可费用。

作为背后支持的公司，Stability 以其热门图像生成模型 Stable Diffusion 闻名。去年，在包括 Eric Schmidt 和 Napster 创始人 Sean Parker 在内的投资者试图扭转局面时，Stability 获得了新一轮资金。据称，该公司联合创始人及前 CEO Emad Mostaque 管理不善，导致公司陷入财务困境、员工纷纷辞职、与 Canva 的合作流产，以及投资者对公司前景日益担忧。

在过去几个月中，Stability 已聘请新 CEO，并邀请电影制片人 James Cameron 加入董事会，同时发布了数款全新的图像生成模型。

来源：至顶网一点号

标签：模型智能音频 stability stabilityai

本文地址：https://news.43u.com.cn/a/1590994.html

免责声明：本站系转载，并不代表本网赞同其观点和对其真实性负责。如涉及作品内容、版权和其它问题，请在30日内与本站联系，我们将在第一时间删除内容!