摘要:近日,上海独角兽企业MiniMax稀宇极智发布了新一代语音大模型Speech-02。这个大模型在两份国际权威语音评测榜单Artificial Analysis(人工分析)和Hugging Face TTS Arena(抱抱脸文本转语音竞技场)上,力压OpenA
近日,上海独角兽企业MiniMax稀宇极智发布了新一代语音大模型Speech-02。这个大模型在两份国际权威语音评测榜单Artificial Analysis(人工分析)和Hugging Face TTS Arena(抱抱脸文本转语音竞技场)上,力压OpenAI、ElevenLabs等国际巨头,排名双榜榜首。这意味着我国在人工智能语音生成领域已跻身国际领先行列。国外网民说:“它是音频领域游戏规则的改变者。”
据介绍,Speech-02在字错率、相似度等语音模型的核心指标上取得了SOTA(在特定任务或领域中表现最佳)结果。用户盲听的主观评价也很好,认为它生成的语音自然、真实。
与Seed-TTS、CosyVoice 2和真实音频相比,这个语音大模型在中英文的零样本语音克隆中均实现了更低的字错率,表明其发音错误率更低,且更清晰稳定。在相似度这个指标上,Speech-02在所有24种测试语言中均显著优于ElevenLabs的multilingual_v2模型,生成的语音更逼近真人输出。
国际权威语音评测榜单Artificial Analysis
基于泛化的模型能力,这个国产大模型为用户带来了超拟人、个性化、多样性的语音服务。通过“文生音”功能,它可根据自然语言文本描述,生成符合描述的音色;通过“声音参考”功能,可对任意给定语音进行灵活控制,完成感情、语速、音高和语种等无缝切换;同时支持粤语、葡萄牙语、法语等32个语种,在同一段语音里也可以实现多个语种间的自如切换。
值得关注的是,Speech-02的商用定价仅为全球头部语音模型ElevenLabs的四分之一。这大幅降低了企业采用先进语音AI技术的门槛,有望为智能客服、语音交互等领域带来变革。
Hugging Face TTS Arena 评测榜单
目前,MiniMax已在文旅导览、金融服务、语音助手和AI教育等领域提供应用服务,为AI玩具、教育学习机、汽车智能座舱等硬件场景打造了解决方案,与声网、阅文集团旗下起点读书、高途教育、香港电视台以及Hedra等海外机构达成了深度合作。
这家上海企业今年1月发布的Speech-01语音模型,支持17种语言和上百种音色,已在北美、英国、意大利、澳大利亚、日韩、巴西等20多个国家和地区落地合作。
“在海外,我们已支持大量内容创作者通过低门槛的语音工具,用自己的声音灵活接单,为广告、短片进行声音表演,赋能零工经济。”MiniMax海外生态负责人林达介绍,“这次发布的Speech-02能轻松驾驭32个语种的不同口音和不同情绪,我们相信通过AI和对小语种的支持,会将多语种的声音以当地最地道的发音传向全世界,帮助全球每一种语言都被听见、每一种文化都被理解。”
栏目主编:黄海华
来源:云中乔