A5站长网9月30日消息,语音技术公司ElevenLabs发布新一代语音生成模型Eleven v4以及同代的Turbo版本。官方把它称作目前为止表达力最强的一代,主打的是同一段文字该怎么说——语速、情绪、停顿、口音——而不再只是把字念清楚。两款模型即日起通过ElevenCreative、ElevenAgents与ElevenAPI对外提供。
语言覆盖面是这次提升最直观的一项。两款模型都支持九十多种语言,上一代是七十种,官方特别提到日语、巴西葡萄牙语、普通话与粤语的自然度改善明显。语音克隆的门槛也降下来了:即时语音克隆现在拿十秒音频就能录下一个声音,而且用一门语言录的素材,可以直接去说其他语言,同时保留原说话人的身份,口音朝母语者靠拢,不会在长句里慢慢漂回原来的口音。
表现控制上,Eleven v4允许把表演指令直接写进文本。笑声、耳语、情绪与节奏提示、口音要求,甚至雨声、门铃这类音效,都能用方括号标出来,由模型按标记演出。单次请求最多可以处理一万个字符,大约是十分钟音频,长内容里的节奏与音色能够保持一致;多说话人对话会结合上下文判断每一句该怎么处理,而不是把每行当成孤立的一段。上一代缺席的专业语音克隆也回来了。
面向实时语音代理的是Turbo版本。官方给出的中位推理延迟约一百毫秒,从请求到听到第一段语音约一百五十毫秒,作为对比,同业Cartesia的Sonic3.6约二百六十二毫秒,OpenAI的GPT-4o mini TTS约八百一十四毫秒。Turbo会在底层模型生成文字的同时就开始播音频,用来消除对话里的停顿感,客服场景中升级、等待与冲突语气也在适配范围之内。
生态这边,Adobe已经把ElevenLabs的声音接进Firefly的语音生成功能,Spotify也在和它合作制作AI旁白有声书。官方援引第三方盲测结果称,其在语音竞技榜单上的偏好度排在前列。听得出差别的地方,主要落在长篇幅、多语言以及需要演出感的内容上,短句演示里各家模型的差距其实没那么明显。
十秒素材就能复刻一个声音,对做有声书、游戏角色与本地化配音的团队来说是一次效率提升,同时也意味着声音被冒用的门槛跟着降低,配音与虚拟主播这类以声音为资产的行当感受最直接。模型能力公开之后,怎么界定授权与使用的边界,会和技术本身一样重要。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
