AI 音频与语音
语音合成、声音克隆、音乐生成与音频降噪修复。
4 个工具
- ElevenLabs该品类中输出最自然的语音合成与声音克隆工具。官网:elevenlabs.io$5/月起
- Descript通过编辑文字稿来剪辑视频和播客。官网:descript.com$15/月起
- Suno根据文字描述生成包含配乐、人声和歌词的完整歌曲。官网:suno.com$8/月起
- Otter.ai会议转录,带发言人标注与自动摘要。官网:otter.ai$17/月起
四种基本不相关的技术共用这个标签:把文字变成语音、克隆某个特定的声音、生成音乐、修复录音。它们成熟度不同,更要紧的是法律基础也不同。语音合成和音频修复已经稳定、有用且没什么争议;声音克隆和音乐生成则既不稳定也不是没有争议。
挑选时该看什么
做旁白,请听长样本,别听短样本
每家厂商的演示片段听起来都不错。真正把这类工具区分开的是几分钟之后的表现:节奏是否还自然、遇到人名或缩写处理得是否得体、重音有没有落在意思所在的地方。做决定前先用你自己的稿子生成两分钟 —— 那些让听众关掉的毛病,十五秒里是听不出来的。
声音克隆需要同意,而且往往不止同意
未经许可克隆某人的声音,从不道德到违法都有可能,取决于你在哪里,而且已有若干司法辖区专门就此立法。正规工具会要求你验证对某个声音拥有权利。如果一个工具完全不问,那是关于这家公司的警告信号,而不是省事。
音乐生成:读许可条款,然后再读一遍
你能否商用生成的音乐、厂商是否保留权利、如果某段旋律与已有作品相似会怎样 —— 这些在不同服务和不同档位之间差别很大。对任何要发布或用于变现的东西,许可条款比输出好不好听更重要。
什么时候你其实不需要
音频修复值得一提,它是这里安静的赢家:去背景噪声、平衡电平、修复一段糟糕的录音,这些任务上这类工具稳定地表现优秀,而且没什么风险。如果你只有一个音频问题要解决,通常就是这一个,而不是合成。
