声音复刻简介
声音复刻是火山引擎基于全自研豆包语音大模型打造的超轻量级音色定制方案,用户在开放环境中录制秒级别录音即可极速拥有专属定制音色。

声音复刻核心功能
秒级极速复刻:仅需在开放环境下录制最短5秒音频即可完成复刻,音频上传成功后秒级别完成模型复刻,几乎无等待时延,可立即调用合成试听。
高度还原真人音色:高度还原真人音色特点、说话风格、口音和声学环境。2.0版本对于高表现力声音,如口音、特色音色等,还原度进一步提升。
跨语种克隆:录制一个语种的声音,可支持中文、英语、日语、西班牙语(墨西哥口音)、葡萄牙语(巴西口音)、印尼语等多个语种的合成,让声音轻松说外语。
双版本可选:提供声音复刻1.0(秒级极速复刻,延迟低,适合对合成速度要求高的场景)和声音复刻2.0(复刻音色在合成时可灵活调控情感、语速等风格属性,适合对音色表现力要求高的场景)两个版本,价格相同。
低成本调优:每个音色可支持用户上传训练10次,如果上传的训练音频效果不满意,可以更换音频再次训练。
ICL在途学习技术:声音复刻ICL(In-Context Learning)技术仅需10-15秒的参考音频即可实现音色复刻。
音素级时间戳输出:支持输出音素级时间戳,配合数字人实现个性化形象定制能力。
声音复刻产品优势
超低录制成本:开放环境下录制最短5秒音频即可完成复刻,录制成本极低。
秒级完成复刻:音频上传成功后秒级别完成模型复刻,几乎无等待时延。
技术领先:全新大模型技术,使用全新自研算法,提供高品质的复刻能力,效果行业领先。
高自然度:区别传统复刻,机械感变弱,音调、韵律、节奏、情感等更接近真人表现。
跨语种迁移能力:即使用户仅会说中文,也可借助跨语言克隆技术,完成地道的英语、日语等语种表述。
多模型复用:购买的音色槽位支持各个模型的复用,不同模型无需重复下单购买。
行业领先的算法能力:豆包语音大模型为抖音持续提供行业领先算法能力及丰富配音服务。
声音复刻应用场景
视频配音:复刻特色声音,如IP、搞怪等特色化声音,为创作带来更多元更高效的方式,激发创作灵感。
数字人驱动:支持输出音素级时间戳,配合数字人实现个性化形象定制能力,实现形象+声音完整的个性化定制。
语音助手:复刻独具特色的品牌人机交互音色,例如家人朋友等,作为手机助手、导航语音、游戏趣味语音等,为用户提供独特的交互体验。
在线教育:复制老师音色,可以减少老师重复性、标准化讲解的工作,提升授课效能,降低老师长时间授课带来的咽喉损害。
有声阅读:快速复刻家人朋友的声音,用声音来实现“分身术”,随时随地给予用户亲切、温暖的阅读陪伴,为用户打造定制化的听书体验。
客户服务:实现高度拟人化的AI声音,通过复刻的AI音色与人工客服本人一致,毫无违和感。
声音复刻使用教程
准备工作
在开始使用声音复刻功能前,建议提前准备好一段用于复刻的参考音频。参考音频要求如下:
音频格式:支持小于3MB的WAV、MP3、M4A格式文件,推荐使用WAV格式。
音频时长:建议控制在10-30秒。
音频质量:避免多人对话、明显杂音、噪音、混响等情况。
使用流程
购买声音复刻资源:登录火山引擎控制台,在AI服务购买与管理页面选择声音复刻1.0或声音复刻2.0,设置购买数量后完成支付。每个声音复刻资源均有1年有效期。
训练并生成音色:在控制台“我的声音 > 复刻音色”页面选择音色版本(1.0或2.0),为当前声音设置名称,点击“复刻音色”按钮,通过上传或录制的方式提供一段音频,系统将基于该音频复刻出目标音色。
API调用:在音色库中获取声音ID(speakerid),在API Key管理中获取API Key,即可通过API调用复刻的音色进行语音合成。
训练音频Prompt设计要点
训练音频长度在10-15秒,过长的音频系统会自动截断。
尽可能选取低噪声、单人且人声效果较好的单轨音频(不用双声道录制)作为参考音频。
进一步的调优可以利用降噪等手段,保证音频人声的清晰度。
不要出现情感过大的起伏。
对于中英混情况,参考音频中最好能同时覆盖中英文。
声音复刻收费标准(以官方为准)
声音复刻为付费功能,采用音色槽位(预付费)与后付费相结合的计费模式。
预付费音色:在火山引擎控制台“开通管理-快速购买”页面选择音色槽位进行下单购买。购买的音色槽位支持各个模型的复用。音色槽位费用将在首次使用此复刻音色进行语音合成时收取。
后付费音色:需在控制台开通声音复刻2.0+音色服务,无需手动下单。
免费试用:新用户完成账号注册并认证后,可一键开通全部模型并获取免费试用礼包。创建应用后会免费赠送一定数量音色,能够进行15次训练以及可以合成20,000字符。
计费维度:按声音复刻次数计费,每次复刻收费。
优惠活动:新客首单可享低至3折活动。
具体价格及套餐详情以火山引擎官网(www.volcengine.com)公布为准。
声音复刻常见问题(FAQ)
声音复刻是什么? 声音复刻是火山引擎基于豆包语音大模型打造的超轻量级音色定制方案,用户在开放环境中录制秒级别录音即可快速拥有专属定制音色。
声音复刻需要录制多长时间的音频? 最低仅需录制5秒音频即可完成复刻。ICL版本建议使用10-15秒的参考音频以获得更佳效果。
声音复刻1.0和2.0有什么区别? 1.0版本支持秒级极速复刻、延迟低,适合对合成速度要求高的场景;2.0版本复刻音色在合成时可灵活调控情感、语速等风格属性,适合对音色表现力要求高的场景。
声音复刻支持哪些语种? 支持中文、英语、日语、西班牙语、印尼语、葡萄牙语等语种。跨语种克隆功能支持录制一个语种的声音合成多个语种。
声音复刻资源有效期是多久? 每个声音复刻资源均有1年有效期。
每个音色可以训练几次? 每个音色可支持用户上传训练10次,如果效果不满意可以更换音频再次训练。
合成声音中出现漏读、错读如何处理? 建议按照“prompt调优 → 合成文本切片段 → 尝试多次合成”的方式解决。
多音字读错如何处理? 可通过SSML标记语言进行快速修复。
合成声音的音质不佳怎么办? 一般而言是参考音频中含有底噪所致,建议选择低噪声、高质量的参考音频。对于更高质量的效果要求,可考虑使用精品超自然音色定制方案。



















皖公网安备34010202602243号