仅用1/4数据量还原真人语音100%细节,火山语音上新超自然对话语音合成技术!
IT行业相对于一般传统行业,发展更新速度更快,一旦停止了学习,很快就会被行业所淘汰。所以我们需要踏踏实实的不断学习,精进自己的技术,尤其是初学者。今天golang学习网给大家整理了《仅用1/4数据量还原真人语音100%细节,火山语音上新超自然对话语音合成技术!》,聊聊,我们一起来看看吧!
数星星盼月亮,万千杰迷苦等6年,不久之前终于等到周董发新专辑啦!一经上线引爆全网讨论。
正当大家沉浸在对那时青葱岁月的美好追忆时,发布爆火音频的小伙伴表示:这段对话居然是语音合成的!
提到“语音合成”,你脑海中可能会出现这样的种种:
• 导航中种类丰富但语气机械的“前方路口左转”
• 接电话时,对面笨拙无感情的“您好,这里是xx信用卡中心”
• 视频网站上,十个解说视频九个声音相同,看到就想赶快划走的“注意看,这个男人叫小帅”…...
而如今直接颠覆了许多人的刻板印象,语音合成技术已经能做到像上面那段音频一样完美自然的效果了。这段音频的发布者——火山语音,字节跳动 AI Lab Speech & Audio 智能语音与音频团队,又通过两段音频更好地向大众解密里面的技术亮点。
这几句输入的文本完全相同,即 “南方菜系偏爱蘸料,例如我第一次去上海才知道烧烤里的蔬菜也需要配蘸料” ,但合成的音频效果却有明显差异,即第二段音频来源于火山语音团队本次上新的超自然对话语音合成技术。
回想一下人在日常表达时的状态,大脑处理信息是需要思考时间的。体现到语言上,人就会不由自主的出现一些犹豫、拖音、倒装,甚至是说了一半改口、结巴重复的情况,也会刻意加重读音强调想表达的重点信息。这就带来了大量难以观测的细微表达。这些现象在传统的TTS中难以被捕捉还原。而这些细微之处的完美复现正是让声音真假难辨的奥妙之源,也是上述音频的奥秘所在。
具体来说,火山语音团队最新发布的超自然对话语音合成技术相较传统TTS更加真实自然,即语气词、吸气声、犹豫时的停顿以及字音拖长等细节统统被完美复现,而且只需常规音库1/4数据,就可完美还原真人说话细微的韵律特点、发音口癖,让合成效果更加真实。有专业评测结果显示,火山语音的这项新技术与真人录音对比基本没有差距,难以被评测者分辨出来。此外这项技术目前已在视频配音、电话客服等多个场景投入应用,近日即将上线火山引擎语音技术官网对外露出。
这么厉害的技术,究竟是怎么办到的?
据介绍,上述这些在实际交流中经常出现的倒吸气、吞音、思考时不由自主的拖长字音、低笑等表现被称为副语言现象(paralanguage),尽管这是人脑思考、表达过程中最真实的表现,但由于传统的语音合成技术框架无法对分布稀疏的副语言现象进行有效建模,所以在说话时的韵律还原度表现有限、过于“正确”。
基于上述难点,火山语音超自然语音合成技术分别从文本和语音建模两个层面进行突破,具体来说:
• 在文本层面,火山语音采用了生成式的风格迁移模型,模仿真人说话的方式对文本进行可控的口语化转写,让文本更好地拥抱口语化,避免最终效果太过书面。
• 在语音层面,团队则是通过文本分析模型的突破,在TTS的输入侧额外增加了副语言预测,模仿真人的发音特点来实现自然自发的语音效果。
值得一提的是,团队通过使用无监督特征的TTS建模方案,有效提高了模型的稳定性与表现力,仅仅使用常规音库1/4的数据规模,就可以实现十分自然多变的韵律效果,很赞吧?

致力文本口语化 让“拟真人表达”跃然纸上
文本作为语音合成技术的输入,其风格是否贴近真人的表达方式,是合成效果提升的第一步;但受限于根深蒂固的书写用语习惯,大多数合成前的文本并不够自然,或者需要投入大量精力不断调整,费时费力。为了解决此类问题,火山语音团队采用了两阶段方案并取得了不错的效果:
• 阶段一:采用自监督方法,使用伪数据对口语化模型进行预训练,降低了数据量的需求;同时在模型中引入了指针网络结构,增强了文本可控性。
• 阶段二:利用少量优质的人工标注数据,对预训练好的口语化模型进行微调,最终实现可控的、自然的口语化文本效果。
原始文本 | 自动化预测后的文本 |
南方菜系偏爱蘸料,例如我第一次去上海才知道烧烤里的蔬菜也需要配蘸料 | 嗯,南方菜系的话,超级偏爱用蘸料啊什么的,就比如说我第一次呃,第一次去上海的时候,才知道这个烧烤里的蔬菜也得配着蘸料 |
像我们上街去买白菜,南方人说我要半颗白菜,北方人说我来半车白菜 | 嗯这跟我们上街买白菜差不多吧,南方人说我要半棵白菜,然后那个北方人说我来半车 |
其实南方菜系更偏重吃调料的味道,即厨师用调料去发挥他的功力 | 对,其实南方菜系更偏重的是吃它这个调料的味道,也就是说,厨师这个,用调料去发挥他的功力 |
副语言建模+韵律多样性可圈可点 语音真实感全面升级
为了更好地还原真人,区别于传统的语音合成技术,火山语音在副语言建模和韵律多样性上也分别进行了深入研究。在副语言建模方面,团队推出的合成技术实现了声学模型对自然表达中出现的吸气、笑声、犹豫、修正等多种副语言现象建模,并且结合文本的语义信息自动插入副语言现象。在插入过程中同时考虑合理性与随机性,表现更加自然真实。
文本 | 超自然 |
我觉得这样吸气>其实对身体特别好。 | 音频C.wav |
你看像我们现在这个工作,早上延长>基本上就不怎么吃早餐了。 | 音频D.wav |
像我们早上基本上卡顿>就是豆浆油条包子。 | 音频E.wav |
他肯定是口误修正>,很想吃肉。 | ParalangTest_is_000008_npy_01_new2的副本.wav |
“在韵律多样化的探究中,我们结合无监督表征学习技术,自主研发了高表现力的声学模型框架,通过发音、韵律、音色解耦等方式,不但降低了数据量的需求,实现对出现频率极低发音现象的高效建模;同时使用无监督表征特征并结合音素级别的基频、能量信息等,实现了韵律的自然多变,促成高质量对话语音生成。”火山语音团队总结道。

火山语音,字节跳动AI Lab Speech&Audio智能语音与音频团队,长期以来面向抖音、剪映、番茄小说、飞书等业务提供领先的AI语音技术能力及全栈语音产品解决方案,并通过火山引擎向外部企业开放技术服务。
今天关于《仅用1/4数据量还原真人语音100%细节,火山语音上新超自然对话语音合成技术!》的内容介绍就到此结束,如果有什么疑问或者建议,可以在golang学习网公众号下多多回复交流;文中若有不正之处,也希望回复留言以告知!
推理速度比Stable Diffusion快2倍;视觉Transformer统一图像文本
- 上一篇
- 推理速度比Stable Diffusion快2倍;视觉Transformer统一图像文本
- 下一篇
- 用户在更新到 macOS Monterey 12.3 后报告外部显示器问题
-
- 科技周边 · 人工智能 | 29分钟前 |
- Deepseek联手Descript,打造专业播客体验
- 445浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 |
- 2025AI视频生成趋势与创作前景解读
- 120浏览 收藏
-
- 科技周边 · 人工智能 | 1小时前 | 免费 功能 AI写作 入口 DeepSeekAI
- DeepSeekAI写作入口与免费链接分享
- 264浏览 收藏
-
- 科技周边 · 人工智能 | 2小时前 | Midjourney 提示词 高级参数 图像引导 未来城市景观
- MidJourney未来城市怎么画?
- 186浏览 收藏
-
- 科技周边 · 人工智能 | 2小时前 |
- Claude多语言翻译体验分享
- 289浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- ChatExcel酷表
- ChatExcel酷表是由北京大学团队打造的Excel聊天机器人,用自然语言操控表格,简化数据处理,告别繁琐操作,提升工作效率!适用于学生、上班族及政府人员。
- 3211次使用
-
- Any绘本
- 探索Any绘本(anypicturebook.com/zh),一款开源免费的AI绘本创作工具,基于Google Gemini与Flux AI模型,让您轻松创作个性化绘本。适用于家庭、教育、创作等多种场景,零门槛,高自由度,技术透明,本地可控。
- 3425次使用
-
- 可赞AI
- 可赞AI,AI驱动的办公可视化智能工具,助您轻松实现文本与可视化元素高效转化。无论是智能文档生成、多格式文本解析,还是一键生成专业图表、脑图、知识卡片,可赞AI都能让信息处理更清晰高效。覆盖数据汇报、会议纪要、内容营销等全场景,大幅提升办公效率,降低专业门槛,是您提升工作效率的得力助手。
- 3454次使用
-
- 星月写作
- 星月写作是国内首款聚焦中文网络小说创作的AI辅助工具,解决网文作者从构思到变现的全流程痛点。AI扫榜、专属模板、全链路适配,助力新人快速上手,资深作者效率倍增。
- 4563次使用
-
- MagicLight
- MagicLight.ai是全球首款叙事驱动型AI动画视频创作平台,专注于解决从故事想法到完整动画的全流程痛点。它通过自研AI模型,保障角色、风格、场景高度一致性,让零动画经验者也能高效产出专业级叙事内容。广泛适用于独立创作者、动画工作室、教育机构及企业营销,助您轻松实现创意落地与商业化。
- 3832次使用
-
- GPT-4王者加冕!读图做题性能炸天,凭自己就能考上斯坦福
- 2023-04-25 501浏览
-
- 单块V100训练模型提速72倍!尤洋团队新成果获AAAI 2023杰出论文奖
- 2023-04-24 501浏览
-
- ChatGPT 真的会接管世界吗?
- 2023-04-13 501浏览
-
- VR的终极形态是「假眼」?Neuralink前联合创始人掏出新产品:科学之眼!
- 2023-04-30 501浏览
-
- 实现实时制造可视性优势有哪些?
- 2023-04-15 501浏览

