AI 参与的语音世界真神奇,既可以将一个人的语音换成任何其他人的语音,也可以与动物之间的语音互换。
我们知道,语音转换的目标是将源语音转换为目标语音,并保持内容不变。最近的任意到任意(any-to-any)语音转换方法提高了自然度和说话者相似度,但复杂性却大大增加了。这意味着训练和推理的成本变得更高,使得改进效果难以评估和建立。
问题来了,高质量的语音转换需要复杂性吗?在近日南非斯坦陵布什大学的一篇论文中,几位研究者探究了这个问题。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
arxiv.org/pdf/2305.18975.pdf研究亮点在于:他们引入了 K 最近邻语音转换(kNN-VC),一种简单而强大的任意到任意语音转换方法。在过程中不训练显式转换模型,而是简单地使用了 K 最近邻回归。
具体而言,研究者首先使用自监督语音表示模型来提取源话语和参照话语的特征序列,然后通过将源表示的每个帧替换为参照中的最近邻来转换成目标说话者,最后使用神经声码器对转换后的特征进行合成以获得转换后的语音。
从结果来看,尽管 KNN-VC 很简单,但与几个基线语音转换系统相比,它在主观和客观评估中都能媲美甚至提高了清晰度和说话者相似度。
我们来欣赏一下 KNN-VC 语音转换的效果。先来看人声转换,将 KNN-VC 应用于 LibriSpeech 数据集中未见过的源说话者和目标说话者。
源语音00:11
合成语音100:11
合成语音200:11
KNN-VC 还支持了跨语言语音转换,比如西班牙语到德语、德语到日语、汉语到西班牙语。
源汉语00:08
目标西班牙语00:05
合成语音300:08
更令人称奇的是,KNN-VC 还能将人声与狗吠声互换。
源狗吠00:09
源人声00:05
合成语音400:08
合成语音500:05
我们接下来看 KNN-VC 如何运行以及与其他 jixian 方法的比较结果。
kNN-VC 的架构图如下所示,遵循了编码器 - 转换器 - 声码器结构。首先编码器提取源语音和参照语音的自监督表示,然后转换器将每个源帧映射到参照中它们的最近邻,最后声码器根据转换后的特征生成音频波形。
其中编码器采用 W*LM,转化器采用 K 最近邻回归、声码器采用 HiFiGAN。唯一需要训练的组件是声码器。
对于 W*LM 编码器,研究者只使用预训练的 W*LM-Large 模型,并在文中不对它做任何训练。对于 kNN 转换模型,kNN 是非参数,不需要任何训练。对于 HiFiGAN 声码器,采用原始 HiFiGAN 作者的 repo 对 W*LM 特征进行声码处理,成为唯一需要训练的部分。
图片
在实验中,研究者首先将 KNN-VC 与其他基线方法进行比较,使用了最大可用目标数据(每个说话者大约 8 分钟的音频)来测试语音转换系统。
对于 KNN-VC,研究者使用所有目标数据作为匹配集。对于基线方法,他们对每个目标话语的说话者嵌入求平均。
下表 1 报告了每个模型的清晰度、自然度和说话者相似度的结果。可以看到,kNN-VC 实现了与最佳基线 FreeVC 相似的自然度和清晰度,但说话者相似度却显著提高了。这也印证了本文的论断:高质量的语音转换不需要增加复杂性。

此外,研究者想要了解有多少改进得益于在预匹配数据上训练的 HiFi-GAN,以及目标说话者数据大小对清晰度和说话者相似度的影响有多大。
下图 2 展示了两种 HiFi-GAN 变体在不同目标说话者大小时的 WER(越小越好)和 EER(越高越好)关系图。
图片
对于这个「仅利用最近邻」的语音转换新方法 kNN-VC,有人认为,文中使用了预训练语音模型,因此用「仅」不太准确。但不可否认,kNN-VC 仍然要比其他模型简单。
结果也证明了,与非常复杂的任意到任意语音转换方法相比,kNN-VC 即便不是最好,也同样有效。
图片
还有人表示,人声与狗吠互换的例子非常有趣。
图片
以上就是支持跨语言、人声狗吠互换,仅利用最近邻的简单语音转换模型有多神奇的详细内容,更多请关注其它相关文章!
# 语音
# fig
# peech
# ai
# 营销推广具有什么特征
# seo模拟不同ip访问
# 公关策划网站建设
# 搜索seo服务
# 燕郊有seo学校地址
# 江苏seo营销推广平台
# 遵义短视频推广营销
# 廊坊seo关键词分析
# 嘉兴seo关键词排名优化团购
# 姜堰区定制网站建设
# 高质量
# 使用了
# 越好
# 谁能
# 提高了
# 德语
# 西班牙语
# 开源
# 有多
# 声码
相关栏目:
【
Google疑问12 】
【
Facebook疑问10 】
【
优化推广96088 】
【
技术知识133117 】
【
IDC资讯59369 】
【
网络运营7196 】
【
IT资讯61894 】
相关推荐:
人工智能时代 数字文明对话向“尼”走来
普林斯顿大学推出 Infinigen AI 模型,生成真实自然环境 3D 场景
酒店业将如何受益于人工智能的改变?
丰田汽车研究院推出生成式人工智能汽车设计工具
全面拥抱大模型浪潮,ISC 2025打造全球首场AI数字安全峰会
脑机接口产业联盟发布十大脑机接口关键技术
灯塔AI大模型票房预测上线:开源算法不断提升精准度
引领AI变革,九章云极DataCanvas公司重磅发布AIFS+DataPilot
美妆行业在AI时代蓬勃发展
百亿量化私募:量化投资进入“精耕细作”时代 AI带来行业新变革
亚马逊确认今年不会举办 re:MARS 机器人和人工智能大会
特斯拉首发人形机器人“擎天柱”亮相世界人工智能大会
令人惊叹!AI模型能够以iPhone照片为基础创作诗歌
人工智能在交通领域的革新:智能解决方案彻底改变交通方式
生成式人工智能如何改变云安全的游戏规则
MiracleVision视觉大模型
复旦发布「新闻推荐生态系统模拟器」SimuLine:单机支持万名读者、千名创作者、100+轮次推荐
B站内测 AI 搜索功能,输入“?”即可体验
有远见!华为四年前注册商标Vision Pro:苹果AR国内要改名
美踏控股推出创新人工智能大数据模型“心乐舞河”:虚拟人音舞社交的新体验
财联社首档运用虚拟人技术播报栏目《AI半小时》今晚上线!敬请期待
ChatGPT会成为你家新的语音助手吗?
“可用”“有用”的讯飞星火认知大模型将亮相世界人工智能大会
网易数帆以AI融合创新引领数据分析与软件开发新趋势
可按用户语气自动回复消息,Zoom 推出基于生成式 AI 的新功能
AI数字人业务频频获点赞,谦寻积极引领示范作用
闪电快讯|京东推出言犀AI大模型 面向零售、医疗、物流等产业场景
周鸿祎:用超级AI实现室温超导和核聚变,实现能源自由
实现人工智能和物联网的协同运作
2025世界人工智能大会(上海)开幕式纪要
AI智能室内效果图设计软件效果,确实惊到我了!
猿力科技入选北京市通用人工智能产业创新伙伴计划
写出优质文章的妙招:利用"稿见AI助手"的实用指南
首家承认ChatGPT影响其收入的公司Chegg选择拥抱AI ,裁减4%员工
码刻 | 48小时Hackathon,源码见证新生代AI创新的发生
羊驼家族大模型集体进化!32k上下文追平GPT-4,田渊栋团队出品
大疆 Air 3 无人机售价和实物照片曝光
25个AI智能体源码现已公开,灵感来自斯坦福的「虚拟小镇」和《西部世界》
大型无人机FH-98国内首次夜航转场成功
“直击”AI新世界,智能机器人再次“火出圈”了
ChatGPT大更新!OpenAI奉上程序员大礼包:API新增杀手级能力还降价,新模型、四倍上下文都来了
AI取代人工先拿教育行业开刀?美版“作业帮”启动裁员
NVIDIA垄断AI市场90%份额:AMD性能追上80% 软件太不能打
RoboNeo安装教程
《共同的演化》展览启幕,重新思考人类与人工智能关系
人工智能赋能无人驾驶:商业化进程再提速
人工智能助力精准学习,猿辅导小猿学练机满足学生个性化学习需求
云鲸发布全新的扫拖机器人J4系列
学生作文评分的新趋势:教师与AI的合作模式
先进技术在防止全球数据丢失方面的作用
2023-07-04
运城市盐湖区信雨科技有限公司是一家深耕海外推广领域十年的专业服务商,作为谷歌推广与Facebook广告全球合作伙伴,聚焦外贸企业出海痛点,以数字化营销为核心,提供一站式海外营销解决方案。公司凭借十年行业沉淀与平台官方资源加持,打破传统外贸获客壁垒,助力企业高效开拓全球市场,成为中小企业出海的可靠合作伙伴。