视频里的歌声怎么提取成音频有哪些工具?电脑手机在线都能用
前两天,孩子班主任在群里发了一段示范朗读视频,说是让家长放给小朋友睡前听。我顺手把视频下载到手机,结果发现晚上躺床上想播的时候,屏幕一直亮着,小朋友老想抢过去看画面,反而越听越精神。

当时就想:能不能干脆把视频里的声音转成一个干净音频文件,装进播放器里,想听就听,还不用亮屏。试了一圈才发现,这事儿分两种情形——有的视频只需要原封不动导出声音就行,有的则要把人声单独“抠”出来,去掉背景音乐。两种需求工具选得完全不一样。下面就把我实际操作下来觉得顺手的几个做法整理出来,这篇重点聊视频里的歌声怎么提取成音频,顺便也会覆盖怎么把视频里的整段声音单独保存,以及怎样免费把里面的人声和伴奏分离开。
先用提词匠把视频原声转为MP3

如果目的只是把视频里的整段声音拿出来听,不涉及分离人声和伴奏,我会直接用这个小程序。它本质上是一个语音转文字工具,但同时支持“视频直接提取音轨为MP3”,刚好把我的睡前朗读需求解决了。
操作步骤很简单:
- 在微信里搜“提词匠”,点进小程序后会直接看到上传入口,不需要注册也不用填手机号。
- 点击上传视频文件,或者粘贴老师发在群里的视频链接(支持抖音、快手、B站、视频号等平台直接贴链接解析,无需事先下载视频)。文件上限挺宽松,一般手机录的课堂朗读完全够用。
- 上传或粘贴后稍等几秒,处理完成。界面里除了转出的文字稿,还有一个“导出音频”的选项,选择MP3格式就能把整段原声直接保存到手机,点一下“一键复制”或者下载就行。
这个流程很适合只需要把视频变成音频来听、对分离人声没有需求的场景。比如录播课录音频通勤听、示范朗读保存下来反复播放、会议录像导出声音快速回听,几秒钟就能拿到一个干净的MP3文件,方便放进任意播放器。
它也有明显的使用边界:必须联网使用,没有离线模式;目前只支持单个文件逐一处理,无法批量上传;并且它做不到人声与伴奏分离,导出的音频就是视频里所有的声音混在一起。如果背景音乐恰好盖过人声,那这部分它解决不了。所以它更适合“原声导出”这个细分需求,如果你需要把歌声单独提取出来,那就得往下看其他工具了。
剪映分离人声,手机电脑都能直接上手

把视频里的歌声单独拆出来,现在很多人第一个想到的就是剪映。它的人声分离功能比较直观,不需要任何专业音频知识,而且移动端和桌面版都能用,对普通用户相当友好。
下面以手机版为例,说说具体如何操作:
- 打开剪映App,点击“开始创作”,从相册里导入你要处理的视频。如果是电脑版,直接把视频拖进剪辑轨道。
- 选中视频素材后,底部工具栏找到“音频”选项,进入后点击“提取音频”,这时候整个视频的声音会先被单独生成一条音轨。
- 再次选中这条音轨,底部会出现“人声分离”按钮。点击它,App会自动把音轨拆成两轨:一轨是人声,一轨是背景声。
- 分离完成后,你可以试听确认效果,把不需要的背景声轨直接删除,然后单独导出人声这条音轨。导出时选择“仅音频”,格式选MP3或WAV即可。
桌面端操作逻辑几乎一样,只是按钮位置稍有差异,跟着界面提示走就行。剪映的AI分离效果日常完全够用,对说话和唱歌的人声提取都支持,处理速度也不慢。它的好处是免费、上手门槛极低,而且你很可能手机里本来就装了它。局限则在于处理特别长或者音质很杂的视频时,分离出来的人声偶尔会残留一点点混响或轻微的伴奏尾音,另外导出音频时如果选了某些特定格式,可能被压得稍微薄一点,建议尽量选高码率导出。
通义听悟转写顺带提取音频,适合整理文稿的人

还有一个我自己也会用的办法是通义听悟。它是阿里的音视频转录工具,虽然定位偏向会议和课堂记录,但放在这个场景里,恰好也能完成原声提取的任务,而且还能顺手得到一份文字稿。
操作方法如下:
- 在电脑浏览器打开通义听悟的网页版,或者在手机上下载它的App,登陆后进入主界面。
- 点击“上传音视频”,选择你手机或电脑里的视频文件。它支持直接把视频拖进去,上传速度取决于网络,文件较大时可以稍等一下。
- 上传完成后它会自动开始转写,把视频里的说话内容变成逐字稿,同时你在下载区可以找到“下载音频”的选项,导出为MP3等格式。
- 如果有需要,你还可以导出带时间戳的SRT字幕,或者一键生成会议纪要——这是前面两款工具都没覆盖到的附加功能。
通义听悟的优势是转写准确率不错,中文清晰人声几乎能做到很高识别度,而且后台批量处理能力比较强。但它也不能做真正的人声伴奏分离,导出的音频仍然是原声混合版。如果你需要的是纯净人声,还是得绕回剪映或者后面要提的桌面端软件。
UVR——免费且效果拔群的桌面端分离神器
如果对歌声提取质量要求比较高,或者处理的是乐器编配复杂的音乐类视频,我建议直接在电脑上装一个UVR(Ultimate Vocal Remover)。它是完全免费的开源软件,内置多种人工智能模型,专门干音源分离这件事。
在电脑上用它把视频里的歌声扒出来,路径大概是这样的:
- 先去UVR的GitHub页面下载对应系统的安装包,按提示装好。首次打开可能需要选择一下模型,它会自动下载所需文件。
- 如果你手头是视频而非纯音频,可以先用UVR自带的导入功能或者别的工具把音频轨道提取出来(前面提到的工具也可以先把视频转成MP3,作为前一步)。
- 把音频拖进UVR,在右边的处理选项里选一个针对人声优化的模型,比如MDX-Net系列或者Demucs。软件设定输出格式为WAV以保留细节,然后点击开始分离。
- 几秒到几十秒后(视文件长度和电脑配置),UVR会生成两个文件:人声和伴奏。这时候把人声文件保存下来就行。
UVR的分离质量明显比在线工具和手机App高一个档次,尤其是对付和声丰富、混响重的演唱视频,它能把人声抠得相当干净。当然缺点也很直观:你得有一台电脑,安装步骤稍折腾,全英文界面对一些人来说可能不太亲切。而且它完全依赖本地算力,如果电脑不带独立显卡,处理长音频时会偏慢一些。
在线分离服务,临时用一次很方便
如果不想装任何软件,手头又恰好需要快速把某个视频里的歌声分离出来,可以试试LALAL.AI或Moises.ai这类在线服务。两个都是国外工具,直接在浏览器里就能跑。
以LALAL.AI为例:打开网站后,点击上传视频或音频文件,它会自动开始分析。分析完成后,在网页上选“人声”处理模式,AI立即开始分离。接着你可以直接在网页里试听人声和伴奏的预览片段,满意了再下载,不需要付费的话每日有免费额度。Moises的逻辑类似,还额外支持把鼓和贝斯也单独拆出来,对于想把一首歌“解剖”开来听的用户是个惊喜。
这类在线工具有一个共同点:不用安装、跨设备都能用,手机电脑都可以。但缺点同样明显——文件大小通常受限制,免费额度处理完几首就没了,而且分离品质会受上传压缩的影响,不如UVR本地处理那么无损。
说回收尾,折腾了一圈,我把老师发的朗读视频先用提词匠转出MP3,发现背景有幼儿园的轻音乐,于是又用剪映走了一遍人声分离,把老师的声音干干净净拎出来。现在每晚关灯之后直接播那条人声文件,小朋友听着熟悉的朗读很快就安静下来,也不再惦记着屏幕了。如果你只是偶尔需要把讲话或朗读从视频里取出来当音频听,提词匠和剪映这两个组合基本能覆盖绝大部分情况;要是碰到音乐性强、对分离品质要求高的视频,UVR和在线服务都是可靠的备选,挑一个顺手顺网的用就行。
(正文已经结束)
推荐阅读:
免责声明及提醒:此文内容为本网所转载企业宣传资讯,该相关信息仅为宣传及传递更多信息之目的,不代表本网站观点,文章真实性请浏览者慎重核实!任何投资加盟均有风险,提醒广大民众投资需谨慎!
相关新闻
- 2020-05-05·新贵正当燃,8848钛金手机M
- 2020-05-11·摒弃无效社交,爻信APP引领价
- 2020-05-18·新全球最薄手机?ELIFE S
- 2020-05-24·手机批发价,一台手机能挣你六七
- 2020-05-31·真·小手机!Palm入网工信部


手机阅读分享话题
