翻唱音准修正
翻唱爱好者录完人声后,发现副歌有几个音唱偏了半度,但整段情绪和节奏都对。用本工具把人声单独提取出来,只把偏音那几个小节升高或降低 50 音分(约半音),不改变语速和时值。不用重录整段,也不用学复杂的音高编辑软件,10 秒导出修正后的干声直接混缩。
一首歌升了调,人声变尖得像卡通片,伴奏也跟着失真——这是变调时常遇到的麻烦。这个工具用 FFmpeg 做音高变换,同时锁定原始节奏,让声音在音高上移或下移时,语速和节拍保持不变。音频文件上传后由服务器端处理,适合播客后期补录、翻唱伴奏调整或语音样本分析这类需要保留时序细节的场景。
翻唱爱好者录完人声后,发现副歌有几个音唱偏了半度,但整段情绪和节奏都对。用本工具把人声单独提取出来,只把偏音那几个小节升高或降低 50 音分(约半音),不改变语速和时值。不用重录整段,也不用学复杂的音高编辑软件,10 秒导出修正后的干声直接混缩。
一期播客请了三位嘉宾,一位用手机录的、一位用 Zoom 录的、一位语音连线。混音时发现手机录的那轨整体比 Zoom 轨低了约 100 音分,听感像两个人。用本工具把低的那轨整体升高 100 音分,保持语速不变,三轨音高对齐后直接混音,不用逐个片段调。
电子音乐制作人从一张 78 转老唱片里采了一段钢琴 riff,但 riff 的调性是降 E,而新编曲是 C 大调。用本工具把采样整体降低 3 个半音(300 音分),保持原汁原味的唱盘噪声和速度,不产生变速带来的“花栗鼠”感。直接拖进 DAW 和工程对调,省去重新采样或手动拉伸的步骤。
给一个 30 秒的英文产品视频配中文旁白,中文配音员录完后发现总时长比原声短了 0.8 秒,但语速已经最快。用本工具把中文轨整体降低 200 音分(约两个半音),时长不变,听感低沉但仍在可接受范围,然后后期用 EQ 补回高频,口型与画面完全对齐,不用重录或剪画面。
吉他手在排练房没有调音器,手机也没装调音 App。用本工具把标准 A4(440Hz)的音频文件升高或降低,生成 E2(82.41Hz)、A2(110Hz)、D3(146.83Hz)、G3(196Hz)、B3(246.94Hz)、E4(329.63Hz)六个参考音,每个音播放 3 秒,逐根弦对听。本工具不改变音长,参考音持续稳定,比用手机 App 快,且不用联网。
| 输入 | 输出 | 说明 |
|---|---|---|
| 输入音频:人声清唱(采样率 44100Hz,16bit,单声道),目标变调:+4 半音(升 4 个半音) | 输出音频:人声清唱(采样率 44100Hz,16bit,单声道),时长不变,音高升高 4 个半音,人声变尖,无变速感 | 常规:最常见的升调场景,验证不变速核心特性,人声素材典型 |
| 输入音频:钢琴 C 大调音阶(采样率 48000Hz,24bit,立体声),目标变调:-5 半音(降 5 个半音) | 输出音频:钢琴 C 大调音阶(采样率 48000Hz,24bit,立体声),时长不变,音高降低 5 个半音,音色变低沉,无变速感 | 常规:降调场景,立体声素材验证通道一致性 |
| 输入音频:白噪声(采样率 22050Hz,8bit,单声道),目标变调:+12 半音(升 1 个八度) | 输出音频:白噪声(采样率 22050Hz,8bit,单声道),时长不变,音高升高 12 个半音,白噪声频谱整体上移,听感无明显音高变化 | 边界:噪声类素材无明确基频,变调后频谱平移但听感不产生旋律感,验证工具对非乐音素材的处理 |
| 输入音频:语音(采样率 8000Hz,16bit,单声道),目标变调:0 半音(不变) | 输出音频:语音(采样率 8000Hz,16bit,单声道),时长不变,音高不变,输出与输入完全一致 | 边界:零变调输入,验证工具是否正确处理无变化请求,低采样率素材兼容性 |
| 输入音频:正弦波 440Hz(单声道,采样率 44100Hz,16bit,持续 1 秒),目标变调:+24 半音(升 2 个八度) | 输出音频:正弦波 440Hz(单声道,采样率 44100Hz,16bit,持续 1 秒),时长不变,音高升高 24 个半音,输出频率为 1760Hz,波形无失真 | 边界:大幅升调 2 个八度,验证算法在高倍率下是否引入伪影或失真,纯音素材便于频谱验证 |
| 输入音频:鼓点节奏(采样率 44100Hz,16bit,立体声,时长 2 秒,包含瞬态冲击),目标变调:-12 半音(降 1 个八度) | 输出音频:鼓点节奏(采样率 44100Hz,16bit,立体声,时长 2 秒,包含瞬态冲击),时长不变,音高降低 12 个半音,鼓点冲击感保留,无拖尾或模糊 | 易错:打击乐瞬态丰富,部分变调算法会模糊瞬态,此例验证工具对瞬态保持能力 |
| 输入音频:人声清唱(采样率 44100Hz,16bit,单声道),目标变调:+1 半音(升 1 个半音) | 输出音频:人声清唱(采样率 44100Hz,16bit,单声道),时长不变,音高升高 1 个半音,人声略微变高,无变速感 | 易错:最小整数半音步进,验证工具在最小调整量下是否产生可闻的相位失真或音色变化 |
1.把「变调」和「变速」混为一谈
上传一段语速太快的录音,想通过变调让它变慢。上传一段录音,通过变调改变音高而不改变播放速度。变调只改变频率(音高),不改变时长;变速才改变播放速度。两者是独立参数,本工具专门处理变调。
2.期望变调能修复严重失真的音频
用手机在嘈杂环境中录了一段声音,想通过变调让声音变清晰。先用降噪工具处理音频,再用变调调整音高。变调只调整频率分布,不消除噪声或修复失真。噪声中的频率同样会被变调,效果反而更差。
3.输入参数超出人耳可感知范围
将变调参数设为 +12 个半音(提高一个八度),结果听起来像卡通音。将变调参数设为 +2 到 +4 个半音,用于模拟女性声音或增加明亮感。人耳对大幅变调的容忍度有限,超过 ±6 半音通常会产生明显的人工感或失真,适合特殊效果而非自然调整。
4.用变调来模拟不同乐器音色
将一段钢琴录音变调 +5 半音,期望听起来像小提琴。使用音色合成或采样器工具来改变乐器音色。变调只改变基频,不改变音色(谐波结构)。钢琴和小提琴的频谱包络不同,变调后仍保留钢琴的音色特征。
5.上传过短或过长的音频文件
上传一段 0.5 秒的音频片段进行变调。上传至少 2 秒以上的音频片段进行变调。极短音频(<1 秒)的频谱信息不足,FFmpeg 变调算法可能产生不稳定的边界效应。过长音频(>30 分钟)则受浏览器内存限制,建议分段处理。
6.忽略输出格式与原始格式的兼容性
将 48kHz 采样率的 WAV 文件变调后,直接保存为 8kHz 的 MP3。保持输出采样率与输入一致(48kHz),或选择 44.1kHz 等标准采样率。变调过程中频率被拉伸/压缩,若输出采样率过低,高频部分会被截断,导致音质严重下降。建议保持原采样率。
7.误以为变调可以调整音量大小
上传一段音量很低的音频,希望通过提高变调参数让声音变大。使用音量增益或标准化工具调整音量。变调改变的是频率而非振幅,音量(响度)由振幅决定。变调参数不影响音量大小。
8.对多声道音频只处理单声道
上传立体声文件,变调后只输出左声道,右声道丢失。确保输入文件为双声道立体声,输出时保持声道映射。部分简易变调实现默认只处理第一个声道。本工具基于 FFmpeg 处理,默认保留所有声道,但若用户误选了单声道输出选项则会导致声道丢失。
f_out = f_in × 2^(n/12)
f_out变调后的频率,单位 Hzf_in原始音频频率,单位 Hzn半音数,正数升调负数降调原始音高为 A4(440 Hz),升 3 个半音(n=3):f_out = 440 × 2^(3/12) = 440 × 2^0.25 ≈ 440 × 1.1892 ≈ 523.25 Hz,即 C5 音高,时长不变。
本工具专门用了 FFmpeg 的 atempo 滤镜配合变调算法,原理是重采样(resample)而不改变播放时长。如果操作后发现速度变了,可能是音高调整幅度过大导致听感上觉得“快”或“慢”,实际时长不变。可以对比原音频的进度条确认。如果仍然觉得速度异常,检查是否误选了其他非变调选项。
支持常见音频格式,包括 mp3、wav、aac、flac、ogg 等。上传 wav 没反应可能因为文件太大(超过 100MB)或文件名带特殊字符。建议先确认文件大小,本工具纯浏览器端 WASM 处理,大文件可能卡住;可尝试压缩或分段上传。如果格式不在支持列表,系统会提示“不支持格式”,不会无响应。
正常。FFmpeg 的变调算法基于线性重采样,大幅调高(超过 3-4 个半音)时,频谱被拉伸,会引入伪影和金属声。这是算法本身的限制,不是工具问题。如果需要更自然的变调,建议调幅控制在 ±3 个半音内;极端变调(如升八度)建议用专用变声软件(如 Melodyne)配合更高阶的相位声码器。
完全本地处理。本工具使用 WASM 技术将 FFmpeg 编译到浏览器中运行,所有音频数据在用户设备上完成变调,不上传任何文件到服务器。处理完成后,结果音频也仅存在于浏览器内存中,关闭页面即消失。可以断网测试:上传文件后断网,变调功能依然可用。
本工具默认输出无损 WAV 格式(PCM 编码),文件体积通常比压缩格式(如 mp3)大 5-10 倍。如果原文件是 128kbps 的 mp3,变调后输出为 WAV 就会膨胀。建议在结果页下载时选择“输出为 mp3”或手动重新编码压缩。另外,变调本身不改变采样率,所以体积差异完全来自编码格式。
当前版本仅支持单文件处理,没有批量上传功能。如果需要批量变调,可以用 FFmpeg 命令行本地处理:`ffmpeg -i input.mp3 -af atempo=2.0 output.mp3`(2.0 表示升一个八度)。本工具定位是快速单次变调,适合临时调整一段语音或音乐。如果确实需要批量,建议搜索“FFmpeg 批量变调脚本”。
本工具保证时长不变,所以节奏理论上不变。如果感觉对不上,可能是变调后音高变化导致听感上的“节奏错觉”——比如升调后音符变“尖”,人耳会误以为速度变快。可以导出后放在波形编辑器里对比波形长度,确认时长完全一致。如果实际时长变了,可能是操作时误点了“变速”功能(本工具无此功能,但其他工具有)。
FFmpeg 的 atempo 滤镜在处理大幅变调时,可能会因重采样导致整体增益下降(通常降 1-3dB)。本工具未自动补偿音量。可以在变调后,用本工具或别的工具做一次“音量放大”处理。或者用 FFmpeg 命令行加 `volume=2.0` 参数。如果只是轻微变小,大多数播放器(如 VLC)也有音量增益功能。
隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。