音频盲测
二合一的盲测。每一轮播放一段神秘样本:投票判断这段音乐片段是完整的 16-bit,还是被压缩到 8-bit;或者判断踩镲是否与底鼓同步落下,还是晚了几毫秒。每一次计分都会与纯猜测做比较,所以运气好也蒙混不过“黄金耳朵”的检验。
播放神秘样本并投票——你的第一次回答就会开始计分。
音箱本身会带来数毫秒的延迟,房间噪声还会掩盖细微的声音细节。
一次回答说明不了任何问题。10 次答对 9 次,才是首个能在 95% 置信度下击败运气的成绩。
神秘片段可以随意重播——但每一次投票都会抽取一个全新的样本。
带着预设去听是不可靠的:当你知道哪个版本“应该更好”时,你就会觉得它更好。盲测消除了这种偏见——每一轮随机抽取一个样本,你只投一次票,最终只看计分结果。位深测试让一段 16 位(CD 标准,本底噪声接近 −96 dB)的音乐循环,对阵同一段被截断到 8 位的版本——后者会把本底噪声抬高到大约 −48 dB,在最安静的音符和衰减尾音上带出颗粒感和嘶声。时序测试播放一个底鼓和一个踩镲,让你判断它们是否同时敲响,偏移量从容易分辨的 100 ms 一路降到残酷的 1 ms。
两个版本都来自同一份源样本,唯一的差异就是被测试的那一项:位深游戏中是量化精度,时序游戏中是起音偏移。你可以随意多次练习带标签的参考片段,然后再播放神秘样本。重播不限次数,但每次投票都会抽取一个全新的样本,所以没有“回头猜”的机会。请使用耳机——分体式音箱与两耳的距离不同,会额外带来数毫秒的误差。一切都在你的浏览器本地合成,不会上传任何数据。
你需要答对多少题?
纯猜测大约能对一半,所以原始分数本身说明不了什么。置信度是指你的成绩击败纯抛硬币概率的可能性——95% 是“我能听出这个差异”这类说法的常见门槛,而较为苛刻的人会要求 99%。十次测试是让统计结果有意义的最低次数;更多的测试次数能保护一双真正灵敏的耳朵不被一次运气不好的失误连累。
| 测试次数 | 达到 95% 置信度需答对 | 达到 99% 置信度需答对 |
|---|---|---|
| 10 | 9 | 10 |
| 15 | 12 | 13 |
| 20 | 15 | 16 |
| 30 | 20 | 22 |
| 50 | 32 | 34 |
你应该期待听到什么?
听不出来是正常的——这本来就是重点所在。8-bit 版本的量化噪声在响亮而密集的音乐中出乎意料地隐藏得很好,这也是为什么 16 位作为发行格式已经相当宽裕,更不用说 24 位了。如果位深测试让你觉得无从下手,可以把音量调高一些,专注听最后一个音符的尾音——那里音乐最安静,新增的噪声也最容易暴露。在时序方面,大多数人能轻松听出 50–100 ms 的错位,在 10 到 20 ms 之间会渐渐失去把握,几乎没有人能听出 1–2 ms 的差异——按这个阶梯逐级尝试,找到你自己的极限所在。
