这是一个古老而简单的问题:你能听到的最微弱的声音是多少?听力学家通过纯音阈值搜索来回答这个问题——在隔音室里,通过校准的耳机,在一组标准频率上播放一个声音,询问,再放一个更轻的声音,再次询问。手机版保留了这种搜索,但丢掉了隔音室,而有趣的工程学正是完全在于它如何应对这一缺失。

首先让我们明确它的定位,因为该活动本身就是这样坚持的:这是通过手机扬声器进行的筛查估算,而不是听力图。房间里的扬声器不是隔音室里的听力计。结果屏幕上是这么写的,保存的测量结果也自带其不确定度,因此一年后阅读它的人不仅能看到曲线,也能看到警告提示。

为什么它是一套流程,而不是一次采集

平台上的大多数测量都是采集:将传感器指向世界,按下按钮,提取特征。听力阈值是无法被采集的,因为单一的声音说明不了任何问题。能说明问题的是步骤:在六个听力测试频率的每一个上,逐个频带进行自适应阶梯测试。播放声音;你按下“我听到了”或“没有”——这就是测试接收的全部输入;当你听到时阶梯向下移动,当你没听到时阶梯向上移动,而它上下波动的声级就是你该频带的阈值。

步骤有其前置条件,而其中任何一个前置条件失效时,都必须结束运行,而不是悄悄地粉饰数据。这就是其设计原则,并且它在三个地方得到了体现。

固定音量,否则刻度尺就会变形

第一个前置条件虽然枯燥但至关重要:媒体音量必须固定在最大值。测试中呈现的每个声级都是一种衰减——即比手机最大输出低多少分贝。只有当最大输出在每次测量中代表相同意义时,这才能成为一把刻度尺。固定音量能让第60次测试中的“40 dB下”与第1次测试时的含义完全相同;如果音量按键在运行中被轻碰了一下,在此之后的每个结果都会在无形中改变比例。

在测试耳朵之前,先测量房间

隔音室的作用是消除环境噪声。客厅可不行,所以该活动改为测量房间:在播放任何测试声音之前,麦克风会记录每个频带的环境声级。然后,房间的底噪会设定每个频带的阶梯底限——只要房间能在噪声之上留出 50 dB 的可用范围,就能在这个范围内完美测量阈值。

至于房间声音实在太吵的频带呢?它会在呈现之前就被判定为无法测试。不是在测试后被丢弃,而是在最开始就被排除,这就是四分钟测试与六分钟测试(最后还要扔掉三分之一的数据)的区别。这也意味着屏幕可以告诉你它跳过了哪些频率以及原因,此时你仍然可以做点什么来改善:关上窗户、消灭冰箱的嗡嗡声、换个房间、然后重试。

拒绝好过猜测。一种诱人的设计是无论如何都去测试每个频段,让嘈杂的环境去放大无形的误差范围。这一活动的做法恰恰相反:无法被正确测量的频段绝不参与结果——没有可疑的数字,没有勉强的估计,什么都没有。未通过环境检查的频段绝不允许计入结果。一个告知了空白原因的单元格,比一个让你心生怀疑的数值更有价值,因为针对空白你可以采取行动,而对于数值,你却无法在看过之后装作不信。

回环:让扬声器吐露实情

第三个先决条件非常巧妙。手机扬声器的频响非常不平坦——在 2 kHz 处强,在 250 Hz 处弱,而且每个机型都不同。因此,在测试之前,手机会播放测试频段,并通过自己的麦克风听取自己的声音。这一回环有两个作用:一是确认扬声器确实发出了所要求的每个频段(回环未听到的频段会被排除,就像嘈杂房间的情况一样);二是测量每台设备的频率曲线(即此手机的输出在各频段之间的倾斜情况),以此为基准进行校准,使不同频率下的阈值具有可比性。这就是为什么测试即使完全是播放声音,也需要麦克风正常工作的原因:没有回环,就没有曲线校准和环境检查,而这两者都是支撑这一测试结论的核心支柱。

数据背后的含义——链条的三环,弱其一

那么,结果到底有多大可比性?老实算来,有三个环节:

这一链条使得一次测试与他人在另一台手机上的测试结果在筛查仪器的精度范围内具有可比性——这是一个有用的结论。但如果是与你自己早前在同一台手机上的测试结果相比,这一薄弱环节就消失了:假设的偏移量变成了一个可抵消的共同常数,对比精度会大大提高,远超 ±10 dB。在一台设备上长期追踪你自己的听力,是这一测试最强大的功能——这与支持双手机隔音测试的“设备在比例中抵消”的逻辑相同,只是应用在时间跨度上,而不是隔着一堵墙。

当一次测试的基准无法确认参考频段时,该活动会明确地降低级别,而不是装作没事人一样:它会报告简单的衰减量,而不是估算的听力水平。这虽然较难解读,但与同一台手机上的另一次测试依然具有完全的可比性——这是一个较小但真实的结论,好过一个较大却虚假的承诺。而且,无论如何,存储的数据都会保留每个频段的原始衰减量,因此如果以后有了更好的基准,它就可以重新评估旧的测试结果,而不仅仅是改进新的测试。

写在明处的细则

即使某个频段运行顺利,也可能在没有确定阈值的情况下结束,每种结局都有自己的名字:如果仍能听到该手机能发出的最微弱音调,意味着你的阈值低于下限——你的听力比这台手机能测出的还要好;而如果连最响的声音也听不到,则记为高于上限。这两种情况都不会被勉强折算成一个数字。同样,进度是以确定下来的频段数量来计算的,而不是以完成的测试次数来计算,因为自适应测试无法预知其总测试次数——这是唯一能够诚实反映单调递增的统计指标。而仅点击两次就放弃的测试不会保存任何内容;在至少有一个频段真正确定下来之前,保存按钮会一直处于禁用状态。

请在它适用的范围内使用它:比如用来发现你的左耳高频听力自春天以来是否有所偏差,或者新的耳塞是否留下了可测量的影迹——并在出现变化时提醒你去就医。它的兄弟活动——视力测试,运行着相同的自适应阶梯机制,只是用光代替了声音,且建立在更可测的稳固基础上。对于手机能测量的其他一切,请从工具概览开始。