BlowLive 用吹气声学加人脸做多因子生物认证,50 人数据上融合模态达 100% 准确率并支持模板与密钥吊销
核心概要
该工作提出并实现了 BlowLive 多因子生物认证框架,把对着手机吹气产生的声学信号作为行为模态、把同时抓拍的人脸作为生理模态,用 GFCC 特征加 CNN 生成吹气嵌入、用 FaceNet 生成人脸嵌入,再经模糊提取器从二值化融合嵌入中派生密钥完成认证,并加入基于多普勒频移的活体检测;在 50 名参与者采集的数据上,吹气模态准确率 99.56%、人脸与融合模态 100%,活体检测在逐用户阈值下准确率 99.46%。
深度剖析
框架把吹气声学(行为)与人脸(生理)两种模态在一次吹气动作中同时采集并融合,用 GFCC 加 CNN 得到 128 维吹气嵌入、用 FaceNet 得到 128 维人脸嵌入,再通过分数级加权求和或特征级拼接形成统一表示。 相较此前同样使用吹气声学与人脸的 Halim 等工作,本文引入了 GFCC 这一更精细的频谱特征提取流程,并同时提供分数级与特征级两种融合路径。 在 50 名参与者、每人 10 至 12 次会话(坐姿与站姿各半、每次约 5 秒)的数据上评测;特征级融合在 q=10 时报告 100% 准确率、0% FAR 与 0% FRR,分数级融合为 99.95%。
认证不依赖原始生物模板,而是用模糊提取器(BCH 纠错码)把二值化融合嵌入转成稳定密钥 K 与公开辅助串 P,认证时以汉明距离是否落在阈值内决定能否复现同一密钥。 把认证从模板比对改为密钥复现,使系统在模板层面不存储敏感生物特征,并因此获得不可链接性、不可逆性与多样性等性质。 论文以性质论述方式给出不可链接性、不可逆性、多样性与可吊销性,并报告密钥生成 0.0224 ms、密钥复现 1.0667 ms、密钥吊销 0.1304 ms 的运行时间。
由于吹气属于行为模态,用户可以通过改用新的吹气模式来更换生物身份,因此系统同时支持密钥吊销与模板吊销两个层级。 论文指出既有可吊销/可取消生物特征方案多是通过更换密钥或用户参数实现吊销,底层生物特征本身不变;本文借助行为模态让模板本身也可更换。 该结论来自框架设计论证与对相关工作的对比表,而非独立的吊销攻击实验。
活体检测模块让手机持续发出约 20 kHz 超声载波,用带通滤波、STFT 提取峰值频移、多普勒包络与 GFCC 能量,加权合成混合分数来区分真实吹气与回放。 论文指出语音类多普勒活体方法依赖谐波与唇动、声道动态,无法直接用于没有浊音成分的吹气信号,因此专门设计了针对气流湍流的处理流程。 在 554 条真实与 558 条回放样本上评测:全局阈值准确率 90.38%(FAR 5.56%、FRR 13.72%),逐用户动态阈值准确率 99.46%(FAR 0%、FRR 1.08%)。
启示与展望
该结果面向使用普通智能手机麦克风与前置摄像头、以 1:1 认证模式运行的场景,作者明确说明系统不做 1:N 识别,因此单次请求的计算复杂度与注册用户总数无关,服务器端仅需为每个用户保存一份固定长度的辅助数据。适用对象是愿意在一次吹气动作中同时完成声学与人脸采集的用户,论文列举的潜在落点是手机解锁、IoT 设备认证与安全门禁。活体检测的阈值设计有两种取向:全局阈值面向群体层面的真实行为建模,逐用户阈值面向个体吹气强度差异较大的情形,论文的实测支持后者。
论文的评测为离线进行,尚未给出端到端在线部署下的时延与稳定性表现。活体检测的对比样本是真实吹气与回放两类,作者在威胁模型中还列出窃取样本与 AI 生成吹气两类攻击,这两类在实验表格中没有单独的结果行。数据集来自 50 名参与者、每人 10 至 12 次会话,跨设备、跨环境噪声与更大人群分布下的表现仍是开放问题。此外,论文在正文中给出的活体检测准确率为 99.42%,而表 1 中逐用户动态阈值为 99.46%,两处数字并不一致,读者在引用时需留意这一差异。
