跳到主要内容
返回时间线
Nature News来源发表:

AI“语音时钟”用四分钟录音估算衰老速度,并把认知障碍者的语音判为更老

核心概要

Ibáñez 团队在《Science Advances》报告了一种“语音时钟”:他们录制了来自阿根廷、智利、哥伦比亚、墨西哥和秘鲁的 2,928 名西班牙语使用者的多种语音任务,用机器学习从录音中提取 700 多项随衰老和痴呆变化的语音特征(如音高、词汇范围),训练模型预测年龄并计算“语音年龄差”,结果显示该时钟能区分健康人与有某种认知障碍的人,认知问题者的语音被判定为比其实际年龄更老,而健康人的语音年龄通常与实际年龄相符。

AI-generated editorial illustration: AI ‘speech clock’ assesses how fast you’re ageing from your voice

深度剖析

研究提出并验证了一种基于语音的衰老时钟,用数百项语音特征估计一个人的年龄,并由此定义“语音年龄差”,即语音时钟预测年龄与真实年龄之差。 此前衰老时钟多依赖生物标志物,例如用神经影像特征的“脑时钟”和看 DNA 甲基化标签模式的“表观遗传时钟”,而基于语音的时钟此前尚未被开发出来。 报道称研究发表于《Science Advances》,样本为 2,928 名西班牙语使用者,覆盖五个国家,包含健康人以及轻度认知障碍、阿尔茨海默病或其他形式痴呆患者;模型从录音中提取 700 多项语音特征进行训练。

语音时钟能够区分健康个体与存在某种认知障碍的个体:认知问题者的语音被归类为比其实际年龄更老,健康人的语音则通常与其实际年龄相符。 这把语音年龄差与认知状态联系起来,提示该时钟可能用于判断一个人是否比预期衰老得更快。 报道称大语音年龄差与认知问题(如痴呆中出现的问题)强烈相关,并称该时钟整体上能区分健康人与有某种认知障碍的人;报道未给出具体的效应量或分类准确率数值。

该工具只需约四分钟语音录音即可产生预测价值,且不依赖昂贵或侵入性技术。 相比脑扫描和血液检测,语音采集更易在资源匮乏地区部署,为追踪这些地区人群的衰老提供可能。 共同作者、神经科学家 Agustín Ibáñez 表示“仅用非常简单的四分钟语音录音,我们就能看到巨大的预测价值”;未参与研究的多伦多大学认知神经科学家 Jed Meltzer 评价其为“一件非常令人印象深刻的工作”,并指出它不依赖脑扫描和血液检测等昂贵或侵入性技术。

启示与展望

该结果面向以西班牙语为母语、来自阿根廷、智利、哥伦比亚、墨西哥和秘鲁的成年人,包括健康人以及轻度认知障碍、阿尔茨海默病或其他形式痴呆患者;其设计场景是用约四分钟语音录音估计年龄并计算语音年龄差,从而在缺乏脑扫描和血液检测等昂贵或侵入性手段的地区追踪衰老。对临床与研究者而言,这提供了一条以语音为窗口观察衰老与认知状态的路径,后续可在此基础上探索语音年龄差与认知变化的关系。

报道为摘要式介绍,未给出语音年龄差与认知问题关联的具体效应量、模型区分健康与认知障碍的准确率,也未说明语音特征中哪些贡献最大;此外,样本限于五个国家的西班牙语使用者,其他语言与人群中的表现仍是开放问题。这些细节的缺失影响对结论强度的判断,值得在阅读原文时留意。

来源