跳到主要内容
返回时间线
Hugging Face Blog来源发表:

TII发布1.6B参数Falcon-ASR:六套阿拉伯语测试平均WER 20.92%,内部阿联酋方言评测22.73%

核心概要

阿布扎比技术创新研究院(TII)发布1.6B参数的语音识别模型Falcon-ASR,重点面向阿拉伯语及阿联酋方言,同时支持英语、法语、西班牙语和葡萄牙语;在六套阿拉伯语测试集上平均词错误率20.92%,优于其引用的最佳已发布结果23.17%,在内部阿联酋方言评测中取得22.73%词错误率和10.19%字错误率,为所比较系统中最优,并提供词级时间戳。

AI-generated editorial illustration: huggingface.co

深度剖析

Falcon-ASR在六套阿拉伯语测试集上取得20.92%的平均词错误率和8.79%的平均字错误率,优于同一榜单快照中最佳已发布结果的23.17%词错误率与9.23%字错误率,差距为2.25个百分点。 该结果按Open Universal Arabic ASR Leaderboard的等权平均协议、使用榜单固定样本清单评测,使不同规模系统在同一口径下可比;模型参数量为1.6B,小于对比中的2.0B至7.0B系统。 评测遵循榜单协议并使用其固定清单,竞品数字取自2026年9月30日核对的榜单已发布平均值;对比模型包括Audar-ASR-V1-Turbo、Cohere Transcribe Arabic与omniASR LLM 7B。

在TII内部阿联酋及海湾语音评测中,Falcon-ASR取得22.73%词错误率和10.19%字错误率,为所比较系统中最优,词错误率比次优的Qwen3-Omni低4.07个百分点。 公开数据中已有Casablanca的UAE子集,该内部评测以额外保留录音和经人工校验的转写补充这一覆盖,把方言能力评估扩展到公共UAE子集之外。 内部评测使用保留录音与人工校验转写,并与Qwen3-Omni-30B-A3B-Instruct、Audar-ASR-V1-Turbo、Cohere Transcribe Arabic、Qwen3-ASR-1.7B-hf、Audar-ASR-V1-Flash等系统在同一评测上比较。

同一套权重无需语言标记即可转写英语、法语、西班牙语和葡萄牙语,输出为所讲语言的转写文本;在Hugging Face Open ASR Leaderboard所用的七套公开英语测试集上平均词错误率为5.74%。 多语言能力由单一模型权重承载而非按语言切换模型或提示,英语各测试集结果从LibriSpeech clean的1.75%到Earnings-22的11.86%不等,覆盖朗读、会议与电话等不同场景。 英语结果按公开榜单所用的七套测试集报告,逐集列出WER;多语言支持以同一权重、无需语言标志的方式描述。

模型训练覆盖背景噪声、重叠语音、音乐、房间混响与电话效应,以及语速和音高变化,并对阿联酋录音施加同样处理;同时支持词级时间戳,将每个转写词对应到音频中的位置。 这些条件针对会议、通话和日常录音等实际使用场景,而非仅限朗读或广播语音;词级时间戳为转写结果提供时间对齐信息。 训练条件与时间戳能力由发布方在模型说明中直接描述,未给出各条件对应的消融或分项指标。

启示与展望

该结果面向阿拉伯语(尤其阿联酋方言)以及英语、法语、西班牙语和葡萄牙语的语音转写,适用于会议、通话和日常录音等包含噪声、重叠语音、混响与电话效应的场景。发布方提供Hugging Face演示空间供试用自有录音,API访问与原生应用尚在计划中。模型建立在Falcon3-Audio工作之上,其架构与训练方法见所引论文。

内部阿联酋评测的录音与转写未随文公开,外部读者无法复现该22.73%词错误率;竞品数字取自2026年9月30日核对的榜单快照,榜单后续更新可能改变排序。训练条件虽列出噪声、混响与电话效应等,但未给出各条件的分项消融结果,因此难以判断每项处理各自的贡献。词级时间戳的精度指标未在文中报告。此外,本材料为发布方自述的模型说明,未包含独立第三方复现。

来源