德州560万起车祸的叙述里藏着编码字段漏掉的因素:手机使用类伤害事故,叙述记下15074起,字段只记7340起
导语
德州2017至2025年5601890起车祸中,一个读编码表的模型与一个读警员叙述的模型被同一套抽样设计连起来,得到带区间的人口计数:手机使用相关伤害事故叙述记下15074起,编码字段只记7340起。
正文
同一份车祸记录的两种读法被放进一套估计系统,输出的是全州计数、不一致地图、重读清单和阅读预算,而不是单点预测。 此前编码字段与警员叙述几乎从不放在同一套抽样设计下互相测量,安全部门只知道自己数了什么,不知道漏了多少。 在德州2017至2025年5601890起车祸上,覆盖5018080起带可用叙述的车祸,第二个人工层按记录概率抽取,与全部十五个估计在其抽样误差内一致。
编码表读的是每起车祸的结构化记录,叙述读的是抽样到的文本,人工判断用来校准叙述读出的概率。 此前表格模型只用于预测结果,不作为推断设计里的读数器,预测驱动推断也只用一个代理。 表格读数器是Kumo Tabular小号,上下文6万行;叙述读数器是Jev 1.13.0,读第一波15万条简单随机样本和第二波79510条按不一致分数抽取的叙述;人工层是400条叙述上的2309条可用判断。
接下来
下一步可以在其他州重复这套设计,看多少不一致属于德州做法;也可以跨两个读数器的版本重复,看读数器更换时估计有多稳定。对没有坐标的车祸叙述做一次清洗后读取,可以把外推组纳入实测人口;按分配规则扩大人工层,可以收窄由校准层主导的区间。把车祸、单元、人员三张表联合读取的关系型表格读数器,是编码视图的自然延伸。
叙述读数器是训练数据未公开的闭源商业模型,其读数被固定在一个版本上,靠两个人工层审计和校准,而不是靠检查内部。对没有可用叙述的车祸的外推按构造是模型驱动的,与每个估计分开报告。车辆缺陷的估计有41%落在人工核查的概率阈值以下,肇事逃逸和故意碰撞的核查区间最宽,这些行的人工一致性证据最弱。校准层承载了大部分方差,酒精为95%,逆行驾驶为99%,因此表格读数器对总半宽的收窄有限。
