JEVDB用类型化决策模型加语义布隆过滤器,在SemBench全部21条查询上取得最低延迟
相关研究与后续进展核心概要
JEVDB是一个可扩展的语义数据库系统,用快速的类型化决策模型处理语义过滤、连接、分类与排序,并把不确定情形选择性升级给生成式LLM;它结合Yannakakis式半连接归约与语义布隆过滤器(SBF)来削减语义连接工作量,在SemBench上JEVDB-Flash于全部21条评测查询上取得最低延迟、19条上最低成本并保持有竞争力的答案质量,在TPC-DS衍生的Shelob负载上(连接规模达54万候选对)全部查询完成且平均F1为95.7%–97.5%,SBF筛选在语义评估前移除87.4%的候选对,可复用的条件索引评分进一步把推理模型升级减少55.2%。
Figure 1 : JEVDB architecture and query execution workflow. Semantic SQL queries are compiled into relational plans and typed decision primitives. Tier 1 reduces candidates through relational predicate pushdown, Semantic Bloom Filters, relational Yannakakis semijoin reduction, and input deduplication. Tier 2 evaluates surviving inputs with the Jev decision engine, while uncertain decisions are escalated to a frontier LLM in Tier 3.
arXiv深度剖析
JEVDB以快速的类型化决策模型承担语义过滤、连接、分类和排序等离散关系决策,只把不确定情形选择性升级给生成式LLM。 相对依赖自回归LLM完成离散关系决策的现有语义数据库引擎,这一设计把高延迟与高成本的生成式推理从常规路径移到例外路径。 摘要层面的系统设计与定位陈述,未给出各决策模型的具体架构或升级阈值的细节。
为削减语义连接工作量,JEVDB把关系结构上的精确Yannakakis式半连接归约与语义布隆过滤器结合,后者用已注册的必要条件在潜在语义边上筛选候选。 把经典关系代数中的半连接归约与面向潜在语义边的必要条件筛选组合起来,形成连接前的剪枝机制。 摘要给出机制描述与量化效果:SBF筛选在语义评估前移除87.4%的候选对。
在SemBench上,JEVDB-Flash在全部21条评测查询上取得最低延迟、19条上最低成本,同时保持有竞争力的答案质量。 相对现有引擎,在延迟与成本两个维度上同时给出覆盖面较广的领先结果。 摘要报告21条查询的延迟与19条查询的成本对比,并称答案质量具有竞争力,但未给出具体质量数值。
在TPC-DS衍生的Shelob语义连接负载上,连接规模达54万候选对,JEVDB完成全部查询且平均F1为95.7%–97.5%,可复用的条件索引评分把推理模型升级减少55.2%。 把评测从SemBench扩展到更大规模的语义连接负载,并给出剪枝与升级削减的量化收益。 摘要报告候选对规模、平均F1区间与升级减少比例;未报告逐查询分布或方差。
启示与展望
该工作面向在非结构化数据上扩展SQL的语义数据库场景,适用于需要语义过滤、语义连接、分类与排序的查询处理,尤其是连接候选对规模较大的负载;摘要所述评测覆盖SemBench与TPC-DS衍生的Shelob,并提到提供交互式查询模拟器、源代码与基准,便于在相近设置下复现与比较。
摘要未给出答案质量的具体数值、逐查询结果分布、升级阈值设定以及SBF必要条件的注册方式,这些细节会影响对方法适用范围的判断;此外,Shelob为TPC-DS衍生的语义连接负载,其在其他数据分布与查询形态下的表现仍需进一步观察。
