长尾数据误差减半
首个融合量子计算与经典数据库的采样算法,无需预处理或先验知识即可自动识别并放大稀有组信号,在长尾分布查询上取得更高精度。
伍赛 · Meng, Shi · 张东祥 · 赵俊博 · Yuan, Gongsheng · 陈刚
IEEE Transactions on Knowledge and Data Engineering 2024
算法对稀有组和正常组采用不同采样策略,并用扩散门与 QRAM 反复放大稀有组信号,样本在各类别间分布更均衡,查询结果不再被常见组主导。
在同样的采样预算下,混合采样方案给出的查询结果更接近真实值;这意味着部署时无需增加采样量或额外的预处理开销。
随着查询选择性增大,量子加速带来的精度收益相对经典方法更为突出,因此在面向稀有或高选择性条件的分析型负载中价值更高。
算法不依赖对工作负载或数据分布的预先假设,也不需要训练阶段,可在线识别并处理稀有组,降低了在实际数据库系统中部署的门槛。