Schaalwetten voor roostergebaseerd benaderend dichtstbijzijnde-buur zoeken in hoge dimensies
Scaling Laws for Grid-Based Approximate Nearest Neighbor Search in High Dimensions
July 1, 2026
Auteurs: Matthew J Liu, Wei Hang Zheng, Vidhan Purohit, Siqi Xie, Chieh-En Li, Jerry Li, Noah Flynn
cs.AI
Samenvatting
Op raster gebaseerde benaderingen voor het zoeken naar benaderende dichtstbijzijnde buren (ANN) ontbraken in moderne schaalanalyses. Wij presenteren een systematische karakterisering van een multiprobe-roosteralgoritme met betrekking tot datasetgrootte N en dimensionaliteit d. Onze experimenten onthullen een voorheen niet gerapporteerde d-schaalovergang in de GloVe-inbeddingsfamilie, waarbij multiprobe-roosterzoekopdracht een ongeveer constante dimensionale schaalexponent handhaaft, terwijl andere op grafiek-, boom- en partitie gebaseerde methoden een afnemende doorvoer vertonen. Het voordeel komt met een bijna lineaire query-schaling in N, maar ook met lagere indexeringskosten dan concurrerende ANN-methoden. Onze resultaten suggereren dat op raster gebaseerde methoden zoals multiprobe-rooster concurrerend kunnen zijn in herbouwintensieve of hoogdimensionale omgevingen waar indexeringskosten en dimensionale robuustheid de prestaties bepalen. In bredere zin heeft recent werk self-attention geformaliseerd als een ANN-operatie. Daarom kunnen de N- en d-schaaleigenschappen van ANN-algoritmen de kostenanalyse van efficiënte transformatorarchitecturen sturen. Code is beschikbaar op: https://github.com/weiz345/MultiProbeANN.
English
Grid-based approaches to approximate nearest neighbor (ANN) search have been absent from modern scaling analyses. We present a systematic characterization of a multiprobe grid algorithm with respect to dataset size N and dimensionality d. Our experiments reveal a previously unreported d-scaling crossover on the GloVe embedding family, in which multiprobe grid search maintains an approximately constant dimensional scaling exponent while other graph-, tree-, and partitioning-based methods exhibit degrading throughput. The advantage comes with near-linear query scaling in N, but also with lower indexing cost than competing ANN methods. Our results suggest that grid-based methods such as multiprobe grid may be competitive in rebuild-heavy or high-dimensional settings where indexing cost and dimensional robustness dictate performance. More broadly, recent work has formalized self-attention as an ANN operation. Thus, the N- and d-scaling properties of ANN algorithms may guide cost analysis of efficient transformer architectures. Code is available at: https://github.com/weiz345/MultiProbeANN.