ChatPaper.aiChatPaper

MultiHashFormer: op hash gebaseerde generatieve taalmodellen

MultiHashFormer: Hash-based Generative Language Models

June 26, 2026
Auteurs: Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras
cs.AI

Samenvatting

Taalmodellen (TM's) representeren tokens met behulp van inbeddingsmatrices die lineair schalen met de woordenlijstgrootte. Om de parameteromvang te beperken, stelt eerder werk voor om veel tokens te hashen naar een enkele vector binnen encoder-only modellen. Hoewel dit parameter efficiëntie biedt, verhinderen vele-op-één botsingen het gebruik ervan in causale TM's. In dit artikel introduceren we MultiHashFormer, een nieuw raamwerk dat op hash gebaseerde autoregressie mogelijk maakt. Elk token wordt gerepresenteerd als een unieke hash-handtekening, een korte reeks discrete hash-ID's, gegenereerd door meerdere onafhankelijke hashfuncties. Een Hash Encoder comprimeert deze handtekening tot een enkele latente vector voor verwerking door een Transformer-decoder. Vervolgens genereert een Hash Decoder de hash-handtekening van het volgende token, die vervolgens wordt teruggekoppeld naar tekst. We evalueren onze aanpak op de schalen van 100M, 1B en 3B parameters, en tonen aan dat MultiHashFormer consequent beter presteert dan standaard Transformer-TM's op meerdere benchmarks. Bovendien laten we zien dat ons model meertalige woordenlijstuitbreiding aankan met een constante parameteromvang, zonder enige aanpassingen.
English
Language models (LMs) represent tokens using embedding matrices that scale linearly with the vocabulary size. To constrain the parameter footprint, prior work proposes hashing many tokens into a single vector within encoder-only models. While this offers parameter efficiency, many-to-one collisions prevent its use in causal LMs. In this paper, we propose MultiHashFormer, a new framework that allows hash-based autoregression. Each token is represented as a unique hash signature, a short sequence of discrete hash IDs, generated by multiple independent hash functions. A Hash Encoder compresses this signature into a single latent vector for processing by a Transformer decoder. Then, a Hash Decoder generates the hash signature of the next token, which is then mapped back to text. We evaluate our approach at the 100M, 1B and 3B parameter scales, demonstrating that MultiHashFormer consistently outperforms standard Transformer LMs across multiple benchmarks. Furthermore, we show that our model handles multilingual vocabulary expansion with a constant parameter footprint without any modifications.