ChatPaper.aiChatPaper

MultiHashFormer: Modelos de Linguagem Generativos Baseados em Hash

MultiHashFormer: Hash-based Generative Language Models

June 26, 2026
Autores: Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras
cs.AI

Resumo

Modelos de linguagem (LMs) representam tokens utilizando matrizes de embedding que escalam linearmente com o tamanho do vocabulário. Para restringir a pegada de parâmetros, trabalhos anteriores propõem o hashing de muitos tokens em um único vetor dentro de modelos apenas com encoder. Embora isso ofereça eficiência de parâmetros, colisões muitos-para-um impedem seu uso em LMs causais. Neste artigo, propomos o MultiHashFormer, uma nova estrutura que permite autorregressão baseada em hash. Cada token é representado como uma assinatura hash única, uma sequência curta de IDs hash discretos, gerada por múltiplas funções hash independentes. Um Codificador Hash comprime essa assinatura em um único vetor latente para processamento por um decodificador Transformer. Em seguida, um Decodificador Hash gera a assinatura hash do próximo token, que é então mapeada de volta para texto. Avaliamos nossa abordagem nas escalas de 100M, 1B e 3B parâmetros, demonstrando que o MultiHashFormer supera consistentemente os LMs Transformer padrão em vários benchmarks. Além disso, mostramos que nosso modelo lida com expansão de vocabulário multilíngue com uma pegada de parâmetros constante, sem quaisquer modificações.
English
Language models (LMs) represent tokens using embedding matrices that scale linearly with the vocabulary size. To constrain the parameter footprint, prior work proposes hashing many tokens into a single vector within encoder-only models. While this offers parameter efficiency, many-to-one collisions prevent its use in causal LMs. In this paper, we propose MultiHashFormer, a new framework that allows hash-based autoregression. Each token is represented as a unique hash signature, a short sequence of discrete hash IDs, generated by multiple independent hash functions. A Hash Encoder compresses this signature into a single latent vector for processing by a Transformer decoder. Then, a Hash Decoder generates the hash signature of the next token, which is then mapped back to text. We evaluate our approach at the 100M, 1B and 3B parameter scales, demonstrating that MultiHashFormer consistently outperforms standard Transformer LMs across multiple benchmarks. Furthermore, we show that our model handles multilingual vocabulary expansion with a constant parameter footprint without any modifications.