ChatPaper.aiChatPaper

StateSMix: Compressão Online sem Perdas via Modelos de Espaço de Estados Mamba e Mistura de Contexto Esparsa de N-gramas

StateSMix: Online Lossless Compression via Mamba State Space Models and Sparse N-gram Context Mixing

April 5, 2026
Autores: Roberto Tacconelli
cs.AI

Resumo

Apresentamos o StateSMix, um compressor sem perdas totalmente autónomo que combina um Modelo de Espaço de Estados (SSM) do tipo Mamba, treinado online, com uma mistura de contexto esparsa de n-gramas e codificação aritmética. O modelo é inicializado do zero e treinado token a token no ficheiro que está a ser comprimido, não necessitando de pesos pré-treinados, de GPU ou de dependências externas. O SSM (DM=32, NL=2, aproximadamente 120K parâmetros ativos por ficheiro) fornece uma estimativa de probabilidade continuamente atualizada sobre tokens BPE, enquanto nove tabelas de hash esparsas de n-gramas (desde bigramas até 32-gramas, 16M de espaços cada) adicionam uma memorização exata de padrões locais e de longo alcance através de um mecanismo de viés de *logit* invariante ao *softmax* que atualiza apenas tokens com contagem não nula. Um mecanismo de escalonamento adaptativo à entropia modula a contribuição dos n-gramas com base na confiança preditiva do SSM, impedindo a sobrecorreção quando o modelo neural já está bem calibrado. No benchmark padrão enwik8, o StateSMix alcança 2,123 bpb em 1 MB, 2,149 bpb em 3 MB e 2,162 bpb em 10 MB, superando o xz -9e (LZMA2) em 8,7%, 5,4% e 0,7%, respetivamente. Experiências de ablação estabelecem o SSM como o motor de compressão dominante: apenas por si, é responsável por uma redução de 46,6% no tamanho em relação a uma linha de base de contagem de frequência e supera o xz sem qualquer componente de n-grama, enquanto as tabelas de n-gramas proporcionam um ganho complementar de 4,1% através da memorização exata de contexto. A paralelização OpenMP do ciclo de treino produz uma aceleração de 1,9x em 4 núcleos. O sistema é implementado em C puro com instruções SIMD AVX2 e processa aproximadamente 2.000 tokens por segundo em hardware x86-64 comercial.
English
We present StateSMix, a fully self-contained lossless compressor that couples an online-trained Mamba-style State Space Model (SSM) with sparse n-gram context mixing and arithmetic coding. The model is initialised from scratch and trained token-by-token on the file being compressed, requiring no pre-trained weights, no GPU, and no external dependencies. The SSM (DM=32, NL=2, approximately 120K active parameters per file) provides a continuously-updated probability estimate over BPE tokens, while nine sparse n-gram hash tables (bigram through 32-gram, 16M slots each) add exact local and long-range pattern memorisation via a softmax-invariant logit-bias mechanism that updates only non-zero-count tokens. An entropy-adaptive scaling mechanism modulates the n-gram contribution based on the SSM's predictive confidence, preventing over-correction when the neural model is already well-calibrated. On the standard enwik8 benchmark, StateSMix achieves 2.123 bpb on 1 MB, 2.149 bpb on 3 MB, and 2.162 bpb on 10 MB, beating xz -9e (LZMA2) by 8.7%, 5.4%, and 0.7% respectively. Ablation experiments establish the SSM as the dominant compression engine: it alone accounts for a 46.6% size reduction over a frequency-count baseline and beats xz without any n-gram component, while n-gram tables provide a complementary 4.1% gain through exact context memorisation. OpenMP parallelisation of the training loop yields 1.9x speedup on 4 cores. The system is implemented in pure C with AVX2 SIMD and processes approximately 2,000 tokens per second on commodity x86-64 hardware.